Skip to yearly menu bar Skip to main content


Poster Tue, Oct 6, 2026 • 4:30 PM – 6:30 PM PDT Grand Ballroom #103

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

Qinsi Wang ⋅ Jing Shi ⋅ Huazheng Wang ⋅ Kun Wan ⋅ Yiran Wu ⋅ Bo Liu ⋅ Qingyun Wu ⋅ Hai H Li ⋅ Yiran Chen ⋅ Handong Zhao ⋅ Wentian Zhao

Abstract

Log in and register to view live content