Skip to yearly menu bar Skip to main content


Poster Wed, Oct 7, 2026 • 11:00 AM – 1:00 PM PDT Imperial Ballroom #36

Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning

Tianyuan Shi ⋅ Canbin Huang ⋅ Bei Li ⋅ Xin Chen ⋅ Xiaojun Quan ⋅ Jingang Wang ⋅ Qifan Wang

Abstract

Log in and register to view live content