Skip to yearly menu bar Skip to main content


Poster Wed, Oct 7, 2026 • 11:00 AM – 1:00 PM PDT Grand Ballroom #124

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

Ömer Çağatan ⋅ Xuandong Zhao

Abstract

Log in and register to view live content