Skip to yearly menu bar Skip to main content


Poster Tue, Oct 6, 2026 • 4:30 PM – 6:30 PM PDT Grand Ballroom #140

A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Large Language Model Training

Zihan Qiu ⋅ Zeyu Huang ⋅ Kaiyue Wen ⋅ Peng Jin ⋅ Bo Zheng ⋅ Yuxin Zhou ⋅ Haofeng Huang ⋅ Zekun Wang ⋅ Xiao Li ⋅ Huaqing Zhang ⋅ Yang Xu ⋅ Haoran Lian ⋅ Siqi Zhang ⋅ Rui Men ⋅ jianwei zhang ⋅ Ivan Titov ⋅ Dayiheng Liu ⋅ Jingren Zhou ⋅ Junyang Lin

Abstract

Log in and register to view live content