This was part of
Reinforcement Learning from Offline Data and Human Feedback
On the Learning Dynamics of RLVR at the Edge of Competence
Yuejie Chi, Yale University
Wednesday, April 22, 2026