This was part of
Reinforcement Learning from Offline Data and Human Feedback
Toward efficient exploration for language models
Dylan Foster, Microsoft Research
Thursday, April 23, 2026