Recent Videos

Reinforcement Learning beyond Reward Maximization

Yuda Song
April 1, 2026

Reasoning and Acting with LLM: An RL Framework

Zhaoran Wang
April 1, 2026

Toward a Statistical Perspective on LLM Post-training: Preference Sampling and Gradient Reweighting

Yaqi Duan
March 31, 2026

Building Deep Research Agents via Reinforcement Learning

Wen Sun
March 31, 2026

“From CoT to 
Collaborative Inference: Efficient Inference via Collaborative Reasoning”

Ayush Sekhari
March 31, 2026

Regression as Policy Optimization: Advantages In, Policies Out

Kianté Brantley
March 31, 2026

On the Mechanism and Dynamics of Modular Addition: Fourier Features, Lottery Ticket, and Grokking

Zhuoran Yang
March 31, 2026

Multi-turn and Multi-agent Reinforcement Learning Fine-Tuning of LLMs

Natasha Jaques
March 30, 2026

Self-Supervised Reinforcement Learning and Patterns in Time

Benjamin Eysenbach
March 30, 2026