Recent Videos

What structures make model-free RL possible? an elliptic theory for controlled Markov diffusions

Wenlong Mou
April 23, 2026

Deterministic Policy Gradient for Reinforcement Learning with Continuous Time and Space

Xin Guo
April 23, 2026

Optimal offline policy learning under unknown confounding factors

Zhimei Ren
April 23, 2026

Toward efficient exploration for language models

Dylan Foster
April 23, 2026

On the Learning Dynamics of RLVR at the Edge of Competence

Yuejie Chi
April 22, 2026

Statistical Inference under Adaptive Sampling with LinUCB

Yuting Wei
April 22, 2026

Non-Asymptotic CLTs and Concentration Inequalities for Stochastic Approximation Algorithms, with Applications to Reinforcement Learning

R. Srikant
April 22, 2026

Off-policy Evaluation via Particle Filtering and Moment Matching

Nan Jiang
April 22, 2026

Model simulation using offline observations with low-rank factor model

Devavrat Shah
April 22, 2026