Article
Publications 3
Pointwise or Pairwise: When Do Pairwise Losses Help Reward Learning, Provably?
arXiv:2609.37209
A Jointly Efficient and Optimal Algorithm for Heteroskedastic Generalized Linear Bandits with Adversarial Corruptions
arXiv:2602.10971
Learning to Reason in LLMs by Expectation Maximization
arXiv:2512.20169