- Working Effectively with AI Agents
More verified, useful outcomes—for less total human attention.
1 min - SFT Memorizes, RL Generalizes
A review of SFT Memorizes, RL Generalizes, focusing on how supervised finetuning and verifier-based reinforcement learning behave under shifted rules and visual inputs.
5 min - Post-Training of Modern LLMs
Modern LLM post-training, from preference learning to reinforcement learning with verifiable rewards.
6 min
Back