- SFT Memorizes, RL Generalizes
A review of SFT Memorizes, RL Generalizes, focusing on how supervised finetuning and verifier-based reinforcement learning behave under shifted rules and visual inputs.
5 min - Post-Training of Modern LLMs
Modern LLM post-training, from preference learning to reinforcement learning with verifiable rewards.
6 min
Back