Reasoning and RL Post-Training
6.15.1Verifiable Rewards and RLVR#
6.15.2GRPO, REINFORCE-Style Methods, and Group-Relative Advantage Estimation#
6.15.3DAPO, Reward Shaping, and Sample Filtering#
6.15.4Outcome Reward and Process Reward#
6.15.5On-Policy, Off-Policy, and Importance Sampling#
6.15.6Long Chain-of-Thought, Multi-Turn RL, and Agentic RL#
6.15.7Reward Hacking, Length Bias, and Training Stability#