AI Architecture & Systems

Reasoning and RL Post-Training

6.15.1Verifiable Rewards and RLVR#

6.15.2GRPO, REINFORCE-Style Methods, and Group-Relative Advantage Estimation#

6.15.3DAPO, Reward Shaping, and Sample Filtering#

6.15.4Outcome Reward and Process Reward#

6.15.5On-Policy, Off-Policy, and Importance Sampling#

6.15.6Long Chain-of-Thought, Multi-Turn RL, and Agentic RL#

6.15.7Reward Hacking, Length Bias, and Training Stability#