DAPO

https://arxiv.org/abs/2503.14476 This is mostly generate by Gemini 3-pro

1. Introduction (引言):为何复现 R1 这么难?

这部分主要交代了背景和动机。


2. Preliminary (预备知识):重温 PPO 与 GRPO


3. DAPO (核心方法):四大“魔改”技术

这是论文最精华的部分,详细解释了如何解决 Section 1 提出的问题。

DAPO

compare to GRPO GRPO

3.1 Raise the Ceiling: Clip-Higher (解耦裁剪)

PPO 的 Clip 机制对低概率 Token 的“提拔”限制太死,导致那些一开始概率低的“潜力股”很难翻身,模型最终只能选择一开始概率就高的“平庸股”,导致熵坍缩

3.2 The More the Merrier: Dynamic Sampling (动态采样)

3.3 Rebalancing Act: Token-Level Policy Gradient Loss (Token 级损失)

3.4 Hide and Seek: Overlong Reward Shaping (超长截断处理)


4. Experiments (实验)

这部分验证了 DAPO 的有效性。


5. 总结

DAPO 通过解耦 Clip(促进探索)、动态采样(保证梯度质量)、Token-level Loss(适应长链推理)和合理的截断处理,成功在开源框架下复现并超越了 DeepSeek-R1-Zero 的效果。