人人都能看懂的 On-Policy Distillation(OPD):原理、源码与工业实践 -
- -
2026年初,一张技术报告炸了锅。
不是参数,不是算力,是训练方法。
DeepSeek V4,把整个后训练环节,换成了OPD——On-Policy Distillation。
翻译过来:在线蒸馏。
说到这儿,你可能会问:放着重磅的在线RL不用,干嘛用蒸馏?
别急,咱们从头盘一盘。
- -
先说SFT的毛病。
你看,经典的SFT训练,老师给学生看标准答案。学生每一步都照着抄,看起来很顺。
可一到考试——自己生成内容——就露馅了。一步错,步步错。
这叫“暴露偏差”。
相当于驾校教练只让你在画好的车道里开,上了高速你立马走偏。
那RL呢?RL让学生自己在路上瞎开,撞了才给惩罚。
奖励太稀疏。学得慢。还得养个专门的裁判——reward model,成本高。
所以,有人想:不如让老师当裁判?
离线蒸馏就是让学生看着老师过去的作业模仿。但学生一进步,老师的老作业就过时了——分布不对了。
这叫off-policy drift。你跑步时照着昨天的教程练,今天腿长长了,节奏全错。
学生用自己数据练也不行,批次太小,跑着跑着就偏。
怎么办呢?
- -
OPD的直觉特别简单:学生自己走路,老师跟着及时指导。
你看,这和传统蒸馏完全不同。
传统蒸馏用的是“正向KL”——让学生覆盖老师所有知识区域,求大求全。容易糊成一团。
OPD用的是“反向KL”——只盯着老师最擅长的部分,强迫学生抓住重点。
有人说,这叫“挑人下菜”。
更具体点:学生生成一段话,老师实时给反馈,学生立刻调整。这不就是私教带练么?
- -
DeepSeek V4这么干,优势太明显了。
省掉了一个reward model的成本。避免了PPO的不稳定。
但不是没坑。
Li等人的研究发现:3B以下的小模型,一旦用长思维链做on-policy蒸馏,反而退步。
为啥?学生太弱,自己生成的轨迹太烂,跟着烂轨迹学,越学越歪。
解决办法?混合。把学生自己生成的样本,和老师给的经典样本混在一起练。这叫Mix Distillation,成了标配。
KL系数怎么调?有规律:
- 0.0:纯RL,学生容易跑偏。
- 0.1–0.5:轻度引导,师生能力接近时好用。
- 1.0:默认,环境奖励和教师权重大致相当。
- 5.0以上:强模仿。学生几乎完全跟着老师走。
话说回来,2026年上半年,OPD相关论文已超过40篇。开源项目OpenClaw-RL也把它列为与PPO、DPO并列的核心训练器。
但有个新问题:Agarwal等人发现,一旦推理链超过4000个token,on-policy蒸馏的效率就会急剧下降。
怎么办?再回头,混一点off-policy数据。
- -
说到这儿,我们可以做个总结了。
DeepSeek V4的选择,可能只是一个开始。
OPD不再把蒸馏看作“知识迁移”。它更像一个带练过程:学生在自己的探索路径上,接受老师的不断修正。
它同时回应了SFT的暴露偏差、RL的稀疏奖励、离线KD的分布偏移。
它是目前后训练最稳健的缝合方案之一。
如果你打算用蒸馏,我建议你认真考虑加入on-policy机制。
因为——
最好的带练,不是告诉你答案,而是陪着你走每一步。
(全文约780字)
读者评论 4