← 返回资讯
苏晴
资深编辑
已审核

人人都能看懂的 On-Policy Distillation(OPD):原理、源码与工业实践 -

DeepSeek V4,把整个后训练环节,换成了OPD——On-Policy Distillation。

人人都能看懂的 On-Policy Distillation(OPD):原理、源码与工业实践 -

人人都能看懂的 On-Policy Distillation(OPD):原理、源码与工业实践 -

不是参数,不是算力,是训练方法。

DeepSeek V4,把整个后训练环节,换成了OPD——On-Policy Distillation。

翻译过来:在线蒸馏。

说到这儿,你可能会问:放着重磅的在线RL不用,干嘛用蒸馏?

别急,咱们从头盘一盘。

先说SFT的毛病。

你看,经典的SFT训练,老师给学生看标准答案。学生每一步都照着抄,看起来很顺。

可一到考试——自己生成内容——就露馅了。一步错,步步错。

这叫“暴露偏差”。

相当于驾校教练只让你在画好的车道里开,上了高速你立马走偏。

那RL呢?RL让学生自己在路上瞎开,撞了才给惩罚。

奖励太稀疏。学得慢。还得养个专门的裁判——reward model,成本高。

所以,有人想:不如让老师当裁判?

离线蒸馏就是让学生看着老师过去的作业模仿。但学生一进步,老师的老作业就过时了——分布不对了。

这叫off-policy drift。你跑步时照着昨天的教程练,今天腿长长了,节奏全错。

学生用自己数据练也不行,批次太小,跑着跑着就偏。

怎么办呢?

OPD的直觉特别简单:学生自己走路,老师跟着及时指导。

你看,这和传统蒸馏完全不同。

传统蒸馏用的是“正向KL”——让学生覆盖老师所有知识区域,求大求全。容易糊成一团。

OPD用的是“反向KL”——只盯着老师最擅长的部分,强迫学生抓住重点。

有人说,这叫“挑人下菜”。

更具体点:学生生成一段话,老师实时给反馈,学生立刻调整。这不就是私教带练么?

DeepSeek V4这么干,优势太明显了。

省掉了一个reward model的成本。避免了PPO的不稳定。

但不是没坑。

Li等人的研究发现:3B以下的小模型,一旦用长思维链做on-policy蒸馏,反而退步。

为啥?学生太弱,自己生成的轨迹太烂,跟着烂轨迹学,越学越歪。

解决办法?混合。把学生自己生成的样本,和老师给的经典样本混在一起练。这叫Mix Distillation,成了标配。

KL系数怎么调?有规律:

话说回来,2026年上半年,OPD相关论文已超过40篇。开源项目OpenClaw-RL也把它列为与PPO、DPO并列的核心训练器。

但有个新问题:Agarwal等人发现,一旦推理链超过4000个token,on-policy蒸馏的效率就会急剧下降。

怎么办?再回头,混一点off-policy数据。

说到这儿,我们可以做个总结了。

DeepSeek V4的选择,可能只是一个开始。

OPD不再把蒸馏看作“知识迁移”。它更像一个带练过程:学生在自己的探索路径上,接受老师的不断修正。

它同时回应了SFT的暴露偏差、RL的稀疏奖励、离线KD的分布偏移。

它是目前后训练最稳健的缝合方案之一。

如果你打算用蒸馏,我建议你认真考虑加入on-policy机制。

因为——

最好的带练,不是告诉你答案,而是陪着你走每一步。

(全文约780字)

89
4478 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 11:37

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

A
AI研究员 1周前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 2天前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 5天前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)