← 返回资讯
陈默
AI 行业分析师
已审核

从技术报告看On-Policy Distillation的崛起: 大模型后训练新范式 -

故事要从2025年说起。那年,大模型后训练圈出了一件怪事:几份顶级技术报告,不约而同地提到了同一个词——On-Policy Distillation,简称OPD。中文叫“在策略蒸馏”。

从技术报告看On-Policy Distillation的崛起: 大模型后训练新范式 -

从技术报告看On-Policy Distillation的崛起: 大模型后训练新范式 -

故事要从2025年说起。那年,大模型后训练圈出了一件怪事:几份顶级技术报告,不约而同地提到了同一个词——On-Policy Distillation,简称OPD。中文叫“在策略蒸馏”。

你觉得,这又是一个学术黑话?不。它已经成了工业界的默认动作。

你看,Qwen3用了OPD,训练轻量模型,推理成本降了一大截。GLM-5用了OPD,修复了多阶段RL后的能力遗忘——那种灾难性的“学完就忘”,是长链RL pipeline的老病根。MiMo-V2更绝,搞了一个多教师OPD:数学一个老师,代码一个老师,搜索一个老师。三个老师教一个学生。精英教育啊!

但最系统的,还是DeepSeek-V4。它公开了一套多专家OPD流程:先独立训练10多个专家模型,每个都走完SFT加GRPO的完整后训练。然后,一个还没成熟的学生模型,用on-policy的方式自己生成回答。每生成一个token,教师就在旁边评估、纠正。

说白了,这就是把强化学习的“在线探索”和知识蒸馏的“密集信号”,合成了一个东西。

说到这儿,你可能会问:OPD到底好在哪?以前我们不是有SFT和RL吗?

说穿了,SFT有暴露偏差——老师教的时候好好的,学生自己说就乱套了。RL呢,奖励信号太稀疏,学半天不知道错在哪。OPD给出了一个中间解:学生用自己的分布生成轨迹,教师在每个token上都给软监督。既避免了分布偏移,又比稀疏奖励更容易优化。

换句话说,这招把“自己走一遍”和“老师手把手改”合在了一起。

今年4月,清华THUNLP联合多机构发了一篇论文,叫《Rethinking On-Policy Distillation》。他们用f-散度统一框架,从三个维度梳理了整个版图:反馈信号、教师访问、损失粒度。相当于给OPD画了张地图。

地图上还有两个新物种:OPSD——用自己教自己,效果和GRPO差不多,省了一大半资源。OPCD——非对称蒸馏,让学生在上下文层面吸收教师分布。2025年10月,Thinking Machines Lab发布了最全面的OPD工程实践指南,从采样到KL散度计算,一套成熟流水线,成了社区的基准。

但是,免费午餐从来不是理所当然。

现场直播总会出岔子。在实际训练日志里,研究者反复观察到sampled-token OPD的不稳定性——模型可能收敛到局部合理点,整体性能反而下滑。清华团队点明了关键:教师有“质量阈值”。一旦教师本身有偏差,或者学生采样空间太大,蒸馏反而放大了错误。怎么平衡计算开销和收益?多教师之间冲突了怎么办?这些答案,决定了OPD能不能从“明星技术”变成“通用基础设施”。

好了,故事讲到最后。你发现没有,OPD不是终点。它是一座桥。桥的一头是监督微调和强化学习,另一头是更持续的进化。它提供的信号,比RL更密集,比SFT更鲁棒。未来,随着混合教师、自适应采样和失败修复机制的成熟,OPD会和RL互补共生。

我们正在经历的,不只是一种技术崛起,而是一种训练哲学的转变。

让模型,在“自己走过的路”上,向更强的自己学习。

这就是OPD的故事。记住一句话:最好的老师,不是替你走的人,而是在你走的每一步,都能给你信号的人。

717
11956 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 11:37

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)