从技术报告看On-Policy Distillation的崛起: 大模型后训练新范式 -
- -
你说的对。今天我给你讲一个故事。
故事要从2025年说起。那年,大模型后训练圈出了一件怪事:几份顶级技术报告,不约而同地提到了同一个词——On-Policy Distillation,简称OPD。中文叫“在策略蒸馏”。
你觉得,这又是一个学术黑话?不。它已经成了工业界的默认动作。
你看,Qwen3用了OPD,训练轻量模型,推理成本降了一大截。GLM-5用了OPD,修复了多阶段RL后的能力遗忘——那种灾难性的“学完就忘”,是长链RL pipeline的老病根。MiMo-V2更绝,搞了一个多教师OPD:数学一个老师,代码一个老师,搜索一个老师。三个老师教一个学生。精英教育啊!
但最系统的,还是DeepSeek-V4。它公开了一套多专家OPD流程:先独立训练10多个专家模型,每个都走完SFT加GRPO的完整后训练。然后,一个还没成熟的学生模型,用on-policy的方式自己生成回答。每生成一个token,教师就在旁边评估、纠正。
说白了,这就是把强化学习的“在线探索”和知识蒸馏的“密集信号”,合成了一个东西。
说到这儿,你可能会问:OPD到底好在哪?以前我们不是有SFT和RL吗?
说穿了,SFT有暴露偏差——老师教的时候好好的,学生自己说就乱套了。RL呢,奖励信号太稀疏,学半天不知道错在哪。OPD给出了一个中间解:学生用自己的分布生成轨迹,教师在每个token上都给软监督。既避免了分布偏移,又比稀疏奖励更容易优化。
换句话说,这招把“自己走一遍”和“老师手把手改”合在了一起。
今年4月,清华THUNLP联合多机构发了一篇论文,叫《Rethinking On-Policy Distillation》。他们用f-散度统一框架,从三个维度梳理了整个版图:反馈信号、教师访问、损失粒度。相当于给OPD画了张地图。
地图上还有两个新物种:OPSD——用自己教自己,效果和GRPO差不多,省了一大半资源。OPCD——非对称蒸馏,让学生在上下文层面吸收教师分布。2025年10月,Thinking Machines Lab发布了最全面的OPD工程实践指南,从采样到KL散度计算,一套成熟流水线,成了社区的基准。
但是,免费午餐从来不是理所当然。
现场直播总会出岔子。在实际训练日志里,研究者反复观察到sampled-token OPD的不稳定性——模型可能收敛到局部合理点,整体性能反而下滑。清华团队点明了关键:教师有“质量阈值”。一旦教师本身有偏差,或者学生采样空间太大,蒸馏反而放大了错误。怎么平衡计算开销和收益?多教师之间冲突了怎么办?这些答案,决定了OPD能不能从“明星技术”变成“通用基础设施”。
好了,故事讲到最后。你发现没有,OPD不是终点。它是一座桥。桥的一头是监督微调和强化学习,另一头是更持续的进化。它提供的信号,比RL更密集,比SFT更鲁棒。未来,随着混合教师、自适应采样和失败修复机制的成熟,OPD会和RL互补共生。
我们正在经历的,不只是一种技术崛起,而是一种训练哲学的转变。
让模型,在“自己走过的路”上,向更强的自己学习。
这就是OPD的故事。记住一句话:最好的老师,不是替你走的人,而是在你走的每一步,都能给你信号的人。
读者评论 2