← 返回资讯
陈默
AI 行业分析师
已审核

PRM不是没用,是我用错了场景——半年踩坑实录

说起来你可能不信,我跟PRM这事儿纠缠了快大半年。

PRM不是没用,是我用错了场景——半年踩坑实录

PRM不是没用,是我用错了场景——半年踩坑实录


说起来你可能不信,我跟PRM这事儿纠缠了快大半年。

从去年9月OpenAI o1出来后,我就跟中了邪似的,非要复现一个出来。踩的坑比吃的盐还多。

真的。


最开始的想法简单粗暴得可爱——给推理的每一步都打分,模型不就知道哪步走对哪步走错了嘛。你想想,就像Janet卖鸭蛋那道题:鸭每天下16个蛋,早餐吃3个,做松饼用4个,剩下卖$2一个。正确推理是16-3=13,13-4=9,9×2=18。但模型有时候算出个17来,你说气不气人?

我寻思,这不就是中间哪步判断错了嘛。给每一步打分,问题不就解决了?

结果,第一个坑直接把我埋了。

花了整整两周,标注了800条数学题的推理步骤。每条都把步骤拆开,找到第一个错误步骤标上负分。信心满满训了个PRM,测试准确率——67%。

懵了。

后来才反应过来,我只标注到"第一个错误",也就是说模型只学会了在错误发生时给反馈。前面正确的步骤它根本不知道该打高分还是低分。就像你教小孩做题,只在他算错的时候喊停,对的时候一声不吭。他能学会个啥?

这个方案——不对,该叫策略——得调整。


然后我换了个思路。学OpenAI那篇《Let's Verify Step by Step》的做法,每个步骤都给标注,对的标正,错的标负。又吭哧吭哧标了800条。

这次准确率提到74%。

但我很快发现第二个坑:泛化能力几乎为零。PRM在数学题上还行,一旦换个领域——逻辑推理、代码调试——直接崩。评分像随机的一样。花了那么多钱标注数据,训出来个只能做数学的偏科生?讲真,我当时想砸键盘。

后来看到有论文对比了PRM和ORM的泛化能力,PRM确实更强一些。但也强不到哪儿去。说实话,我怀疑那些论文的数据集跟我用的不是同一类题。你品,你细品。


第三个坑更隐蔽。

我开始尝试把PRM和搜索算法结合——就是MCTS那套。流程看着挺美:PRM引导搜索树展开,每一步都打分,选高分路径继续走。清华那篇ReST-MCTS的论文我反复看了三遍,流程图都能背下来了。

但实际跑起来,速度慢得离谱。

一个简单的三步推理题,PRM要在每个节点生成10个候选,然后打分,选top 3继续。最后还要从多条完整路径里选质量值最高的。一道题跑下来20秒。让用户等20秒就为了算个16-3-4×2?

绝了。

更让我崩溃的是,DeepSeek R1出来了。人家压根没用PRM,直接纯强化学习,AIME 2024准确率从15.6%飙到71.0%。我当时看到这个结果,手里的咖啡都凉了半截——不对,是全凉了。2024年1月的事儿,我记得特别清楚,那天北京零下12度,我坐在暖气旁边都觉得冷。


我这半年干嘛去了?

冷静下来想想,PRM不是没用。是我用错了场景。PRM本质是个剪枝工具,用在搜索成本极高的复杂推理上才有价值。简单题best-of-N就够了,中等难度beam search可能更合适。只有问题特别难、推理路径特别长、搜索空间特别大的时候,PRM的细粒度反馈才显出优势。

这事儿让我想起ACM圈子里那俩流派——搜索解所有题,和图论解所有题。PRM就是给搜索流的剪枝刀。但如果你面对的问题压根不需要搜索,这把刀就是累赘。白花钱还拖后腿。


对了,还有个事挺有意思。

DeepSeek R1虽然没用PRM,但他们训练初期遇到个问题:模型不会说人话。推理能力强了,但输出中英文混杂,可读性极差。最后不得不加了个冷启动的SFT阶段,用几千条人工标注数据先调一调,再上RL。

这让我想到,PRM可能也是这个路子——它不是最终答案,而是帮你渡过早期训练不稳定阶段的一个拐杖。等模型自己学会了推理的路数,这个拐杖也许就可以扔了。

大概是这么回事吧...我也不确定,毕竟R1的论文写得挺隐晦的。你懂的,大厂论文嘛,关键细节都藏着掖着。


踩了这么多坑,我现在对PRM的态度变了。不再把它当万能解药,而是当成工具箱里一把特殊扳手——只在特定螺丝上拧。如果你也在折腾这个,我唠几句实在的:

别一上来就标几千条数据。先用100条跑通流程再说。我当初就是太着急,800条标完发现方向错了,那感觉……酸爽。

训PRM的时候,让每一步的所有token都参与训练,别只在最后那个token上做分类。我试过,前者准确率能高3-5个点。这个细节论文里都不怎么写,但真的管用。

先确定你的场景真需要PRM。问题简单就别折腾了,best-of-N足够。问题难到普通模型完全做不出来的时候,再考虑PRM+MCTS的组合。别像我一样,拿着牛刀杀鸡,还嫌刀太重。

还有一条——如果DeepSeek R1那条路能走通,也许我们根本不需要PRM。

翻车了。白忙活半年。

但说实话,这半年也没完全白费。至少我现在知道,有些工具不是不好,是你得在对的时候用它。就像你不会拿菜刀去拧螺丝——虽然也能凑合,但何必呢?

380
9512 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月27日 13:01

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

老李 5天前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)