← 返回资讯
林远舟
技术编辑
已审核

DeepSeek-R1 模型发布,性能对标 OpenAI

不是加班追剧,不是在打游戏。我在“玩”一个模型——DeepSeek R1。

DeepSeek-R1 模型发布,性能对标 OpenAI

DeepSeek-R1 模型发布,性能对标 OpenAI


哎,说到昨晚,我熬到凌晨三点。你猜干吗?

不是加班追剧,不是在打游戏。我在“玩”一个模型——DeepSeek R1。

说真的,很久没被一个AI震成这样了。上一次这么激动,还是GPT-4刚出来那会儿。但这次不一样——这玩意儿不光强,它让我有种“在看一个东西觉醒”的错觉。


这玩意儿到底从哪儿蹦出来的

先说说背景。

去年12月,DeepSeek-V3开源的时候,我就觉得不对劲。一个660B的模型,训练成本才557万美元,性能直接跟GPT-4叫板。我当时写了篇文章,说这是中国AI的“奇袭珍珠港”,评论区直接吵翻。

现在回头看?V3就是个前菜。

真正炸裂的,是1月20号晚上发布的R1。当时我正吃饭,手机推送弹出来。打开一看,筷子差点掉了——AIME 2024数学测试,79.8%,跟OpenAI o1-1217打平;MATH-500,97.3%;Codeforces Elo评级2029,超过96.3%的人类参赛者。

这不是牛逼,是离谱。

更离谱的是——开源了。两个660B大模型,加六个蒸馏版,从1.5B到70B,代码、权重全扔GitHub。

你想想,一个顶级推理模型,就这么公开了。放在两年前,谁敢信?


R1-Zero:那个让人起鸡皮疙瘩的东西

我要重点说一下R1-Zero。

很多人忽略了这个东西有多可怕。它是在完全没有人类示范的情况下,直接在基座模型上拿强化学习(RL)训练出来的。就是说,模型从没见过人怎么解题,全靠自己东摸西撞,瞎摸索。

结果呢?AIME 2024测试,pass@1从最初的15.6%一路飙到71.0%。换成多数投票,直接86.7%,超过o1。

技术报告里有一段话,我读到的时候真的鸡皮疙瘩全起来了——原话是:“连研究人员都没有预料到——R1出现了‘啊哈’时刻。”

你听清楚了吗?模型开始学会反思了。它会检查自己的答案对不对,会花更长时间想复杂问题。没人教它反思,它自己学的。

就像Alpha Zero自己学会下围棋一样,只是这次换成了语言模型。

有网友说:“2025年可能就是RL之年。”我现在觉得,这话可能要成真。


GRPO到底是什么?我给你打个比方

网上讲GRPO(Group Relative Policy Optimization)的文章,动不动就是policy、reward、advantage、actor、critic……一堆术语直接把人搞晕。

我换个说法。

传统PPO,相当于请了个专业教练+裁判来训练运动员。教练(Critic模型)要实时看运动员每个动作好不好,裁判(Reward Model)打分。这两个角色都是庞大的神经网络,跟着运动员一起长大,显存算力耗得飞起。

GRPO干了什么?直接炒了教练。

让运动员自己组小组比赛,谁做得好谁得分高,对比一下就完了。就像班级里的小组竞赛——你生成8个答案,对的加分,错的扣分,简单粗暴。只有在主观题没有标准答案的时候,才喊裁判来打分。

好处很明显:省显存,省算力,工程复杂度降了一大截。

但代价也很大:训练初期不稳定,容易崩。就像一堆学生没人带路,自己瞎琢磨,走着走着就撞墙了。DeepSeek团队花了大把精力才把这个过程稳住。

我之前写过一篇文章叫《概率的囚徒与突围者》,讲的就是这个逻辑。大模型本质上是在概率空间里按训练信号找最优解。GRPO这个思路,是在找一种更高效的“找路”方式——而且,找到了。


我自己亲测了一把

我挑了一道o1同款的解密题,扔给R1。

它想了74秒,给了正确答案。

过程中,它的思考过程是放在...标签里的。你能像看内部直播一样,看它一步一步推理。那种感觉确实跟其他模型不一样——Gemini 1206、Claude 3.5、GPT-4 Turbo,用那些模型你得精细设计prompt,反复调措辞。

用R1的时候,我更像在跟一个同事聊天。

它也会犯错,但经常作对。最神奇的是:当它发现自己错了,它会换思路重新来。这个能力不是写死在代码里的,而是RL训练中自己“涌现”出来的。

有网友说得特别准:“它就像推开了一扇门。”我甚至觉得这比喻还不够——它推开的是通往AGI的一扇小门。


行业炸了:Meta慌了,英伟达在暗讽

学术界反应比我想象的激烈多了。

UC Berkeley的Alex Dimakis直接说:“DeepSeek已经领先了,美国公司得赶紧追。”这话从伯克利教授嘴里说出来,分量不一样。

AutoAWQ的作者Casper Hansen分析说,R1用了多阶段循环训练:基础→RL→微调→RL→微调→RL。我理解下来,核心就是先让模型在RL中长出推理能力,再用SFT做质量控制,反复迭代。

机器之心爆了个料,说Meta内部已经“陷入恐慌”,在疯狂分析DeepSeek,搞不懂他们怎么做到这么低的训练成本。

更耐人寻味的是英伟达高级科学家Jim Fan的发言。他在X上发了一段话:“影响可以通过‘内部实现的ASI’或像‘草莓计划’这样神乎其神的名称来完成。影响也可以通过简单展示原始算法和matplotlib学习曲线来实现。”

你品,你细品。

OpenAI搞个AGI,包装得像宗教仪式,又是神秘代号又是内测邀请。DeepSeek倒好,直接把代码扔GitHub,把学习曲线挂出来,告诉你:“看,就是这样训练的,你也能搞。”

这对比,太鲜明。


钱的事情,我算了笔账

R1的API价格:每百万输入tokens,命中缓存1块钱,没命中4块。输出tokens每百万16块。

o1什么价?输入15美元,输出60美元。

换算一下,R1大概是o1价格的3%到5%

我已经在切换了。

对做AI应用的朋友来说,这是重大利好。顶级的推理模型,成本降到这个程度,意味着很多以前因为成本不敢落地的产品,现在可以重新拿出来了。


别高兴太早,有几个坑我得说清楚

第一,R1-Zero虽然牛逼,但存在阅读体验差的问题。它会混入多种语言,表述不够自然。后来的DeepSeek-R1加了多阶段SFT才解决这个问题。

第二,660B的模型,绝大多数人自己是跑不动的。我试了试在单卡A100 80G上推理,直接就OOM了。官方提供的API体验还行,但如果你做本地部署,得准备相当规模的硬件。

第三,RL训练的不稳定性是个大问题。GRPO省了Critic模型带来的成本,但也失去了精细指导。这个trade-off不是所有人都能接受的。如果你的业务对输出质量要求极高,场景复杂多变,传统的PPO可能还是更稳妥的选择。


更大的图景:Scaling Law在转移方向

我一直盯的一个趋势,在这篇文章里被明确提了出来。

“直到不久前,训练LLM所消耗的大部分算力都投入到预训练阶段。过去,我们主要关注扩大预训练规模,而后训练则是一个开销较小的环节。”

但现在变了。

DeepSeek-R1-Zero用了10万H800 GPU小时做RL训练,占它预训练算力的3.75%。这个比例在前沿模型迭代中被进一步放大——从o1到o3增加了超过10倍,Grok-3到Grok-4也有类似飞跃。

这意味着什么?预训练的Scaling Law正在减速,RL的Scaling Law成为新主战场。互联网上的高质量数据基本被训练完了,下一步比拼的不是谁有更多数据,而是谁能在RL阶段找到更高效的策略。

OpenAI已经用o1到o3证明了这条道路走得通。DeepSeek用R1证明了开源模型也能走到这一步。


我的一些真心疑问(说得不对你打我)

我必须老实说几个疑惑。

第一,R1-Zero的性能提升曲线虽然惊艳,但AIME这类数学benchmark的难度正在被逐步攻克。我不确定是不是存在benchmark过拟合的风险。如果模型在训练过程中已经隐式接触了大量同类题目,这个分数就有水分。

第二,自然语言推理任务上的表现,我没看到特别详细的数据。R1在数学和代码上强,但在更广泛的语言理解任务上,能不能同样表现出色?我还没测够。

第三,那种类似人类反思的能力,到底是真正的推理涌现,还是RL训练中“多轮生成-择优”模式的副产品?这个问题很关键——如果只是算法驱动下的模式匹配,那“啊哈”时刻的意义就要打折扣。

打个不恰当的比方:一个学生背熟了所有例题,考试确实能考高分。但遇到从没见过的新题型,能不能灵活应对?目前我还没看到足够有力的证据。


连着o1一起说

还有一个很有意思的视角。

o1和R1的出现,其实揭示了一个更大的趋势——模型层正在“塌陷”。当推理能力可以通过RL训练在后训练阶段大规模提升时,预训练阶段模型架构的优势在缩小。你会看到越来越多的模型通过强化学习逼近o1/R1的水平,而它们的基础架构可能完全不同。

这有点像智能手机早期竞争——硬件差异化越来越难,软件优化成为决胜关键。R1就是这个思路的极致体现:它不是在架构上做了多大的创新,而是在训练策略上找到了突破口。

但这也带来了新的隐患。如果所有模型都靠RL冲推理能力,那上层场景到底长什么样?是越来越多的中间应用会被模型替代,还是模型能力会催生全新的需求?我现在还没想清楚,但这个问题值得所有人思考。


给你五条实在的建议(拿笔记一下也行)

作为同样在折腾的开发者,我给你的建议很实在:

1. 能接入API就接入API。别折腾本地部署660B的事情,除非你预算充足且有大规模分发需求。DeepSeek的API价格和延迟都还行,先用着。

2. 把R1用在推理密集型任务上。编程debug、数学计算、逻辑分析、知识图谱推理,这些是它的强项。当成日常对话助手用?太大材小用了。

3. 注意token消耗。R1的推理链很长,一个简单问题可能产出几百甚至上千token的思考过程。如果API按token计费,这部分成本要留心。实际使用成本可能是直接回复的2-3倍。

4. 关注蒸馏版本。R1蒸馏出来的1.5B和7B版本,在一部分任务上已经超过了GPT-4o和Claude Sonnet。如果你想在边缘设备上跑推理,这些蒸馏版可能是最佳选择。

5. 别盲目跟风换技术栈。如果你是做对话机器人,用PPO和Critic模型的传统方案不一定需要替换。GRPO的优势在于推理场景,如果你的场景不是那么“硬”,维持现状可能更稳妥。


未来怎么走?我觉得2025年会是一个分水岭

DeepSeek用非常有限的预算,证明了开源路线在推理能力上的可行性。这不仅是对OpenAI的商业冲击,更是对整个行业技术路线的深刻反思——究竟是堆算力更重要,还是找对方法更重要?

R1的成功不是偶然。它建立在大量基层研究和工程实践的基础上,每一步推进都有迹可循。DeepSeek团队在技术报告里写得很坦诚,RL训练的细节、遇到的问题、解决思路,全部公开。这种开放的态度,在当下的AI圈子里越来越稀缺。

我见过太多团队在拿到类似成果后,第一反应是建墙:申请专利、注册商标、限制访问。DeepSeek选择了一条完全不同的路——把成果摊开,所有细节、训练方案全部公开。这种做法让它赢得了远超短期收益的行业尊重和用户信任。

我相信,未来会有更多团队沿着这个方向走。不是因为DeepSeek多伟大,而是因为它证明了一条可行的路。那条路可能是通往AGI的关键路径——纯粹通过强化学习,让模型在自博弈过程中涌现出更高阶的认知能力。

如果你现在才开始关注R1,建议你读一下官方论文,去体验一把API,看看R1是怎么思考的。你会发现,技术文档和实际体验完全是两回事。那些冰冷的benchmark数字背后,是一个正在觉醒的智能体。

很多人说买模型产品只是付钱,没有深度体验和反思。但R1不一样——它是整个行业从“买模型”到“用模型思考”的一个转折点。

借用论文里的一句话:“我们没直接教模型如何解决问题,只是给予它正确的激励,模型就能自己琢磨出先进的解题办法。”

这大概就是2025年AI圈的底色:激励大于指令,自我进化大于人工干预,开源推动众生。

而你,站在这个路口——

别只当看客。跳进去,那个浪潮才会带你走得更远。

151
5037 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 02:13

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

前端工程师 1周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 1周前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 2周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)