← 返回资讯
赵一鸣
产品评测编辑
已审核

开源大模型与闭源大模型的差距是在缩小还是在扩大?关键因素

嘿,你见过一个1.5TB的“模型”长什么样吗?

开源大模型与闭源大模型的差距是在缩小还是在扩大?关键因素

开源大模型与闭源大模型的差距是在缩小还是在扩大?关键因素


嘿,你见过一个1.5TB的“模型”长什么样吗?

我见过!上个月Meta把Llama 3.1 405B的权重放出来后,我像抢首发游戏一样冲进去下载。1.51TB——什么概念?够塞满三块硬盘!我用Unsloth的2-bit量化,硬扛到238GB,总算在我那台256GB的工作站上跑起来了。

你猜结果怎么样?

效果竟然超出我预期。在Terminal-Bench上,Llama 3.1 405B跟Claude 3 Opus只差4分。我拿自己的测试集又跑了一遍:文档分析、摘要、标准编码,基本分不出谁是谁。

更炸裂的是成本:DeepSeek-V3每百万输入token才0.14美元,只有GPT-4o同档的二十分之一。Llama 3.1 405B通过API跑的价格是1.40/4.40美元,比Claude便宜10倍。

对大容量代理工作负载来说,这已经不光是省钱,商业模式都能翻个天。

数据也不骗人:2025年1月到2026年1月,开源权重模型在推理市场的份额从1%蹿到15%,12个月15倍。OpenRouter上,中国模型Kimi、DeepSeek-V3、Qwen2.5、GLM-4系列占了所有token流量的60%以上。

讲道理,现在说“开源追平了”,真不是瞎说。

——等等,你先别急着信。


但“追平”这件事,可能是个错觉

说到这儿,我得跟你讲个我亲自踩过的坑。

去年有个客户,看了这些benchmark数据,一拍大腿:开源模型够了!全量业务切过去。结果上线第一周就崩了——用户问“这个代码报错了,你看看这个方向”,模型完全听不懂潜台词,给出的建议驴唇不对马嘴。

问题出在哪?

闭源公司手里攥着海量用户交互数据。每天几百万上千万的对话,哪些回答被点赞、哪些被踩——这些实时反馈就是他们的“天梯”。Google、Anthropic的协议里都留了一手:用你的对话做训练。你每次在聊天里说“不对,你应该看这个方向”——你其实在免费帮他们做最高级的RLHF。

你想想,这种包含人类真实意图、纠错逻辑的动态数据流,开源模型能拿到吗?根本拿不到。

结果就是:开源模型往往“智商”很高——做题牛,但“情商”不够——听不懂潜台词,很难像真人一样处理模糊指令。普通用户也许感觉不到,但一到复杂业务场景,差距立刻暴露。


真正拉开差距的,是工程化壁垒

这才是最让我倒吸一口凉气的地方。

你该不会以为大模型就是一个神经网络文件吧?太天真了。现在的模型越来越像一个复杂的软件系统。

看这几个例子:Claude 3.5 Sonnet 混合推理,能在复杂任务里自动“扩展思考”;GPT-4o 用路由系统,在快速模式和深度模式之间动态切换;Google Gemini 1.5 Pro 能处理200万甚至1000万Token——这背后不只是模型架构的事,而是Ring Attention在数千张TPU上做分布式计算的工程奇迹。

把模型代码开源给你?没有那个万卡集群的低延迟互联环境,你跑得起来吗?

我试过在8卡A100上跑Llama 3.1 405B推理,速度感人——不是说不能跑,但跟闭源API比,差距是数量级的。

这就好比:有人把法拉利的图纸给你了,但你只有一台自行车作坊,能造出来吗?


所以,现在的格局到底什么样?

我倾向于认为分了两层:

前沿模型——最难的那些推理任务(ARC-AGI-2、FrontierMath、人类最后一考),由闭源御三家主导:OpenAI、Anthropic、Google。它们在这些地狱级基准上还保持15到30个百分点的领先。

较小的、针对特定用例的模型——文档分析、摘要、数据处理、标准编码,开源生态系统完全够用,还便宜得多。

这不是谁取代谁,而是谁更适合什么场景。


如果你现在要做技术选型,我掏心窝说几条

首先,别信benchmark。

LLM排行榜的参考价值越来越小,因为新模型分数高很可能是数据渗入了训练集。开源和闭源都在刷榜——面子上不能输。你盯着榜单看,等于被牵着鼻子走。

第二,试试混合架构。

我现在就这么干:

第三,关注后训练质量,而不是参数大小。

基础模型差距可能不大,但后训练和产品反馈会让体验天差地别。模型能力不只看考试分数,还要看听不听话?稳不稳定?有没有幻觉?会不会主动确认?能不能用工具?长任务能执行到底吗?这些才是关键。

第四,数据安全是硬约束。

如果你做金融、医疗、政务——开源模型可以私有化部署,所有数据留自己服务器上。闭源API再强,数据出去了就是出去了。这已经不是技术问题,是合规问题。


最后的趋势判断,我也说说

开源追上闭源的速度在加快——DeepSeek-V3的发布是个分水岭,证明了大厂不一定需要最强硬件也能追平。

但闭源的“能力溢价”不会消失,只是在持续缩水。最难的推理任务、长任务执行、产品反馈闭环——这些差距是结构性的,不是靠堆参数能解决的。

成本差距继续扩大:闭源降价空间有限(GPU成本摆在那),开源在量化、蒸馏、小模型优化上的空间还很大。


最后跟你说句实在话:90%的生产场景下,开源和闭源的差距对终端用户来说不可感知。真正拉开差距的,是成本和运维复杂度。

所以,别被benchmark忽悠了,也别被“技术民主化”的叙事绑架。选什么模型,取决于你的场景、预算、合规要求,还有——

你的数据,敢不敢出去?

474
6779 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 16:34

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

运营小陈 2天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 5天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 2周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)