← 返回资讯
赵一鸣
产品评测编辑
已审核

国内AI大模型已近80个,哪个最有前途?

上个月,一个互联网圈的小聚会上,有人抛了个问题:“国内AI大模型都快80个了,到底哪个最有前途?”

国内AI大模型已近80个,哪个最有前途?

国内AI大模型已近80个,哪个最有前途?


最终版本

80个AI大模型?别被晃花了眼!我赌的那个,连你手机上都跑得动

上个月,一个互联网圈的小聚会上,有人抛了个问题:“国内AI大模型都快80个了,到底哪个最有前途?”

话音刚落,场面直接炸了。

有人掏出手机当场演示豆包写周报,有人力挺DeepSeek写代码厉害,还有人神神秘秘地说“你得看SuperCLUE的排名,那个才权威”……

我坐在旁边,看着他们争得脸红脖子粗,心里就一句话——

你们争的,根本就不是同一个问题。

提问的人问的是“哪个最有前途”,但大家全在比“谁现在分数最高”。我觉得,这问法一开始就偏了。

于是我当场说了句让全场安静的话——

“我的答案是通义千问。不是因为它每一项都最强,而是它最不像‘模型’,它更像一个正在悄悄铺开的底座。”

所有人都愣住了。不服?行,我给你四个我亲眼看到的事实。


第一件事:Qwen把尺寸玩出了花

其他家都在推旗舰款,吹自己多牛。

Qwen在干嘛?

它把从0.5B、1.5B、32B到MoE的模型全摆出来了,甚至包括能在手机上跑的量产版本!

我亲自试过:把Qwen2.5的0.5B模型量化后,塞进一部五年前的老安卓手机。跑个闲聊和摘要,顺畅得不行!

1.5B版本呢?在树莓派上也能跑。

你可能觉得:这有啥了不起?错了。 这背后不是技术问题,是战略问题。

从端侧到云侧全覆盖,国内目前就它一家做得这么彻底。对开发者来说,搞端侧离线功能,不用换技术栈;上云做复杂任务,还是同一套模型,省了多少事!

DeepSeek推理确实强,但你见过DeepSeek出0.5B的小模型吗?没有。它赌的是锋利度,不是覆盖率。

一个下围棋,一个耍飞刀——路数完全不一样。


第二件事:开源不是噱头,是真能让你用

去年我一个朋友给一家中小企业做客服系统。对方开口就让他崩溃——

“模型必须本地部署,数据绝不外泄。”

好嘛,只能用开源模型。

他试了一圈:智谱的GLM-4 Agent能力确实不错,但文档和社区支持……怎么说呢,就像进了个门,发现后面全是坑。

直到他碰到Qwen。

从Qwen2.5的权重下载到用vLLM上线,几行代码就搞定。在群里提问,基本当天就有人回复!

他后来跟我感叹:“开源模型拼的不只是技术,还有社区运营能力。”

你想想,一个模型只有论文没有生态,开发者用着用着就得自己去填坑——就像你买了一辆车,结果全世界只有一家4S店,还离你两千公里。

而Qwen背后有阿里云撑着,生态迭代的持续性,比小团队强太多。

开源不是把代码扔出去就完事了,而是要让每个开发者都感觉“有人陪我一起趟坑”。


第三件事:这个“偏科生”,其实是个全能型选手

我做过一个有点傻的实验——拿同一份500词的技术英文文档,让几个模型翻成中文。

结果出来了:

我自测的样本不大,但跟网上一些中文翻译评测结果挺像——中文翻译,Qwen确实在第一梯队。

编程方面呢?

嗯,Qwen确实打不过DeepSeek,这点我认。实测“带过期时间的LRU缓存”那道题,DeepSeek写得最完整。

但你要明白:普通开发任务,Qwen也够用,差距没到不能用的地步。

创意写作Qwen偏弱,但日常知识问答、逻辑推理……差距小到几乎可以忽略不计。

Qwen像个每科85-90分的均衡型学霸,DeepSeek是数学99但语文80的偏科生。

你要只写代码,选DeepSeek没问题。但如果你要处理五花八门的需求——今天写报告,明天翻译文档,后天搭个客服系统——你选谁?


第四件事:企业落地的“最后一公里”,Qwen有天然优势

大模型光跑分没用,关键是怎么落地。

现在很多企业发现:最头痛的不是模型不够聪明,而是不知道该怎样把它接进自己的系统。

要写800行代码连ERP,半夜爬起来改接口文档……想想都崩溃。

而Qwen背后是阿里云和钉钉。

钉钉的AI助理已经深度集成了通义千问,组织架构、审批流、日程直接打通。企业想做个内部知识库,几分钟搭起来。

这件事DeepSeek、智谱都做不到这么顺滑,为什么?因为它俩没有自己的办公生态和云。

我知道有人会说:字节的豆包产品力强,抖音用户量大。

没错。豆包在应用能力上确实拿了国内前几,精确指令遵循和幻觉控制也做得不错。

但你仔细看评测——豆包的推理能力会比DeepSeek和Qwen弱一些。

短期靠产品体验能抓用户,但长期呢?模型智能深度不够,终究会碰到天花板。

字节工程化能力确实强,但AI最终拼的是智力,不是用户量。


说说那些反对声音

“DeepSeek-V3推理能力断层领先,不选它选谁?”

这个数据确实是最近SuperCLUE的结果,我认。

但你想想,高分能持续多久?DeepSeek的强项在推理,可一旦GPT-4o甚至未来更强的模型也把推理拉上来,差距就会缩小。另外,DeepSeek没有像阿里云这样的完整生态做支撑,商业化路径比较单一。C端APP上的影响力远不如豆包和Kimi,B端又不如Qwen和文心有老客户。

只看分数不看生存环境,等于只看技术不看商业。

“那Kimi的长文本不是独一份吗?200万字输入!”

Kimi长文本确实是优势,我读论文和合同偶尔也会用。

但问题是什么呢?单一功能点太容易被复制了。 现在Qwen、DeepSeek不都支持百万级上下文了吗?Kimi的用户高峰在2024年下半年,后来份额慢慢被蚕食。

只靠一个长文本,撑不起长期前途。

“智谱GLM-4的Agent能力在国产里排前头,不牛吗?”

牛。但智谱的问题在哪?定位偏学术和开源项目,离普通用户和中小企业有点远。跟清华绑定紧,商业化速度不够快。Agent能力强是好事,但得跟实际场景结合才能发挥,目前能用的场景还不够多。

这不是技术问题,是落地问题。


最后说点掏心窝子的话

如果你只是写写周报、做做翻译,随便抓一个头部模型都行,差距不超过5%,别纠结。

但如果你问我——“哪个模型最有希望活成基础设施?”

我投通义千问一票。

原因很简单:它把从端侧到云再到办公场景的全链路都占了,开源社区活跃,企业落地有阿里云托底。这是一个能让你从个人开发用到企业部署的生态,而不是一个孤立的爆款。

当然,我可能看走眼。也许DeepSeek接下来搞出个推理突破,或者字节用产品力逆袭。

但让我现在押注?

我选那个最不像模型、更像平台的。

反正别被那80个名字晃花了眼。大部分模型明年还在不在,都不一定呢。


那天聚会结束,一个一直没说话的大佬突然开口:

“你们争来争去,有没有想过——真正能活下来的,根本不是‘最聪明的’,而是‘最让开发者离不开的’。”

全场鸦雀无声。

后来好几个人说,这句话自己记住了。

我也记住了。

470
9411 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 15:06

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

Dev小王 2天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)
A
AI研究员 5天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 1周前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 2周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)