国内外知名大模型及应用——模型/应用维度2026/06/17
2026年的AI牌桌,我终于看懂了
先给你讲个事儿。
上周跟一个做AI infra的朋友喝酒,喝着喝着他突然问我:“你说这大模型,一茬接一茬地冒,我到底该用哪个?”
我一愣。说实话,这问题我自己也问了自己八百回了。
2026年都过半了,你能叫得上名字的大模型少说几十个,光国内就1500多种。普通人一看这阵仗,谁不懵?
所以今天不整那些虚头巴脑的排行榜,跟你聊聊我这一年多实操下来的真实感受。
国内这群“卷王”,路子走岔了又走对了
先说个贼有意思的事儿。
上周我拿同一段代码让几个模型跑,结果你猜怎么着?
DeepSeek V4 Pro甩出来的代码干净利落,注释写得比我亲自带的实习生还规范,甚至顺手给你附上了反爬建议。这服务,贴心到不像AI。
但换成通义千问Qwen3.6-27B,这货居然反问了我一句:“需要我帮你模拟测试环境吗?”
!!!你敢信?它居然能主动思考下一步该干嘛!
我当时丢给它的是一个爬虫脚本的框架,让它补全。DeepSeek老老实实把代码填完了,规规矩矩的。Qwen3.6呢?直接问我“要不要测试环境”,还自己脑补了好几个异常处理场景。
这事儿搁以前,只有Claude能这么干。现在,国产模型也有这脑子了。
后来我翻了翻Qwen3.6的技术报告,差点没把手机摔了——这个27B的小模型,在智能体编程上居然干翻了自家前代那个400多B的旗舰!400多B啊,兄弟们!27B打400多B,还赢了?
你看,参数真不是万能的。架构才是硬道理。
但你要以为国产模型都在一个赛道上卷,那就大错特错了。
你看智谱GLM-5.2,玩的是全栈国产化——全程用华为昇腾芯片训练。这在信创圈子里简直就是香饽饽!SWE-bench Verified干到77.8%,比GPT-5.5都高,API价格只要GPT的几分之一。你要是做政企项目,这几乎是唯一的选择。
说到这儿,得提一下MiniMax。6月1号刚发布的M3,直接支持100万token上下文。编程评测超过GPT-5.5和Gemini 3.1 Pro。
你没看错。一个国产开源模型,在美国人的评测里,把美国旗舰按在地上摩擦。
我第一时间就上手试了。感觉就俩字:野心大。100万上下文不是闹着玩的,我直接把一个开源项目的整个代码库扔进去,它能帮你重构整个架构。
这以前谁敢想?!
但说句心里话,我不太信它所有场景都稳。大厂在这种事儿上向来是“先堆参数后修bug”,等大规模用户涌进去,问题就暴露了。不过,能有这样的魄力,已经值得我喊声“respect”了。
国外那几位,在玩另一套游戏
再说说国际巨头那边。格局也挺有意思。
Anthropic的Claude Fable 5,现在基本就是“全平台最强”的代名词。Intelligence 60、Coding 62.0、Agentic 80.6,三项第一!你看看那个Agentic的成绩——80.6,比自家前代Opus 4.8的77.8高了快3分。
我用了两周,感受就一句话:这模型写代码几乎不会跑不通。安全性控制做得极其严格,干擦边球的事儿门儿都没有,但你要写正经的工程项目,它就是天花板。
不过贵也是真贵。Opus 4.8的API价格是你钱包的噩梦。但Sonnet 4.6价格大概是Opus的20%,SWE-bench只落后8个百分点——这才是“甜点级”的选择。我日常用的就是Sonnet,只有特别复杂的活儿才上Opus。
说到GPT-5.4,它有个特别好玩的技能——Computer Use。OSWorld准确率75%,超过人类基准的72.4%。
啥意思?就是说,你让它帮你操作电脑——截图、点按钮、填表单——它能自己完成。我让它帮我在一个SaaS系统里批量录入数据,丢进去200条记录,它自己打开页面、登录、填表、提交,中间还处理了两个验证码弹窗。整个流程跑了大概20分钟,零失误。
这事儿太可怕了。你天天加班改bug的时候,人家AI已经在帮你干那些脏活了。你说气不气人?
但Google的Gemini 3.1 Pro最近有点翻车。长文档分析确实是强项,100万token随便啃,多模态也是真能看图说话。不过稳定性让人抓狂——有时候同一个提示词,上午跑和下午跑,答案能差出一大截。据说是最近在内部大重构,模型版本迭代太快导致的不稳定。
你要用它在生产环境?我劝你三思。
还有个事儿在圈子里炸了锅——xAI把Colossus 1超算租给了Anthropic。22万块英伟达GPU,每月12.5亿美元,租到2029年。
xAI把自家最大的算力集群租给了直接竞争对手!这意味着什么?他们在前沿竞赛中退了一步。Grok 4.3确实便宜,输入只要1.25美元每百万token,在旗舰里算最低的一档,接入X的实时数据也是独一份。但下一代Grok 5还在训练中,重组、算力外租之后还能不能按时跳出来?真不好说。
我的判断,和几个实在建议
测了大半年,踩了不少坑,说几个实在结论。
第一,别迷信参数。 27B的Qwen3.6能干翻400B的Qwen3.5——这事儿明摆着告诉你,架构效率和训练数据质量才是核心。你追参数量,追到最后,可能就是个数字游戏。
第二,中国模型在走一条不一样的路。 开源、低成本、场景适配快。SuperCLUE 5月榜单里,DeepSeek V4 Pro总分70.48,推理74.43,国内第一。但豆包Seed-2.0-pro的应用能力68.14,在精确指令遵循和幻觉控制上拿了高分。
说白了,中国模型正在从“能不能打”变成“好不好用”。
第三,国外旗舰的优势在变窄。 Claude Fable 5、GPT-5.5这些确实是天花板,但天花板在降低。你每月花20美元用ChatGPT,和免费用的DeepSeek V4,在日常场景里体验差距越来越小。我让它们写同样的爬虫,DeepSeek甚至更贴心——还提醒我注意反爬策略。
这在一年前,你敢想?
第四,我的选择标准变了。 以前我会问“哪个模型最强”,现在我更关注“哪个模型最适合我的场景”:
- 如果干复杂工程项目,上Claude Opus或Fable。
- 还想省钱又要质量?Sonnet 4.6或GLM-5值得考虑。
- 搞前端或UI自动化?GPT-5.4的Computer Use是你的菜。
- 国产化信创项目?GLM-5系列闭眼入。
- Agent自主编程?Kimi K2.6的300个智能体集群协同可以试试。
- 手头紧?DeepSeek V4 Flash,成本是海外的十分之一,开源社区已经帮你验证过了。
最后说个预测。到今年年底,我估计开源模型会进一步吃掉闭源模型的市场份额,尤其是在企业服务场景。MiniMax M3的开源发布已经证明了——开源模型在能力上完全能对标闭源旗舰。DeepSeek V4的预训练成本据说只有GPT-5的几分之一,但它在中高端场景的表现已经让很多大厂开始认真评估替代方案了。
哦对了,关于小米那个MiMo V2.5 Pro,我也测了,Agentic 67.4分,在国产里属于第一梯队。但说实话,小米的AI布局一直让我摸不透。手机和IoT场景或许才是它的主场,通用场景目前还不算出彩。
大模型这一年半的进化速度,说实话,把我这个写了十年专栏的老东西都看晕了。
但有一点我越来越确定:2026年,已经不是“谁家模型最强”的问题了,而是——
你选对了没有。
别追着参数跑,先搞清楚你要解决什么问题。
大模型进化再快,也快不过你找到那把钥匙的速度。
读者评论 4