← 返回资讯
陈默
AI 行业分析师
已审核

大语言模型-逻辑能力横评 25-12月榜

你有没有过那种感觉——明明仔细想想就能拿分的题,你花大价钱买来的大模型,交上来的答案却让你想砸键盘?

大语言模型-逻辑能力横评 25-12月榜

大语言模型-逻辑能力横评 25-12月榜


你有没有过那种感觉——明明仔细想想就能拿分的题,你花大价钱买来的大模型,交上来的答案却让你想砸键盘?

12月夜深人静,我打开最新一套逻辑题,坐在电脑前,眼睛瞪着屏幕,手悬在键盘上十秒。最后没打一个字,而是笑出声来——不是开心,是苦笑。

今天聊聊,这个月我到底被模型们气成什么样,你又为什么该关心这些。

先给你看三个问题,也是我最想聊的:

来,坐好,边聊边吃瓜。


一、我故意挖的“坑”,模型们一个个往里跳

说起来你可能不信。这两道题原本是我给 Gemini 2.5 Pro 准备的见面礼。结果它没来,OpenAI 的 o1 倒快把分数拿满了。我一看,得提前放出来,看看其他模型的底裤到底有多薄。

设计思路朴素到极致:对人类来说,只要直觉加认真推导就能解。对大模型?你猜怎么着——撞上一堵看不见的墙。

先讲#53,那道让人裂开的“精细文本处理题”。

给你一串规则、一个目标文本,要求模型逐字符处理,还要记住上下文状态。说白了,不能蒙,得老老实实一个字符一个字符算。

测试下来,差距挺大。

表现最好的是 o1-mini、o1-preview 和 o1。几乎满分,偶尔失误。我反复测了五轮,平均得分 95% 以上。o1 最稳,有一轮全对——在我题库里,这就是神仙下凡。

跟着的是 Grok 2 和 Gemini 2.5 系列。你能明显感觉到它们“懂题意了”,思维链写得头头是道。可一处理具体字符就手抖。我数过,Grok 2 平均每道题错 2-3 个字符——逻辑对,但执行时像喝了假酒。

再往后是 DeepSeek-R1 和 MiniMax-T1。这两款大部分时候完全看不懂题,偶尔灵光一闪拿个中高分。我测 DeepSeek-R1 的时候,第一遍直接答非所问,第二遍忽然写得不错——我怀疑撞上了训练数据里的某个片段,运气爆棚那种。

剩下那些模型得分基本靠撞大运。后来我把答案随机化了一遍,发现它们的得分率和瞎蒙差不了多少。

你想想,这帮家伙每个月烧掉多少电费、算力、工程师的头发,结果被一道人类初中生水平的问题难住。气不气?

再讲#54,拼图题的升级版陷阱。

#54 是#35 的升级版。#35 原来只要求给拼图编号——后来我发现好多模型靠计算面积撞答案,只要面积对了就能蒙分。这次我要求输出完整拼图方案,位置、方向、旋转全要。

看起来只是加了个全排列,结果愣是把绝大多数模型卡死了。

o1 是唯一稳定拿到三分之一分数的——不是满分,但在所有模型里已经是独一档。Grok 系列、Gemini 系列能选出正确拼图,但放不对位置。最让我意外的是小米的 MiLM,有一次居然拼对了——但只有一次。这种爆发力就跟偶尔中彩票一样,不能当饭吃。


二、国产模型只落后 4 个月?我扇自己一巴掌

年初我写过一篇总结,当时信心满满地判断“国产模型落后世界第一梯队 4 个月”。现在到了 12 月,回头看那句话,我真想抽自己一巴掌,而且是左右开弓那种。

拿纯逻辑性能来说,12 月的国产模型赶上 8 月的 o1-mini 了吗?没有。甚至 7 月的 Grok 2,能跟上的都寥寥无几。

编程任务更扎心。5 月的 Claude 3.5 Sonnet 在综合编程上,到现在还有不少国产模型打不过。

视觉能力就更不用提了,3 月的 Gemini 2.5 至今还是守门员——站在那,谁也踢不过去。

但你要说我对国产模型转悲观,也不是。

2025 年我确实看到了不少让我眼前一亮的东西。Qwen 系列一统开源江湖,我拿它跑了好几个私有任务,虽然硬逻辑还差一点,但工程场景下已经很有竞争力。月之暗面、智谱、稀宇从六小龙里杀出来,成了三剑客。字节砸钱不留余地,多模态上的投入我都替他们心疼——但效果是真的。腾讯那只“睡虎”醒了,我知道他们内部挖了不少大牛,剑还没出鞘,寒气我已经感觉到了。百度在骂声中死扛,至少还在局里。最硬核的还是 DeepSeek,永远一副“我就这样,你爱用不用”的姿态,但每次发版都能把整个行业的方向盘掰一掰。

你看,这些家伙活的活、卷的卷,至少没躺平。2013 年那会儿我是真的看不到国产的希望,现在至少还有点盼头。

但“只落后 4 个月”这话,我再也不敢说了。不是我不信,是我不敢信。


三、我的题库为啥从不公开?三个字:我怕废

问这个问题的读者不少。干脆摊牌聊。

一来我不够权威。我就是个人评测,结合自己的使用场景和对模型的理解,搞了一套滚动更新的私有题库。不公开、不商用、不接稿。目的超级单纯——跟踪大模型在逻辑、数学、编程、指令遵循这些能力上的长期进化。你可能觉得它横评不准,但它是我自己的需求,所以我敢写实话,敢怼敢骂。

二来公开题目等于废题。你想想,模型厂商会针对训练。我早年用网上公开题测试,结果某模型从 40% 直接跳到 90%——后来发现训练集里塞了原题。从那以后,我再不用公开题。现在的题全是中文、原创、不在互联网上出现。每月更新一次,平均分超过 70% 直接淘汰。所以每个月每个模型分数会有正负 3 分波动,但排名大体稳定。

三来我想分享的不是参考答案,而是方法论。每个人应该根据自己的需求去测模型,而不是看一个排名就觉得“A 比 B 好”。我记录踩坑过程,比如某模型在长文本任务中,思维链明明提取对了,后续处理却失真——这种 bug 你在官方测试报告里永远看不到,只有自己动手试才能发现。

说到这儿,突然想到一个生活类比:你以为你在选汽车,其实你在试方向盘的手感。排名是别人的,感受才是你自己的。


最后甩你四个反直觉的观点,看完别吃惊

模型分数波动不是玄学。 有些模型在 max/xhigh 档位下表现反而下降——因为过度思考导致自己把自己绕进死角,陷入局部解。别看到一次高分就以为它真行,多看几轮 Pass,像看人心一样多观察几次。

指令遵循能力正在取代硬逻辑,成为真正的分水岭。 很多模型逻辑勉强及格,可一碰到长指令、多条件就开始崩,幻觉跟着往上窜。我测试时经常被迫调低档位才能跑完整个任务——就像考试时明明会做,但题目一长你就犯困,能怪谁?

别迷信“推理模式”。 慢思考确实能提高上限,但不是所有场景都适用。我用 xhigh 跑某些任务,结果超 Token 限制被按 0 分处理——体验和实际使用差太远了。从 6 月开始我改了规则:如果最长档位超长,就降级跑,保结果准确。记住,工具是为任务服务的,不是反过来。

Qwen2.5-Max 正式版值得重测。 预览版我骂过它,但正式版幻觉抑制明显改善,稳定性提升后很多任务和我当初的预期对上了。虽然单位 Token 智力还是偏低,但在国产里已经算第一梯队。人家在进化,咱们也得跟着看。


12 月月榜到此结束。

明年继续滚题库,继续怼模型。想看的 follow 我,想吵架的评论区见——但别杠数据,我在每道题上测了三遍才有胆发出来。

记住:这个世界没有绝对的第一,只有永远不停迭代的自己。

你猜怎么着?最大的对手从来不是模型,而是你以为自己懂了。

41
1044 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月24日 05:40

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

技术小白 3天前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 6天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)