大语言模型-逻辑能力横评 25-12月榜
你有没有过那种感觉——明明仔细想想就能拿分的题,你花大价钱买来的大模型,交上来的答案却让你想砸键盘?
12月夜深人静,我打开最新一套逻辑题,坐在电脑前,眼睛瞪着屏幕,手悬在键盘上十秒。最后没打一个字,而是笑出声来——不是开心,是苦笑。
今天聊聊,这个月我到底被模型们气成什么样,你又为什么该关心这些。
先给你看三个问题,也是我最想聊的:
- 我出了两道“阳谋题”,到底是啥把模型们整不会的?
- 国产模型到底追没追上?别再拿“只差4个月”骗自己了
- 我搞的这套私有题库,从来不公开,藏着掖着还是另有隐情?
来,坐好,边聊边吃瓜。
一、我故意挖的“坑”,模型们一个个往里跳
说起来你可能不信。这两道题原本是我给 Gemini 2.5 Pro 准备的见面礼。结果它没来,OpenAI 的 o1 倒快把分数拿满了。我一看,得提前放出来,看看其他模型的底裤到底有多薄。
设计思路朴素到极致:对人类来说,只要直觉加认真推导就能解。对大模型?你猜怎么着——撞上一堵看不见的墙。
先讲#53,那道让人裂开的“精细文本处理题”。
给你一串规则、一个目标文本,要求模型逐字符处理,还要记住上下文状态。说白了,不能蒙,得老老实实一个字符一个字符算。
测试下来,差距挺大。
表现最好的是 o1-mini、o1-preview 和 o1。几乎满分,偶尔失误。我反复测了五轮,平均得分 95% 以上。o1 最稳,有一轮全对——在我题库里,这就是神仙下凡。
跟着的是 Grok 2 和 Gemini 2.5 系列。你能明显感觉到它们“懂题意了”,思维链写得头头是道。可一处理具体字符就手抖。我数过,Grok 2 平均每道题错 2-3 个字符——逻辑对,但执行时像喝了假酒。
再往后是 DeepSeek-R1 和 MiniMax-T1。这两款大部分时候完全看不懂题,偶尔灵光一闪拿个中高分。我测 DeepSeek-R1 的时候,第一遍直接答非所问,第二遍忽然写得不错——我怀疑撞上了训练数据里的某个片段,运气爆棚那种。
剩下那些模型得分基本靠撞大运。后来我把答案随机化了一遍,发现它们的得分率和瞎蒙差不了多少。
你想想,这帮家伙每个月烧掉多少电费、算力、工程师的头发,结果被一道人类初中生水平的问题难住。气不气?
再讲#54,拼图题的升级版陷阱。
#54 是#35 的升级版。#35 原来只要求给拼图编号——后来我发现好多模型靠计算面积撞答案,只要面积对了就能蒙分。这次我要求输出完整拼图方案,位置、方向、旋转全要。
看起来只是加了个全排列,结果愣是把绝大多数模型卡死了。
o1 是唯一稳定拿到三分之一分数的——不是满分,但在所有模型里已经是独一档。Grok 系列、Gemini 系列能选出正确拼图,但放不对位置。最让我意外的是小米的 MiLM,有一次居然拼对了——但只有一次。这种爆发力就跟偶尔中彩票一样,不能当饭吃。
二、国产模型只落后 4 个月?我扇自己一巴掌
年初我写过一篇总结,当时信心满满地判断“国产模型落后世界第一梯队 4 个月”。现在到了 12 月,回头看那句话,我真想抽自己一巴掌,而且是左右开弓那种。
拿纯逻辑性能来说,12 月的国产模型赶上 8 月的 o1-mini 了吗?没有。甚至 7 月的 Grok 2,能跟上的都寥寥无几。
编程任务更扎心。5 月的 Claude 3.5 Sonnet 在综合编程上,到现在还有不少国产模型打不过。
视觉能力就更不用提了,3 月的 Gemini 2.5 至今还是守门员——站在那,谁也踢不过去。
但你要说我对国产模型转悲观,也不是。
2025 年我确实看到了不少让我眼前一亮的东西。Qwen 系列一统开源江湖,我拿它跑了好几个私有任务,虽然硬逻辑还差一点,但工程场景下已经很有竞争力。月之暗面、智谱、稀宇从六小龙里杀出来,成了三剑客。字节砸钱不留余地,多模态上的投入我都替他们心疼——但效果是真的。腾讯那只“睡虎”醒了,我知道他们内部挖了不少大牛,剑还没出鞘,寒气我已经感觉到了。百度在骂声中死扛,至少还在局里。最硬核的还是 DeepSeek,永远一副“我就这样,你爱用不用”的姿态,但每次发版都能把整个行业的方向盘掰一掰。
你看,这些家伙活的活、卷的卷,至少没躺平。2013 年那会儿我是真的看不到国产的希望,现在至少还有点盼头。
但“只落后 4 个月”这话,我再也不敢说了。不是我不信,是我不敢信。
三、我的题库为啥从不公开?三个字:我怕废
问这个问题的读者不少。干脆摊牌聊。
一来我不够权威。我就是个人评测,结合自己的使用场景和对模型的理解,搞了一套滚动更新的私有题库。不公开、不商用、不接稿。目的超级单纯——跟踪大模型在逻辑、数学、编程、指令遵循这些能力上的长期进化。你可能觉得它横评不准,但它是我自己的需求,所以我敢写实话,敢怼敢骂。
二来公开题目等于废题。你想想,模型厂商会针对训练。我早年用网上公开题测试,结果某模型从 40% 直接跳到 90%——后来发现训练集里塞了原题。从那以后,我再不用公开题。现在的题全是中文、原创、不在互联网上出现。每月更新一次,平均分超过 70% 直接淘汰。所以每个月每个模型分数会有正负 3 分波动,但排名大体稳定。
三来我想分享的不是参考答案,而是方法论。每个人应该根据自己的需求去测模型,而不是看一个排名就觉得“A 比 B 好”。我记录踩坑过程,比如某模型在长文本任务中,思维链明明提取对了,后续处理却失真——这种 bug 你在官方测试报告里永远看不到,只有自己动手试才能发现。
说到这儿,突然想到一个生活类比:你以为你在选汽车,其实你在试方向盘的手感。排名是别人的,感受才是你自己的。
最后甩你四个反直觉的观点,看完别吃惊
模型分数波动不是玄学。 有些模型在 max/xhigh 档位下表现反而下降——因为过度思考导致自己把自己绕进死角,陷入局部解。别看到一次高分就以为它真行,多看几轮 Pass,像看人心一样多观察几次。
指令遵循能力正在取代硬逻辑,成为真正的分水岭。 很多模型逻辑勉强及格,可一碰到长指令、多条件就开始崩,幻觉跟着往上窜。我测试时经常被迫调低档位才能跑完整个任务——就像考试时明明会做,但题目一长你就犯困,能怪谁?
别迷信“推理模式”。 慢思考确实能提高上限,但不是所有场景都适用。我用 xhigh 跑某些任务,结果超 Token 限制被按 0 分处理——体验和实际使用差太远了。从 6 月开始我改了规则:如果最长档位超长,就降级跑,保结果准确。记住,工具是为任务服务的,不是反过来。
Qwen2.5-Max 正式版值得重测。 预览版我骂过它,但正式版幻觉抑制明显改善,稳定性提升后很多任务和我当初的预期对上了。虽然单位 Token 智力还是偏低,但在国产里已经算第一梯队。人家在进化,咱们也得跟着看。
12 月月榜到此结束。
明年继续滚题库,继续怼模型。想看的 follow 我,想吵架的评论区见——但别杠数据,我在每道题上测了三遍才有胆发出来。
记住:这个世界没有绝对的第一,只有永远不停迭代的自己。
你猜怎么着?最大的对手从来不是模型,而是你以为自己懂了。
读者评论 2