我测了三个月大模型写代码,大部分国产模型卡在一个Swift渲染器上
测了三个月大模型编程,国产模型第三轮就跪了
先说结论——GPT-5.5在V3编程应用测试里拿了最高分。
但这根本不是重点。
重点是,大部分国产模型在C项目上,卡在第三轮就彻底歇菜了。C项目是什么?一个用Swift写macOS渲染器的活儿,说难不难,说简单也不简单。但不管你怎么重试、怎么rewind、怎么清空上下文重新来,它就是过不去。
真的。
讲真,这事儿得从去年9月说起。当时我写了篇预告,说要搞一套全新的V3测试方案。核心目标就一句话:用最接近真实工程的标准,给大模型的编程能力打个分。
不是刷LeetCode那种。是实打实从零搭建项目。
结果呢?拖到现在才出第一期。
原因很离谱——大模型厂商发新模型的速度,比我测模型的速度还快。你想想,每个模型每个项目要跑3到4天,三个项目就是小两周。我刚测完一个,那边又发三个新的。
根本追不上。
绝了。
测试怎么整的
首批三个项目,我尽量让它们互不重叠。
C工程用Swift写macOS的OpenGL渲染器,考察小众语言、图形学、重交互场景。D工程基于Flutter做全功能聊天软件,服务端用Golang,考察移动端、数据库、网络通信。E工程自选技术栈,做纯网页端视频剪辑应用,考察前端、音视频处理、复杂状态管理。
每个项目拆成10到12轮prompt,每轮1500到2000字。这个字数——不对,应该叫信息密度——是我反复打磨过的。之前A和B两个测试项目的prompt写得太随意,有歧义,模型经常理解偏。这次学乖了,每个要求都写得像产品需求文档,确保无歧义。
测试过程模拟的是vibe coding。
我知道bug在哪,但我就是不说。就告诉你现象:页面白屏了、log报了什么错、操作到哪一步卡住了。你自己猜去。跟真实开发一样,同事甩过来一句"这个功能不好使",你得自己定位问题。
3轮修不好?rewind,清代码,清上下文,重来。再3轮还不行?退出测试。这个模型在这个项目上就算翻车了。
说实话,这个标准比实际开发要严格。实际用的时候,你可能会换个思路引导模型,或者干脆自己上手改。但测试嘛,总得有个统一标准。而且你细想,如果3轮都修不好,实际项目里你大概率也换模型了,本质上一样。
一些有意思的发现
V3榜单只是我整个评测体系的一部分。
在另一个逻辑能力横评里,我一直跟踪各模型的自主修复能力。从9月开始改了个规则:模型第一轮代码有语法错误或运行时异常,我不手动修了,而是把报错信息喂回去,给它一次自主修复的机会。
这个改动很关键。
因为实际用Agent的时候,模型配合lint、run工具,本来就能发现这些"硬"问题。之前单轮测试的成绩其实有点失真——怎么说呢,不够真。
结果挺有意思。
GPT-5、Sonnet4、Gemini系列、Grok4,几乎都能自主修复所有基础异常。Sonnet4 Think有两次翻车,一次是C#代码算法问题导致超时,修复后还是超时;另一次是C++语法错误,修复失败。这也印证了Sonnet4系列在C++上确实偏弱。
扯远了,说回国产模型。
DeepSeek V3.1 Think和Doubao1.6 thinking表现最好。非推理模型里Kimi K2最亮眼,但有3次修复失败,全是Golang的变量声明未使用问题。K2修了一处,连带导致另一处未使用——跟打地鼠似的。这事儿在实际Agent多轮环境里其实很容易发现和全部修复,所以如果去掉这部分,K2的修复后异常率能降到2.78%。
挺能打的这玩意儿。
但Qwen3 Coder就有点惨了。初轮异常率11%不算高,但修复轮只处理了不到一半,剩余6.4%。而且剩下的都是运行超时、堆异常这种疑难杂症,给再多轮次也未必能解决。说白了,不是不够聪明,是底子就有点问题。
Doubao-1.6 thinking有个数据特别扎眼:修复后极限分数提升了9.2分。这说明什么?这模型被各种基础错误耽误得挺深,一旦修复,可用性直接上一个台阶。而GPT-5、Kimi K2、GLM4.5修复提升不大——第一遍输出不满意的话,与其修修补补,不如直接重试。
好使是好使,就是费token。
4月的逻辑题更难了
4月开始,新模型我全用最高档位测试。以前统一用high,是因为大部分模型最高就是high。现在厂商都疯了,xhigh、max档位层出不穷,原来的high档位反而被削弱了。所以规则得跟上。
但这个月淘汰了两道老题,上了两道新题,难度直接拉满。
#61题考察洞察能力。给一段压缩处理后的文本,让你找原文。这道题没法穷举,必须找到规律。稳定满分的只有GPT-5.4/5.5、Opus 4.6,国产的DeepSeek V4 Pro有概率满分。GPT和Opus平均只消耗不到20K Token,DS V4 Pro推理效率低一些,用了些局部穷举,消耗到60K。
差了3倍的token。这玩意儿快是快,就是费钱。
Kimi K2.6、GLM-5.1、DeepSeek V4 Flash能解出半数用例,平均消耗50K Token。Qwen3.6系列、Seed 2.0 Pro、Gemini 3系列基本只能解出最明显的兜底用例,而且过程中伴随严重幻觉,推理到一半已经弄不清原题了,梦到哪输出到哪。
翻车了。
#62题考察指令遵循,相对简单。但设计了很多"否定"指令,模型得避免所有"否定"约束。满分的有GPT-5.4/5.5、DeepSeek V4 Pro、Gemini 3.1 Pro、Seed 2.0 Pro。GLM-5.1、Qwen3.6-Max、Opus 4.6、Kimi K2.6表现不稳定,多Pass输出不同。经过指令遵循特训的Hy3表现尚可,能拿半数分。其他模型要么读不懂题,要么无法同时遵循所有条件,要么幻觉爆炸。
这东西——这题吧——说难不难,但就是筛人。
5月Qwen 3.7 Max杀疯了
5月淘汰了4道题。
原因是Qwen 3.7 Max太强势了,老题区分度不够,得上新题探探它的上限。
结果Qwen 3.7 Max基本通过了新题考验,反而是一众国产模型分数不同程度下探。
#63题继承了我之前魔方旋转的思路,设计了一个带状态机构,让模型在长工况下精准记住每个中间步骤和原始规则。满分模型5个:GPT-5.5、Opus 4.8、DeepSeek V4 Pro、Gemini 3.5 Flash、Qwen 3.7 Max。基本都是幻觉抑制比较成功的模型。
Kimi K2.6、GLM-5.1过程中总有些错误,只能拿半数分。比较意外的是Hy3 Preview也能拿到差不多分数,多Pass下还算稳定。Seed 2.0 Pro有小概率接近满分,但多数情况完全错误——跟买彩票似的。
#64题是我第一次用Vibe Coding开发出题环境。以前全是手动出题、手动验证,效率低得要死,跟手工作坊似的。这次用模型辅助出题,效率直接起飞。题目考察空间想象力,空间直觉弱的模型只能用逐步推导模拟,容错率很低。
GPT-5.5依然稳定满分。Opus 4.8/4.6、DeepSeek V4、Gemini 3.5 Flash/3.1 Pro有概率满分但不稳定。Qwen 3.7 Max难以应付这类问题,低效模拟推导后产生少量误差,拿不到满分。其他模型更惨,消耗数万Token后依然搞不清空间关系——梦游呢这是。
回到V3榜单
这些碎片拼在一起,图景就清晰了。
逻辑题考的是推理深度、幻觉抑制、指令遵循。编程应用考的是工程化能力、多轮交互、自主修复。两个维度互相印证。GPT-5.5在两边都是顶尖。Opus系列在逻辑题上很强,但编程应用测试里表现如何,我还没测完——太慢了,一个模型一个项目至少2小时,消耗上千万Input Token和上百万Output Token。遇到服务资源紧张,耗时更长。
等不起,真的等不起。
国产模型里,DeepSeek V4 Pro和Qwen 3.7 Max在逻辑题上已经能摸到第一梯队。但V3编程测试里,大部分国产模型连C项目的第三轮都过不去。
这事儿让我挺感慨的。
刷榜和干活,真的是两码事。我写这个专栏快十年了,测过的模型没有一百也有八十。说实话,每次看到新模型发布时那些漂亮的benchmark分数,我都会想起V3测试里那些卡在第三轮的国产模型。大概是期望越高,落差越大吧。
但也不是全无希望。Qwen3.6-Plus就是个例子。纵观2025年,千问团队的表现确实亮眼。到了26年,三日发五模,拼命追赶。内卷这事儿,有时候也是好事。Qwen3.6-Plus在编程方面的改进非常显著,常规前后端开发、网页应用上,已经优于Sonnet 4.5和GLM-5.0/MiniMax。
只是Agent浪潮来得太快,曾经弱小的对手已经吃尽了红利。
高材生写不好代码,不是因为笨,是因为以前没人教。现在学会了,但赛道已经变了。
你们觉得呢?
读者评论 2