GPT-5.5 token消耗降了40%,SWE-Bench却几乎原地踏步
凌晨三点,我在屏幕前枯坐了三晚。
从GPT-3就开始在API上跑活的老玩家。写过吐槽帖,搭过生产级Agent,每次大版本更新,都得亲手拆一遍才敢上线。这次GPT-5.5发布,OpenAI自称“迄今最大更新”,48天就端上新版本。我心里打了个结。
三个晚上,我的心情从希望到惊叹,又变成骂娘,最后是沉默。
虚假的舒适圈:排名看着漂亮,细看让人发虚
官方发了九项对比表,我全重绘了。但这些基准测试啊,越来越像高考选考科目,谁选得巧谁分数高。
Artificial Analysis Intelligence Index(第三方加权):GPT-5.5第一,60分。总算打破三强并列,而且效率有明显改善——干同样的活,token消耗比5.4少了40%。这个OpenAI没吹牛。
接下来才是关键。
编程方面:
- **Terminal-Bench 2.0**(复杂命令行):82.7%,比5.4的75.1%涨了7个点,跟Claude 3.5 Sonnet(82%)打平。
- **SWE-Bench Pro**(真实GitHub Issue修复):58.6%。这个数字放在5.4(57.7%)旁边,几乎看不到涨幅。Claude Opus 4是64.3%。
- **内部测试Expert-SWE**(人类中位耗时20小时的长周期任务):73.1%,比5.4的68.5%涨了4.6个点。
看到SWE-Bench Pro那个数字我笑出声。OpenAI说自己不用SWE-bench Verified了,理由是训练数据污染和测试用例误判——于是摆出SWE-bench Pro。现在Pro上进步也不大,就又弄了个Expert-SWE来证明自己。
老套路:考不好就换试卷。
卷子越换越难,结果越换越暧昧。好比健身教练说“体脂秤不准,我们测体态”,然后给你看一堆看不太懂的姿势评分。
其他知识工作:
- **GDPval**(44个职业知识任务):84.9%胜出或平手,比5.4高了1.9%。
- **OSWorld-Verified**(电脑独立操作):78.7%,Claude Opus 4是78.0%,几乎平手。5.4是75.0%,5.2是47.3。横向看是在进步,但纵向看增速已经放缓。
- **买星巴克那个玩笑测试**:Toolathlon基准上只有55.6%,5.4是54.6%,一个百分点。
我敢说:想让ChatGPT帮你点星巴克?接着失望吧。
实测见真章:有些惊喜,有些想骂人
编程:确实干得了了
我翻出两个历史项目:一个C语言小工具,一个E项目的Web应用。
GPT-5.5的总扣分只有5.4的三分之一。E项目几乎一遍过,只有一个一眼就能修的小错。
最意外的是——UI审美!
以前GPT写的前端页面,圆角歪、间距崩、颜色辣眼睛。这次它直出的SVG和交互动效,几乎不用调,跟Opus 4打平。你给的需求,它出品的视觉,直接拿给客户看都不会被骂。
但是—— 架构设计上,它不会像Opus那样自作主张给你大段重写。你想要的架构,还是得在prompt里说清楚。少了一分“我懂你”的默契,多了一分“你说了算”的规矩。
逻辑测试:直觉快了,下限依然不靠谱
我自己出了一套找规律和文本解析题(参考了网友的#41、#61、#62)。
中等难度,GPT-5.5只用了3000 token就想出答案,比5.4还少10%。Claude Opus用了8000,国产模型普遍2万以上,有的直接token耗尽开始穷举。
更难的#41混乱文本解析,它第一次拿到了满分。以前从来没通过,这次过了,我差点拍桌子。
然而—— 不稳定。跑十次,七次满分,三次崩盘。你还是不敢完全信任它。
钱的事:你以为省了?其实没
GPT-5.5 API定价:5美元/百万输入token,30美元/百万输出token。是5.4价格的两倍。
OpenAI说:别怕,token消耗少40%,总成本不升。
我连夜算了一笔账——
一个任务,5.4需要1000个输出token(成本0.015美元),5.5需要600个(成本0.018美元)。
实际还贵了20%。
省下来的token红利,变成了你的额外支出。就像健身房的年卡促销,算下来其实一次没便宜。
只有做高复杂度任务、5.5一遍过而5.4需要重试时,账才能拉平。
便宜和效率不可兼得,用户二选一。OpenAI把选择题扔给用户,自己两头都想要。
但有一点得承认——5.5的推理稳定性确实上来了。同一个复杂prompt跑多遍,输出之间的差异只有3.2%。以前5.4同一问题三次三个结果,得挑好的用。现在第一遍就是最好的,省了API调用次数,也省了血压。
这叫用钱的痛换心的稳。
降智?你未必知道
每次GPT升级都有人说变蠢。这次也不例外。我没遇到严重降智,但有些事得说明白:
5月6日上线GPT-5.5 Instant——回复长度缩短30%,emoji几乎消失。我在ChatGPT上试了,回复确实更紧凑,但个性也少了。
5月中旬——OpenAI官方页面记录GPT-5.5性能下降。他们说调查并解决了,但论坛上5月24-26日的降智投诉反而更多。
更早的2月——有人用trace命令发现Codex请求被静默降级到5.2。这已经不是第一次了。
你能接受吗?你买的是5.5,系统悄悄给你切成5.2。
我在API上测试时没觉得变蠢,但我用的是5.5(非Instant),且把thinking模式开到高档。默认设置或Instant版的体验可能完全不同。
这种“标签没换脑子换了”的操作,早晚会磨掉用户对品牌的信任。
安全:最严的一代,但也别妄想自由
GPT-5.5号称“迄今为止防护最严”。内部外部红队测试,网络安全和生物武器专项验证,结合近200个真实场景调整。
对企业用户或许是好事。对你我这样的普通开发者呢?
换来的就是更多拒绝回答,更多长流程被掐断。
我测试一个自动撰写市场报告的任务时,模型突然说:“我不能协助生成可能误导读者的内容。”
我写的只是产品介绍。
就像保镖连你进便利店买水都要搜身。安全是安全了,但你失去了“我自己能判断”的体面。
谁该用它,谁该继续等
推荐给你,如果你:
- 需要高可靠后端任务:厌倦重试和输出不一致,愿意为稳定多花钱
- 做复杂编程工作流:Terminal-Bench 2.0的提升不是虚的,命令行工具和长任务确实强
- 做逻辑推理密集型任务:5.5的直觉更准,消耗token更少
- 在企业做应用:安全做了闭环,有内部团队背书
先别冲,如果你:
- 对价格敏感、任务简单:GPT-5.3 Instant或更便宜的模型够用,何必多花两倍
- 需要强个性和创造性:回复更紧凑,偶尔拒绝,你会头疼
- 对降智零容忍:如果你经历过GPT-5.2翻译倒退或5.3 Codex降级,不如等更稳定的版本
我的做法——可能听着挺精分:
主力API会切到5.5,但不是一次性全切。先把生产流量分出20%到5.5,跑一周看稳定性。
ChatGPT那边,保留Plus的GPT-5.5选项,但Instant我不用——那玩意儿明显缩水。
写文章这类创意工作,我还在Claude Opus和GPT-5.5之间交替用,看谁更听话。
就像老司机的修理厂里备了两台发动机:一台快但爱偷懒,一台稳但费油。哪个活用哪个,别跟机器赌气。
最后说一句
这模型确实强,但不是无脑强。
OpenAI在宣传里强调“用更少的token干更难的活”。但没说的是——token省下来了,钱没省。
这种夹缝里的收益,暴露了现在AI厂商的定价策略:知道你离不开,所以按能力定价,而不是按成本定价。
别信跑分,信你钱包的厚度。
还得再加一句——
当你发现自己越来越难判断“智能”和“性价比”哪个更重要时,请记住:AI厂商不是在卖工具,而是在卖你的依赖。
而你,有没有做好为它的“不确定性”买单的准备?
读者评论 3