OpenAI GPT-5.5 测评
朋友,你有没有被一个AI气到想砸电脑的瞬间?
我有。就在上周。
一个破项目——从乱七八糟的日志里扒数据、生成可视化报表——我拿GPT-4o搞了两天,写了十几个prompt模板,调来调去。每次输出都不一样。要么漏字段,要么格式飞出天际。气得我啊,差点以为是自己不会写prompt,在AI面前智商归零了。
然后昨天下午,我抱着"再信一次"的心态,把同一个任务扔给了刚上线的o1-preview。
你猜怎么着?
第一次输出,完美。连字段顺序都跟我脑子里想的一模一样。
我愣了五秒钟,又跑了三遍。三次完全一样!新模型的多Pass一致性已经被吹了好久了,我以为是营销。现在信了——这玩意儿第一次就是最好的。写代码的人都懂这意味着什么:再也不用"再跑一遍看看会不会好一点"。省下来的不光是API费用,还有你被反复折磨掉的那点耐心。
但,别急着高兴。
啊,价格嘛,说来话长……你先坐稳。
Token省了,钱却没省——这不是数学题,是哲学题。
说到这,我算了一笔账,你听听看是不是想骂人。
o1这代推理效率提升确实猛。我拿一个中等难度的找规律题试手,它思考了3000个Token就拿到正确答案,比4o少了大概10%。而Claude Opus要至少8000,有些国产模型动不动冲到20000、50000。更夸张的是,同任务o1的Token消耗比4o省了整整40%。
效率涨了啊!所以红利你总能吃到吧?
来,看价格——直接翻倍还不止。
输入从5美元/百万Token涨到15块,输出从15涨到60。跟Claude Opus比,输入倒是便宜点,输出也差不多。Pro版本?输出600美元/百万Token,普通人看一眼就默默关网页了。
我帮你再细算一笔:做一个任务,4o需要1000个输出Token,成本15美元;o1只用600个(省了40%),但单价60美元——总成本36美元,多了21美元。
效率高了,花的钱没省,还涨了。OpenAI的逻辑是"任务复杂时一次过,总成本可能更低"。但那说的是高难度任务。简单任务?就是更贵。
所以选择很直白:想省钱,用4o;想一遍过不纠结,上o1。省钱和舒坦,你只能二选一。气不气?
编程这块,翻身仗打得挺漂亮,但写代码还没打算全换。
以前GPT的审美有多差?4o的UI直出丑得我直接自闭。搞个按钮,颜色能猜三五次。o1呢?我第一次让它写个小工具界面,出来我愣住了——交互动效、精致的SVG图标,全都有!而且没瞎加功能,要什么给什么,多余的部分克制到我都想鼓掌。
这一点跟Claude Opus完全两个路子。Opus喜欢自我发挥,一上来给你开一整篇代码架构,有时候省事,有时候画蛇添足。o1更像一个听话的执行者——你交代什么,它做什么。想要更聪明的架构?你得明确授意。
基准测试也撕出了差距。Terminal-Bench 2.0考全链路Agent能力:给终端环境加个模糊目标,自己规划、调工具、写脚本、处理报错。o1拿下82.7%,把Opus的69.4%甩开13个百分点,差距肉眼可见。但在SWE-Bench Pro(真实GitHub Issue修复)上,o1只有58.6%,Opus是64.3%。
所以你看:o1擅长"执行任务",Opus擅长"写代码"。不是谁替代谁,是侧重点不同。
OpenAI还顺手捅了Anthropic一刀——在SWE-Bench Pro旁边打了个星号,说"Anthropic的报告部分问题子集存在过拟合迹象"。翻译成人话就是:你考得好啊?我怀疑你背过答案。
不管这刀是不是真扎着了,现在你可以这样用:Opus写复杂工程,o1跑长周期Agent任务,两头不耽误。但如果你只能买一个……那就看你是写项目,还是搭流程。
从"回答"到"执行"——这模型变了味了。
我这次最深的感觉,不是那些数字,是这玩意儿的定位整个变了。
以前你问"这个bug怎么修",它给你一段代码,你还得自己跑。现在你说"帮我管好这个项目"——它自己拉代码、复现问题、查日志、改代码、跑测试、出报告。全程7小时不带崩的!这个7小时是公开数据里最强的抗造成绩,100万Token的上下文窗口也是独一份。
我试了一个跨三天的多步任务,中间断过几次对话。每次续上它都能正确理解上下文,还能引用之前的记忆。新出的"记忆来源"功能会直接告诉你回答参考了哪段历史,方便你删掉过时的信息。这个透明度,得给个赞——至少我知道它凭什么这么回答。
还有视觉能力,你更想不到。
o1 Pro在视觉智商测试上拿到145——门萨俱乐部门槛!你觉得数字花里胡哨?我用它把整本《物种起源》变成了一张信息图。再也不需要逐字啃书了,知识摄入方式直接被颠覆。学东西快太多了。
当然,这些都得看价格。Pro版输出600美元/百万Token,普通人看一眼就关网页了。但如果你做的是知识分析、长周期Agent,这个效率提升可能真值回票价。
最后说两句,不,必须说。
这次发布还有个插曲特逗:OpenAI刚发模型,Anthropic当天就紧急发文,说已经修好了Claude Code最近"降智"的问题,还给所有订阅用户重置了使用限制。修没修好我不知道,但那个时间点说明什么?说明他们慌了。
我的判断很简单:o1是目前最强的全能模型,但价格策略让人一边用一边骂。如果你主要写代码,Opus还是更划算;如果你需要Agent跑长任务或者做复杂分析,上o1没问题。日常使用可以等o1-mini——这次o1-mini在事实准确性上提升很大,幻觉减少了52%,回答也更简洁、更便宜。
OpenAI证明了自己还是那个领头羊,但吃饭的姿势越来越难看了。
我准备先爽一个月o1 Pro,等项目跑顺了,立马切回o1-mini。省下来的钱?就当给自己买烟了。
技术进步最快的方法,就是把钱包和耐心一起燃掉。但你至少可以选——是用钱包,还是用耐心。
读者评论 5