← 返回资讯
赵一鸣
产品评测编辑
已审核

OpenAI GPT-5.5 测评

朋友,你有没有被一个AI气到想砸电脑的瞬间?

OpenAI GPT-5.5 测评

OpenAI GPT-5.5 测评


朋友,你有没有被一个AI气到想砸电脑的瞬间?

我有。就在上周。

一个破项目——从乱七八糟的日志里扒数据、生成可视化报表——我拿GPT-4o搞了两天,写了十几个prompt模板,调来调去。每次输出都不一样。要么漏字段,要么格式飞出天际。气得我啊,差点以为是自己不会写prompt,在AI面前智商归零了。

然后昨天下午,我抱着"再信一次"的心态,把同一个任务扔给了刚上线的o1-preview。

你猜怎么着?

第一次输出,完美。连字段顺序都跟我脑子里想的一模一样。

我愣了五秒钟,又跑了三遍。三次完全一样!新模型的多Pass一致性已经被吹了好久了,我以为是营销。现在信了——这玩意儿第一次就是最好的。写代码的人都懂这意味着什么:再也不用"再跑一遍看看会不会好一点"。省下来的不光是API费用,还有你被反复折磨掉的那点耐心。

但,别急着高兴。

啊,价格嘛,说来话长……你先坐稳。

Token省了,钱却没省——这不是数学题,是哲学题。

说到这,我算了一笔账,你听听看是不是想骂人。

o1这代推理效率提升确实猛。我拿一个中等难度的找规律题试手,它思考了3000个Token就拿到正确答案,比4o少了大概10%。而Claude Opus要至少8000,有些国产模型动不动冲到20000、50000。更夸张的是,同任务o1的Token消耗比4o省了整整40%。

效率涨了啊!所以红利你总能吃到吧?

来,看价格——直接翻倍还不止。

输入从5美元/百万Token涨到15块,输出从15涨到60。跟Claude Opus比,输入倒是便宜点,输出也差不多。Pro版本?输出600美元/百万Token,普通人看一眼就默默关网页了。

我帮你再细算一笔:做一个任务,4o需要1000个输出Token,成本15美元;o1只用600个(省了40%),但单价60美元——总成本36美元,多了21美元。

效率高了,花的钱没省,还涨了。OpenAI的逻辑是"任务复杂时一次过,总成本可能更低"。但那说的是高难度任务。简单任务?就是更贵。

所以选择很直白:想省钱,用4o;想一遍过不纠结,上o1。省钱和舒坦,你只能二选一。气不气?

编程这块,翻身仗打得挺漂亮,但写代码还没打算全换。

以前GPT的审美有多差?4o的UI直出丑得我直接自闭。搞个按钮,颜色能猜三五次。o1呢?我第一次让它写个小工具界面,出来我愣住了——交互动效、精致的SVG图标,全都有!而且没瞎加功能,要什么给什么,多余的部分克制到我都想鼓掌。

这一点跟Claude Opus完全两个路子。Opus喜欢自我发挥,一上来给你开一整篇代码架构,有时候省事,有时候画蛇添足。o1更像一个听话的执行者——你交代什么,它做什么。想要更聪明的架构?你得明确授意。

基准测试也撕出了差距。Terminal-Bench 2.0考全链路Agent能力:给终端环境加个模糊目标,自己规划、调工具、写脚本、处理报错。o1拿下82.7%,把Opus的69.4%甩开13个百分点,差距肉眼可见。但在SWE-Bench Pro(真实GitHub Issue修复)上,o1只有58.6%,Opus是64.3%。

所以你看:o1擅长"执行任务",Opus擅长"写代码"。不是谁替代谁,是侧重点不同。

OpenAI还顺手捅了Anthropic一刀——在SWE-Bench Pro旁边打了个星号,说"Anthropic的报告部分问题子集存在过拟合迹象"。翻译成人话就是:你考得好啊?我怀疑你背过答案。

不管这刀是不是真扎着了,现在你可以这样用:Opus写复杂工程,o1跑长周期Agent任务,两头不耽误。但如果你只能买一个……那就看你是写项目,还是搭流程。

从"回答"到"执行"——这模型变了味了。

我这次最深的感觉,不是那些数字,是这玩意儿的定位整个变了。

以前你问"这个bug怎么修",它给你一段代码,你还得自己跑。现在你说"帮我管好这个项目"——它自己拉代码、复现问题、查日志、改代码、跑测试、出报告。全程7小时不带崩的!这个7小时是公开数据里最强的抗造成绩,100万Token的上下文窗口也是独一份。

我试了一个跨三天的多步任务,中间断过几次对话。每次续上它都能正确理解上下文,还能引用之前的记忆。新出的"记忆来源"功能会直接告诉你回答参考了哪段历史,方便你删掉过时的信息。这个透明度,得给个赞——至少我知道它凭什么这么回答。

还有视觉能力,你更想不到。

o1 Pro在视觉智商测试上拿到145——门萨俱乐部门槛!你觉得数字花里胡哨?我用它把整本《物种起源》变成了一张信息图。再也不需要逐字啃书了,知识摄入方式直接被颠覆。学东西快太多了。

当然,这些都得看价格。Pro版输出600美元/百万Token,普通人看一眼就关网页了。但如果你做的是知识分析、长周期Agent,这个效率提升可能真值回票价。

最后说两句,不,必须说。

这次发布还有个插曲特逗:OpenAI刚发模型,Anthropic当天就紧急发文,说已经修好了Claude Code最近"降智"的问题,还给所有订阅用户重置了使用限制。修没修好我不知道,但那个时间点说明什么?说明他们慌了。

我的判断很简单:o1是目前最强的全能模型,但价格策略让人一边用一边骂。如果你主要写代码,Opus还是更划算;如果你需要Agent跑长任务或者做复杂分析,上o1没问题。日常使用可以等o1-mini——这次o1-mini在事实准确性上提升很大,幻觉减少了52%,回答也更简洁、更便宜。

OpenAI证明了自己还是那个领头羊,但吃饭的姿势越来越难看了。

我准备先爽一个月o1 Pro,等项目跑顺了,立马切回o1-mini。省下来的钱?就当给自己买烟了。

技术进步最快的方法,就是把钱包和耐心一起燃掉。但你至少可以选——是用钱包,还是用耐心。

298
5975 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 11:45

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

M
创业者Mark 1周前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 2天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 5天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)