← 返回资讯
苏晴
资深编辑
已审核

OpenAI GPT-5.5 测评 -

你知道吗?历史上有个词叫“临界点”。水烧到100度,沸腾;信任攒到某个值,质变。OpenAI这次发布的GPT-5.5,没带来GPT-3到4那种震撼——但它做了一件更基础的事:把AI的出错概率,压到了你愿意交给它干活的那条线下面。

OpenAI GPT-5.5 测评 -

OpenAI GPT-5.5 测评 -

别看只隔了48天。48天前,AI还经常跑偏,说话有口癖,干活你得蹲在旁边盯着。现在呢?推理稳定性直接翻篇。输出差异降到了3.2%。什么意思?你让它写同一个代码十次,九次半结果一样。从前这叫“惊喜”,现在这叫“预期”。

说到数据,咱们一个一个拆。

编程:Terminal-Bench 2.0,82.7%。十个软件工程任务,八个半它独立完成。SWE-Bench Pro,58.6%。过半的维修和开发,直接交机器。换句话说,初级程序员的工作边界,正在被改写。

白领核心:FinanceAgent得分60.0%;内部投行建模88.5%;OfficeQA Pro 54.1%。Excel、财务模型、文档处理——这些坐办公室一天干到晚的活,AI已经有了实战水平。OpenAI自己的财务团队,用Codex审了24771份K-1税务表格,一共71637页。比往年提前两周。他们信任它了。

视觉智商:GPT-5.5 Pro的视觉推理测试得分——145。什么概念?高于98%的人类。它还能把《物种起源》这种厚书,瞬间转成一张信息图。你学习的媒介,被重写了。

安全测试:Lyptus团队从2024年开始追踪AI的进攻性安全能力。去年12月,他们搭了全球最难的300个黑客任务。GPT-5.5只消耗5000万Token,全部通关。研究团队的反馈就一句话:这套评估方法,已经没用了。从“最难”到“不够用”,只用了6个月。

你看,能力曲线一直在涨,但真正改变行为的,是信任曲线的跃迁。那位用户说得准:“能力曲线可能是连续的,但信任曲线不是。”95%到97%,你懒得动;97%到99%,你的工作流开始重写。OpenAI市场团队用AI自动化周报,每周省5到10小时。企业内部开始把正经活儿放给它,不是试试看,是日常作业。

今天,GPT-5.5跨过了那个临界点。而上一版本发布,仅仅在48天前。进化速度的斜率,才是这个时代最震撼的基准测试。你准备好了吗?这不是取代,是“彼可取而代之”——而且,它已经开始干了。

291
14570 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 11:37

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 1周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 昨天
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 4天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)