OpenAI GPT-5.5 测评 -
- -
你知道吗?历史上有个词叫“临界点”。水烧到100度,沸腾;信任攒到某个值,质变。OpenAI这次发布的GPT-5.5,没带来GPT-3到4那种震撼——但它做了一件更基础的事:把AI的出错概率,压到了你愿意交给它干活的那条线下面。
别看只隔了48天。48天前,AI还经常跑偏,说话有口癖,干活你得蹲在旁边盯着。现在呢?推理稳定性直接翻篇。输出差异降到了3.2%。什么意思?你让它写同一个代码十次,九次半结果一样。从前这叫“惊喜”,现在这叫“预期”。
说到数据,咱们一个一个拆。
编程:Terminal-Bench 2.0,82.7%。十个软件工程任务,八个半它独立完成。SWE-Bench Pro,58.6%。过半的维修和开发,直接交机器。换句话说,初级程序员的工作边界,正在被改写。
白领核心:FinanceAgent得分60.0%;内部投行建模88.5%;OfficeQA Pro 54.1%。Excel、财务模型、文档处理——这些坐办公室一天干到晚的活,AI已经有了实战水平。OpenAI自己的财务团队,用Codex审了24771份K-1税务表格,一共71637页。比往年提前两周。他们信任它了。
视觉智商:GPT-5.5 Pro的视觉推理测试得分——145。什么概念?高于98%的人类。它还能把《物种起源》这种厚书,瞬间转成一张信息图。你学习的媒介,被重写了。
安全测试:Lyptus团队从2024年开始追踪AI的进攻性安全能力。去年12月,他们搭了全球最难的300个黑客任务。GPT-5.5只消耗5000万Token,全部通关。研究团队的反馈就一句话:这套评估方法,已经没用了。从“最难”到“不够用”,只用了6个月。
你看,能力曲线一直在涨,但真正改变行为的,是信任曲线的跃迁。那位用户说得准:“能力曲线可能是连续的,但信任曲线不是。”95%到97%,你懒得动;97%到99%,你的工作流开始重写。OpenAI市场团队用AI自动化周报,每周省5到10小时。企业内部开始把正经活儿放给它,不是试试看,是日常作业。
今天,GPT-5.5跨过了那个临界点。而上一版本发布,仅仅在48天前。进化速度的斜率,才是这个时代最震撼的基准测试。你准备好了吗?这不是取代,是“彼可取而代之”——而且,它已经开始干了。
读者评论 4