自适应思考省了Token,但关键时刻翻车了
那天晚上刷到Anthropic的更新公告,第一反应是——又来卷编程了?
用了三天,发现整件事完全想偏了。
Opus 4.6最大的杀手锏根本不是编程。是它终于学会了一个职场老油条的必备技能:看人下菜碟。
真的。
我用Claude快十年了。从1.0那个问它"今天星期几"都要愣两秒的版本开始。这些年它给我的感觉一直很割裂——智商拉满,情商欠费。你不把话说得明明白白、需求拆得清清楚楚,它就杵在那儿等你投喂指令。
4.6不一样。它开始揣摩你了。
自适应思考这事儿,比官方描述的阴险十倍
官方管它叫Adaptive Thinking,翻译过来就是"自适应思考"。
说白了,这功能解决了一个很具体的痛点。
以前用Claude,开推理模式心疼Token,关掉又怕答得太浅。开不开全凭你猜。跟去一家没菜单的私房菜馆似的,服务员不告诉你菜量多大,你只能瞎蒙——点少了不够吃,点多了浪费。
现在呢?Claude自己判断。
简单问题秒回,复杂问题慢慢想。听着挺美好对吧?
我周三下午拿它测了一整天。发现这玩意儿比想象中鸡贼得多。
比如我问"1+1等于几",它几乎0延迟直接回。但我把一份37页的Q3财报扔进去,说"帮我标注出异常数据点",它会自动切进深度推理模式——你能看到那个推理进度条慢慢走,Token消耗大概比非推理模式多了20%到130%。
省钱了。
讲真。
但这里有个坑,我踩过一次。当时是周五晚上赶一个项目复盘,我问了个看起来很简单的问题:"这段Python代码为什么报错?"它觉得简单,秒回了个答案。结果答案不对。那个bug藏得很深,是个异步调用时序问题,表面上看是语法错误,实际上要追溯到三层调用栈之外。
翻车了。
所以我的建议是:重要任务别省那点Token,手动开推理。这个自适应更适合日常闲聊和轻量任务。 它判断"简单"和"复杂"的标准,跟你真正需要的深度,有时候不在一个频道上。
不是不行,就是有点不靠谱。
1M上下文,这次真不是PPT功能
Claude之前也支持长上下文。但怎么说呢——超过一定长度就开始"失忆"。你给它扔一本小说进去,问第3章主角穿的什么颜色衣服,它能给你编一个出来。还挺像那么回事。
这次4.6在MRCR v2的8-needle 1M测试里拿了76%。
对比一下,Sonnet 4.5只有18.5%。
这个差距大到什么程度?就像一个人认真读了整本书做了笔记,另一个人翻了目录就开始写读后感。
我做了个真实测试。扔了一堆项目文档进去——大概40万token,包含需求文档、API文档、数据库schema,还有之前几个月的会议纪要。然后问它:"第三季度为什么延迟上线?"
它从8月15号的会议纪要里翻出一条记录,说技术方案评审没通过,评审意见是架构扩展性不够。又翻出9月3号的另一条,说依赖的第三方SDK有个安全漏洞,等对方修复等了两周。
全对。
以前的版本大概会告诉我"根据文档推测可能是因为技术问题"。
你品。
但注意,1M上下文目前是beta版本,默认还是200K。想用的话得手动切,而且超过200K的部分要加钱——输入每百万token从5美元涨到10美元,输出从25美元涨到37.5美元。
贵是真的贵。好用也是真好用。
编程:强,但别被官方宣传带偏了
Anthropic说Opus 4.6在编程上"几乎全方位领先",Terminal-Bench 2.0拿了最高分。
我实测下来,感觉有点微妙。
我让它和Opus 4.5同时开发一个聚合搜索引擎。两个都完成了任务,但4.5的版本搜出来的结果乱七八糟,4.6确实更准确。不过这个差距——怎么说呢——不是那种"卧槽这也能行"的震撼,更多是"嗯,确实好一些"的程度。
然后网上有人测了Opus 4.6和GPT-5.3-Codex的对比。在Terminal-Bench上GPT-5.3-Codex反而领先了11.9%。
这就尴尬了。
Anthropic半夜发公告说自己是"编程新王",结果OpenAI当晚就掏出了GPT-5.3-Codex。两家半夜打架,我们打工人第二天早上起来一脸懵。
我的判断是:Opus 4.6的编程确实强,但不是断档式的强。 大型代码库的理解、调试、自我纠错上有明显进步。但如果你只是写个脚本、做个简单网站,说实话跟4.5差别不大。不大到你可能感受不到。
真正拉开差距的是复杂项目——多文件、多依赖、需要理解整体架构的那种。这种场景下,4.6的100万上下文就派上用场了,不用来回切文件,一把梭。那个体验,巴适。
字符处理:这才是Claude真正的护城河
如果说编程是Opus跟GPT打得有来有回,那字符处理就是Opus单方面碾压。
这事儿从Claude系列出生就注定了。到4.6更离谱。
#41错乱文本解析题,之前所有模型都过不了半数case。Opus 4.6推理模式首次通过了超过半数,非推理模式也有半数通过。
GPT-5.2的上限,是Opus 4.6的下限。
绝了。
#55障碍地图题,GPT-5.2犯了好几处小错误——有些是那种"你看一眼就知道不对"的错误。Opus 4.6一次就满分。
我测了这么多年模型,字符处理这块,Opus通常领先其他模型8个月以上。不是我吹,数据摆在那儿。
为什么这很重要?因为真实世界的文本是乱的。
PDF转出来的格式错乱、用户输入的错别字、OCR识别的一坨屎、从微信粘贴过来带着各种隐藏字符——这些场景下,Opus的容错率高得离谱。你让GPT处理一份扫描版合同,它可能漏掉关键条款。Opus不会。
挺好的这东西。
金融和办公:华尔街的饭碗真的在抖
这次Opus 4.6还专门强调了金融分析能力。官方说在约50个金融分析用例上,比Sonnet 4.5提升超过23个百分点。
然后FactSet当天股价暴跌10%。S&P Global、穆迪、纳斯达克全在跌。
不是巧合。
我试了试它的Excel能力——这功能叫Claude in Excel,配合新出的Claude in PowerPoint。你给它一堆供应链数据,它能自动找出异常值,还能画折线图。PPT也能直接生成,从布局到字体到母板,保证符合品牌规范。
说实话,我这种写了十年文章的人,看到这个心情很复杂。一方面觉得真方便。另一方面觉得——这不就是把我的活儿也顺便干了吗?
但转念一想,工具而已。电钻发明了,木匠也没灭绝。会用的人更值钱,不会用的被淘汰。大概是这样吧。扯远了,说回正题——金融分析这个赛道的护城河,正在以肉眼可见的速度被填平。
如果你也在纠结要不要升
Opus 4.6的价格没涨,输入5美元/百万token,输出25美元/百万token。超过200K上下文翻倍。Pro和Max用户还送了50美元额度,但得在2月16号前激活。
如果你日常用Claude写代码、处理长文档、做数据分析,值得升。1M上下文和自适应思考能省不少事。
如果你只是偶尔聊聊天、写写文章,说实话4.5够用了。4.6的提升你未必感受得到。
但有一点是确定的:AI正在从"能聊天"变成"能干活的"。 这次Opus 4.6的更新,编程、金融、办公三管齐下,摆明了要抢打工人的饭碗。或者说——帮打工人抢别人的饭碗。
看你站哪边了。
真到了那一天,别怪我没提醒你。
读者评论 3