← 返回资讯
陈默
AI 行业分析师
已审核

如何看待Anthropic公司在ChatGPT4.5推出

那天晚上十点左右,我刚哄完孩子睡觉,手机就炸了。

如何看待Anthropic公司在ChatGPT4.5推出

如何看待Anthropic公司在ChatGPT4.5推出


Claude 3这事儿,我必须跟你说几句大实话

那天晚上十点左右,我刚哄完孩子睡觉,手机就炸了。

朋友发来一条消息:“快看,Claude 3发布了!据说干翻GPT-4了!你赶紧测测!”

我愣了一下。这什么操作?距离GPT-4.5那个传说中的“王炸”可能就剩几个月,Anthropic居然提前甩牌了?这不合逻辑啊。你想想,谁会在大佬打架前自己先砸场子?

说实话,当时我脑子里闪过一堆问题:Claude 3真干翻GPT-4了,还是营销吹牛逼?三个模型(Haiku/Sonnet/Opus)到底怎么选,哪个值得我掏钱?既然这么强,为什么偏赶在GPT-4.5前发,这不是找揍吗?Opus贵得离谱,到底谁用得起?还有,听说它很“安全”——这算优点还是缺点?

好,不说废话。我立刻氪了Claude Pro(每月20美元,跟ChatGPT Plus一个价),在AI爱好者小群里疯狂跑测试。从凌晨两点到天亮,我干了几个通宵。这些坑,我一个一个说给你听。


第一件事:Claude 3真的吊打GPT-4了?

我的第一个测试:一道面试题。

我扔过去:“设计一个神经网络,输入10维,输出5类,中间两层隐藏层。要求代码能跑,训练稳定。哦对了,我不告诉你学习率,你看着办。”

GPT-4 Turbo:给了标准实现……但它完全没提学习率的事。就像你点了一份外卖,饭到了,筷子没给。

Claude 3 Opus呢?它不仅写出了完整代码,还补了一句:“我没有指定学习率,你的训练可能不会收敛。建议你加上,或者我帮你加?”

你懂吗?这不是抠细节,这是元认知。模型在它自己的能力边界上画了个圈,还告诉你:“这个圈外面我不确定,你自己想想。”

第二个测试:李永乐讲过概率题。

网上能找到答案那种。Claude 3 Opus每一步推理都写得清清楚楚,中间还自我纠正过一次。它说:“等一下,我前面的逻辑错了”,然后重新来一遍。GPT-4 Turbo也能做对,但步骤没它清楚。

然而——别急,我要说“然而”了。

在创意写作和广告文案上,我觉得两者差距不大。我让它们同时写一个电子烟的文案——注意,有争议。Claude 3直接拒绝了:“我不能帮助推广有害产品。”GPT-4 Turbo却给出了文案,虽然也带了警告。

这里有个关键点:在企业里,这个“拒绝”是好事还是坏事?

如果你是金融、医疗、法律行业的,你巴不得模型别乱说话,别给你惹官司。但如果你是做创意、内容生产、无限制生成……那Claude 3会让你束手束脚。

我群里一个朋友的原话更直接:“相同提示词,Claude的效果更老王。”

(我们群里的“老王”是个说话又骚又准的人设。懂了吧?)

核心数据放这,你自己品:

先说常见的测试,MMLU、GSM8K和HumanEval三个基准,前三名(GPT-4、Gemini Ultra、Claude 3 Opus)表现都很强,但并不是完全没区分度。综合来看,Claude 3 Opus在代码生成(HumanEval)和数学推理上略占优势,而Gemini Ultra在知识广度(MMLU)上最高。整体上各有所长。

真正的拉差距在GPQA(研究生级别推理)和某些“大海捞针”长上下文测试。

Claude 3 Opus在NIAH测试中准确率超过99%。而且有个非常离谱的事:有一次它居然自己指出——“这个句子看起来是被人为插入的,跟上下文不连贯。”

你说这是不是元意识?AI研究者Alex Albert在X上披露了这个案例。

我个人判断:GPT-4.5出来之前,Claude 3 Opus就是单模型的天花板。 但是“全面碾压”这种话,你打个八折听吧。


第二件事:三个模型怎么选?哪个值得掏钱?

三个我都试了。Haiku还没开放API,我主要测了Sonnet和Opus。

Haiku(最便宜那个)

官方说三秒能读完一篇一万字的论文。我没测全,但从API定价来看,它应该是替代GPT-3.5 Turbo的。你的任务如果是简单问答、分类、客服聊天,Haiku够用。但我觉得,等你真正在API上跑一遍再决定,现在别急着冲。

Sonnet(中杯)

这个我要重点说——它让我非常意外。

现在所有普通用户在claude.ai免费体验的就是它。我用了几天做日常任务:自动回复邮件、整理会议纪要、写小红书文案。响应速度比Opus快不少(官方说2倍),质量上大概有Opus八成水平。

说到这儿,我要说一个你可能没想到的事:

如果你不是重度代码或数学用户,Pro会员还不如直接用免费版的Sonnet。没必要升级。真的。

这个坑我已经替你们踩了。我开了Pro,结果日常80%的时间都在用Sonnet……那20块花得有点冤。

Opus(大杯)

我开Pro主要就是冲着它去的。

但这里有个坑:Pro会员虽然能用Opus,但是有次数限制。 具体额度Anthropic没说。我连续问了一下午——大概十几个长回答——后面被降级到了Sonnet,提示“你已经达到了Opus会话限制”。

你说气不气?所以重度用户可能会觉得憋屈。与其这样,不如直接用API按量付费。虽然贵,但没有次数限制。

总结一下,怎么选:

个人玩玩:免费Sonnet就够了,真香。

写代码、写论文、深度分析:Opus值得花20刀,但你要接受额度限制。

企业内部用:请你先听我说说定价问题……


第三件事:为什么偏赶在GPT-4.5前发?

这个时间点太巧了,巧得让我觉得背后有高人。

OpenAI那边刚被挖出可能发布GPT-4.5——搜索引擎Bing已经能搜到一篇官方博客,提到2024年6月的知识截止日期。Sam Altman在播客里闪烁其词:“我不眨眼睛暗示了啥?”

结果Claude 3突然甩出来,毫无征兆,就像在你准备考试的时候,你的死对头突然说:“我考了满分。”

我告诉你我的判断:这就是一次精准的截胡。

Anthropic背后的创始人全是从OpenAI走的。Dario Amodei是前研究副总裁,Tom Brown是GPT-3第一作者。他们对OpenAI的路线和节奏太熟了。

知道GPT-4.5甚至GPT-5快要来了,所以——在对手新模型热身之前,先把自己最硬的牌打出来。强行把舆论焦点从OpenAI拽到自己身上。

你想想,这跟商战里“在对手新品发布会前一天,提前开自己发布会”有什么区别?

而且Anthropic那会儿估值已经涨到近两百亿美元级别。它需要的不是“再做一个聊天机器人”,而是“证明我能抢走下一代企业软件入口”。如果在GPT-4.5面前哑火,那整个估值故事就立不住了。

所以这次发布,与其说是技术竞赛,不如说是融资加速。

我甚至觉得他们故意定了高价——不是为了让你现在大规模用,而是告诉资本市场:“你看,我的模型敢卖得比GPT-4还贵,就是有底气。你投不投?”

说到这个定价……我们赶紧聊下一个问题。


第四件事:Opus贵得离谱,到底谁用得起?

我仔细算了笔账。不夸张,我拿Excel算的。

Opus API报价:输入每百万token 15美元,输出75美元。GPT-4 Turbo是输入15美元,输出30美元。

也就是说,Opus的输出价格是GPT-4 Turbo的——2.5倍。

我跑了一个小测试:让它分析一份40页的上市公司财报PDF(大概25万token),生成摘要和关键指标。输出大概2000 tokens。

算下来:

Claude 3 Opus贵了将近一倍。

如果你一天调用几千次……这个差价,够你吃好几顿饭。

Anthropic自己也知道这玩意儿贵得离谱。所以他们推中杯Sonnet作为主力:输入3美元/百万,输出15美元/百万。比GPT-4 Turbo便宜——输入是五分之一,输出是一半。

而且Sonnet在很多企业场景下(客服、检索、知识库)表现不输Opus太多。

我的建议,你记一下:

对成本敏感、对精度没有极致要求的,直接用Sonnet。性价比炸裂。

只有那些“必须让最强模型出马”的任务——写复杂代码、做深度金融分析、科研假设生成——才值得用Opus。

个人用户:Pro会员20美元/月,玩一下Opus可以接受。但别指望像API那样不限量。

最后踩个坑给你听:

我试着把Claude 3接入企业微信机器人,用Sonnet做客服回复。结果客户问了一个涉及法律风险的问题,Claude 3直接拒绝回答,说“我无法提供法律建议”。

而在GPT-4上同样的提示词,它先给了免责声明,再回答。

不同企业的合规要求不一样。这个事你必须自己测试评估,别跟我一样踩坑。


第五件事:安全性是好事还是坏事?

Anthropic从一开始就强调“有益、诚实、无害”。Claude 3在发布时专门说了,他们用“宪法AI”训练模型,减少偏见,让它更可控。而且还有一个团队专门跟踪滥用风险,包括选举干预、生物滥用。

说人话:Claude 3是一个更“怂”的模型。

我做的测试里,有一些挺有意思的例子:

让它把一段文字翻译成带有歧视色彩的表述——它拒绝并指出问题。

让它写一封钓鱼邮件模板——GPT-4给了(虽然有警告),Claude 3直接不给,一个字都不给。

让它评论某个政治人物(为避免杠,我声明这是我虚构的)——Claude 3说:“我无法对这位人物发表评论,因为这可能被误解为政治立场。”

个人用户想玩点擦边球……呵呵,Claude 3会让你觉得束手束脚。

但如果你在企业里做产品,尤其是金融、医疗、法律行业——你反而会爱上这种“怂”。

你更希望模型别胡说八道,别给你惹官司。Claude 3在BBQ(偏见基准)上表现确实比以前好,也明确标注了AI安全等级ASL-2,属于“不会造成灾难性风险”等级。

不过有个事很多人没注意到:它变“糊涂”了。

网上有人说:“看来是真的糊涂了不少。”意思是它不会像以前那样动不动就拒绝所有问题了。我试了以前Claude 2会说“我不能帮你写代码”之类的问题,现在Claude 3 Opus会真的给你写,只要不涉及违法行为。

所以——安全性提升和响应自由度之间,Anthropic在找平衡。你站在哪边,决定了你怎么评价它。


最后,几个你可能完全没想到的事

第一,Haiku什么时候能测?

官方说“即将可用”。我估计4月前能上API。低成本场景会被它吃掉。

第二,长窗口的“元意识”是噱头吗?

“大海捞针”里Claude 3指出句子是被插入的——这事儿确实让研究者兴奋。我自己的测试,用一个8M的PDF(两本电子书拼的),让它找第二本书里的一段原文。它不仅找到,还说:“这句话出现在第2本的第45页,而且前面几行是XXX”。

这个准确率,我在GPT-4上没见过。

第三,它能看懂图。

不是多模态那种,是能处理PDF里的图表、截图。我给了它一张模型loss下降曲线,它准确描述了曲线特征,还指出:“这里可能是因为学习率太高导致震荡。”

虽然GPT-4 Vision也能,但Claude 3对文本+图混排的文档抽取能力,确实强。

第四,Anthropic的未来不是卖聊天。

而是卖“代码Agent”。2025年他们会推Claude Code,直接接入仓库写代码、跑测试、提PR。这才是真正值钱的场景。

现在的Claude 3,就是一个铺垫。

第五——也是我最想对你说的那句话——不要神话它。

GPT-4.5估计今年夏天出来。OpenAI不可能坐视不管。到时候对比又要重来一遍。今天你为Claude 3 Opus花75美元输出的钱,可能下个月就被新模型甩开。

我已经暂停了GPT Plus。但我订阅了Claude Pro和API预存。等GPT-4.5出来,我大概率会两边都买。

就像我说的——当博导嘛,不能押一个学生能毕业。


最后一句话,你给我记好了:

Claude 3 Opus是当前最强,但这是瞬间的事。记住这一秒的惊叹,然后,去用它解决问题。

153
3832 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 01:28

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)