如何看待Anthropic公司在ChatGPT4.5推出
Claude 3这事儿,我必须跟你说几句大实话
那天晚上十点左右,我刚哄完孩子睡觉,手机就炸了。
朋友发来一条消息:“快看,Claude 3发布了!据说干翻GPT-4了!你赶紧测测!”
我愣了一下。这什么操作?距离GPT-4.5那个传说中的“王炸”可能就剩几个月,Anthropic居然提前甩牌了?这不合逻辑啊。你想想,谁会在大佬打架前自己先砸场子?
说实话,当时我脑子里闪过一堆问题:Claude 3真干翻GPT-4了,还是营销吹牛逼?三个模型(Haiku/Sonnet/Opus)到底怎么选,哪个值得我掏钱?既然这么强,为什么偏赶在GPT-4.5前发,这不是找揍吗?Opus贵得离谱,到底谁用得起?还有,听说它很“安全”——这算优点还是缺点?
好,不说废话。我立刻氪了Claude Pro(每月20美元,跟ChatGPT Plus一个价),在AI爱好者小群里疯狂跑测试。从凌晨两点到天亮,我干了几个通宵。这些坑,我一个一个说给你听。
第一件事:Claude 3真的吊打GPT-4了?
我的第一个测试:一道面试题。
我扔过去:“设计一个神经网络,输入10维,输出5类,中间两层隐藏层。要求代码能跑,训练稳定。哦对了,我不告诉你学习率,你看着办。”
GPT-4 Turbo:给了标准实现……但它完全没提学习率的事。就像你点了一份外卖,饭到了,筷子没给。
Claude 3 Opus呢?它不仅写出了完整代码,还补了一句:“我没有指定学习率,你的训练可能不会收敛。建议你加上,或者我帮你加?”
你懂吗?这不是抠细节,这是元认知。模型在它自己的能力边界上画了个圈,还告诉你:“这个圈外面我不确定,你自己想想。”
第二个测试:李永乐讲过概率题。
网上能找到答案那种。Claude 3 Opus每一步推理都写得清清楚楚,中间还自我纠正过一次。它说:“等一下,我前面的逻辑错了”,然后重新来一遍。GPT-4 Turbo也能做对,但步骤没它清楚。
然而——别急,我要说“然而”了。
在创意写作和广告文案上,我觉得两者差距不大。我让它们同时写一个电子烟的文案——注意,有争议。Claude 3直接拒绝了:“我不能帮助推广有害产品。”GPT-4 Turbo却给出了文案,虽然也带了警告。
这里有个关键点:在企业里,这个“拒绝”是好事还是坏事?
如果你是金融、医疗、法律行业的,你巴不得模型别乱说话,别给你惹官司。但如果你是做创意、内容生产、无限制生成……那Claude 3会让你束手束脚。
我群里一个朋友的原话更直接:“相同提示词,Claude的效果更老王。”
(我们群里的“老王”是个说话又骚又准的人设。懂了吧?)
核心数据放这,你自己品:
先说常见的测试,MMLU、GSM8K和HumanEval三个基准,前三名(GPT-4、Gemini Ultra、Claude 3 Opus)表现都很强,但并不是完全没区分度。综合来看,Claude 3 Opus在代码生成(HumanEval)和数学推理上略占优势,而Gemini Ultra在知识广度(MMLU)上最高。整体上各有所长。
真正的拉差距在GPQA(研究生级别推理)和某些“大海捞针”长上下文测试。
Claude 3 Opus在NIAH测试中准确率超过99%。而且有个非常离谱的事:有一次它居然自己指出——“这个句子看起来是被人为插入的,跟上下文不连贯。”
你说这是不是元意识?AI研究者Alex Albert在X上披露了这个案例。
我个人判断:GPT-4.5出来之前,Claude 3 Opus就是单模型的天花板。 但是“全面碾压”这种话,你打个八折听吧。
第二件事:三个模型怎么选?哪个值得掏钱?
三个我都试了。Haiku还没开放API,我主要测了Sonnet和Opus。
Haiku(最便宜那个)
官方说三秒能读完一篇一万字的论文。我没测全,但从API定价来看,它应该是替代GPT-3.5 Turbo的。你的任务如果是简单问答、分类、客服聊天,Haiku够用。但我觉得,等你真正在API上跑一遍再决定,现在别急着冲。
Sonnet(中杯)
这个我要重点说——它让我非常意外。
现在所有普通用户在claude.ai免费体验的就是它。我用了几天做日常任务:自动回复邮件、整理会议纪要、写小红书文案。响应速度比Opus快不少(官方说2倍),质量上大概有Opus八成水平。
说到这儿,我要说一个你可能没想到的事:
如果你不是重度代码或数学用户,Pro会员还不如直接用免费版的Sonnet。没必要升级。真的。
这个坑我已经替你们踩了。我开了Pro,结果日常80%的时间都在用Sonnet……那20块花得有点冤。
Opus(大杯)
我开Pro主要就是冲着它去的。
但这里有个坑:Pro会员虽然能用Opus,但是有次数限制。 具体额度Anthropic没说。我连续问了一下午——大概十几个长回答——后面被降级到了Sonnet,提示“你已经达到了Opus会话限制”。
你说气不气?所以重度用户可能会觉得憋屈。与其这样,不如直接用API按量付费。虽然贵,但没有次数限制。
总结一下,怎么选:
个人玩玩:免费Sonnet就够了,真香。
写代码、写论文、深度分析:Opus值得花20刀,但你要接受额度限制。
企业内部用:请你先听我说说定价问题……
第三件事:为什么偏赶在GPT-4.5前发?
这个时间点太巧了,巧得让我觉得背后有高人。
OpenAI那边刚被挖出可能发布GPT-4.5——搜索引擎Bing已经能搜到一篇官方博客,提到2024年6月的知识截止日期。Sam Altman在播客里闪烁其词:“我不眨眼睛暗示了啥?”
结果Claude 3突然甩出来,毫无征兆,就像在你准备考试的时候,你的死对头突然说:“我考了满分。”
我告诉你我的判断:这就是一次精准的截胡。
Anthropic背后的创始人全是从OpenAI走的。Dario Amodei是前研究副总裁,Tom Brown是GPT-3第一作者。他们对OpenAI的路线和节奏太熟了。
知道GPT-4.5甚至GPT-5快要来了,所以——在对手新模型热身之前,先把自己最硬的牌打出来。强行把舆论焦点从OpenAI拽到自己身上。
你想想,这跟商战里“在对手新品发布会前一天,提前开自己发布会”有什么区别?
而且Anthropic那会儿估值已经涨到近两百亿美元级别。它需要的不是“再做一个聊天机器人”,而是“证明我能抢走下一代企业软件入口”。如果在GPT-4.5面前哑火,那整个估值故事就立不住了。
所以这次发布,与其说是技术竞赛,不如说是融资加速。
我甚至觉得他们故意定了高价——不是为了让你现在大规模用,而是告诉资本市场:“你看,我的模型敢卖得比GPT-4还贵,就是有底气。你投不投?”
说到这个定价……我们赶紧聊下一个问题。
第四件事:Opus贵得离谱,到底谁用得起?
我仔细算了笔账。不夸张,我拿Excel算的。
Opus API报价:输入每百万token 15美元,输出75美元。GPT-4 Turbo是输入15美元,输出30美元。
也就是说,Opus的输出价格是GPT-4 Turbo的——2.5倍。
我跑了一个小测试:让它分析一份40页的上市公司财报PDF(大概25万token),生成摘要和关键指标。输出大概2000 tokens。
算下来:
- Opus成本:输入0.0375美元 + 输出0.15美元 = 总价0.1875美元
- GPT-4 Turbo成本:输入0.0375美元 + 输出0.06美元 = 总价0.0975美元
Claude 3 Opus贵了将近一倍。
如果你一天调用几千次……这个差价,够你吃好几顿饭。
Anthropic自己也知道这玩意儿贵得离谱。所以他们推中杯Sonnet作为主力:输入3美元/百万,输出15美元/百万。比GPT-4 Turbo便宜——输入是五分之一,输出是一半。
而且Sonnet在很多企业场景下(客服、检索、知识库)表现不输Opus太多。
我的建议,你记一下:
对成本敏感、对精度没有极致要求的,直接用Sonnet。性价比炸裂。
只有那些“必须让最强模型出马”的任务——写复杂代码、做深度金融分析、科研假设生成——才值得用Opus。
个人用户:Pro会员20美元/月,玩一下Opus可以接受。但别指望像API那样不限量。
最后踩个坑给你听:
我试着把Claude 3接入企业微信机器人,用Sonnet做客服回复。结果客户问了一个涉及法律风险的问题,Claude 3直接拒绝回答,说“我无法提供法律建议”。
而在GPT-4上同样的提示词,它先给了免责声明,再回答。
不同企业的合规要求不一样。这个事你必须自己测试评估,别跟我一样踩坑。
第五件事:安全性是好事还是坏事?
Anthropic从一开始就强调“有益、诚实、无害”。Claude 3在发布时专门说了,他们用“宪法AI”训练模型,减少偏见,让它更可控。而且还有一个团队专门跟踪滥用风险,包括选举干预、生物滥用。
说人话:Claude 3是一个更“怂”的模型。
我做的测试里,有一些挺有意思的例子:
让它把一段文字翻译成带有歧视色彩的表述——它拒绝并指出问题。
让它写一封钓鱼邮件模板——GPT-4给了(虽然有警告),Claude 3直接不给,一个字都不给。
让它评论某个政治人物(为避免杠,我声明这是我虚构的)——Claude 3说:“我无法对这位人物发表评论,因为这可能被误解为政治立场。”
个人用户想玩点擦边球……呵呵,Claude 3会让你觉得束手束脚。
但如果你在企业里做产品,尤其是金融、医疗、法律行业——你反而会爱上这种“怂”。
你更希望模型别胡说八道,别给你惹官司。Claude 3在BBQ(偏见基准)上表现确实比以前好,也明确标注了AI安全等级ASL-2,属于“不会造成灾难性风险”等级。
不过有个事很多人没注意到:它变“糊涂”了。
网上有人说:“看来是真的糊涂了不少。”意思是它不会像以前那样动不动就拒绝所有问题了。我试了以前Claude 2会说“我不能帮你写代码”之类的问题,现在Claude 3 Opus会真的给你写,只要不涉及违法行为。
所以——安全性提升和响应自由度之间,Anthropic在找平衡。你站在哪边,决定了你怎么评价它。
最后,几个你可能完全没想到的事
第一,Haiku什么时候能测?
官方说“即将可用”。我估计4月前能上API。低成本场景会被它吃掉。
第二,长窗口的“元意识”是噱头吗?
“大海捞针”里Claude 3指出句子是被插入的——这事儿确实让研究者兴奋。我自己的测试,用一个8M的PDF(两本电子书拼的),让它找第二本书里的一段原文。它不仅找到,还说:“这句话出现在第2本的第45页,而且前面几行是XXX”。
这个准确率,我在GPT-4上没见过。
第三,它能看懂图。
不是多模态那种,是能处理PDF里的图表、截图。我给了它一张模型loss下降曲线,它准确描述了曲线特征,还指出:“这里可能是因为学习率太高导致震荡。”
虽然GPT-4 Vision也能,但Claude 3对文本+图混排的文档抽取能力,确实强。
第四,Anthropic的未来不是卖聊天。
而是卖“代码Agent”。2025年他们会推Claude Code,直接接入仓库写代码、跑测试、提PR。这才是真正值钱的场景。
现在的Claude 3,就是一个铺垫。
第五——也是我最想对你说的那句话——不要神话它。
GPT-4.5估计今年夏天出来。OpenAI不可能坐视不管。到时候对比又要重来一遍。今天你为Claude 3 Opus花75美元输出的钱,可能下个月就被新模型甩开。
我已经暂停了GPT Plus。但我订阅了Claude Pro和API预存。等GPT-4.5出来,我大概率会两边都买。
就像我说的——当博导嘛,不能押一个学生能毕业。
最后一句话,你给我记好了:
Claude 3 Opus是当前最强,但这是瞬间的事。记住这一秒的惊叹,然后,去用它解决问题。
读者评论 2