估算 Claude Opus 4.5/4.6 和 GPT 的真实大小:它到底有多少参数?
参数的大小,到底谁在说谎?
你猜我上周收到了多少条私信?整整38条。全是同一个问题:新一代Claude Opus到底有多大?
说实话,我的第一反应是不想写。
为啥?因为一个让人尴尬的事实摆在那儿:Anthropic和OpenAI,从没公开过自家旗舰模型的真实参数。你看到的“25T”“10T”“5T”,90%都是从犄角旮旯扒出来的碎片,加点想象力就敢往外发。
但我还是动笔了。你想想,这事儿跟你口袋里的钱直接挂钩。参数大小决定你花多少成本、能跑多快、能干多少活。信了那些10T的鬼话,选型的时候一脚踩进坑里,那叫一个惨。
先把结论拍了,免得你读到一半没耐心:
现在所有一线模型的活跃参数,都在50B-150B这个区间。总参数在1T-2T。
最新版Claude Opus的活跃参数?100B上下,总参数1.5T-2T。
那些10T、25T的传闻?要么是把训练数据量搞混了,要么就是把推理速度里的“T”拉来凑数。
它到底多大?我用数据跑了个“测谎”
去年年底我开始系统性地测这些大家伙。一开始用AlpacaEval,测着测着发现不对劲——这玩意儿只反映指令遵循能力,跟模型大小八竿子打不着。
真正让我开窍的,是今年2月一篇逆向工程分析。
作者叫unexcitedneurons,在Substack上发了一篇文章。这哥们干了件漂亮事:拿OpenRouter上各模型在Vertex和Bedrock的token吞吐数据,倒推模型参数量。
你看,这里的逻辑:同一个硬件后端上,token生成速度主要受限于每次前向传播要加载和计算的活跃参数量。MoE模型尤其明显——每次推理只激活一部分专家,所以“活跃参数”才是决定速度的关键。
他拿了3个开源MoE模型做校准基准,推算出Vertex平台的有效内存带宽大概是4.0-4.5 TB/s。
然后算出什么了?最新版Claude Opus在FP8精度下,活跃参数是93-105B。如果按FP8稠密层+FP4混合专家层,大概是127-154B。
我看完坐直了,马上拿自己的实测数据去核对。
任务挺无聊:让模型把一篇2000字的英文论文摘要翻译成中文,同时提取关键词。最新版Claude Opus在我的测试里,速度大概是GPT-4o的70%。如果GPT-4o的活跃参数是200B(网上比较公认的数字),那么最新版Claude Opus大约140B——跟前面的分析对上了。
有意思的来了:这比上一代Claude Opus小了一大截。
马斯克有一次公开场合“说漏嘴”,提到上一代Claude Opus参数约5T,Sonnet约1T。后来大家对照推理速度发现,上一代的总参数可能真的到了5T-6T,但活跃参数大概是180B左右。
那为啥最新版反而小了?
答案就两个字:蒸馏。
从定价就能看出来:最新版Claude Opus的API价格——输入$15/百万token,输出$75/百万token——比它的前代刚发布时便宜了近三分之二。速度呢?快了大概3倍。
你品,你细品:一个模型快了3倍、便宜了一大半,大概率不是因为硬件进步了——而是模型本身就变小了。
“25T”那出戏,到底是从哪传出来的?
这个坑我踩过。去年我一篇文章里引用过“Claude参数25T”的说法,被同行追着怼了三天。专门去查原始出处,才发现问题出在哪儿。
网上流传的“25T”,大概率指的是训练数据量——25T tokens,用25万亿个token的数据来训练。Anthropic训练Opus系列时确实用了海量数据,但有人把“训练数据25T tokens”直接传成了“模型参数25T”。
还有一个来源:一篇已经被证伪的论文,声称Claude有25T参数。学术界复现后发现,原始代码有严重逻辑偏差,结论根本站不住脚。
说到这儿,我得说句大实话:你要是有台机器能跑25T参数的模型,我给你磕三个响头。现在最强的商用GPU,H100是80GB显存,B200大概192GB。一个25T参数的模型,就算用FP4量化——每个参数2比特——也需要大约6.25TB显存。多少张显卡?78张B200才能塞下去。
而且MoE的通信开销是噩梦级的。别说推理了,做一次前向传播的延迟,就能让你怀疑人生。
所以“10T+”的说法,在当前硬件条件下根本站不住。1.5T-2T的总参数,100B左右的活跃参数,是目前能跑得动的上限。
怎么自己当侦探?
这事儿挺好玩,我教你怎么干。
有API权限的话,找个固定平台——比如Azure或Bedrock——拿同一个测试prompt去对比不同模型的输出速度。
我用常用测试来举例:
最新版Claude Opus (Bedrock)
prompt:“写一篇500字的回答,主题是‘为什么程序员35岁不是危机’”
速度:约35 token/sec
最新版Claude Sonnet (Bedrock)
prompt:同上
速度:约55 token/sec
GPT-4o (Azure)
prompt:同上
速度:约50 token/secSonnet比Opus快了大概1.5倍,说明Sonnet的活跃参数大约是Opus的2/3。GPT-4o跟Sonnet差不多,但GPT-4o可能是200B总参数的密集模型,Sonnet的MoE架构用更少的总参数实现相近速度——这说明Anthropic在MoE这块确实有两下子。
但有个坑,我踩过一次,疼得很:不同平台不能直接用速度对比。在OpenRouter上测了Opus和某个中国模型的推理速度,结果在Vertex上Opus跑得慢,在另一家提供商上又突然变快。后来发现是平台用的硬件不同——H
读者评论 5