R1毛利85%,但GPT-4o可能超95%
昨天晚上刷到那个标题的时候,我正在喝第二杯咖啡——对,凌晨一点,还在debug一个推理服务的缓存问题。
「DeepSeek成本利润率545%」
我直接把咖啡喷键盘上了。
这数字看着像那种"月入百万"的朋友圈广告。跟AI模型打了三年交道,第一反应就是:又来,标题党割韭菜。
但翻完官方技术文档,我发现这事儿比标题写的更有意思。
先说结论,那个545%确实是标题党。DeepSeek自己公布的数据是:一天成本8.7万美元,如果全部按R1的API价格算收入是56万美元。正确表述应该是——R1模型API业务毛利85%左右。V3价格只有R1一半,毛利大概70%。
545%怎么来的?把理论收入和纯硬件成本简单除了一下。没算带宽、没算电费、没算人力。这算法跟你开餐厅只算食材成本说利润率500%一个道理。
但这不是重点。
真正炸裂的是他们公开了成本结构
你想想,之前有哪个大模型公司敢这么干?
OpenAI不说。Anthropic不说。Google更不说。所有人都捂着成本数据像捂银行卡密码。结果DeepSeek直接把账本摊开了:我用的是H800,用了多少节点,白天多少晚上多少,缓存命中率多少,全写出来了。
我琢磨了一晚上这事儿。
越想越觉得有意思。
我之前写过一篇文章估算OpenAI的毛利在90%以上,当时评论区一群人骂我瞎猜。现在DeepSeek这数据一出来,基本坐实了我的判断。
你算算这个账。
GPT-4o输入输出定价是2.5/10美元每百万token,Claude 3.7 Sonnet是3/15美元。DeepSeek R1才收1/2美元。就算OpenAI和Anthropic是美国公司,效率再低,他们收了5-7倍的价格。
这意味着什么?
按API价格算,GPT-4o和Claude 3.7的毛利应该在95%以上。
绝了。
更逗的是,the information之前披露过,OpenAI的显卡是租微软云的,API收入要分20%给微软。微软云业务毛利50%左右。也就是说,API卖10美元,微软拿走2美元,真实成本不到1美元。
所以那些说OpenAI亏损的新闻——你懂的,会计手段做出来的。
技术上的骚操作
DeepSeek公开了三个优化技术。说实话,有几个地方我反复看了三遍才搞明白。
第一个是计算和通信并行。
他们发现对单个请求来说,dispatch和combine的延迟占比很大,大概3/5时间在通信,2/5在做计算。如果傻等着通信完成,GPU就闲着了。
他们的解法是分成两个micro-batch。一个batch做计算的时候,另一个batch在通信。通信时间就被"藏"起来了。
这个方案——不对,应该叫策略——我在2023年折腾分布式训练的时候也想过类似思路。但当时用的是InfiniBand,延迟够低,就没深入搞。现在看他们在RoCE网络上搞这个,胆子是真大。
第二个是KVCache缓存。56.3%的输入token命中缓存。
这个数字什么概念?将近一半的请求跳过了预处理环节。按他们H800单卡14.8k tokens/s的解码速度算,每天能省1.2万GPU小时。
我自己部署过R1的推理服务。当时没开缓存,成本比现在高了一大截。后来补上这个,成本直接降了快20%。
说白了就是——提前把重复工作做了。
第三个是负载均衡,分了三个层面:预填充阶段、解码阶段、MoE专家调度。
他们让每个GPU处理的计算量尽量相当,避免出现某个GPU累死、其他GPU划水的情况。听着简单,但MoE模型里某些"热门专家"被调用的频率远高于其他专家,做均衡其实挺难的。
时间套利这套玩得真溜
DeepSeek还干了一件事。
白天高峰期所有节点做推理,晚上负载低的时候释放算力做训练。
过去24小时,峰值占用了278个节点,平均226.75个节点。闲置资源再利用率18.4%。
省了大概7.8万美元一天。
你想想,大部分公司的GPU服务器晚上都在干嘛?待机。DeepSeek这波操作相当于让服务器打了两份工。
我去年帮一个创业团队部署模型的时候也想过这套路。但他们的业务量太小,晚上训练白天推理根本跑不满节点。这事儿还是得有规模才行。
为什么说现在不部署就晚了
DeepSeek V4预览版已经上线了,永久降价。而且适配了华为昇腾950芯片,下半年超节点批量上市后成本还能再降。
但窗口期正在关。
技术红利在衰减。混合精度、KVCache缓存这些方案已经被头部企业广泛采用了,你再搞也形不成差异化。
硬件资源在紧张。H200需求激增,云服务商的GPU资源可能会被提前入场的企业抢光。晚进场的等空余资源,等的时间越来越长。
市场在饱和。如果未来12个月主流模型都采用类似架构,单位token收入可能下降50%到70%。参考ChatGPT API的价格变化曲线就知道了。
我算过一笔账。
以代码生成赛道为例,2025年Q2入场,单用户日均成本0.12美元,客单价0.8美元,利润率能做到500%以上。等到2026年Q2再入场,模型规模更大导致硬件成本上升,客单价被压到更低,利润率会缩水到——大概是现在的三分之一吧。
这意味着晚一年入场,需要覆盖成倍的用户量才能达到同样的利润规模。
真的。
说回那个545%
其实DeepSeek这波公开数据,最大的意义不是那个夸张的利润率数字。
而是告诉了整个行业:大模型API业务很赚钱,非常赚钱。OpenAI和Anthropic的亏损是会计做出来的,不是真亏。
梁文锋之前说过一句话,说降价是因为成本先降下来了,也觉得AI应该是普惠的。这次的永久降价就是这句话的兑现。
而且他们还在赚钱。只是赚得少一点。
这让我想起移动互联网早期,第一批做App的人吃到了流量红利。现在AI这波,DeepSeek已经把成本打到这么低了,越早部署做业务越好。
等等党这回可能真要哭了。
你们觉得呢?现在入场还是再等等?反正我昨晚看完文档,默默把下季度的部署计划提前了三个月。
读者评论 5