← 返回资讯
赵一鸣
产品评测编辑
已审核

R1毛利85%,但GPT-4o可能超95%

昨天晚上刷到那个标题的时候,我正在喝第二杯咖啡——对,凌晨一点,还在debug一个推理服务的缓存问题。

R1毛利85%,但GPT-4o可能超95%

R1毛利85%,但GPT-4o可能超95%


昨天晚上刷到那个标题的时候,我正在喝第二杯咖啡——对,凌晨一点,还在debug一个推理服务的缓存问题。

「DeepSeek成本利润率545%」

我直接把咖啡喷键盘上了。

这数字看着像那种"月入百万"的朋友圈广告。跟AI模型打了三年交道,第一反应就是:又来,标题党割韭菜。

但翻完官方技术文档,我发现这事儿比标题写的更有意思。

先说结论,那个545%确实是标题党。DeepSeek自己公布的数据是:一天成本8.7万美元,如果全部按R1的API价格算收入是56万美元。正确表述应该是——R1模型API业务毛利85%左右。V3价格只有R1一半,毛利大概70%。

545%怎么来的?把理论收入和纯硬件成本简单除了一下。没算带宽、没算电费、没算人力。这算法跟你开餐厅只算食材成本说利润率500%一个道理。

但这不是重点。

真正炸裂的是他们公开了成本结构

你想想,之前有哪个大模型公司敢这么干?

OpenAI不说。Anthropic不说。Google更不说。所有人都捂着成本数据像捂银行卡密码。结果DeepSeek直接把账本摊开了:我用的是H800,用了多少节点,白天多少晚上多少,缓存命中率多少,全写出来了。

我琢磨了一晚上这事儿。

越想越觉得有意思。

我之前写过一篇文章估算OpenAI的毛利在90%以上,当时评论区一群人骂我瞎猜。现在DeepSeek这数据一出来,基本坐实了我的判断。

你算算这个账。

GPT-4o输入输出定价是2.5/10美元每百万token,Claude 3.7 Sonnet是3/15美元。DeepSeek R1才收1/2美元。就算OpenAI和Anthropic是美国公司,效率再低,他们收了5-7倍的价格。

这意味着什么?

按API价格算,GPT-4o和Claude 3.7的毛利应该在95%以上。

绝了。

更逗的是,the information之前披露过,OpenAI的显卡是租微软云的,API收入要分20%给微软。微软云业务毛利50%左右。也就是说,API卖10美元,微软拿走2美元,真实成本不到1美元。

所以那些说OpenAI亏损的新闻——你懂的,会计手段做出来的。

技术上的骚操作

DeepSeek公开了三个优化技术。说实话,有几个地方我反复看了三遍才搞明白。

第一个是计算和通信并行。

他们发现对单个请求来说,dispatch和combine的延迟占比很大,大概3/5时间在通信,2/5在做计算。如果傻等着通信完成,GPU就闲着了。

他们的解法是分成两个micro-batch。一个batch做计算的时候,另一个batch在通信。通信时间就被"藏"起来了。

这个方案——不对,应该叫策略——我在2023年折腾分布式训练的时候也想过类似思路。但当时用的是InfiniBand,延迟够低,就没深入搞。现在看他们在RoCE网络上搞这个,胆子是真大。

第二个是KVCache缓存。56.3%的输入token命中缓存。

这个数字什么概念?将近一半的请求跳过了预处理环节。按他们H800单卡14.8k tokens/s的解码速度算,每天能省1.2万GPU小时。

我自己部署过R1的推理服务。当时没开缓存,成本比现在高了一大截。后来补上这个,成本直接降了快20%。

说白了就是——提前把重复工作做了。

第三个是负载均衡,分了三个层面:预填充阶段、解码阶段、MoE专家调度。

他们让每个GPU处理的计算量尽量相当,避免出现某个GPU累死、其他GPU划水的情况。听着简单,但MoE模型里某些"热门专家"被调用的频率远高于其他专家,做均衡其实挺难的。

时间套利这套玩得真溜

DeepSeek还干了一件事。

白天高峰期所有节点做推理,晚上负载低的时候释放算力做训练。

过去24小时,峰值占用了278个节点,平均226.75个节点。闲置资源再利用率18.4%。

省了大概7.8万美元一天。

你想想,大部分公司的GPU服务器晚上都在干嘛?待机。DeepSeek这波操作相当于让服务器打了两份工。

我去年帮一个创业团队部署模型的时候也想过这套路。但他们的业务量太小,晚上训练白天推理根本跑不满节点。这事儿还是得有规模才行。

为什么说现在不部署就晚了

DeepSeek V4预览版已经上线了,永久降价。而且适配了华为昇腾950芯片,下半年超节点批量上市后成本还能再降。

但窗口期正在关。

技术红利在衰减。混合精度、KVCache缓存这些方案已经被头部企业广泛采用了,你再搞也形不成差异化。

硬件资源在紧张。H200需求激增,云服务商的GPU资源可能会被提前入场的企业抢光。晚进场的等空余资源,等的时间越来越长。

市场在饱和。如果未来12个月主流模型都采用类似架构,单位token收入可能下降50%到70%。参考ChatGPT API的价格变化曲线就知道了。

我算过一笔账。

以代码生成赛道为例,2025年Q2入场,单用户日均成本0.12美元,客单价0.8美元,利润率能做到500%以上。等到2026年Q2再入场,模型规模更大导致硬件成本上升,客单价被压到更低,利润率会缩水到——大概是现在的三分之一吧。

这意味着晚一年入场,需要覆盖成倍的用户量才能达到同样的利润规模。

真的。

说回那个545%

其实DeepSeek这波公开数据,最大的意义不是那个夸张的利润率数字。

而是告诉了整个行业:大模型API业务很赚钱,非常赚钱。OpenAI和Anthropic的亏损是会计做出来的,不是真亏。

梁文锋之前说过一句话,说降价是因为成本先降下来了,也觉得AI应该是普惠的。这次的永久降价就是这句话的兑现。

而且他们还在赚钱。只是赚得少一点。

这让我想起移动互联网早期,第一批做App的人吃到了流量红利。现在AI这波,DeepSeek已经把成本打到这么低了,越早部署做业务越好。

等等党这回可能真要哭了。

你们觉得呢?现在入场还是再等等?反正我昨晚看完文档,默默把下季度的部署计划提前了三个月。

316
10563 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月27日 11:38

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 2周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 3天前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 6天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)