Claude编程最强但贵30倍,DeepSeek性价比碾压
这问题一年能费我200个GPU小时。
先扔结论:2026年6月,你要是个正经干活儿的人,模型不是越贵越好——Claude Fable 5的编程Agent得分62,甩开第二名一大截,但你用API调一次够吃两顿海底捞。DeepSeek V4 Pro性价比暴打全场,不过编程能力真不如Claude。选哪个?看你是要命还是要钱。
真的。
上周三下午,我翻了下自己的API账单。6月调用量87万次,花的钱够买一台顶配MacBook Pro。其中37%花在Claude上,但产出的代码量只占19%。剩下的全喂给DeepSeek和GLM,便宜得像不要钱。
这事儿我得从头说。
两年前我能闭着眼睛推荐,现在?
现在不行了。
我浏览器收藏夹里躺着17个评测页面。Artificial Analysis、SWE-bench、AIME、MMMU,光是把这些跑分看一遍就得俩小时。版本号更离谱——V3.1、V4 Pro、Fable 5、Thinking、Flash、Max,每家命名都跟密码似的。OpenAI那个GPT-5.5,你以为是最新?错,它还有个内部叫法完全不同的实验版。
所以上周六我花了整个下午——从1点到晚上9点,中间吃了碗泡面——把我实际部署过、踩过坑、觉得还能用的模型全捋了一遍。
以下纯血泪史。
别当权威榜单看。这行变脸比翻书快。写于2026年6月26日下午3点,可能你读到的时候已经有新版本打我脸了。
美国三座大山:还在,但裂缝很明显
ChatGPT、Claude、Gemini,天花板级别的东西。但天花板之间,也开始分层了。
GPT-5.5,我对它心情复杂。
它什么都能干。写代码、做表格、联网搜、跑插件,配合那个生态基本就是一站式搞定。SWE-bench 74.9%,MMMU多模态84.2%,AIME 2025数学94.6%——数据确实漂亮。
但贵。
真贵。
API价格是DeepSeek的30倍。订阅费20美元一个月,企业调用成本压得人喘不过气。我认识一哥们儿,号用了半年突然被封,申诉无门,里面还有300多美元的余额。
没了。
这还不是最头疼的——国内访问玄学问题依旧。有时候连着三天正常,第四天突然抽风。
Claude Fable 5,目前公认的最强公开模型。
真香。
Artificial Analysis评测我反复看了三遍:Intelligence 60分,Coding 62分,Agentic 80.6分。三项全排第一。Agentic能力比自家Opus 4.8的77.8分高出一截——这个差距在国产模型里目前还没人摸得到。
我拿它写过几篇长文,说实话,写出来的东西没有那种AI味儿。逻辑通顺,文笔甚至有点优雅。Artifacts功能对前端开发简直是开挂,代码效果直接在侧边栏预览,不用切来切去。
但风控太严了。
稍微聊点敏感话题——哪怕只是写小说剧情需要——它都能礼貌地拒绝你。有次我让它帮我润色一段反派台词,它回复了三段"我理解你的创作需求,但我无法……"
扫兴。
Gemini 3.1 Pro的多模态是独一档的。
扔给它一段15分钟的视频,它能精准告诉你第3分27秒发生了什么。上下文窗口100万token,配合Google全家桶,办公效率确实高。
但最近稳定性有点问题。
逻辑推理偶尔"幻觉",产品线改名改得我头疼——我现在都搞不清它到底叫Gemini 3还是3.1,还是什么别的。
插一段:SpaceXAI把超算租给对手,这事儿挺逗
SpaceXAI的Colossus 1超算——超过22万块英伟达GPU——全部租给了Anthropic跑Claude。每月12.5亿美元,租期到2029年。
细想。
把自家最大算力集群租给直接竞争对手,怎么看都像是xAI在前沿竞赛中退了一步。与其继续烧钱追Claude,不如收租子来得稳当。所以Grok 5的前景变得不确定了。主力产品Grok 4.3还在运营,上下文100万token,输入价格1.25美元/百万token,在旗舰里算最低的一档。
接入X的实时数据是独特优势。某些内容的开放程度也是独一档——但这给它惹了不少监管麻烦。
国产模型:开源是主旋律,价格屠夫扎堆
中国模型最大的特点是开源。全球累计下载量超过100亿次——这个数字我核实了三遍,确实没看错。国内大模型数量超过1500种,主要开源榜单前排多数被中国模型占据。海外开发者用中国开源模型搭生产环境,已经很普遍了。
讲真,这事儿两年前我是不信的。
重点说几家。有两家新冒出来的,值得提。
DeepSeek,价格屠夫本夫。
V3.2把推理成本压到极低。V4 Pro已进入早期访问,MIT协议完全开源。V4 Pro Thinking版本总参数1.6T,每token激活49B,上下文窗口1M。推理和数学能力对标海外旗舰,AIME跑分很高。
我日常用它做代码审查和数学推导,性价比无敌。但要说编程能力——看数据,Artificial Analysis的Coding得分47.5,跟Claude Fable 5的62分有明显差距。Agentic 67.2分,国产里算第一集团,但也谈不上最突出。
实话实说。
通义千问Qwen,阿里的卷王。
最新Qwen3.5,原生多模态MoE架构,支持201种语言,Apache协议开源。Max、VL、Omni产品线齐全,企业级应用和出海都覆盖。Qwen3.7 Max的Coding得分50.1,Agentic 66.6,稳扎稳打型。
我测过它的翻译功能。201种语言不是吹的,一些东南亚小语种处理确实比其他模型强。但中文写作的"灵气"不如GLM——更偏工具属性。
Kimi,长文本之王。
K2.6的编程评测还不错,Coding 47.1,Agentic 66.0。6月12日刚上线了K2.7 Code,专门做编程的,但Coding得分45.6,反而比K2.6略低。
这个让我有点困惑。专门优化反而退步了?可能是方向不同。
Kimi最早靠200万字无损上下文震惊业界——这个长度足以吞下几十本长篇小说。处理超长文档,它还是首选。没得说。
GLM-5.2,我的中文写作首选。
智谱6月16日上线,已经上市了。Intelligence 51分,开源阵营最高;Coding 50.7,Agentic 75.9——这个Agentic分数在19款模型里排第三,超过GPT-5.5的74.1。在国产开源里,这个单项成绩最突出。
我拿它写过几篇中文文章。说实话,中文表达的"人味儿"是最浓的。AutoGLM在Agent方向也受关注,支持1M上下文。如果你要私有化部署且看重中文表达,GLM-5.2目前是我的首选。
巴适。
MiniMax M3,6月1日发布的新锐。
上下文100万token,支持图片视频输入,编程评测超过GPT-5.5和Gemini 3.1 Pro。Agentic得分68.6,国产里维持高位。公司也上市了。
M3的定位很清晰:开源阵营里能力最全的一档,价格还低。适合编程、长文档和控成本的Agent场景。我测了代码生成,注释和异常处理确实比前代提升明显。
豆包,字节跳动的国民级产品。
不开源,但用户量大到吓人——日均使用量突破50万亿Tokens,稳居中国第一、全球第三。语音和视频理解能力强,手机助手体验成熟。豆包大模型1.8是12月发的,同时推出的Seedance 1.5 Pro做音视频创作。
偏大众,日常使用很顺滑。但对开发者来说,不开源意味着灵活性受限。咋整,自己掂量。
小米MiMo,有点意外。
2025年12月发布并开源,MoE架构,参数309B(激活15B)。混合注意力架构,滑动窗口注意力与全局注意力交替用。在27T token上做了多token预测预训练,引入多教师在线策略蒸馏做后训练。性能接近Kimi-K2-Thinking和DeepSeek-V3.2。
MiMo-V2.5-Pro的Agentic得分67.4,国产里相当能打。小米做模型这事儿——不对,应该说小米做大模型这个方向——一开始我是存疑的。看了数据和实测,确实有两把刷子。
腾讯混元Hy3-preview,4月发的。
参数295B(激活21B),上下文256K。架构上192路专家与top-8路由机制,配3.8B参数的MTP层。定位是"快慢融合MoE",重点补强复杂推理、代码和智能体能力。
腾讯的优势在生态集成——微信、QQ这些国民级应用。但模型本身的能力,我觉得还在追第一梯队。实话。
阶跃AI的Step3-VL,1月发的多模态模型。
参数量只有10B,但官方宣称是10B以下的SOTA,能媲美甚至超越规模大得多的开源模型(如GLM-4.6V 106B、Qwen3-VL-Thinking 235B)和闭源旗舰(如Gemini 2.5 Pro)。说是靠高质量多模态语料库预训练(1.2T tokens)和规模化多模态强化学习(超过1400次RL迭代),还搞了Parallel Coordinated Reasoning做并行视觉探索。
10B能打235B?
听起来像营销话术。我没实测过,暂时存疑。
我自己的使用建议(非常主观,爱信不信)
如果你能搞定网络,追求最强编程和Agent能力——Claude Fable 5或MiniMax M3。
如果你最看重性价比——DeepSeek V4 Pro或MiMo V2.5 Pro。
如果要私有化部署且看重中文表达——GLM-5.2。
如果需要多模态处理视频音频——Gemini 3.1 Pro。
如果要长文本处理——Kimi K2.6。
企业出海——通义千问Qwen3.5。
日常使用不想折腾——豆包。
得嘞。
三个我没想明白的问题
开源模型的护城河到底是什么?
MIT协议的开源模型正在快速蚕食闭源市场,预计到2027年大部分企业的AI能力都会建立在开源模型上。但闭源还有"独家数据"和"顶尖对齐"两条护城河。问题是,这两条护城河能守多久?三年?五年?
不知道。
价格战还在继续。国产模型API已经低到令人发指,预计到年底主流模型输入价格会降到0.5元/百万token以下。对用户是好事,对厂商是血战。当年我们在机房烧GPU跑模型的时候,这个价连电费都不够。
Agent元年真的来了。MCP协议的普及让AI终于长出了手脚。2026年下半年,会有大量基于Agent的AI原生应用爆发。谁能把Agent做得最好,谁就是下一个时代的赢家。
但这些预测跟天气预报差不多——大概率不准。
AI这行变得太快。我写这篇文章的3个小时里,可能已经有新版本发布了。
所以上面这些,参考参考得了。
别全信。
毕竟,上周我还信誓旦旦跟团队说某个模型稳了,结果周三晚上它就翻车了。
读者评论 4