← 返回资讯
苏晴
资深编辑
已审核

御三家大模型横评Claude, Gemini, GPT和

前两天我在改一个Python项目,要重构一个老模块。

御三家大模型横评Claude, Gemini, GPT和

御三家大模型横评Claude, Gemini, GPT和


别迷信单一大模型了,你得学会“养蛊”

前两天我在改一个Python项目,要重构一个老模块。

你猜我怎么干的?

先让最新的GPT搭了个毛坯框架,丢给Claude 3.5 Sonnet填核心逻辑,最后扔给Gemini 2.5 Pro做代码审查——三个模型轮着来,一套组合拳打下来,原本要干两天的活,三个小时搞定。

我当时坐在电脑前,愣了三秒。

说实话,现在还在纠结“哪个模型最强”的人,可能从一开始就问错了问题。

三巨头,各有各的“人设”

说到这儿,我得先交代一下我的“血泪史”。

我用大模型写专栏写了两年多,从GPT-4一路跟到现在的GPT-4o,Claude从3到3.5 Sonnet,Gemini从1.5到2.5 Pro。订阅费加起来一个月快两千块——ChatGPT Plus、Claude Pro、Gemini Advanced、Grok SuperGrok,再加个Kimi会员。

说出来我自己都觉得离谱。

但这就是现实:没有哪个模型能包打天下。

ChatGPT给我的感觉,像个经验丰富的产品经理。 热情周到,而且面面俱到,说话滴水不漏。你问一个问题,他能从五个角度给你拆开了揉碎了讲,信息密度高到爆炸。

前阵子我在琢磨一个用户增长的分析框架,思路还没成形,就跟GPT聊了一下午。聊着聊着,框架自然就出来了。GPT特别擅长这种“从混沌中理出头绪”的场景——你不需要多清晰的思路,他会帮你把思路理清楚。

但问题也在这儿:信息密度太高,有时候显得没重点。你得会“跟”他——不断地把话题拉回来,或者用明确的边界约束他。

说白了,GPT是个好队友,但对话主导权你得捏在自己手里。

Claude 3.5 Sonnet,更像是那个技术出身、话不多但一针见血的资深工程师。

代码生成、长篇写作,还有复杂逻辑梳理——这是他的主场。SuperCLUE的测试数据也佐证了这一点:Claude在代码生成上拿了高分,领先Gemini,相比自己的上个版本也有明显提升。在SWE软件工程子任务上也是第一。

我实际用下来的感觉是——Claude写代码有一种“通透感”。他不是机械地拼凑函数,而是真的在理解业务逻辑。

之前遇到一个多线程死锁加内存泄漏的组合Bug,几个模型轮番上阵,最后还是Claude 3.5 Sonnet定位到了根因——一个我检查了三遍都没发现的时序问题。

但他也有短板:翻译和结构化任务上,不如GPT和Gemini。

我现在的工作流就是:GPT译初稿,Claude润色表达。两个模型各有各的不可替代性。

Gemini 2.5 Pro,说句公道话,进步真的很大。

特别是2025年3月那个带思维链的exp版本发布之后,在数学、编程上提升明显。但Gemini有个很分裂的问题:AI Studio和App端体验完全不同。

我自己对比过,同样一个问题,AI Studio上的回复质量明显更高。App端不知道是不是因为加了system prompt,回复经常被过度简化,有时候甚至直接给你错误答案。

而且!App端不能编辑中间消息——只能改最后一条。

这意味着你没法在对话里展开一个分支再回到主线,上下文一多就容易“串味”。每次用到这个设计都想骂人。

但是——AI Studio的1M上下文是真的香!

上传YouTube视频链接,调整帧率到0.1,分辨率拉到最低,一篇两小时的播客节目轻松装下。配合Deep Research功能,生成的研究报告质量比GPT的Deep Research要稳——因为Gemini会先生成一个搜索计划,覆盖得比我预想的还全面。

三个模型的“吵架”现场,最能看出性格

有位知友说得好:同样的问题,不同模型画风完全不一样。

我拿一个产品研发场景试过——

ChatGPT像产品经理,热情澎湃地跟你聊各种可能性;

Claude像专业工程师,从技术细节切入,逻辑严密但自说自话。

而DeepSeek更像一个懂业务的领导,上来就抓核心矛盾,语言简洁但切中要害。

这三个风格,没有绝对的好坏,就看场景。

你需要头脑风暴的时候,找GPT;

落地执行的时候,找Claude;

想要一针见血的诊断,找DeepSeek。

拿我最近一个因子挖掘实验来说。我们在AlphaMind平台上让三个模型在同样的任务上PK——优化换手率相对强度反转因子,目标最大化Pure Long Short Sharpe。

但这次有个关键变化:不再统一用Claude Code作为执行客户端,而是让每个模型回到自己的官方原生工具里。

结果?最高分直接把基准Sharpe干到了3.07。

三个模型跑出了三种完全不同的“世界观”。

这说明什么?模型再聪明,如果官方工具的调用、上下文管理、长任务稳定性跟不上,最终表现会打折扣。

反过来,一个调校精良的官方Agent,能把模型的能力榨得更干净。

所以现在选模型,你得连“工具链”一起考虑。

格局正在悄悄变化

从市场份额看,ChatGPT依然是“扛把子”——移动端月活领先同行,网页端月访问量是Claude的10倍、Gemini的2.7倍。企业端市占率约45%,年化营收持续增长。短期没人能撼动。

但Claude的增长曲线才叫吓人。

2024年底年化营收还不到10亿美元,到2025年中已经翻了不止一倍——企业客户的爆发是核心引擎。年消费超百万美元的企业客户半年内翻倍。Claude Code和智能体功能落地后,移动端月活环比暴涨,日活同比飙升。更离谱的是单用户价值:Claude单用户年化贡献是高居榜首,是ChatGPT的近30倍。

这说明Claude在“高价值任务”上的不可替代性,让愿意付费的用户舍得花更多钱。

Gemini就有点尴尬了。技术底子不差,2.5 Pro在SuperCLUE中文评测里甚至后来居上。但市场份额在萎缩,用户体验上App端和AI Studio的割裂,决策层的混乱,都让用户用起来有“拧巴感”。

实战经验:怎么“养蛊”

几个月用下来,我自己摸索出了一套组合拳:

编程场景:GPT-4o搭框架,Claude 3.5 Sonnet写核心逻辑,Gemini 2.5 Pro做代码审查。这个流程下来,基本能把大部分Bug扼杀在上线前。GitHub Copilot现在也接入了GPT-4o Codex,IDE里的自动补全确实丝滑。

写作场景:GPT做初版大纲和素材收集,Claude润色表达。Claude在情感表达和复杂概念讨论上,给出的内容更有层次感。我之前那篇讲AI代理工作流的万字长文,就是GPT搭架子、Claude填肉、我自己做“整合质检”。

资料整理:Gemini的强项。处理Gmail和Google Doc自动化,整理海外新闻生成Markdown摘要,Gemini的Google生态集成确实好用。1M长上下文让它在处理几万行代码和超长文档时,优势明显。

日常轻量任务:DeepSeek够用,速度快而且便宜。DeepSeek的最新模型在编程上也不弱——在一些多模型横评里,真正能做Production的Coding模型,它和GPT-4o并列第一。而且DeepSeek已经率先宣布降价,性价比确实能打。

说实话,最让我警惕的不是技术差距

2025年中的格局,最让我感兴趣的其实不是御三家本身,而是两个变量:

一是MiniMax在AI Agent领域的突然崛起。特别是终端执行能力和Mavis桌面Agent,在“全程自主执行”这个维度上已经逼近甚至部分超越了Claude。如果这趋势能持续,明年的格局可能会更“碎片化”。

二是国产开源模型的崛起。Qwen2.5在开放程度上已经是全球领先,DeepSeek在编程评测中直接跟GPT-4o并列第一。

我说的“第一”不是在中文赛道上,而是在全球通用评测基准上。

你想想,两年前国产模型还在追GPT-3.5的水平,现在已经能跟御三家平起平坐了。

就像当年汽车行业一样,历史可能正在重演。

我的判断

如果只推荐一个长期主力模型给普通用户,我依然会推荐ChatGPT——综合最稳,出错率低,生态最成熟。

但对我来说,真正的工作流一定是“多模型并行”。

每个模型都是工具,都有自己的擅长和短板。真正值钱的不是哪个模型“最强”,而是你知不知道什么场景该用哪个模型、怎么组合才能把效率拉到最高。

这个能力,比评测分数有用得多。

最后说一句:

别太迷信任何一家。

这个行业的变化速度,快到你三个月前做的决定,三个月后就可能被颠覆。

保持观察,保持尝试,让工具为你所用,而不是为工具站队。

因为在这个时代,最值钱的能力从来不是“选对”,而是“组合拳”。

215
5394 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 00:34

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

技术小白 3天前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 6天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)
A
AI研究员 1周前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 1周前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)