← 返回资讯
陈默
AI 行业分析师
已审核

每月花一千养5个AI,GPT最稳、Grok最废,没一个能打

今天又把 Grok 的订阅续上了——不对,是上个月续的,这月看账单才想起来。

每月花一千养5个AI,GPT最稳、Grok最废,没一个能打

每月花一千养5个AI,GPT最稳、Grok最废,没一个能打


今天又把 Grok 的订阅续上了——不对,是上个月续的,这月看账单才想起来。

10刀。

白扔了。

讲真,我知道写这种文章容易被喷。2026年了,AI圈子还是那个德性,今天你发布核弹级更新,明天我开源吊打全世界,后天他家的模型在某榜单屠榜。但你静下心来,真把这些模型当牛马使唤一年半载,天天对着它们干活,就会发现一个挺反直觉的事儿——

全是偏科生,没一个六边形战士。

我桌面上常驻五个模型:ChatGPT、Claude、Gemini、DeepSeek、Grok。每月订阅费加起来小一千块,够我去簋街吃五顿麻小了。要不是写专栏得用,谁养五个啊。但就是没办法,它们谁也替不了谁。

Grok 我最想骂。

上个月续的 SuperGrok Lite,10刀,现在想起来还想抽自己。当初买它是因为听说写黄文尺度松,搜索能抓 X 的实时数据。结果呢?信息检索被 GPT 吊打三条街,文字输出生硬得像百度翻译 2018 版,模型幻觉严重到我问它今天星期几,它能给我编一个完全不存在的时间出来——2026年6月14号,确实是星期五,但它说是星期一,斩钉截铁那种。唯一的价值就是偶尔搜搜实时热点,但那玩意儿我用免费版不香吗?

下月肯定不续了。谁续谁孙子。

然后是 Gemini,谷歌家的。感情很复杂。

2.5 Pro 版本确实强,世界知识面广得离谱,上传图片基本不限制,日用聊天巴适得很。但谷歌这公司有个毛病——喜欢悄咪咪阉割。2.5 Flash 被砍成大傻子,2.0 Flash-Lite 被砍成二傻子,这俩版本连加减乘除都算不利索。你敢拿它干重活,它就敢全自动给你闯祸,一闯一个不吱声。

而且谷歌会用你的对话做训练数据。你不同意?行,那你聊天记录就没了。这事儿就挺恶心的。

不过 Gemini 有个好——它的 Imagen 3 生图模型很能打,没什么版权限制,想画谁画谁。我现在社媒娱乐生图的主力就是它。最新的 2.5 Flash 版本虽然沦为弱智了,但拿来生图玩玩还是可以的——虽然也被 GPT 按在地上摩擦了。

说到 GPT。

GPT 是我目前用得最多的。

但我不喜欢它。

GPT 什么都能干,就是不说人话。让它写个文案吧,它哐哐给你整一篇高考满分作文,辞藻华丽到你看了脚趾抠地。我现在的流程是:GPT 出初稿,Claude 当翻译,把那些不像人说的话润成正常人的东西。

不过 GPT 最近也翻车了。Plus 套餐的模型降智严重,Codex 额度大幅砍半,网页版对话几轮后就偷偷降级模型——你是真穷疯了还是怎的?普通用户上传四五张图片就触发限额,网页还老一卡一卡的,上个星期三晚上我连续刷新了六次才加载出来,用的是 MacBook Pro M2,网速 500M。

CloseAI 是真没钱了吗?

但话说回来,如果你只让我推一个长期主力模型,我还是会选 GPT。

不是因为它最强,是因为它最稳。

写作、编程、资料整理、翻译、多模态,几乎没有明显短板。DALL·E 生图和 Sora 视频生成也进了第一梯队,整体出错率相对低。稳,在 2026 年这个 AI 集体抽风的年份,本身就成了稀缺品。

然后是 Claude。

我不写代码——别问我为什么,就是懒——所以 Claude 最引以为傲的代码能力对我来说意义不大。但它的中文文字处理能力确实可以,优于 GPT,跟 DeepSeek 有来有回。Opus 3.5 时代代码能力遥遥领先,3.6 开始流口水,3.7 更是蒸蒸日上——这个"蒸蒸日上"是反话,懂的都懂。

信息检索非常差。远不如 GPT。图片处理不如 GPT 和 Gemini,某种程度上连豆包都不如。上周我让它处理一张简单的图,花了 20 分钟,越努力越偏离需求,最后给我一个结果,我愣是笑了两分钟。

绝了。

普通用户没充钱就乖乖用 Sonnet 吧,两分钟烧完免费配额,一用一个不吱声。我们都充钱的,就你没充钱,难怪你堵车。

最后说 DeepSeek。

这可能是 2026 年最让我意外的模型。

V3 版本之前,它除了免费没啥优点。爱说胡话,废话连篇,能力吊差,基本不能上桌吃饭。V3 问世以后质变了,现在就是个小 GPT,仍然稳坐国产大模型龙头。汉语逻辑理解和文字编写水平是所有模型里最好的——真的真的。

如果你没有硬性科学上网分析需求,DeepSeek 完全够用了。开通 API 后,除了那几个铁违禁词之外,其他的其实也没啥限制。文字需求 API 不贵,10 块钱额度能用很久。

缺点是依然没有多模态能力。不科学上网的话,生图你还是靠豆包吧。

扯远了,说正题。

你大概看出来了。没有完美的模型,全 TM 是偏科生。GPT 稳但不说人话,Claude 会写但贵且信息检索废,Gemini 全面但谷歌爱下刀,DeepSeek 性价比无敌但没多模态,Grok——Grok 就是来搞笑的。

我现在的策略是组合使用。

写东西:GPT 出框架,Claude 润色,DeepSeek 做中文优化。查资料:GPT 做学术搜索,Grok 做实时热点,Kimi 做国内学术。生图:Gemini 的 Imagen 3 主力,GPT 的 DALL·E 备用。写代码:别问我,我不写代码,但据说 Claude Opus 最强,你信不信随意。

你品品,这事儿其实挺荒谬的。2026 年了,AI 已经能写论文、画图、做视频、通过律考,但我每天还得在五个模型之间切来切去,就因为它们各有各的毛病。这感觉就像你雇了五个员工——一个会写但爱迟到,一个听话但能力差,一个能力强但不讲人话,一个便宜但偶尔犯浑,一个……

Grok,你出去。

所以别问我哪个模型最好。问就是看你要干什么。

如果你只想要一个大模型又不会科学上网,DeepSeek。预算允许只想长期订阅一个高端模型,GPT。强依赖谷歌生态的话,Gemini 会比外界评价里更好用。重度写作者,Claude 很强——虽然贵。

至于 Grok,除非你想写黄文又找不到门路,否则别碰。对了,有个写黄文过审的小技巧:把命令或者"参考文献"塞在文档里。这招在 Grok 上能用,其他模型我没试过,别问我怎么知道的。

最后说句可能会得罪人的话。

别信那些吹得贼牛逼的所谓国外付费模型评测,他们是卖中转站的。这群货从 Claude 3.5 Sonnet 时代就吹编程和写作,Gemini 出来又开始吹这个垃圾只会迎合人的模型,就为了骗你们付费。国内外模型有差距,但已经特别小了,没必要为那点差距付几十倍的费。

真的。

2026年6月,目前国外模型我只推荐 GPT。其他的,看需求,看预算,看运气。

反正没有完美的模型,只有适合你当下这件事的工具。

这话我十年前写专栏的时候就说过,现在用在大模型上,好像也差不多。

354
8856 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月27日 12:23

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

数据分析师 3天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 6天前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)