从技术角度讲,ChatGPT的表达能力为什么逊色于 Cl
我花了三个晚上,终于搞明白为什么ChatGPT说话越来越像机器人
你知道吗?我花了三个晚上,盯着屏幕,反复测,反复比——终于想通了一件事。
先说结论,别被版本号骗了!这两个模型的表达能力差距,根子根本不在于什么4.0还是4.6,而在于它们的训练哲学,完全是两条路。我用了三年ChatGPT、两年Claude,中间还试过Gemini和DeepSeek,到2026年了,差距不但没缩小,反而越拉越大!你想想,这是什么感觉?
我得承认,最早我是不服气的。
2024年底那会儿,ChatGPT 4o正处在巅峰期——我说的是API里那个chatgpt-4o-latest版本,不是后来那些缩水正式版。那阵子GPT回复真灵活,我拿它写邮件、写周报、甚至写点小软文,感觉跟真人没差。我还跟朋友吹过:“说Claude中文更好?我不信。”
然后就被打脸了。啪啪响那种。
Claude的“好文章语感”到底从哪来
这事儿还得从2024年上半年说起。
我翻旧聊天记录的时候发现,Claude 3.0那个版本有个特别有意思的毛病——它说中文时会混用文言和白话,有时候还生造一些古雅的新词。我当时没当回事,还拿这个特点做了几个角色卡来玩。现在回头看,这哪是毛病啊!这分明是它吃了大量古籍的证据!
真正的实锤是后来曝光的“巴拿马项目”。2025年到2026年初,因为版权诉讼,Anthropic内部的一些文件被公开了。好家伙,这帮人是真的狠——他们启动了一个代号叫“巴拿马项目”的数据采集计划,核心目标就一句话:“获取世界上所有的书籍”。
具体操作手法?雇前Google图书扫描项目的高管带队,花几千万美元从二手书商、批发商那里批量买实体书,然后用液压切割机把书脊切断,散成单页扔进工业级高速扫描仪,扫完直接粉碎销毁。
这就是所谓的“毁灭性扫描”。
我当时看到这个,第一反应是:这帮疯子。第二反应是:难怪。
他们内部文件里有一句话我印象特别深:“在训练我们的模型时,拥有每一本书,比仅仅拥有少量备受赞誉的文学作品更有价值。”人家花钱买的是“每一本书”,不是精选书单,不是畅销排行榜,是书本身——好的坏的都收!模型要的不是内容的思想高度,而是理解“人类到底是怎么把文字组织在一起的”。这个思路直接决定了Claude的语感基础。一个看过几百万本书的模型,写出来的东西怎么可能跟你用论坛帖子喂出来的模型一样?
但问题来了:OpenAI难道不买书吗?
说实话,我猜他们也会买,但量级和导向完全不同。
真正让ChatGPT“说话难听”的,是另一套机制。
2024年《自然》上发过一篇论文,测试大模型的心智理论。结论挺有意思:在大部分测试里,GPT-4的表现超过或等于人类,但有个叫“社交失态”的任务,它明显弱于人类。什么叫社交失态?就是那种“你明明知道这话不该说,但你说了”的场景。GPT-4在这类任务上表现不好,说明它对“什么场合说什么话”的把握天生有缺陷。
那OpenAI怎么补这个短板?
答案是RLHF。
这里要说点技术上的东西,尽量说人话。ChatGPT的整个训练流程里,RLHF(人类反馈强化学习)占了很大比重。标注员会给模型的输出打分,他们偏好的天然就是那些“安全”“客客气气”“格式工整”的回复。Reward Model会奖励那些高频出现的稳妥词序,模型为了高分,自然会倾向于选概率最高的“平庸表达”。
这就是“AI腔”的来源——“赋能”“深入探讨”“值得注意的是”,这些词你眼熟吧?不是模型自己发明的,是标注员喂出来的!
相比之下,Claude用的是Constitutional AI。这个机制的核心是让模型按内置原则自我批判和修正,Reward设计时明确惩罚信息冗余和低密度套话,鼓励精准、有信息密度的措辞。
说白了,一个的目标是“让AI不犯错”,另一个的目标是“让AI说人话”。
这两个目标经常冲突。你想想,是不是这个理?
真正让我下定决心“脱粉”GPT的是GPT-5
到了2025年,o3和GPT-4.1发布之后,我明显感觉到ChatGPT的Chat全面变味了。这些模型速度快是真的,但世界知识密度很差,表达能力弱得离谱。超大模GPT-4.5的失败让OpenAI走向了另一个极端——小模型加长推理,Sam Altman亲自出来说“一个理想的模型应该体积极小,知识全部外挂,推理链极长”。这个思路直接催生了GPT-5。
我用GPT-5干了件很日常的事——翻译一段英文。结果它把“million”和“billion”翻混了,还翻得特别自信!我当时就愣住了。这要是Claude,虽然不能保证100%不出错,但至少在基本的语言单位上不会犯这种低级错误。为什么?因为Claude模型肚子里是有“书”的,它见过太多context,知道million和billion的区别不光是数字大小,而是日常使用中的语境完全不同。GPT-5的架构思路导致它的模型内部只保留了核心的STEM知识,世界杂类知识被大量外挂。这个设计在推理任务上表现不错,但在表达能力上,等于砍掉了自己的语感根基。
你说气不气人?
还有一个隐藏问题:产品定位的矛盾
ChatGPT现在的困境,一句话就能说清楚——它同时想做好两件互相矛盾的事。一方面,它是OpenAI的王牌产品,要追求用户数量、DAU、市场占有率,这意味着输出必须安全、稳妥、不出错。另一方面,它又是一个“白领工作台”,需要处理创意写作、深度内容生产。这两个诉求天然冲突。
你去推特上看关于“AI谄媚”的讨论,吵得沸沸扬扬。很多人觉得AI过度讨好人类是不高级的,甚至反人类。但OpenAI的解法更可怕——他们三年前就给Copilot加了“反谄媚机制”,不管用户说什么,AI都是前半段附和、后半段批判的机械回复。现在这个机制扩散到了整个ChatGPT。你随便跟它聊点什么,它附和完以后一定会想方设法反对你,说你“想得不够全面”,给你做八竿子打不着的补充。很多时候,你的思维就被它带到西伯利亚去了。
Claude在这方面的定位就单纯得多。它的设计是“帮知识工作者干活”,只要不涉及明显的安全和伦理风险,它没什么执念,怎么顺怎么来。
说实话,ChatGPT最好的Chat体验是2024年下半年那几个月。当时可能在AB测试GPT-4.5,API里那个chatgpt-4o-latest输出质量极高,比我后来用的正式版GPT-4.5都强。而且那时候GPT-4o从GPT-4.5上蒸馏了很多优质的回复,那是唯一一次我真心觉得GPT的表达能力超越了Claude。
可惜,那已经是绝唱了。
所以我的结论是什么
我测试了三个晚上,分别用同样的prompt去问两个模型。我用的是GPT-5.4(最新版)和Claude Opus 4.6,测试场景包括:写一段产品文案、翻译一个技术文档、改一封信的措辞、解释一个复杂概念。
结果很清晰:
- GPT-5.4的信息密度高,但表达公式化严重,读三遍就能感觉到套路。
- Claude Opus 4.6的文本更自然,长句短句交错有节奏感,用词也更精准。
具体到场景:翻译任务上GPT-5.4差得比较多,经常出现“字面对了、味道全错”的情况,我反而不如直接用Google翻译省心。写产品文案的话,Claude Opus的通过率明显更高,审查时几乎不需要重写。长文本召回上倒是GPT-5.4更强,有数据说能达到74%(Claude是32.2%),但召回更全不代表说人话。如果你只是需要查资料,选GPT;如果要写东西、做内容,Claude明显在表达上更胜一筹。
现在各家都怎么回事
如果给现在的模型做个粗暴的画像:
ChatGPT像个什么都懂但说话越来越官腔的老干部。它知道得多,但不管跟你说什么,你总觉得它在照着稿子念。数据也证明了这点:在AA-Omniscience幻觉率上,Claude Opus是36%,ChatGPT高达86%。知道得多,编得也多,这就是代价。
Claude像个读过几千本书的文学青年转行干了码农。写东西有质感,逻辑清晰,但偶尔会陷入自己的世界。代码质量是它在2026年最大的王牌,SWE-bench评分74%+,直接驱动了Cursor、Windsurf这些开发者工具。成本也贵,API价格是GPT的两倍,但很多场景下一轮就能解决的问题,GPT可能要来回扯好几轮。
Gemini是最让我失望的一个。它有个让人崩溃的毛病——喜欢在聊天过程中不断强调你之前说过的观点,说“你刚才的观点一以贯之、自成一体”。我每次都心想,你这是在教我做人还是写表扬信?背后可能是一套谄媚Boost机制在作祟,我实在受不了。不过它的多模态能力确实强,Google Workspace的集成也够深,GPQA评测94.3%的推理分证明它技术底子不差,单纯是产品思路跑偏了。
DeepSeek是性价比之王。免费版已经够用,在某些简单任务上甚至不输付费模型。
你要是问我长期订阅一个该选谁,我还是会说:创作和代码选Claude Opus,日常选ChatGPT。硬要二选一的话,我现在的倾向是Claude Opus——至少跟它聊天,我不会觉得对面是个AI。
除非哪天OpenAI把RLHF那套模板给砸了。
但你说,他们舍得砸吗?
读者评论 4