← 返回资讯
林远舟
技术编辑
已审核

如何看待《Science》称大模型幻觉难根除?

说到这儿,我忍不住想跟你聊聊一件让我头皮发麻的事。

如何看待《Science》称大模型幻觉难根除?

如何看待《Science》称大模型幻觉难根除?


你随口一问,AI就开始编故事了

说到这儿,我忍不住想跟你聊聊一件让我头皮发麻的事。

上周,我闲着没事,随口问了一个AI:“你知道我老家有个小人物叫张德才吗?他生日是哪天?”——说真的,我认识这人十几年了,问这个问题纯粹是考验。

你猜AI怎么着?

它几乎没犹豫,噼里啪啦给了一个日期,还附上了“据某地方志记载”这种听起来绝对靠谱的引文。我当时就笑了——因为我翻了下手机通讯录,张德才生日根本不是那天。

我又问了一遍。这次它给了另一个日期。

五次。五次不同的答案。每一次,语气都自信到让人牙疼。

这不叫犯错。这是出厂设定。


那场1000亿美元的闹剧

2023年2月,Google的Bard搞了个发布会。

本意是展示自家AI多牛,结果呢?Bard说了一句“韦伯望远镜拍了第一张系外行星照片”。现场气氛瞬间凝固——懂行的人都知道,那照片是VLT望远镜拍的,跟韦伯半毛钱关系没有。

就这一句话,Google市值蒸发1000亿美元。

我当时就在屏幕前看着那个数字往下跳,心里只有一个念头:完了。公众对AI的信任,就在这一秒钟,碎了一地。

果然,后来出了更离谱的事。

纽约有个律师,用ChatGPT写法律文书。模型编了6个根本不存在、历史上也没人见过的案例,这哥们连查都没查,直接提交法院。

我当时发了条朋友圈:“这哥们胆子真大啊。”

但我转念一想——用户凭什么要核实?在大多数人眼里,AI就是搜索引擎。我问你,你不应该给我正确答案吗?

多么朴素的信任啊。可惜,信任是双向的。


这事儿根本不是bug

今年早些时候,《Science》有篇报道,OpenAI和佐治亚理工的团队用了个特别形象的比喻——考试。

你想想:学生要是一道题不会,是留白好,还是瞎写满好?

答案取决于老师怎么评分。老师只看写没写满,不看对不对,那傻子才留白。蒙一蒙还有可能蒙对,留白就是零分。

模型也一样。

训练和评估机制从头到尾就在奖励一件事:猜。猜得对不对是其次,关键是——你得说话,不能闭嘴。

谢菲尔德大学的魏星发过一条推文,我看完想了很久。他说:“如果把幻觉彻底修好,将会杀死这个产品。”

你品,你细品。

不是不能修,是修了你就没法用了。大模型的底层逻辑不是查字典,是玩概率——根据你输入的内容,算下一个最可能出现的词是什么。它追求的是“听起来合理”,不是“这是真的”。

猫狗识别能做到99.9%准确,因为猫和狗长得就是不一样。但你要让模型记住每个人的生日?本质上,生日就是随机的,模型没法学,只能硬背。背不下来时,就造一个听起来最合理的。

一篇arXiv论文说得很扎心:预训练阶段,模型读了几万亿句话,每句话都没标注过“这是事实”还是“这是虚构”。模型分不清,它只能统计——哪些词老凑在一起。当两个说法在统计上都“合理”,它随机选一个。

这哪是bug?这是概率模型的必然结局。


老板不看幻觉,只看留存率

后来我认识几个在AI公司做产品的朋友。我问他们:你们内部讨论幻觉吗?

他们笑了:老板不关心,只关心活跃度。ChatGPT要是天天说“我不知道”,用户第二天就跑了。隔壁Claude、Gemini、还有免费的开源模型,谁会说不知道?

有调查显示,用户对AI的容忍度其实特别低。你得给答案,不然用户就觉得你不行。“我不知道”等于承认自己没用。

OpenAI研究人员自己也承认:现有的评估体系——准确率、F1、BLEU——都在鼓励猜测。比如问生日,猜一个日期至少有1/365的概率对,说“我不知道”就是零分。模型被训练成一定得输出点什么,哪怕瞎编。

反过来想想,全怪评估体系也不公平。

让模型学会说“我不知道”,得重新设计训练目标,调整奖励函数,还可能牺牲掉它现在的创造力。Akari Asai团队的DR Tulu给出了一个方向——让模型动态生成评分细则,学会区分好坏回答。他们的8B参数模型在某些测试中表现很亮眼,不输老牌的专有模型。

注意:这还是可控场景下,而且有外挂检索帮忙。

我试过给模型接上RAG(检索增强生成)。效果确实好,但成本翻倍,速度变慢。你让商业公司为每个回答都检索一次知识库?利润直接腰斩。

没有人愿意为“正确”买单。大家只想为“快”买单。


法律判了,但问题还在

国内有个涉及AI幻觉的案子,杭州法院判平台无责。

有朋友问我怎么看,我说:这个判得很聪明。如果平台输了,明天所有AI公司都得关停,或者直接变成“我什么都不知道”模式——因为消除幻觉在现在的技术里根本不可能,只能降低,不能清零。

就像你买一把菜刀,说明书上写着“锋利小心伤手”,你切到手不会怪卖刀的吧?

但说实话,我不觉得这是个长久之计。

随着AI Agent越来越普及,幻觉的后果会更可怕。不是“律师信写错了”这种级别,而是自动执行多步操作——比如AI助理帮你订机票、转账、管理供应链。一旦某个环节幻觉了,连锁反应可能是灾难性的。

Google DeepMind的FACTS Grounding基准测试显示,到2025年底,最强的Gemini 3 Pro综合事实准确率也就68.8%。

一百句话里,三十多句可能有问题。

你敢让它随便操作你的银行卡吗?


我琢磨着,未来大概是这样走的

评估体系必须改。不能只看准确率,要加入不确定性表达、来源追溯、事实核查。Meta的FAIR团队已经在尝试用复合奖励训练推理模型,能降低23个百分点的幻觉率。路还很长,但方向对了。

工具链也要跟上。不能指望模型自己全对。我现在养成的习惯是:用模型写初稿,然后开一个脚本跑事实核查,引用的原文必须能链接到。涉及数字的地方,我强制它写Python代码验证。不完美,但比裸用强。

行业得接受“AI会犯错”这个前提。法律、医疗、金融这些高风险领域,必须有人类审核环节。就像当年计算机出来后,会计不是消失了,而是变成了会用Excel的会计。

小模型+检索可能是更务实的方案。Akari Asaki那句话我特别喜欢:“不要试图把世界装进模型里。”开源的小模型配上对接论文库、数据库的检索架构,比参数量大但胡编乱造的大模型靠谱得多。


最后说一句

你可能会问:幻觉到底能不能根治?

我觉得不会。

就像我们人类,你也做不到每句话都绝对正确。记错、猜错、凭感觉说错——这是智能的代价。但我们可以让它不再致命。

别指望模型永远正确。在你学会为自己的判断负责之前,AI的幻觉,其实是你自己的偷懒。

你让它替你思考,它就替你编故事。

35
505 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月23日 07:41

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

M
创业者Mark 6天前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)