如何看待《Science》称大模型幻觉难根除?
你随口一问,AI就开始编故事了
说到这儿,我忍不住想跟你聊聊一件让我头皮发麻的事。
上周,我闲着没事,随口问了一个AI:“你知道我老家有个小人物叫张德才吗?他生日是哪天?”——说真的,我认识这人十几年了,问这个问题纯粹是考验。
你猜AI怎么着?
它几乎没犹豫,噼里啪啦给了一个日期,还附上了“据某地方志记载”这种听起来绝对靠谱的引文。我当时就笑了——因为我翻了下手机通讯录,张德才生日根本不是那天。
我又问了一遍。这次它给了另一个日期。
五次。五次不同的答案。每一次,语气都自信到让人牙疼。
这不叫犯错。这是出厂设定。
那场1000亿美元的闹剧
2023年2月,Google的Bard搞了个发布会。
本意是展示自家AI多牛,结果呢?Bard说了一句“韦伯望远镜拍了第一张系外行星照片”。现场气氛瞬间凝固——懂行的人都知道,那照片是VLT望远镜拍的,跟韦伯半毛钱关系没有。
就这一句话,Google市值蒸发1000亿美元。
我当时就在屏幕前看着那个数字往下跳,心里只有一个念头:完了。公众对AI的信任,就在这一秒钟,碎了一地。
果然,后来出了更离谱的事。
纽约有个律师,用ChatGPT写法律文书。模型编了6个根本不存在、历史上也没人见过的案例,这哥们连查都没查,直接提交法院。
我当时发了条朋友圈:“这哥们胆子真大啊。”
但我转念一想——用户凭什么要核实?在大多数人眼里,AI就是搜索引擎。我问你,你不应该给我正确答案吗?
多么朴素的信任啊。可惜,信任是双向的。
这事儿根本不是bug
今年早些时候,《Science》有篇报道,OpenAI和佐治亚理工的团队用了个特别形象的比喻——考试。
你想想:学生要是一道题不会,是留白好,还是瞎写满好?
答案取决于老师怎么评分。老师只看写没写满,不看对不对,那傻子才留白。蒙一蒙还有可能蒙对,留白就是零分。
模型也一样。
训练和评估机制从头到尾就在奖励一件事:猜。猜得对不对是其次,关键是——你得说话,不能闭嘴。
谢菲尔德大学的魏星发过一条推文,我看完想了很久。他说:“如果把幻觉彻底修好,将会杀死这个产品。”
你品,你细品。
不是不能修,是修了你就没法用了。大模型的底层逻辑不是查字典,是玩概率——根据你输入的内容,算下一个最可能出现的词是什么。它追求的是“听起来合理”,不是“这是真的”。
猫狗识别能做到99.9%准确,因为猫和狗长得就是不一样。但你要让模型记住每个人的生日?本质上,生日就是随机的,模型没法学,只能硬背。背不下来时,就造一个听起来最合理的。
一篇arXiv论文说得很扎心:预训练阶段,模型读了几万亿句话,每句话都没标注过“这是事实”还是“这是虚构”。模型分不清,它只能统计——哪些词老凑在一起。当两个说法在统计上都“合理”,它随机选一个。
这哪是bug?这是概率模型的必然结局。
老板不看幻觉,只看留存率
后来我认识几个在AI公司做产品的朋友。我问他们:你们内部讨论幻觉吗?
他们笑了:老板不关心,只关心活跃度。ChatGPT要是天天说“我不知道”,用户第二天就跑了。隔壁Claude、Gemini、还有免费的开源模型,谁会说不知道?
有调查显示,用户对AI的容忍度其实特别低。你得给答案,不然用户就觉得你不行。“我不知道”等于承认自己没用。
OpenAI研究人员自己也承认:现有的评估体系——准确率、F1、BLEU——都在鼓励猜测。比如问生日,猜一个日期至少有1/365的概率对,说“我不知道”就是零分。模型被训练成一定得输出点什么,哪怕瞎编。
反过来想想,全怪评估体系也不公平。
让模型学会说“我不知道”,得重新设计训练目标,调整奖励函数,还可能牺牲掉它现在的创造力。Akari Asai团队的DR Tulu给出了一个方向——让模型动态生成评分细则,学会区分好坏回答。他们的8B参数模型在某些测试中表现很亮眼,不输老牌的专有模型。
注意:这还是可控场景下,而且有外挂检索帮忙。
我试过给模型接上RAG(检索增强生成)。效果确实好,但成本翻倍,速度变慢。你让商业公司为每个回答都检索一次知识库?利润直接腰斩。
没有人愿意为“正确”买单。大家只想为“快”买单。
法律判了,但问题还在
国内有个涉及AI幻觉的案子,杭州法院判平台无责。
有朋友问我怎么看,我说:这个判得很聪明。如果平台输了,明天所有AI公司都得关停,或者直接变成“我什么都不知道”模式——因为消除幻觉在现在的技术里根本不可能,只能降低,不能清零。
就像你买一把菜刀,说明书上写着“锋利小心伤手”,你切到手不会怪卖刀的吧?
但说实话,我不觉得这是个长久之计。
随着AI Agent越来越普及,幻觉的后果会更可怕。不是“律师信写错了”这种级别,而是自动执行多步操作——比如AI助理帮你订机票、转账、管理供应链。一旦某个环节幻觉了,连锁反应可能是灾难性的。
Google DeepMind的FACTS Grounding基准测试显示,到2025年底,最强的Gemini 3 Pro综合事实准确率也就68.8%。
一百句话里,三十多句可能有问题。
你敢让它随便操作你的银行卡吗?
我琢磨着,未来大概是这样走的
评估体系必须改。不能只看准确率,要加入不确定性表达、来源追溯、事实核查。Meta的FAIR团队已经在尝试用复合奖励训练推理模型,能降低23个百分点的幻觉率。路还很长,但方向对了。
工具链也要跟上。不能指望模型自己全对。我现在养成的习惯是:用模型写初稿,然后开一个脚本跑事实核查,引用的原文必须能链接到。涉及数字的地方,我强制它写Python代码验证。不完美,但比裸用强。
行业得接受“AI会犯错”这个前提。法律、医疗、金融这些高风险领域,必须有人类审核环节。就像当年计算机出来后,会计不是消失了,而是变成了会用Excel的会计。
小模型+检索可能是更务实的方案。Akari Asaki那句话我特别喜欢:“不要试图把世界装进模型里。”开源的小模型配上对接论文库、数据库的检索架构,比参数量大但胡编乱造的大模型靠谱得多。
最后说一句
你可能会问:幻觉到底能不能根治?
我觉得不会。
就像我们人类,你也做不到每句话都绝对正确。记错、猜错、凭感觉说错——这是智能的代价。但我们可以让它不再致命。
别指望模型永远正确。在你学会为自己的判断负责之前,AI的幻觉,其实是你自己的偷懒。
你让它替你思考,它就替你编故事。
读者评论 3