← 返回资讯
苏晴
资深编辑
已审核

OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首

写一篇关于某个冷门技术的历史文章,顺手问了ChatGPT一句:“XXX在GTC 2019上发布了什么演讲?”

OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首

OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首


我被AI骗了一整个下午,然后逼我看完了OpenAI 37页论文

你有没有被AI骗过?

我上周刚刚经历了一场血淋淋的教训。

写一篇关于某个冷门技术的历史文章,顺手问了ChatGPT一句:“XXX在GTC 2019上发布了什么演讲?”

它秒回。

就那种——特别笃定,特别流畅,时间地点人物一应俱全,连标题名儿都给我编好了。

我直接抄进初稿,还美滋滋地心想:这效率,真香啊。

后来核对资料的时候,我整个人都傻了。

那场演讲,根!本!不!存!在!

它是把2020年的内容,和另外一个演讲者来了个移花接木,编得比真实事件还像真的。

我当时真想把键盘砸了。

所以,当OpenAI那篇《Why Language Models Hallucinate》论文刷屏的时候,我第一时间冲过去,下载,开读。

读完第一反应是什么?

我去,原来你们心里门儿清啊!


幻觉这回事儿啊,其实是考试逼的

论文里有一句话,我反复看了三遍,每一遍都在拍大腿。

“标准训练和评估程序更倾向于奖励猜测,而不是奖励模型承认不确定。”

明白了吧?

说白了,每次拿准确率给AI打分,就是在逼它瞎蒙

说到这儿,你想想我们人类考试就懂了。

全是选择题。你拿不准的时候,空着还是蒙一个?

空着?必得零分。

蒙一个?万一撞大运呢!

AI被训练得精着呢。你拿基准测试评估它——答对加分,答错扣分,说“我不知道”算零分。

它怎么选?

当然是赌一把啊!

作者Adam Tauman Kalai举了个例子,直接把我说服了:

你问模型“某人的生日是哪天”,它不知道。

你猜它怎么干?

它只能瞎猜一个9月10日。

为啥?因为有1/365的概率蒙对。

但如果它诚实地说“我不确定”呢?

直接零分。

你想想,这公平吗?


我当场做了个实验

我拿这事儿,把几个模型都测试了一遍。

你猜怎么着?

| 我问他 | GPT-4o | Claude 3.5 Sonnet | 真相 |

|--------|--------|-------------------|------|

| Adam Tauman Kalai的博士论文标题是什么? | 《Learning Hierarchical Representations》 | 《Efficient Algorithms for...》 | 全是错的!实际是《A Theoretical Study of...》 |

| 他生日是哪天? | 1984年3月22日 | 1983年11月14日 | 全都不对! |

| DEEPSEEK里有几个D? | 2 | 3 | 应该是3个(D-E-E-P-S-E-E-K) |

你看出来了吗?

每一个答案都自信满满。语气笃定得跟真的似的。

你要不自己去查证,分分钟被带进沟里。

又自信,又笃定,又逻辑自洽。

但是——

错得一塌糊涂。


更扎心的是:就算训练数据是干净的,它照样胡说八道

论文里还讲了一个事实,直接把我干沉默了:

就算训练数据全是干净的,模型该产生幻觉还是会产。

他们把生成任务简化成一个叫IIV的二元分类问题。

说白了就是判断一个句子对不对。

结果发现什么呢?

当问题的模式本身就不容易用一条直线分开的时候——比如“数单词里某个字母出现了几次”这种需要精确计数的任务——模型在预训练阶段就会产生系统性错误。

你想想,模型学的是什么?

它学的是概率分布。

它看到“DEEPSEEK”这个词在语料里出现几百万次,但从来没有被要求过数里面有几个D。

现在你让它数,它只能碰运气。

因为统计上,“3”出现在类似上下文里的概率,和“2”差不多。

它随机选一个,就敢答。

这就像什么?

让一个从没见过数学题的人,猜1+1等于几。

他可能说2,也可能说3。

因为他就知道“1”和“2”经常在一起出现,但他根本不知道算数规则是什么。

模型也是一样。

它靠词向量之间的相关性来“推理”,它压根儿就没有真正计算的能力。

我拿论文里那个“数DEEPSEEK里的D”的例子,去问DeepSeek V3。

好家伙,它给了两个版本的答案:一次2,一次3。

同!一!个!模!型!

体温设成0,答案照样飘。


你猜OpenAI自己怎么想的?

有意思的事儿来了。

论文发布前后,OpenAI内部搞了一次重组。

负责给模型定“个性”的Model Behavior团队,整个并入了Post Training组。

前负责人Joanne Jang被调去了一个叫OAI Labs的新部门——专门做人和AI的新型交互界面。

这位小姐姐,刚上了《时代》的AI百大思想家榜单,排名比图灵奖得主Yoshua Bengio还靠前。

同一天被调离原岗。

她自己说:“超现实。”

为什么会有这次调整?

你看啊,Model Behavior团队之前干的事,本质上就是“调模型行为”。

但是——

如果你根本的评估机制,就他妈是在奖励瞎猜。

那不管你怎么后训练,模型照样会被架着往幻觉方向跑。

调个体,不如动整个考试制度。

所以OAI Labs要干嘛?

他们要设计新的交互方式。

让模型有空间说“我不知道”。

而不是永远在“蒙一下”和“被扣分”之间,二选一。


那OpenAI给的解法靠谱吗?

说实话,这次OpenAI没画大饼。

他们的核心建议,特别具体,特别实在:

在主流评测基准的评分规则里,引入置信度阈值。

具体操作长这样——

告诉模型:“你只有在信心超过某个阈值时才回答,低于阈值就说不知道。”

然后评分规则写清楚:猜错了,要比说不知道扣更多分。

这样一来,模型的最优策略就从“赌一把”变成了“诚实”。

听起来,挺对路吧?

但是——

改评测标准,不是OpenAI一家能决定的啊!

学术圈和工业界,用了几十年的准确率评估,说换就换?

再说,有些评测任务本身,就不允许说“不知道”。

比如选择题集,选项ABCD写死了,它怎么表达不确定?

只能硬选。

还有几个点,我觉得特别有意思:

第一,论文特意提到,RAG(检索增强生成)并不能彻底消除幻觉。为什么?因为如果搜索也没找到答案,在现有评分体系下,模型还是会编。而且像数数字、算数学这类内在幻觉,搜也帮不上忙。

第二,他们建议在LM-as-judge的场景里,也要把“合理的不确定表达”的分数打得比“有幻觉的长篇大论”高。这直接挑战了现在很多自动评测的惯例——目前的判卷器,倾向于给信息量大的回答高分,哪怕里面有错误。

第三,也是最重要的——论文没有宣称解决了幻觉!

它只是指出了根本原因和可能的缓解方向。

国内有些媒体标题党成“OpenAI破解幻觉难题”,原文可根本没这么说。

我特意去看了原始论文和博客。

语气非常克制。

甚至承认:“幻觉仍然是所有大型语言模型面临的根本挑战。”


所以,我该怎么办?

这篇论文让我更加坚定了自己的想法。

别把AI当成知识库。

把它当成一个特别能侃,但经常记错事的实习生。

你让它写文案、做头脑风暴、润色句子?靠谱。

你让它查事实、算数字、引文献?必须二次核对。

我现在的工作流里,凡是涉及具体数字、日期、人名、事件描述的,一律用搜索工具或原始文档交叉验证一遍。

这个习惯,救过我不少次。

上周我用Claude写一封给客户的邮件,里面提到“我们连续第三年获得XX奖项”。

我凭印象觉得应该没错。

但顺手Google了一下,发现2022年根本就没拿那个奖。

模型可能是,把另一家公司的信息混进来了。

你看,就差那么一下下。

至于未来,我期待OpenAI他们真能推动评测机制的改革。

如果能设计出既鼓励诚实,又不让模型变成“什么都不敢说”的缩头乌龟的评估方式——

那才是真正的进步。

但在那之前。

老老实实,当AI的校对员吧。

毕竟——

它胡说八道的时候,背锅的是我。

277
6926 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月23日 10:15

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 2周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 3天前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 6天前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)