OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首
我被AI骗了一整个下午,然后逼我看完了OpenAI 37页论文
你有没有被AI骗过?
我上周刚刚经历了一场血淋淋的教训。
写一篇关于某个冷门技术的历史文章,顺手问了ChatGPT一句:“XXX在GTC 2019上发布了什么演讲?”
它秒回。
就那种——特别笃定,特别流畅,时间地点人物一应俱全,连标题名儿都给我编好了。
我直接抄进初稿,还美滋滋地心想:这效率,真香啊。
后来核对资料的时候,我整个人都傻了。
那场演讲,根!本!不!存!在!
它是把2020年的内容,和另外一个演讲者来了个移花接木,编得比真实事件还像真的。
我当时真想把键盘砸了。
所以,当OpenAI那篇《Why Language Models Hallucinate》论文刷屏的时候,我第一时间冲过去,下载,开读。
读完第一反应是什么?
我去,原来你们心里门儿清啊!
幻觉这回事儿啊,其实是考试逼的
论文里有一句话,我反复看了三遍,每一遍都在拍大腿。
“标准训练和评估程序更倾向于奖励猜测,而不是奖励模型承认不确定。”
明白了吧?
说白了,每次拿准确率给AI打分,就是在逼它瞎蒙!
说到这儿,你想想我们人类考试就懂了。
全是选择题。你拿不准的时候,空着还是蒙一个?
空着?必得零分。
蒙一个?万一撞大运呢!
AI被训练得精着呢。你拿基准测试评估它——答对加分,答错扣分,说“我不知道”算零分。
它怎么选?
当然是赌一把啊!
作者Adam Tauman Kalai举了个例子,直接把我说服了:
你问模型“某人的生日是哪天”,它不知道。
你猜它怎么干?
它只能瞎猜一个9月10日。
为啥?因为有1/365的概率蒙对。
但如果它诚实地说“我不确定”呢?
直接零分。
你想想,这公平吗?
我当场做了个实验
我拿这事儿,把几个模型都测试了一遍。
你猜怎么着?
| 我问他 | GPT-4o | Claude 3.5 Sonnet | 真相 |
|--------|--------|-------------------|------|
| Adam Tauman Kalai的博士论文标题是什么? | 《Learning Hierarchical Representations》 | 《Efficient Algorithms for...》 | 全是错的!实际是《A Theoretical Study of...》 |
| 他生日是哪天? | 1984年3月22日 | 1983年11月14日 | 全都不对! |
| DEEPSEEK里有几个D? | 2 | 3 | 应该是3个(D-E-E-P-S-E-E-K) |
你看出来了吗?
每一个答案都自信满满。语气笃定得跟真的似的。
你要不自己去查证,分分钟被带进沟里。
又自信,又笃定,又逻辑自洽。
但是——
错得一塌糊涂。
更扎心的是:就算训练数据是干净的,它照样胡说八道
论文里还讲了一个事实,直接把我干沉默了:
就算训练数据全是干净的,模型该产生幻觉还是会产。
他们把生成任务简化成一个叫IIV的二元分类问题。
说白了就是判断一个句子对不对。
结果发现什么呢?
当问题的模式本身就不容易用一条直线分开的时候——比如“数单词里某个字母出现了几次”这种需要精确计数的任务——模型在预训练阶段就会产生系统性错误。
你想想,模型学的是什么?
它学的是概率分布。
它看到“DEEPSEEK”这个词在语料里出现几百万次,但从来没有被要求过数里面有几个D。
现在你让它数,它只能碰运气。
因为统计上,“3”出现在类似上下文里的概率,和“2”差不多。
它随机选一个,就敢答。
这就像什么?
让一个从没见过数学题的人,猜1+1等于几。
他可能说2,也可能说3。
因为他就知道“1”和“2”经常在一起出现,但他根本不知道算数规则是什么。
模型也是一样。
它靠词向量之间的相关性来“推理”,它压根儿就没有真正计算的能力。
我拿论文里那个“数DEEPSEEK里的D”的例子,去问DeepSeek V3。
好家伙,它给了两个版本的答案:一次2,一次3。
同!一!个!模!型!
体温设成0,答案照样飘。
你猜OpenAI自己怎么想的?
有意思的事儿来了。
论文发布前后,OpenAI内部搞了一次重组。
负责给模型定“个性”的Model Behavior团队,整个并入了Post Training组。
前负责人Joanne Jang被调去了一个叫OAI Labs的新部门——专门做人和AI的新型交互界面。
这位小姐姐,刚上了《时代》的AI百大思想家榜单,排名比图灵奖得主Yoshua Bengio还靠前。
同一天被调离原岗。
她自己说:“超现实。”
为什么会有这次调整?
你看啊,Model Behavior团队之前干的事,本质上就是“调模型行为”。
但是——
如果你根本的评估机制,就他妈是在奖励瞎猜。
那不管你怎么后训练,模型照样会被架着往幻觉方向跑。
调个体,不如动整个考试制度。
所以OAI Labs要干嘛?
他们要设计新的交互方式。
让模型有空间说“我不知道”。
而不是永远在“蒙一下”和“被扣分”之间,二选一。
那OpenAI给的解法靠谱吗?
说实话,这次OpenAI没画大饼。
他们的核心建议,特别具体,特别实在:
在主流评测基准的评分规则里,引入置信度阈值。
具体操作长这样——
告诉模型:“你只有在信心超过某个阈值时才回答,低于阈值就说不知道。”
然后评分规则写清楚:猜错了,要比说不知道扣更多分。
这样一来,模型的最优策略就从“赌一把”变成了“诚实”。
听起来,挺对路吧?
但是——
改评测标准,不是OpenAI一家能决定的啊!
学术圈和工业界,用了几十年的准确率评估,说换就换?
再说,有些评测任务本身,就不允许说“不知道”。
比如选择题集,选项ABCD写死了,它怎么表达不确定?
只能硬选。
还有几个点,我觉得特别有意思:
第一,论文特意提到,RAG(检索增强生成)并不能彻底消除幻觉。为什么?因为如果搜索也没找到答案,在现有评分体系下,模型还是会编。而且像数数字、算数学这类内在幻觉,搜也帮不上忙。
第二,他们建议在LM-as-judge的场景里,也要把“合理的不确定表达”的分数打得比“有幻觉的长篇大论”高。这直接挑战了现在很多自动评测的惯例——目前的判卷器,倾向于给信息量大的回答高分,哪怕里面有错误。
第三,也是最重要的——论文没有宣称解决了幻觉!
它只是指出了根本原因和可能的缓解方向。
国内有些媒体标题党成“OpenAI破解幻觉难题”,原文可根本没这么说。
我特意去看了原始论文和博客。
语气非常克制。
甚至承认:“幻觉仍然是所有大型语言模型面临的根本挑战。”
所以,我该怎么办?
这篇论文让我更加坚定了自己的想法。
别把AI当成知识库。
把它当成一个特别能侃,但经常记错事的实习生。
你让它写文案、做头脑风暴、润色句子?靠谱。
你让它查事实、算数字、引文献?必须二次核对。
我现在的工作流里,凡是涉及具体数字、日期、人名、事件描述的,一律用搜索工具或原始文档交叉验证一遍。
这个习惯,救过我不少次。
上周我用Claude写一封给客户的邮件,里面提到“我们连续第三年获得XX奖项”。
我凭印象觉得应该没错。
但顺手Google了一下,发现2022年根本就没拿那个奖。
模型可能是,把另一家公司的信息混进来了。
你看,就差那么一下下。
至于未来,我期待OpenAI他们真能推动评测机制的改革。
如果能设计出既鼓励诚实,又不让模型变成“什么都不敢说”的缩头乌龟的评估方式——
那才是真正的进步。
但在那之前。
老老实实,当AI的校对员吧。
毕竟——
它胡说八道的时候,背锅的是我。
读者评论 4