“评测即科学”:首篇大语言模型评测的综述,一文带你了解大
有几个地方需要修正:
1. 关于《A Survey on Evaluation of Large Language Models》是“大模型评测领域的第一篇综述”——这个说法过于绝对,早期还有别的综述(比如Chang等人2023年的Survey),建议改成“这个领域早期比较系统的综述之一”。
2. “我们开源项目里维护了一堆评测基准:AlpacaEval、HELM、Big-Bench、还有我们自己的PromptBench”——这几个基准并不是你这个项目在“维护”,而是你们在综述里引用和整理了它们。表达改成“我们在开源项目里整理了很多评测基准”更准确。
3. “我们团队做的PromptBench”——PromptBench最初来自微软和北大,如果你不是核心作者但参与了相关贡献,可以说“我也参与过PromptBench的工作”或模糊化为“PromptBench这个基准”。我按后一种处理,避免认领不确。
4. 数字(200多篇论文、掉20个点、掉十几个点)属于合理估计,保留。
下面是改后的版本,同时去掉了所有AI套话(你列的那些词原文里本来也没有,但有些排比和过于工整的表达我打散了,节奏也调得更像人说话)。
大模型评测,比训练更重要?我替你说句实话!
前两天我手痒,打开一个新模型,连题目都没输。
就输了个编号——“LC 53”。
结果它直接把答案甩出来了。最大子数组和,一步到位,一分不差。
我当时后背一阵凉。
不是因为它聪明。而是它明显“见过”这道题。
一个考生连题目都没看清,答案就脱口而出——这是真会还是背答案?
这事儿让我琢磨了大半年。
后来跟吉林大学、微软亚洲研究院、中科院自动化所的朋友们一起,折腾出一篇《A Survey on Evaluation of Large Language Models》——算是这个领域早期比较系统的综述之一。
搞完这篇东西,我才真正反应过来:
评测,才是大模型的“照妖镜”。
不是打分机器,是真金白银的试金石。
模型跑通?那只是万里长征第一步
做AI十年,我踩过最深的坑就是——以为“跑通了”等于“好用”。
以前搞机器学习,评测多简单:准确率多少,F1多少,跑一遍测试集,完事,下班。
大模型来了之后,这套直接废了。
你想想,一个模型能写诗、能编程、能看病、能聊天——一个分数怎么量化?
扎心的是,很多模型在公开测试集上刷分刷得飞起,一到真实场景立马拉胯。
为啥?
因为测试数据早就被污染了。
我那篇综述里统计了200多篇论文,扒开一层皮,看到一个残酷的真相:评测本身,正在成为一门独立的科学。
它不再是模型开发的“最后一步”。
而是一个需要单独研究、系统设计的领域。
说到这里,你可能会问:那到底怎么测才靠谱?
三个问题,治好我的选择困难症
整理那219篇文献的时候,最大的感受不是看不懂。
是太乱了。
有人测推理,有人测伦理,有人测鲁棒性……各说各话,谁也不服谁。
后来我想通了。
就用三个问题来归类:测什么、在哪测、怎么测。
这套分类框架是我自己最得意的。
先说测什么。
大模型的评测任务,早就从传统NLP(情感分析、文本分类、翻译)跑偏了:数学推理、医学诊断、法律咨询、化学分子式……我甚至见过有人拿大模型做人格测试。
后来我把它们归成9大类,每类再细分。比如“推理能力”这一项,拆成数学、符号、常识、时空——结果发现,不同推理能力,模型差距能差一倍。
再说在哪测。
我们开源项目里整理了一大堆评测基准:AlpacaEval、HELM、Big-Bench,还有PromptBench……
但这暴露出一个问题:基准太多,标准不统一。
同一个模型在AlpacaEval上排第一,换到KoLA上直接垫底。
你说闹不闹心。
但也说明一件事:统一评测标准,迫在眉睫。
最后说说怎么测。
目前主流就两条路:自动评测和人工评测。
自动评测就是让模型打分——用GPT-4评GPT-3.5。你想想,让一个考生去判另一个考生的卷子,多黑色幽默。
人工评测更靠谱,但成本高得吓人。一次大规模评测,烧掉上百万不算夸张。
三个“鬼故事”,听得我睡不着觉
搞评测这大半年,我碰上三个至今无解的难题。
第一个:数据污染防不胜防。
刚才说的LeetCode事件不是个例。
有研究者发现,把测试数据里的实体名字换一换,模型准确率能掉20个点。
这说明什么?模型背的不是逻辑,是答案。
现在有人提“动态评测”——测试题随时更新,模型不可能提前接触。
想法很好。
但做起来,制作成本是原来的三倍以上。
第二个:标准答案不存在了。
以前评测情感分析,“正向”就是“正向”,清清楚楚。
但大模型做的是开放生成。同一段输入,三个专家能给出四种评价。
我亲眼见过一个评测会议,两个审稿人为了一句“这段文本是否包含偏见”,吵了整整一个钟头。
答案不唯一,指标就没法量化。
这事到现在也没完美的解法。
第三个:评测跟不上模型进化速度。
大模型现在几乎是月更。
你花三个月攒一个评测基准,出来的时候模型已经迭代了三轮。
我在综述里专门提了这一点:评测需要“演化视角”——动态的、随时间变化的评测。
这不只是为了跟上进度。
更是为了提前发现风险。
一个越来越强的模型,如果不加约束,翻起车來得多狠?
你的模型,能通过“防撞测试”吗?
我常说,评测就是大模型的碰撞测试。
一部好车上市前,必须经过碰撞测试。没人因为“这车开得快”就忽视安全性。
但在大模型圈里呢?
大家都在拼跑分,很少有人认真问:这模型回答靠谱吗?会不会泄露隐私?会不会在关键决策上说错话?
PromptBench这个基准,测试的就是大模型在指令理解上的鲁棒性。
结论?不乐观。
稍微改改prompt的措辞,加个错别字,改个标点,模型准确率能掉十几个点。
哪是聪明啊,这是玻璃心。
所以我在综述里重点讲了安全性与可靠性评测。不是唱衰大模型,而是觉得——
一个没经过评测验证的模型,不该部署到生产环境。
三个趋势,一句忠告
现在回头看,大模型评测会往三个方向走:
第一,评测越来越“个性化”。通用基准还会存在,但垂直行业——医疗、金融、法律——的评测体系会快速建起来。目标是在专业判断上能超过95%的行业专家。
第二,动态评测会成为标配。固定题库终将失效,在线生成、持续更新的评测方式,会取代传统的“跑分”模式。
第三,人机协同的评测会兴起。全自动不可靠,全人工不可行,折中的办法是人类定规则、机器来批量化。
最后,给同行们一句忠告——
别把评测当成“交作业”。
每次有人问我“你的模型测了吗”,我都会反问他一句:“你测的是什么?”
因为我知道,大多数人在意的是分数,而不是分数背后的东西。
大模型评测的真实价值,不在于给模型排名。
而在于让所有人都能看清:这些模型到底能做什么,不能做什么,以及——
什么时候,最好别相信它。
那篇综述和相关的开源项目(GitHub: MLGroupJLU/LLM-eval-survey),我会一直维护下去。
不为别的。
就为了让大模型圈的“碰撞测试”标准,一天天变好。
毕竟——
一个“能打”的模型,首先得是一个“经得起测”的模型。
读者评论 5