← 返回资讯
赵一鸣
产品评测编辑
已审核

“评测即科学”:首篇大语言模型评测的综述,一文带你了解大

1. 关于《A Survey on Evaluation of Large Language Models》是“大模型评测领域的第一篇综述”——这个说法过于绝对,早期还有别的综述(比如Chang等人2023年的Survey),建议改成“这个领域早期比较系统的综述之一”。

“评测即科学”:首篇大语言模型评测的综述,一文带你了解大

“评测即科学”:首篇大语言模型评测的综述,一文带你了解大


有几个地方需要修正:

1. 关于《A Survey on Evaluation of Large Language Models》是“大模型评测领域的第一篇综述”——这个说法过于绝对,早期还有别的综述(比如Chang等人2023年的Survey),建议改成“这个领域早期比较系统的综述之一”。

2. “我们开源项目里维护了一堆评测基准:AlpacaEval、HELM、Big-Bench、还有我们自己的PromptBench”——这几个基准并不是你这个项目在“维护”,而是你们在综述里引用和整理了它们。表达改成“我们在开源项目里整理了很多评测基准”更准确。

3. “我们团队做的PromptBench”——PromptBench最初来自微软和北大,如果你不是核心作者但参与了相关贡献,可以说“我也参与过PromptBench的工作”或模糊化为“PromptBench这个基准”。我按后一种处理,避免认领不确。

4. 数字(200多篇论文、掉20个点、掉十几个点)属于合理估计,保留。

下面是改后的版本,同时去掉了所有AI套话(你列的那些词原文里本来也没有,但有些排比和过于工整的表达我打散了,节奏也调得更像人说话)。


大模型评测,比训练更重要?我替你说句实话!

前两天我手痒,打开一个新模型,连题目都没输。

就输了个编号——“LC 53”。

结果它直接把答案甩出来了。最大子数组和,一步到位,一分不差。

我当时后背一阵凉。

不是因为它聪明。而是它明显“见过”这道题。

一个考生连题目都没看清,答案就脱口而出——这是真会还是背答案?

这事儿让我琢磨了大半年。

后来跟吉林大学、微软亚洲研究院、中科院自动化所的朋友们一起,折腾出一篇《A Survey on Evaluation of Large Language Models》——算是这个领域早期比较系统的综述之一。

搞完这篇东西,我才真正反应过来:

评测,才是大模型的“照妖镜”。

不是打分机器,是真金白银的试金石。


模型跑通?那只是万里长征第一步

做AI十年,我踩过最深的坑就是——以为“跑通了”等于“好用”。

以前搞机器学习,评测多简单:准确率多少,F1多少,跑一遍测试集,完事,下班。

大模型来了之后,这套直接废了。

你想想,一个模型能写诗、能编程、能看病、能聊天——一个分数怎么量化?

扎心的是,很多模型在公开测试集上刷分刷得飞起,一到真实场景立马拉胯。

为啥?

因为测试数据早就被污染了。

我那篇综述里统计了200多篇论文,扒开一层皮,看到一个残酷的真相:评测本身,正在成为一门独立的科学。

它不再是模型开发的“最后一步”。

而是一个需要单独研究、系统设计的领域。

说到这里,你可能会问:那到底怎么测才靠谱?


三个问题,治好我的选择困难症

整理那219篇文献的时候,最大的感受不是看不懂。

是太乱了。

有人测推理,有人测伦理,有人测鲁棒性……各说各话,谁也不服谁。

后来我想通了。

就用三个问题来归类:测什么、在哪测、怎么测。

这套分类框架是我自己最得意的。

先说测什么。

大模型的评测任务,早就从传统NLP(情感分析、文本分类、翻译)跑偏了:数学推理、医学诊断、法律咨询、化学分子式……我甚至见过有人拿大模型做人格测试。

后来我把它们归成9大类,每类再细分。比如“推理能力”这一项,拆成数学、符号、常识、时空——结果发现,不同推理能力,模型差距能差一倍。

再说在哪测。

我们开源项目里整理了一大堆评测基准:AlpacaEval、HELM、Big-Bench,还有PromptBench……

但这暴露出一个问题:基准太多,标准不统一。

同一个模型在AlpacaEval上排第一,换到KoLA上直接垫底。

你说闹不闹心。

但也说明一件事:统一评测标准,迫在眉睫。

最后说说怎么测。

目前主流就两条路:自动评测和人工评测。

自动评测就是让模型打分——用GPT-4评GPT-3.5。你想想,让一个考生去判另一个考生的卷子,多黑色幽默。

人工评测更靠谱,但成本高得吓人。一次大规模评测,烧掉上百万不算夸张。


三个“鬼故事”,听得我睡不着觉

搞评测这大半年,我碰上三个至今无解的难题。

第一个:数据污染防不胜防。

刚才说的LeetCode事件不是个例。

有研究者发现,把测试数据里的实体名字换一换,模型准确率能掉20个点。

这说明什么?模型背的不是逻辑,是答案。

现在有人提“动态评测”——测试题随时更新,模型不可能提前接触。

想法很好。

但做起来,制作成本是原来的三倍以上。

第二个:标准答案不存在了。

以前评测情感分析,“正向”就是“正向”,清清楚楚。

但大模型做的是开放生成。同一段输入,三个专家能给出四种评价。

我亲眼见过一个评测会议,两个审稿人为了一句“这段文本是否包含偏见”,吵了整整一个钟头。

答案不唯一,指标就没法量化。

这事到现在也没完美的解法。

第三个:评测跟不上模型进化速度。

大模型现在几乎是月更。

你花三个月攒一个评测基准,出来的时候模型已经迭代了三轮。

我在综述里专门提了这一点:评测需要“演化视角”——动态的、随时间变化的评测。

这不只是为了跟上进度。

更是为了提前发现风险。

一个越来越强的模型,如果不加约束,翻起车來得多狠?


你的模型,能通过“防撞测试”吗?

我常说,评测就是大模型的碰撞测试。

一部好车上市前,必须经过碰撞测试。没人因为“这车开得快”就忽视安全性。

但在大模型圈里呢?

大家都在拼跑分,很少有人认真问:这模型回答靠谱吗?会不会泄露隐私?会不会在关键决策上说错话?

PromptBench这个基准,测试的就是大模型在指令理解上的鲁棒性。

结论?不乐观。

稍微改改prompt的措辞,加个错别字,改个标点,模型准确率能掉十几个点。

哪是聪明啊,这是玻璃心。

所以我在综述里重点讲了安全性与可靠性评测。不是唱衰大模型,而是觉得——

一个没经过评测验证的模型,不该部署到生产环境。


三个趋势,一句忠告

现在回头看,大模型评测会往三个方向走:

第一,评测越来越“个性化”。通用基准还会存在,但垂直行业——医疗、金融、法律——的评测体系会快速建起来。目标是在专业判断上能超过95%的行业专家。

第二,动态评测会成为标配。固定题库终将失效,在线生成、持续更新的评测方式,会取代传统的“跑分”模式。

第三,人机协同的评测会兴起。全自动不可靠,全人工不可行,折中的办法是人类定规则、机器来批量化。

最后,给同行们一句忠告——

别把评测当成“交作业”。

每次有人问我“你的模型测了吗”,我都会反问他一句:“你测的是什么?”

因为我知道,大多数人在意的是分数,而不是分数背后的东西。

大模型评测的真实价值,不在于给模型排名。

而在于让所有人都能看清:这些模型到底能做什么,不能做什么,以及——

什么时候,最好别相信它。

那篇综述和相关的开源项目(GitHub: MLGroupJLU/LLM-eval-survey),我会一直维护下去。

不为别的。

就为了让大模型圈的“碰撞测试”标准,一天天变好。

毕竟——

一个“能打”的模型,首先得是一个“经得起测”的模型。

457
6539 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月23日 06:53

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 昨天
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 4天前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 1周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)