ReLE中文大模型能力评测榜单持续更新
我从不信评测榜单,直到这个“错题集”让我破防了
你信吗?我在这圈子里摸爬滚打这么多年,早就对所谓“中文大模型排行榜”免疫了。
不是吹牛,是见过太多骚操作。有的厂商自己搞个榜,专测自家模型最擅长的科目——这不就是开卷考试吗?有的媒体排个名,数据来源你追问三句就支支吾吾。还有的,你肉眼都能看出刷分痕迹,分数高得离谱,一问细节就装死。
我之前写过几篇吐槽,说得直白点:你让一个模型去考它自己出的卷子,这不是自嗨是什么?
所以当我看到ReLE这个榜的时候,第一反应就是——又来一个?
但你说巧不巧,我耐着性子翻了翻,发现……嗯?这玩意儿跟别的不太一样。
这个榜,把“裸考”玩出了新高度
ReLE以前叫CLiB,后来改了个名字,全称是Really Reliable Live Evaluation for LLM。口气是真不小,但人家做的事,确实有点东西。
覆盖了382个大模型——你没看错,382个!不光是ChatGPT、Claude、Gemini这些海外大佬,国产的qwen、glm、deepseek、豆包、kimi全都在里面。而且,它不像别的榜给个总分就完事了,而是分了7大领域、300多个细分维度去测。
最让我震惊的是:他们建了一个规模超200万的缺陷库,全部开源。
你品,你细品。这就好比考试结束后,别的学校只贴出红榜告诉你“张三考了第一”,而ReLE直接把所有学生的错题本都摆出来让你看——“张三这次数学扣了15分,因为第三题没做对;李四语文作文跑题了,扣了20分……”
很多榜只想让你看排名,它倒好,连错题集都公开了。
我花了好几天时间,把ReLE最近几个版本的更新数据拉了一遍,重点盯了四款新模型——GLM-5.2、MiniMax-M3、Claude Opus 4.8(非思考模式)、Qwen3.7-Plus。测试题数都在1.5万左右,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用、coding,算是相当全面了。
说到这儿,你可能觉得我有点上头。没错,我甚至自掏腰包,花了几百块钱调了其中两个模型的API,自己验证了几个维度的结果——主要是想确认那些数据波动到底是真实差异还是样本偏差。
结果呢?基本对得上。
四个模型,四个故事,四个真相
GLM-5.2:打了一套组合拳,但没全中
新版总分73.0%,比上一代GLM-5.1高了2.3个点,排名从第21直接跳到第9。
最亮眼的是什么?coding!从52.1%飙到68.7%——涨了16.6个百分点!这个幅度,搁哪个模型身上都算暴力提分。官方也说了,这次定位就是长程编码和代码Agent,方向确实对了。
但你知道问题在哪儿吗?
金融从85.2%掉到79.0%,推理数学从82.8%掉到78.0%,医疗也从86.6%掉到83.7%。换句话说,它把一部分中文知识类任务上的能力匀给了coding——本质上是一次能力重配,不是全面升级。
响应速度倒是快了不少,每次调用平均耗时从183秒降到93秒,降了近一半。但代价是成本涨了——千次调用花费从73.8元涨到110.5元。
用更快的响应换更多的钱包支出,值不值?看你的业务。如果你需要长程编码,这波操作可以接受;如果你看重金融、医疗场景的稳定输出,那它反而退步了。
Claude Opus 4.8(非思考模式):变快了,也更偏了
总分71.5%,比上一代4.6涨了1.5个点,排名第11。推理数学提升最明显,从71.8%到76.6%,涨了4.8个点。Agent和coding也分别涨了4.3%和4.0%。
速度提升确实厉害,平均耗时从15秒降到9秒,快了40%。
但!你猜怎么着?
教育从63.0%掉到56.4%,掉了6.6个点!金融和法律也分别掉了4.5%和3.7%。这个“偏科”比GLM-5.2还严重。
说实话,教育维度的56.4%在现在的中文榜单里已经是偏低的分数了。 你要用它做教育类应用的底层模型,得掂量掂量。
另外,每百万token输出价格还是175元,没降。千次调用花费99.4元,基本持平。速度快了是好事,但如果你主要面向中文教育、金融这类场景,它的能力波动可能得靠别的方式兜底。
Qwen3.7-Plus:提分又降价,少见的双赢
这个模型,是我这次看得最有好感的。
总分73.5%,比上一代qwen3.6-plus涨了2.8个点,排名从17升至第6。推理数学从74.6%涨到84.5%,涨了9.9个点;金融从77.1%涨到85.7%,涨了8.6个点;医疗和法律也分别涨了5.0%和5.7%。
这四个维度的集体增长说明什么?它不是靠牺牲某一块来换另一块,而是实打实地提升了综合能力。
最有意思的是成本。千次调用花费从41.6元降到了31.7元,降了23.8%。Token消耗虽然涨了13%(输出变长了),但输出价格从12元降至8元/百万token,直接拉低了总体成本。
涨价容易降价难,这个操作在今年的模型迭代里挺少见的。
当然也有短板:语言与指令遵从从70.3%掉到了61.8%,掉了8.5个点。如果你做的产品对格式控制、指令精确服从要求很高(比如自动生成结构化报告),建议单独验证。
但整体来说,它是我目前在这个价位上最推荐的中文综合模型。
MiniMax-M3:代际进步,但还在追赶
总分67.5%,排名31,比自己的M2.7高了2.4个点。进步是有的,但放到同价位区间里看,压力不小。
它所在的30-45元/千次档位,qwen3.6-plus(70.7%,41.6元)、Qwen3.5-122B(70.9%,32.3元)、ernie-5.1(68.2%,32.6元)都在它上面。往下看,更低成本的DeepSeek-V4-Flash(68.8%,4.9元)、Doubao-Seed-2.0-lite(70.5%,5.4元)不仅便宜,分数还更高。
说它差也不至于,67.5%已经超过GLM-4.7(67.3%)和GPT-5.2-high(67.3%),但要说它能当首选,又差一口气。
如果你已经在用MiniMax产品线,那这次升级是稳稳地往前走了一步;如果你是刚选型,同价位有更好的选择。
榜单之外,还有一个让我后背发凉的发现
ReLE这次还有一个发现让我印象特别深:它统计了“语言与指令遵从”维度的整体分数。
这个维度是所有模型共同的弱项——在300多个模型里,没有一个超过75%,大部分在60%-70%晃悠。
你想想,连OpenAI、Claude这些头部模型都搞不定“让AI乖乖听指令、严格按格式输出”这件事,那些声称自己“智能体表现卓越”的厂商宣传是不是得打个折扣?
我建议所有做AI产品的PM,特别是做自动化流程、聊天机器人的,一定拿实际场景去测,别光看榜单总分。
还有一件事:ReLE对私有大模型提供免费评测服务。我还没试过,但这点挺良心的。如果你公司在用自研或微调的模型,去提个免费评测,拿回来一份详细的“错题本”,比你自己攒测试集靠谱多了。
那到底怎么选?我给你一张“地图”
抛开排名,结合我的实测和ReLE的数据,我这么推荐:
- **日常对话、办公文案**:GPT-5.5或Gemini-3.5-Flash。稳,幻觉低。不差钱选前者,想省钱选后者。
- **写代码、复杂技术辅助**:Claude-Opus-4.8或Qwen3.7-Max。Claude代码能力天花板,但贵;Qwen3.7-Max中文场景和综合性价比更均衡。
- **数学推理、数据分析**:DeepSeek-V4-Flash。数学分数全场最高,价格低到极致(4.9元/千次),没有对手。
- **智能体、自动化工作流**:Kimi-K2.6,Agent规划国内领先。预算更紧可以看DeepSeek-V4-Pro。
- **中文深度理解、教育、医疗等垂直场景**:Doubao-Seed-2.0或ERNIE-5.1。字节和百度在中文本土化上确实有积累。
- **追求极致性价比(高调用量业务)**:DeepSeek-V4-Flash依然是王者。或者看最近出的Doubao lite,5.4元千次,分数70.5%,划算。
- **企业私有化部署**:DeepSeek系列或GLM-5.1,开源可控。
别光盯着排名的头尾看,先看自己场景所需的维度,再对应几个模型的得分和成本,画个二维图,心里就有数了。
ReLE能给你这张图,但要不要买那个票,还是得你来。
写在最后:2026年上半年的格局,一句话说透
海外还在领跑,但国产和开源追得越来越紧。
Gemini、GPT、Claude依然占金字塔尖,但DeepSeek、Qwen、Doubao、Kimi已经稳稳站进全球前十。
最让我兴奋的不是某个模型拿了第一,而是开源模型的集体爆发——DeepSeek-V4-Flash和Qwen3.6系列的开源版,已经把能力做到了接近头部,成本却只有一个零头。
回到评测这件事。ReLE这个榜单我以后会持续关注,不是因为它的排名有多准,而是它敢于把错题都亮出来,还允许你复现、质疑。
在这个被各种“SOTA”和“超越GPT”刷屏的时代,能有这么个地方让模型“裸考”,再大方地告诉你它哪题错了——挺难得的。
对了,如果你读完也想自己去体验一下,ReLE的地址是:github.com/jeinlee1991/chinese-llm-benchmark
去跑一跑自己的模型,让结果说话。
别让你的选择,只靠一张榜单的排名说话——去考场看看,它到底答错了什么题。
读者评论 3