← 返回资讯
林远舟
技术编辑
已审核

ReLE中文大模型能力评测榜单持续更新

你信吗?我在这圈子里摸爬滚打这么多年,早就对所谓“中文大模型排行榜”免疫了。

ReLE中文大模型能力评测榜单持续更新

ReLE中文大模型能力评测榜单持续更新


我从不信评测榜单,直到这个“错题集”让我破防了

你信吗?我在这圈子里摸爬滚打这么多年,早就对所谓“中文大模型排行榜”免疫了。

不是吹牛,是见过太多骚操作。有的厂商自己搞个榜,专测自家模型最擅长的科目——这不就是开卷考试吗?有的媒体排个名,数据来源你追问三句就支支吾吾。还有的,你肉眼都能看出刷分痕迹,分数高得离谱,一问细节就装死。

我之前写过几篇吐槽,说得直白点:你让一个模型去考它自己出的卷子,这不是自嗨是什么?

所以当我看到ReLE这个榜的时候,第一反应就是——又来一个?

但你说巧不巧,我耐着性子翻了翻,发现……嗯?这玩意儿跟别的不太一样。


这个榜,把“裸考”玩出了新高度

ReLE以前叫CLiB,后来改了个名字,全称是Really Reliable Live Evaluation for LLM。口气是真不小,但人家做的事,确实有点东西。

覆盖了382个大模型——你没看错,382个!不光是ChatGPT、Claude、Gemini这些海外大佬,国产的qwen、glm、deepseek、豆包、kimi全都在里面。而且,它不像别的榜给个总分就完事了,而是分了7大领域、300多个细分维度去测。

最让我震惊的是:他们建了一个规模超200万的缺陷库,全部开源

你品,你细品。这就好比考试结束后,别的学校只贴出红榜告诉你“张三考了第一”,而ReLE直接把所有学生的错题本都摆出来让你看——“张三这次数学扣了15分,因为第三题没做对;李四语文作文跑题了,扣了20分……”

很多榜只想让你看排名,它倒好,连错题集都公开了。

我花了好几天时间,把ReLE最近几个版本的更新数据拉了一遍,重点盯了四款新模型——GLM-5.2、MiniMax-M3、Claude Opus 4.8(非思考模式)、Qwen3.7-Plus。测试题数都在1.5万左右,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用、coding,算是相当全面了。

说到这儿,你可能觉得我有点上头。没错,我甚至自掏腰包,花了几百块钱调了其中两个模型的API,自己验证了几个维度的结果——主要是想确认那些数据波动到底是真实差异还是样本偏差。

结果呢?基本对得上。


四个模型,四个故事,四个真相

GLM-5.2:打了一套组合拳,但没全中

新版总分73.0%,比上一代GLM-5.1高了2.3个点,排名从第21直接跳到第9。

最亮眼的是什么?coding!从52.1%飙到68.7%——涨了16.6个百分点!这个幅度,搁哪个模型身上都算暴力提分。官方也说了,这次定位就是长程编码和代码Agent,方向确实对了。

但你知道问题在哪儿吗?

金融从85.2%掉到79.0%,推理数学从82.8%掉到78.0%,医疗也从86.6%掉到83.7%。换句话说,它把一部分中文知识类任务上的能力匀给了coding——本质上是一次能力重配,不是全面升级。

响应速度倒是快了不少,每次调用平均耗时从183秒降到93秒,降了近一半。但代价是成本涨了——千次调用花费从73.8元涨到110.5元。

用更快的响应换更多的钱包支出,值不值?看你的业务。如果你需要长程编码,这波操作可以接受;如果你看重金融、医疗场景的稳定输出,那它反而退步了。

Claude Opus 4.8(非思考模式):变快了,也更偏了

总分71.5%,比上一代4.6涨了1.5个点,排名第11。推理数学提升最明显,从71.8%到76.6%,涨了4.8个点。Agent和coding也分别涨了4.3%和4.0%。

速度提升确实厉害,平均耗时从15秒降到9秒,快了40%

但!你猜怎么着?

教育从63.0%掉到56.4%,掉了6.6个点!金融和法律也分别掉了4.5%和3.7%。这个“偏科”比GLM-5.2还严重。

说实话,教育维度的56.4%在现在的中文榜单里已经是偏低的分数了。 你要用它做教育类应用的底层模型,得掂量掂量。

另外,每百万token输出价格还是175元,没降。千次调用花费99.4元,基本持平。速度快了是好事,但如果你主要面向中文教育、金融这类场景,它的能力波动可能得靠别的方式兜底。

Qwen3.7-Plus:提分又降价,少见的双赢

这个模型,是我这次看得最有好感的

总分73.5%,比上一代qwen3.6-plus涨了2.8个点,排名从17升至第6。推理数学从74.6%涨到84.5%,涨了9.9个点;金融从77.1%涨到85.7%,涨了8.6个点;医疗和法律也分别涨了5.0%和5.7%。

这四个维度的集体增长说明什么?它不是靠牺牲某一块来换另一块,而是实打实地提升了综合能力。

最有意思的是成本。千次调用花费从41.6元降到了31.7元,降了23.8%。Token消耗虽然涨了13%(输出变长了),但输出价格从12元降至8元/百万token,直接拉低了总体成本。

涨价容易降价难,这个操作在今年的模型迭代里挺少见的。

当然也有短板:语言与指令遵从从70.3%掉到了61.8%,掉了8.5个点。如果你做的产品对格式控制、指令精确服从要求很高(比如自动生成结构化报告),建议单独验证。

但整体来说,它是我目前在这个价位上最推荐的中文综合模型。

MiniMax-M3:代际进步,但还在追赶

总分67.5%,排名31,比自己的M2.7高了2.4个点。进步是有的,但放到同价位区间里看,压力不小。

它所在的30-45元/千次档位,qwen3.6-plus(70.7%,41.6元)、Qwen3.5-122B(70.9%,32.3元)、ernie-5.1(68.2%,32.6元)都在它上面。往下看,更低成本的DeepSeek-V4-Flash(68.8%,4.9元)、Doubao-Seed-2.0-lite(70.5%,5.4元)不仅便宜,分数还更高。

说它差也不至于,67.5%已经超过GLM-4.7(67.3%)和GPT-5.2-high(67.3%),但要说它能当首选,又差一口气。

如果你已经在用MiniMax产品线,那这次升级是稳稳地往前走了一步;如果你是刚选型,同价位有更好的选择。


榜单之外,还有一个让我后背发凉的发现

ReLE这次还有一个发现让我印象特别深:它统计了“语言与指令遵从”维度的整体分数。

这个维度是所有模型共同的弱项——在300多个模型里,没有一个超过75%,大部分在60%-70%晃悠。

你想想,连OpenAI、Claude这些头部模型都搞不定“让AI乖乖听指令、严格按格式输出”这件事,那些声称自己“智能体表现卓越”的厂商宣传是不是得打个折扣?

我建议所有做AI产品的PM,特别是做自动化流程、聊天机器人的,一定拿实际场景去测,别光看榜单总分。

还有一件事:ReLE对私有大模型提供免费评测服务。我还没试过,但这点挺良心的。如果你公司在用自研或微调的模型,去提个免费评测,拿回来一份详细的“错题本”,比你自己攒测试集靠谱多了。


那到底怎么选?我给你一张“地图”

抛开排名,结合我的实测和ReLE的数据,我这么推荐:

别光盯着排名的头尾看,先看自己场景所需的维度,再对应几个模型的得分和成本,画个二维图,心里就有数了。

ReLE能给你这张图,但要不要买那个票,还是得你来。


写在最后:2026年上半年的格局,一句话说透

海外还在领跑,但国产和开源追得越来越紧。

Gemini、GPT、Claude依然占金字塔尖,但DeepSeek、Qwen、Doubao、Kimi已经稳稳站进全球前十。

最让我兴奋的不是某个模型拿了第一,而是开源模型的集体爆发——DeepSeek-V4-Flash和Qwen3.6系列的开源版,已经把能力做到了接近头部,成本却只有一个零头。

回到评测这件事。ReLE这个榜单我以后会持续关注,不是因为它的排名有多准,而是它敢于把错题都亮出来,还允许你复现、质疑。

在这个被各种“SOTA”和“超越GPT”刷屏的时代,能有这么个地方让模型“裸考”,再大方地告诉你它哪题错了——挺难得的。

对了,如果你读完也想自己去体验一下,ReLE的地址是:github.com/jeinlee1991/chinese-llm-benchmark

去跑一跑自己的模型,让结果说话。

别让你的选择,只靠一张榜单的排名说话——去考场看看,它到底答错了什么题。

137
2757 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 12:23

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

前端工程师 1周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 昨天
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 4天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)