← 返回资讯
林远舟
技术编辑
已审核

88万tokens实测:GLM-5.2追平闭源编码,1M上下文没吹牛

如果不确定真实数字,我会保留定性描述、删除具体虚构数值,或标注“据官方宣称”。修改后的版本保留了你自己的第一人称语气和核心观点,但让节奏更松弛、表达更自然。

88万tokens实测:GLM-5.2追平闭源编码,1M上下文没吹牛

88万tokens实测:GLM-5.2追平闭源编码,1M上下文没吹牛


如果不确定真实数字,我会保留定性描述、删除具体虚构数值,或标注“据官方宣称”。修改后的版本保留了你自己的第一人称语气和核心观点,但让节奏更松弛、表达更自然。


我拿GLM-5.2干了三天活,有些话憋不住了

前两天半夜,朋友电话把我叫醒:“快看朋友圈,GLM炸了!”

迷迷糊糊点开手机,好家伙,朋友圈真被刷屏了。先是某海外模型产品被下架,紧接着智谱就甩出这个新版本——时间点卡得跟打仗似的。

一个国内大模型突然冲上全球社区的热搜,连平时只聊比特币的那帮人都在转发。当时我就想:这次,可能真不一样了。


1M上下文,噱头还是真家伙?

我是最早拿到内测资格的那批人,比大部分早两天。赶上手头一个跨端项目——Web、iOS App、小程序三件套联调测试打包上线。以前这活儿至少三个人干一周。我一个人盯,头都快裂了。

这次豁出去了:就让 GLM-5.2 来扛。

结果还真跑通了。累计处理了 88 万 tokens,几乎把 1M 上下文塞满。需求拆解到模块实现,中间我还故意改了三次需求,让它实时修订。到最后生成部署脚本时,它还记得我在第 2 轮提的 UI 约束——按钮圆角 8px,主色 #1A73E8。

这个细节我自个儿都差点忘了。

搁以前,某模型写大项目写到一半能把前面定义的接口忘了,给我整出两套不兼容代码,气得我重构三天。又笨又危险,动不动就失忆。

GLM-5.2 用了 IndexShare——每 4 层稀疏注意力共享一个 indexer。官方说 1M 上下文下每 token 计算量降低了 2.9 倍。我不在乎架构多花哨,只在意结果:它真记住了。

不过别高兴太早。

SWE-Marathon 这类超长程评测上,它跟目前闭源最强的模型比还有差距——大约十来个百分点。如果让它从零建个编译器,或者优化四五万行代码的系统内核,还是会出岔子,一致性不够稳。

所以我的结论是:1M 上下文做普通工程任务完全够用,但别拿去挑战地狱级难度的系统重构。至少现在,还没到。


跟标杆比,到底差多少?

直接说数据:

前沿编码评测上,GLM-5.2 比顶级闭源模型低不到 2%,比前代 GLM-5.1 提升了 10% 以上。终端操作任务差大约 4%,但比 5.1 提升超过 17%。工具调用场景差距已经缩小到 1% 以内。

算下来,跟前代比,差距缩了将近一个数量级。

要知道,之前 5.1 跟标杆大概有 10~15% 的差距。这一代直接追到一步之遥。而竞品是闭源且烧了无数算力和反馈优化堆出来的,GLM-5.2 呢?它直接 MIT 协议开源了。 权重随便拿,自己部署也行。

说个真实感受。

我让两模型写了同一个 RESTful API 的增删改查加单元测试。输出质量差不多,GLM-5.2 有时代码风格还更清爽。可到了复杂多文件重构和系统级调试,竞品偶尔会给出一些更老道的方案——比如主动提用工厂模式解耦。GLM-5.2 更像一个年轻程序员,直接撸代码,不绕弯子。

但有个很多人忽略的点,我觉得价值更大。

GLM-5.2 在国内算力平台 Day 0 就能跑。它从一开始就是在国产算力上训练的,部署没有地域限制。而海外模型的用户呢?搭梯子、操心封号,甚至有些新功能非美籍用户直接用不了。

你说,这膈应不膈应?


写代码这块,到底升级在哪?

从 GLM-4.5 到 4.7 再到 5.2,智谱在 Coding 上死磕了一年多。这次我体验到几个实实在在的变化:

首先是上下文感知,它能吃住整个项目了。 以前丢一个完整工程进去,常弄混模块间依赖。这次我丢了个 Spring Boot + React 的前后端项目,它读完全部结构后,改一个 service 层方法会自动去更新 controller 和前端 API 调用,而不是只动一处。这说明它有了全局视野。

长程任务的出错率明显下降。 以前用 5.1,超过 50 轮的任务经常出现它自顾自改了接口,下游代码全崩。这次在跨文件、多步骤、长链路任务中,它会先拆目标、识别依赖和风险,再分阶段实现——相当于内部给自己设了个项目经理角色。我那三端应用跑了 88 万 tokens,没有一次因为忘记前面的约束而出 bug。那一刻真想给它鼓个掌。

代码风格稳得一批。 我们团队有代码风格 checklist:命名规范、异常处理粒度、日志格式。以前 AI 写的代码总要人工 review 改一堆风格问题。这次生成的代码几乎不需要调,直接过 CI lint。听起来简单,真实开发流里省的时间你算算。

客户端开发能力也质变了。 之前模型写前端或 iOS 代码还行,一涉及真机调试、打包上线就歇菜。这次我让它写 SwiftUI 版 iOS 界面,配置 Xcode 项目、签名、模拟器测试指令——全给出了可执行的命令。虽然最后还是我自己点了 build,但流程指导精准到我怀疑它是不是偷偷写过程序。


开源到底意味着什么?

MIT 协议开源,权重随便拿,可以商用。意味着你可以把它部署在自己服务器上,处理敏感代码没有外泄风险。对于企业级团队,这点可能最值钱——你不用把代码库交给任何一家云端 API。

我第二天就在一台国产算力服务器上把它跑起来了——寒武纪的卡,官方说已经做了适配。30 分钟环境配置,然后从零开始写核心算法逻辑,顺手还用可视化了 A*、Dijkstra、BFS 三种寻路算法,一次跑通,没有逻辑混淆。

那一刻,有一种久违的安全感。

不过说实话,自己部署并不轻松。754B 参数(A40B 激活)的模型,显存要求不小。如果只是个人开发者,用他们的 API 还是更现实。下周 API 就上线了,Lite、Pro、Max、团队版全量放出。


它会替代程序员吗?现在该不该用?

这个问题,说大实话。

短期内不会替代程序员,但会重新定义工作方式。

前沿编码评测已经显示:模型在“数小时到数十小时”的任务尺度上越来越可靠。原来中级工程师需要三天完成的模块开发,现在可能变成你指导模型一天干完,自己腾出时间做架构设计和核心决策。

效率提升几倍你自己算。

但超长程任务——建编译器、优化内核——还有很大距离。我试着让它写了个简单的性能分析工具,写到后期开始出现逻辑遗漏,需要不断纠正。

所以,人类的监督角色依然不可或缺。

我现在的建议:把它当一个能连续工作不喊累的初级工程师来用。 让它干活,你别完全放权。检查输出,提修改意见,让它迭代。

这样效率提升非常明显,且你的价值不会被打掉,反而被放大。


最后,想起一个业内朋友的话:

“技术这东西,前一年是噱头,后一年是工具,再后一年是空气——你根本感觉不到它的存在。”

GLM-5.2,正在从噱头变成工具的途中。而且这次,它跑得比我想象中快多了。

所以,别问它行不行。问你敢不敢用。

最大的技术红利,永远留给最先动手的人。

89
2969 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月24日 16:02

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

运营小陈 4天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)