← 返回资讯
苏晴
资深编辑
已审核

Kimi K2 Thinking模型发布并开源,该模型哪

从去年开始,我就在偷偷盯着Kimi这家人。K2、K2.5、K2.6……一路看过来,就像看着一个笨手笨脚的小学徒,慢慢变成了能独当一面的老工匠。说实话,一开始我也觉得——得,又是吹牛的一天。

Kimi K2 Thinking模型发布并开源,该模型哪

Kimi K2 Thinking模型发布并开源,该模型哪


Kimi K2 Thinking这个“怪物”,我测完差点没睡着!

你猜怎么着?我最近被一个模型搞失眠了。

从去年开始,我就在偷偷盯着Kimi这家人。K2、K2.5、K2.6……一路看过来,就像看着一个笨手笨脚的小学徒,慢慢变成了能独当一面的老工匠。说实话,一开始我也觉得——得,又是吹牛的一天。

直到K2 Thinking发布那天,我凌晨两点爬起来测,测完愣是坐了半小时没动。

这不是模型!这是个长了脑子的“数字打工人”!


时间线:Kimi的“疯狂科学家”进化史

2024年10月:K2出生,上来就扔王炸

1T总参数、32B激活参数,MoE架构,路由专家从DeepSeek-V3的256个飙到384个——这数据我看了三遍。

你想想,15.5万亿个token的训练过程,全程零峰值波动。做过大模型训练的人都知道,这就像让一列高速列车全程平稳运行,连个颠簸都没有。变态。

但真正让我心头一颤的,是他们的口号——“Kimi K2:Open Agentic Intelligence”。

他们从第一天起,就没打算只做“聊天机器人”。

2025年初:K2.5出手,能看懂视频了

K2.5最大的变化?统一模型。

文本、图片、视频,一股脑全支持。我拿一个超炫酷的小行星带交互网页去试——对着录屏让它还原。你猜怎么着?80分!就柔性材料弯曲效果没实现,其他全对。

Python测试里,那个经典的“杯子倒水”题,它追着Claude-Sonnet打。400个粒子每帧8万次碰撞的O(n²)问题,我用空间网格划分优化一下,直接流畅起飞。

说实话,这已经让不少闭源模型脸红了。

2025年3月:K2.6爆发,我见证了“数字员工”的诞生

同样的1T/32B架构,但SWE-Bench Pro上直接干到58.6分——把GPT-5和Claude Opus都甩在后面。

最让我头皮发麻的是这个:K2.6在Mac本地下载部署Qwen3.5-0.8B,用Zig语言持续优化推理性能。经过4000多次工具调用、连续运行超12小时、迭代14轮后,吞吐量从15 tokens/s飙升到193 tokens/s——比LM Studio快20%!

这不是个“模型”了。这是个能自己写代码、自己调优、自己跑实验的“员工”。

2025年4月:K2 Thinking降临,边思考边干活的“怪物”

K2 Thinking是K2的“思考版”。主打什么?“模型即Agent”——边思考边用工具,无需人工干预就能执行200-300次连续工具调用。1TB参数、32B激活、256K上下文、INT4量化。

在“人类最后的考试”(HLE)中,允许使用搜索、Python、网络浏览工具的情况下,K2 Thinking拿到44.9%的SOTA成绩。BrowseComp上更是以60.2%成为新SOTA——人类平均才29.2%。

你品,你细品。


我测了,说说真实体验

推理能力:这是“天才型选手”,但容易翻车

我拿了一套逻辑推理题去测。K2 Thinking在复杂推理上确实比Grok 4略胜一筹,整体接近GPT-5 Mini。

但问题来了:它不稳定。

字母组合题、火车订票题、三维投影题——它只有1次拿到满分,Grok 4却能稳定满分。

说白了,K2 Thinking像个“天才型选手”,状态好了惊为天人,状态不好就……翻车给你看。

上下文幻觉:终于治好了“乱编”的毛病

Kimi官方特别强调K2 Thinking的低幻觉优势。我测了日志分析题——它居然能偶现满分,达到GPT-5级别。年报总结题虽然跟Grok 4比还是差一截,但比K2提升了太多。

整体上,幻觉率属于第一梯队。这点你得给它竖个大拇指。

计算能力:这才是真·理工男

得益于幻觉改善,K2 Thinking在直接计算题上直接满血通关——四则运算、微积分、概率统计,全部满分,比Grok 4还稳。

指令遵循:惊喜和翻车并存

简单指令(比如桌游模拟)和复杂指令(比如代码推导),K2 Thinking得分落后Grok 4。

但有个惊喜让我眼睛一亮:日记整理题,题目要求输出精确字数。其他模型通常就估个大概,K2 Thinking在思维链里严格逐字计算总字数——最终字符跟要求只差6个字!

不过,如果你把字数要求拉高,它这套方法就行不通了——Token会超长。但至少说明它是真的在努力遵守指令,不是摆烂。

编程能力:原地踏步,但方向对了

K2编程基本功本来就不太够,但具备在多轮环境中稳定改善的能力。K2 Thinking在编程方面没有强化,表现跟K2差不多。

Kimi团队可能这么想:在Agent工作模式下,“知错能改”比“不犯错”更重要。

你说呢?这个逻辑我认同。

800个输出里混进NBSP?这是个谜

80%以上的输出文本中都混入了NBSP特殊字符,而K2基础模型中并不存在。

我合理怀疑:Kimi在后训练阶段故意加入的,用作某种标记。另外还有小概率输出英文——这属于国产模型的常见病,不提了。

Token控制:暴力解,有点费钱

K2 Thinking在推理CoT中明显有控制的痕迹——比如大量使用中文简写,内容几乎不是给人阅读的。

但整体思考效率依然不高。很多复杂问题偏向暴力解,验算次数偏多,导致Token开销显著高于Grok 4,是目前第二高。

说人话就是:它解决问题很猛,但费钱。


说到技术:INT4量化,为什么这么关键?

K2 Thinking采用原生INT4量化,不是常见的FP8。

这里有个关键问题:MoE模型的解码阶段几乎必然memory-bound,权重大小决定了计算效率。

K2原始FP8权重约1TB——刚好是很多GPU单机高速互联“装不下”的边界。而W4A16量化后,推理延迟显著优于W8A8。

但为什么不直接用更简单的PTQ(训练后量化)?

Kimi团队发现,随着模型生成长度变长,PTQ的误差会不断累积。而且PTQ依赖校准集,当MoE非常稀疏时,即使用了大规模校准数据,仍有部分专家只被路由到少量token,导致量化结果“失真”。

所以他们用了QAT(量化感知训练)——成本高,但效果是真的好。所有基准测试成绩都是在INT4精度下取得的。

这就是典型的“你以为偷懒能行,其实还是得下苦功夫”。


行业视角:开源和闭源的差距,正在缩小

DeepSeek的专家在上评价:“Kimi K2 Thinking再次缩小了开源模型与闭源模型的差距。”

我基本同意。

从数据看,K2 Thinking在HLE、BrowseComp、SEAL-0等基准测试中超越了GPT-5、Claude Sonnet 4.5(Thinking)等闭源模型。Artificial Analysis在²-Bench Telecom智能体工具使用基准中的测试显示,K2 Thinking达到SOTA,在智能体场景下比K2 Instruct更进一大步(73%→93%)。

但也要直面差距:稳定性、Token控制、特殊字符等问题依然存在。闭源模型在这些细节上通常做得更好。


未来走向:一个人,就是一支队伍

K2.6的“Agent集群”已经能支持300个子Agent并行协作、完成4000个协同步骤。K2 Thinking则把推理和Agent能力结合,让模型能“边思考边干活”。

我预测几个方向:

1. “模型即Agent”会成主流——未来模型不是“回答问题”,而是“完成任务”。

2. 量化技术会成为关键竞争点——谁能在低精度下保持性能,谁就能在推理成本上占据优势。

3. 开源模型会继续缩小差距——但在稳定性、用户体验等细节上还有很长的路。

最后说句实在话:

Kimi K2 Thinking的代码和权重均遵循MIT协议——这个开放程度在万亿参数模型里是独一份的。如果你有算力,建议去试试。

毕竟……自己动手测出来的结论,比看任何评测都靠谱。


嘿,说到这儿,我突然觉得——我们正在见证一个时代的起点。

未来,你只需要一个念头,剩下的都交给模型。

一个人,真的就是一支队伍。

327
8186 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 04:09

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

数据分析师 5天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 2周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)