GLM-5.2 与 Kimi K2.6 都是开放权重的大型 MoE 模型,但这组对比的结果比大多数组合都更一边倒——而真正需要注意的差别,除了分数,还有许可条款。
一句话结论
评测层面 GLM-5.2 占明显优势:双方共有的 10 项评测中它赢下 9 项,平均分高 6.6 分,Agent 类任务差距尤其大。Kimi K2.6 的取舍点在于更大的模型体量与不同的许可条款。
共有的 10 项评测
怎么读这组数据
Agent 能力的分裂很值得注意。 GLM-5.2 在 Terminal-Bench 2.1 上领先 27.4 分——这是全表最大的差距,几乎是一个数量级的体验差别;但在 Tool Decathlon 上它反而落后 1.8 分,是 Kimi K2.6 唯一赢下的一项。两项都属于工具使用类评测,结论相反,说明"Agent 能力"不是单一维度:终端环境下的长链条执行与多工具编排考察的不是同一件事。
知识与推理的差距很小。 HLE 相差 0.7、GPQA Diamond 相差 1.4,都在可以视作打平的范围内。两者的差距主要不在知识储备上。
Kimi K2.6 另有一批 GLM-5.2 没有的成绩:SWE-bench Verified 80.2、SWE-bench Multilingual 76.7、BrowseComp 83.2、OSWorld-Verified 73.1、MCPMark-Verified 72.8、Claw Bench 80.9、Kimi Code Bench 2.0 50.9、MLS Bench 26.7。其中 SWE-bench Verified 80.2 是相当高的成绩,而 GLM-5.2 在这一项上站内暂无记录——不能据此断定谁在真实 issue 修复上更强,只能说这一项缺少可比数据。
规格与许可
两点实际影响:
上下文差 4 倍。 GLM-5.2 的 1M 对 Kimi K2.6 的 256K,长文档与整库代码分析场景差别明显。
许可需要单独确认。 GLM-5.2 是标准 MIT,条款简短且无附加限制;Kimi K2.6 是 Modified MIT——修改版许可通常会附加条件(常见的是达到一定用户规模或商业规模时需要显著标注来源)。如果用于商业产品,建议直接阅读官方许可原文,不要按标准 MIT 的预期来规划。
体量方面 Kimi K2.6 的 1 万亿总参数比 GLM-5.2 多出约三成,按 BF16 推算权重约 2 TB(该数字为按参数量推算,非官方公布值),自建门槛更高;但它的激活参数(320 亿)反而更少,推理时的计算量低于 GLM-5.2 的 400 亿。部署成本看总参数,推理速度看激活参数,这两个方向在这组对比里是相反的。
怎么选
选 GLM-5.2,如果你:
- 做终端自动化或需要长链条工具执行(Terminal-Bench 差距最大)
- 需要 1M 上下文
- 希望许可条款尽可能简单(标准 MIT)
选 Kimi K2.6,如果你:
- 看重它在 SWE-bench Verified、OSWorld 等 GLM-5.2 暂无记录项目上的表现
- 推理算力受限,更少的激活参数有价值
- 已确认 Modified MIT 的附加条款不影响你的商用场景
数据说明:以上分数取自各模型在站内记录的最佳成绩,同一评测内可比,不同评测之间不可相加或换算。许可条款以各模型官方发布的原文为准。

