GLM-5.1 与 GLM-5.2 都是智谱同一代基座的 MoE 模型,参数规模几乎一致(7,540 亿 / 7,533 亿总参数,均为 400 亿激活),都以 MIT 许可开放权重。真正的差别在于后训练方向与上下文能力,而这一点在总平均分里看不出来。
一句话结论
GLM-5.2 是一次以 Agent 与长上下文为核心的升级。 双方共有的 11 项百分制评测它全部赢下、平均分高 6.4 分,但增益高度集中:工具使用与终端任务提升巨大,常识推理几乎没有变化。
两代共有的 11 项评测
两代在 Text Arena (Coding) 上也都有成绩(1534 → 1593.25),但那是 Elo 评分制,与百分制量纲不同,不参与上面的平均分计算。
这次升级到底提升在哪
Agent 能力是主战场。 Terminal-Bench 2.1 提升 22.3 分,是这份榜单里最大的单项变化——这类评测衡量模型在真实终端环境里连续执行任务的能力,22 分意味着大量原本中途失败的任务现在能跑完。Tool Decathlon 再加 7.5 分,佐证了同一方向。如果你在做 Agent 或工具编排,这次升级的价值远高于平均分暗示的 6.4 分。
非常规编程任务提升明显。 WeirdML v2 提升 10.2 分,这套评测偏向不落俗套的机器学习编码问题,与 SWE-Bench Pro 那类标准 issue 修复(+3.7)拉开了差距——说明提升更多来自处理陌生问题的能力,而非熟练度。
数学与知识是稳步推进,不是跃迁。 AIME 2026 从 95.3 到 99.2 已经接近满分区间,剩余空间有限;GPQA Diamond +5.7、IMO-AnswerBench +7.2 属于扎实但常规的迭代。
常识推理原地踏步。 SimpleBench 两代都是 58.7/58.8,说明这一轮后训练没有针对这类任务优化。如果你的场景以日常常识判断为主,升级带来的收益可能很小。
规格差异
上下文从 200K 扩到 1M 是规格上最实质的变化,5 倍的窗口意味着整库代码分析、长文档处理这类任务从"需要切分"变成"可以一次喂进去"。代价是长上下文场景下 KV Cache 的显存开销会显著上升——权重本身两代都是 1.5 TB 量级,部署门槛没有变化,都需要多卡集群。
该不该升级
建议升级,如果你:
- 在做 Agent、工具调用或终端自动化——这是提升最大的方向
- 需要超过 200K 的上下文窗口
- 处理的编程任务偏非标准、探索性(WeirdML v2 的提升方向)
- 用于竞赛级数学或科学问答
可以观望,如果你:
- 主要场景是常识问答与日常对话(SimpleBench 显示两代无差别)
- 已经在 GLM-5.1 上做了大量后训练或提示词调优,迁移成本高于收益
- 部署资源紧张——1M 上下文的显存开销需要重新评估
两代都是 MIT 许可、免费商用,许可层面不构成迁移障碍。
数据说明:以上分数取自各模型在站内记录的最佳成绩,同一评测内可比,不同评测之间不可相加或换算。Elo/评分制评测未计入平均分。
