DeepSeek-V4-Pro 与 GLM-5.2 是当前最受关注的两款开源权重旗舰,都采用 MIT 许可、都支持 1M 上下文。总平均分只差 1.7 分,看起来势均力敌——但把 11 项共有评测拆开看,两者的强项几乎不重叠,选择取决于你的任务类型,而不是谁"更强"。
一句话结论
做数学与深度推理选 GLM-5.2,做仓库级编程与终端 Agent 选 DeepSeek-V4-Pro。 双方共有 11 项评测,GLM-5.2 赢 7 项、平均分高 1.7 分,但两者的差距集中在完全不同的领域,平均分在这组对比里几乎没有参考价值。
共有的 11 项评测
三处值得单独讲的差距
1. 前沿数学:29.3 对 2.4。 FrontierMath Tier 4 是这套题集里最难的一档,GLM-5.2 拿到 29.3 分而 DeepSeek-V4-Pro 只有 2.4 分——不是"略胜",是一个能做出题、一个基本做不出。在难度低一档的 FrontierMath v2 上差距收窄到 14 分,说明两者的分野出现在题目难度的顶端。值得注意的是,在 AIME、IMO 这类竞赛题上两者都在 90 分左右,用常规数学评测完全看不出这个差别。
2. 编程能力方向相反。 DeepSeek-V4-Pro 在 DeepSWE(+18.7)和 NL2Repo-Bench(+12.6)上大幅领先,这两项偏向"从需求生成仓库级代码";但 GLM-5.2 在 SWE-Bench Pro 上反超 6.7 分,那是更贴近真实 issue 修复的集合。"哪个更会写代码"这个问题在这里没有统一答案,取决于你是在从零构建还是在既有代码库里改。
3. 终端 Agent 上 DeepSeek 更稳。 Terminal-Bench 2.1 领先 6.9 分,配合它独有的 Toolathlon-Verified 74.1、AutomationBench 31.8、CyberGym 83.3 等成绩,DeepSeek-V4-Pro 在长链条工具执行上的记录更完整。
各自的独家成绩
DeepSeek-V4-Pro 独有: MMLU Pro 87.5、SWE-bench Verified 80.6、SWE-bench Multilingual 76.2、BrowseComp 83.4、CyberGym 83.3、Toolathlon-Verified 74.1、Agents' Last Exam 25.7、AutomationBench 31.8,以及评分制的 CodeForces 3206、GDPval-AA 1554。
GLM-5.2 独有: FrontierSWE 74.4、Program Bench 63.7、AIME 2026 99.2、MCP-Atlas 76.8、Tool Decathlon 48.2、PostTrain Bench 34.3。
缺少某项成绩不代表能力欠缺,只表示站内暂未收录该项数据。
部署成本:DeepSeek 是 GLM 的两倍体量
DeepSeek-V4-Pro 的总参数量是 GLM-5.2 的两倍多。按 1.6 万亿参数、BF16 精度推算,仅权重就约 3.2 TB(该数字为按参数量推算,非官方公布值),大致是 GLM-5.2 的两倍。MoE 只把计算量压到激活参数的规模,显存仍按总参数量计——这意味着两者的自建门槛相差一倍,而它们的激活参数(490 亿 vs 400 亿)却很接近,推理速度上的差距远小于部署成本上的差距。
最大输出长度上 DeepSeek-V4-Pro 是 384K 对 128K,三倍差距,长文生成场景值得留意。
怎么选
选 GLM-5.2,如果你:
- 任务涉及高难度数学或需要深度推理的研究场景
- 主要在既有代码库里做 issue 修复(SWE-Bench Pro 更强)
- 自建部署,且希望权重体量控制在 1.5 TB 量级
选 DeepSeek-V4-Pro,如果你:
- 需要从需求直接生成仓库级代码
- 做终端自动化、长链条工具调用
- 需要超长输出(384K tokens)
- 走 API 而非自建,不承担权重体量的成本
两者都是 MIT 许可、免费商用,许可层面没有区别。
数据说明:以上分数取自各模型在站内记录的最佳成绩,同一评测内可比,不同评测之间不可相加或换算。评分制评测(CodeForces、GDPval-AA)与百分制量纲不同,未参与平均分计算。

