GLM-5.3 和 GLM-5.2 是同一个基座吗?升级在哪里?
是同一个基座。官方明确 GLM-5.3 沿用 GLM-5.2 的约 7533.3 亿参数 MoE / DSA 基座,没有更换预训练底座,能力提升全部来自过去一个月继续扩展后训练环境、任务多样性和强化学习算力。因此本站按同一参数规模记录,官方尚未单独披露 GLM-5.3 的激活参数量。
智谱 AI / Z.ai 于 2026 年 8 月 14 日发布的开放权重 Coding 与网络安全模型,744B 总参数、40B 激活的 MoE;权重已于 2026 年 8 月 28 日在 Hugging Face 与 ModelScope 开放,采用自订的 GLM-5.3 License(允许商用,超大规模 MaaS 运营方需先通过 Z.AI 安全审查),仓库代码为 Apache 2.0。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
GLM-5.3 当前已收录的代表性评测结果包括 HLE(4 / 189,得分 62.50)、Creative Writing(3 / 99,得分 2062.40)、Terminal-Bench 2.1(5 / 49,得分 88.20)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
GLM-5.3 是智谱 AI / Z.ai 于 2026 年 8 月 14 日正式发布的 GLM-5 系列开放权重模型,面向复杂 Coding、长程 Agent 任务和网络安全工作。官方说明它与 GLM-5.2 使用同一基座,能力提升全部来自过去一个月继续扩展后训练环境、任务多样性和强化学习算力,而不是更换预训练基座。
Z.ai 官方 GLM-5 仓库现已明确 GLM-5.3 的下载规格为 744B-A40B:MoE 总参数 744B,每 token 激活 40B。它沿用 GLM-5.2 的同一预训练基座与 DSA / IndexShare 架构,继续使用面向长程任务强化学习的 SAO 和大规模异步训练框架 slime。官方评测在多项长程任务中使用 1M context,并将最大输出设为 128K,因此 DataLearner 记录其上下文窗口为 1M、最大输出为 128K。模型输入与输出均为文本。
官方模型 ID 为 glm-5.3。模型始终启用 thinking,不再支持 thinking.type=disabled;reasoning_effort 支持 low、high、max 三档,默认值为 max,官方也建议 Coding 任务使用 max。迁移自旧模型时,如果原请求关闭了 thinking,需要先改为 enabled 并选择至少 low 档,否则请求会失败。
Z.ai 发布页给出了覆盖 Coding、Cyber 和 Agentic 三组的完整对比表。GLM-5.3 的 Coding 成绩包括 Terminal-Bench 2.1 88.2、Terminal-Bench 3.0 28.3、DeepSWE v1.1 66.9、NL2Repo 58.0、ProgramBench 19.0、FrontierSWE 78.1、SWE-Marathon v1.1 42.5、PostTrainBench 39.8;Cyber 成绩包括 CyberGym 84.5、ExploitGym 在 2 小时与 6 小时预算下分别完成 105 和 130 个实例、ExploitBench 54.4;Agentic 成绩包括 Toolathlon Verified 73.0、AutomationBench v1.0.6 48.2、Agents' Last Exam 28.5、HLE with Tools 62.5、GDPval-AA v2 1769。
这些数字是官方发布评测,不代表所有部署、采样参数或第三方服务都能复现相同结果。官方脚注显示,多数 Agent / Cyber 测试使用 Claude Code 2.1.207、max reasoning effort 和受控工具环境;不同基准还采用了 300K、400K 或 1M context、不同超时和重复运行口径。DataLearner 将它们统一挂在“Max(工具)”评测模式下,并在基准定义与本页正文保留测试条件。
GLM-5.3 的权重已于 2026 年 8 月 28 日在 Hugging Face 与 ModelScope 正式开放,规格为 744B-A40B,提供 FP8 与 BF16 两个版本,官方 GLM-5 GitHub 仓库同时给出本地部署说明。
需要注意的是,权重并未沿用 GLM-5 / GLM-5.2 的 MIT 协议,而是改用 Z.ai 自订的 GLM-5.3 License:允许下载、本地部署、微调和商用,但加入了一条收入门槛条款——如果被许可方及其关联方运营 Model as a Service 业务,且连续 12 个月合计收入超过 100 亿美元,则必须先通过 Z.AI 的安全审查才能将该模型或其衍生作品用于任何商业用途。对绝大多数使用者而言仍是免费商用,因此 DataLearner 将其记为“有条件免费商用授权”。仓库代码仍为 Apache 2.0;同系列的 GLM-5.3-Flash 则继续使用 MIT。
GLM-5.3 已向全部 GLM Coding Plan 用户开放,并可在 ZCode、Claude Code、OpenCode 等 Coding Agent 中使用。Coding Plan 采用积分制:每 10,000 tokens 的输入、缓存输入和输出分别使用 6.9、1.7、24 的积分乘数;工作日 14:00–18:00(UTC+8)之外按标准积分的 50% 计算。Z.ai 的标准按量 API 价格页仍未列出 GLM-5.3 的每百万 token 美元价格,因此 DataLearner 暂不生成按量 API 价格行,避免把订阅积分误写成货币价格。
是同一个基座。官方明确 GLM-5.3 沿用 GLM-5.2 的约 7533.3 亿参数 MoE / DSA 基座,没有更换预训练底座,能力提升全部来自过去一个月继续扩展后训练环境、任务多样性和强化学习算力。因此本站按同一参数规模记录,官方尚未单独披露 GLM-5.3 的激活参数量。
官方表示权重计划在完成额外安全评估后约两周公开。由于 GLM-5.3 强化了网络安全方向的能力(ExploitGym、ExploitBench、CyberGym 等),开放权重前的安全评估比常规版本更谨慎。
不能。官方模型 ID 为 glm-5.3,模型始终启用 thinking,不再支持 thinking.type=disabled。reasoning_effort 提供 low、high、max 三档,默认值是 max,官方也建议编程任务直接用 max。从旧模型迁移时如果原请求显式关闭了思考,需要改写调用参数。
这是它区别于同系列其他版本的地方。在 DataLearner 已收录的数据里,CyberGym 84.50 在 3 个模型中排第 1,ExploitBench 54.40、ExploitGym(2h)105 分和(6h)130 分均为当前唯一收录成绩,AutomationBench 48.20 在 8 个模型中排第 1。这组成绩说明它的定位不只是通用编程模型。
分任务看差异明显。仓库级长程任务表现突出:SWE-Marathon 42.50 和 PostTrain Bench 39.80 均排第 1,NL2Repo-Bench 58 排 8 个模型第 2,FrontierSWE 78.10 排第 2。但 Program Bench 19 分在 5 个模型中垫底,DeepSWE 66.90 在 27 个模型中排第 8——短程算法题和高难度仓库补丁上仍不是最强。
上下文窗口 1M tokens,最大输出 128K tokens。官方评测在多项长程任务中就是按 1M 上下文跑的。模型输入与输出均为纯文本,不支持图像或音频输入。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
