GLM-5.3-Flash 是 GLM-5.3 的蒸馏版吗?
不是。官方说明它使用重新训练的基础模型,总参数 3200 亿、每 token 激活 180 亿,与旗舰 GLM-5.3 是两个不同的模型,定位是以 Flash 档位的成本提供接近旗舰的智能体与编程能力。
GLM-5.3-Flash
别名:Ox Alpha / ox-alpha / stealth/ox-alpha / GLM 5.3 Flash
GLM-5.3-Flash 是智谱 AI / Z.ai 于 2026 年 8 月 26 日发布的 GLM-5 系列首个原生多模态模型,发布前曾以 ox-alpha 匿名测试。它不是旗舰 GLM-5.3 的蒸馏版,而是重新训练的基础模型:3200 亿总参数 / 180 亿激活的 MoE,45 层,首次结合线性注意力与稀疏注意力并采用 mHC,相比 GLM-5.3 注意力计算量降约 3 倍、KV Cache 降约 4.4 倍。支持 1M 上下文、文本与图片输入、工具调用与视觉编程闭环,权重以 MIT License 开放,Z.ai API 发布期 5 折至 2026 年 9 月 9 日。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
GLM-5.3-Flash 当前已收录的代表性评测结果包括 HLE(15 / 183,得分 55.30)、AutomationBench(1 / 9,得分 48.80)、GDPval-AA v2(2 / 15,得分 1773)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
GLM-5.3-Flash 由智谱 AI / Z.ai 于 2026 年 8 月 26 日发布,是 GLM-5 系列中第一个原生多模态的成员。它在正式发布前曾以 ox-alpha 的匿名身份在 OpenCode 与 OpenRouter 上公开测试,官方在发布时确认了这一对应关系,因此 Ox Alpha、ox-alpha、stealth/ox-alpha 仍作为别名保留。
需要澄清一点常见误解:Flash 并不是同系列旗舰 GLM-5.3 的轻量蒸馏版,而是重新训练的基础模型。它的目标是在“Flash 档位的成本”下提供接近旗舰的智能体与编程能力,官方发布标题即为“Frontier Intelligence, Flash Cost”。
官方披露的总参数为 3200 亿,每 token 激活 180 亿,共 45 层,预训练使用约 30T tokens 的多模态语料。这是 GLM 系列首次把线性注意力与稀疏注意力结合,并采用 Manifold-Constrained Hyper-Connections(mHC)提升扩展效率;用于长上下文索引的 IndexPool 会把四个 indexer key 向量压缩为一个。官方给出的效率数据是:相比 GLM-5.3,注意力计算量降低约 3.0 倍、KV Cache 降低约 4.4 倍——这正是它能以“Flash”定价支撑 100 万 tokens 上下文的技术前提。
glm-5.3-flash关于视频输入需要注意:匿名测试阶段 OpenRouter 曾展示过视频输入能力,但 Z.ai 正式 API 文档目前只给出文本参数和 image_url 图片输入方式,官方视频基准的说明也对不原生接收视频的模型采用 1 fps 抽帧。因此在官方补充说明之前,稳妥的理解是:正式 API 的确认输入模态为文本与图片。
这一代最值得关注的变化是把视觉能力直接纳入编程闭环:模型可以观察界面、渲染结果和交互反馈,并据此持续测试和修改代码,而不是只按文字描述写代码。官方展示的场景覆盖前端开发、游戏制作、Blender 3D 场景构建,以及通过 Browser Use / Computer Use 操作网页和桌面应用。编程之外,它也面向 Office 办公、金融研究和专业文档处理,可配合工具完成从研究分析、建模到交付 PPTX、PDF、DOCX、XLSX 文件的端到端流程。
Z.ai 文档说明其文本参数与 GLM-5.3 保持一致:reasoning_effort 支持 low、high、max 三档,官方推荐使用 max;thinking.type 只支持 enabled,即思考不可关闭,并建议设置 thinking.clear_thinking=false。流式调用建议同时启用 stream=true 与 tool_stream=true。模型已向 GLM Coding Plan 用户开放,可用额度为 GLM-5.3 的 3 倍。
智能体与编程方向:Terminal-Bench 2.1 84.3、DeepSWE v1.1 63.4、NL2Repo 56.3、Toolathlon Verified 78.4、AutomationBench v1.0.6 48.8、Agents' Last Exam 26.3、HLE(带工具)55.3、GDPval-AA v2 1773。视觉方向:OfficeQA Pro 62.4、CharXiv Reasoning(带工具)89.4、Chartography(带工具)78.0、BabyVision 53.4、MVBench 77.8、MMVU 80.5。
这些均为官方发布数据,且多数项目在带工具、max 思考档位下取得,官方脚注还记录了各自的上下文与采样设置,与无工具口径的成绩不能直接比较。
权重已发布到 Hugging Face,许可证为 MIT License——在同档位模型中属于限制最少的一类,商用无附加条件。safetensors 元数据显示约 321.32B 参数,权重索引总大小约 328.3 GB,仓库提供 FP8 权重、分为 62 个文件。官方列出的本地推理框架包括 SGLang、vLLM、TokenSpeed 与 KTransformers。另据官方说明,匿名测试期间的全部推理流量由中国产 AI 芯片承载。
Z.ai 按每 100 万 tokens 计费,标价为输入 0.15 美元、缓存输入 0.03 美元、输出 0.50 美元,缓存存储限时免费。发布期实行 5 折优惠:输入 0.075 美元、缓存输入 0.015 美元、输出 0.25 美元,官方注明优惠截至 2026 年 9 月 9 日 24:00(UTC+8),之后恢复标价。
不是。官方说明它使用重新训练的基础模型,总参数 3200 亿、每 token 激活 180 亿,与旗舰 GLM-5.3 是两个不同的模型,定位是以 Flash 档位的成本提供接近旗舰的智能体与编程能力。
是同一个模型。发布前它以 ox-alpha 的匿名身份在 OpenCode 与 OpenRouter 上公开测试,官方在发布时确认了对应关系,Ox Alpha、ox-alpha、stealth/ox-alpha 仍作为别名保留。
匿名测试阶段 OpenRouter 曾展示过视频输入,但 Z.ai 正式 API 文档目前只提供文本参数和 image_url 图片输入方式,官方视频基准也对不原生接收视频的模型采用 1 fps 抽帧。因此确认的正式输入模态是文本与图片。
文本参数与 GLM-5.3 一致:reasoning_effort 支持 low、high、max 三档,官方推荐 max;thinking.type 只支持 enabled,即思考不可关闭,并建议 thinking.clear_thinking=false;流式调用建议同时开启 stream 与 tool_stream。
权重已发布到 Hugging Face,许可证为 MIT License,商用没有附加条件。仓库提供 FP8 权重、62 个 safetensors 文件,索引总大小约 328.3 GB,官方支持 SGLang、vLLM、TokenSpeed 与 KTransformers。
Z.ai 标价为每百万 tokens 输入 0.15 美元、缓存输入 0.03 美元、输出 0.50 美元,缓存存储限时免费。发布期 5 折:输入 0.075 美元、缓存输入 0.015 美元、输出 0.25 美元,官方注明截至 2026 年 9 月 9 日 24:00(UTC+8)。
在官方共有评测项目上,终端操作、软件工程、仓库生成等工程任务的差距在 4 分以内,工具编排类项目(Toolathlon Verified)甚至更高,主要差距出现在高难度学术推理 HLE(55.3 对 62.5)。详见本站的评测分析页。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
