DataLearner 标志
GL

GLM-5.3-Flash

多模态大模型编程大模型GLM FlashGLM-5

GLM-5.3-Flash

别名:Ox Alpha / ox-alpha / stealth/ox-alpha / GLM 5.3 Flash

发布时间: 2026-08-26更新于: 2026-08-26 23:23:52.208185
模型参数
3200亿
上下文长度
1M
中文支持
支持
推理能力

GLM-5.3-Flash 是智谱 AI / Z.ai 于 2026 年 8 月 26 日发布的 GLM-5 系列首个原生多模态模型,发布前曾以 ox-alpha 匿名测试。它不是旗舰 GLM-5.3 的蒸馏版,而是重新训练的基础模型:3200 亿总参数 / 180 亿激活的 MoE,45 层,首次结合线性注意力与稀疏注意力并采用 mHC,相比 GLM-5.3 注意力计算量降约 3 倍、KV Cache 降约 4.4 倍。支持 1M 上下文、文本与图片输入、工具调用与视觉编程闭环,权重以 MIT License 开放,Z.ai API 发布期 5 折至 2026 年 9 月 9 日。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GLM-5.3-Flash

模型基本信息

推理过程
支持
思考模式
思考水平 · 最高 (Max) (默认)思考水平 · 低 (Low)思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
128K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-08-26
模型文件大小
约 328.3 GB(FP8 safetensors,62 个分片)
MoE架构
总参数 / 激活参数
3200亿 / 180亿
知识截止
暂无数据
GLM-5.3-Flash

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
在线体验
GLM-5.3-Flash

官方介绍与博客

DataLearnerAI博客
暂无介绍博客
GLM-5.3-Flash

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.075/ 1M$0.250/ 1M
缓存定价Prompt缓存
类型有效期写入读取
文本--$0.015/ 1M
GLM-5.3-Flash

评测结果

GLM-5.3-Flash 当前已收录的代表性评测结果包括 HLE(15 / 183,得分 55.30)、AutomationBench(1 / 9,得分 48.80)、GDPval-AA v2(2 / 15,得分 1773)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高工具
55.30
15 / 183

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
最高工具
84.30
11 / 46
78.40
1 / 7
AutomationBench
最高工具
48.80
1 / 9

编程与软件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
最高工具
63.40
11 / 30
NL2Repo-Bench
最高工具
56.30
4 / 10

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
26.30
8 / 13

生产力知识

共 2 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
最高工具
1773
2 / 15
62.40
2 / 2

多模态理解

共 4 项评测
评测名称 / 模式
得分
排名/总数
CharXiv RQ
最高工具
89.40
4 / 18
MMVU
最高
80.50
2 / 2
Chartography
最高工具
78
1 / 2
53.40
5 / 5

和其他模型对比

GLM-5.3-Flash

发布机构

GLM-5.3-Flash

模型解读

发布背景:GLM-5 系列的第一个原生多模态模型

GLM-5.3-Flash 由智谱 AI / Z.ai 于 2026 年 8 月 26 日发布,是 GLM-5 系列中第一个原生多模态的成员。它在正式发布前曾以 ox-alpha 的匿名身份在 OpenCode 与 OpenRouter 上公开测试,官方在发布时确认了这一对应关系,因此 Ox Alpha、ox-alphastealth/ox-alpha 仍作为别名保留。

需要澄清一点常见误解:Flash 并不是同系列旗舰 GLM-5.3 的轻量蒸馏版,而是重新训练的基础模型。它的目标是在“Flash 档位的成本”下提供接近旗舰的智能体与编程能力,官方发布标题即为“Frontier Intelligence, Flash Cost”。

架构与规格

官方披露的总参数为 3200 亿,每 token 激活 180 亿,共 45 层,预训练使用约 30T tokens 的多模态语料。这是 GLM 系列首次把线性注意力与稀疏注意力结合,并采用 Manifold-Constrained Hyper-Connections(mHC)提升扩展效率;用于长上下文索引的 IndexPool 会把四个 indexer key 向量压缩为一个。官方给出的效率数据是:相比 GLM-5.3,注意力计算量降低约 3.0 倍、KV Cache 降低约 4.4 倍——这正是它能以“Flash”定价支撑 100 万 tokens 上下文的技术前提。

  • 上下文窗口:1M tokens
  • 最大输出:128K tokens
  • 输入模态:文本、图片
  • 输出模态:文本
  • 官方 API 模型 ID:glm-5.3-flash

关于视频输入需要注意:匿名测试阶段 OpenRouter 曾展示过视频输入能力,但 Z.ai 正式 API 文档目前只给出文本参数和 image_url 图片输入方式,官方视频基准的说明也对不原生接收视频的模型采用 1 fps 抽帧。因此在官方补充说明之前,稳妥的理解是:正式 API 的确认输入模态为文本与图片。

视觉编程与智能体能力

这一代最值得关注的变化是把视觉能力直接纳入编程闭环:模型可以观察界面、渲染结果和交互反馈,并据此持续测试和修改代码,而不是只按文字描述写代码。官方展示的场景覆盖前端开发、游戏制作、Blender 3D 场景构建,以及通过 Browser Use / Computer Use 操作网页和桌面应用。编程之外,它也面向 Office 办公、金融研究和专业文档处理,可配合工具完成从研究分析、建模到交付 PPTX、PDF、DOCX、XLSX 文件的端到端流程。

调用方式与思考档位

Z.ai 文档说明其文本参数与 GLM-5.3 保持一致:reasoning_effort 支持 low、high、max 三档,官方推荐使用 maxthinking.type 只支持 enabled,即思考不可关闭,并建议设置 thinking.clear_thinking=false。流式调用建议同时启用 stream=truetool_stream=true。模型已向 GLM Coding Plan 用户开放,可用额度为 GLM-5.3 的 3 倍。

官方评测

智能体与编程方向:Terminal-Bench 2.1 84.3、DeepSWE v1.1 63.4、NL2Repo 56.3、Toolathlon Verified 78.4、AutomationBench v1.0.6 48.8、Agents' Last Exam 26.3、HLE(带工具)55.3、GDPval-AA v2 1773。视觉方向:OfficeQA Pro 62.4、CharXiv Reasoning(带工具)89.4、Chartography(带工具)78.0、BabyVision 53.4、MVBench 77.8、MMVU 80.5。

这些均为官方发布数据,且多数项目在带工具、max 思考档位下取得,官方脚注还记录了各自的上下文与采样设置,与无工具口径的成绩不能直接比较。

开放权重与部署

权重已发布到 Hugging Face,许可证为 MIT License——在同档位模型中属于限制最少的一类,商用无附加条件。safetensors 元数据显示约 321.32B 参数,权重索引总大小约 328.3 GB,仓库提供 FP8 权重、分为 62 个文件。官方列出的本地推理框架包括 SGLang、vLLM、TokenSpeed 与 KTransformers。另据官方说明,匿名测试期间的全部推理流量由中国产 AI 芯片承载。

API 价格

Z.ai 按每 100 万 tokens 计费,标价为输入 0.15 美元、缓存输入 0.03 美元、输出 0.50 美元,缓存存储限时免费。发布期实行 5 折优惠:输入 0.075 美元、缓存输入 0.015 美元、输出 0.25 美元,官方注明优惠截至 2026 年 9 月 9 日 24:00(UTC+8),之后恢复标价。

官方来源

GLM-5.3-Flash

常见问题

GLM-5.3-Flash 是 GLM-5.3 的蒸馏版吗?

不是。官方说明它使用重新训练的基础模型,总参数 3200 亿、每 token 激活 180 亿,与旗舰 GLM-5.3 是两个不同的模型,定位是以 Flash 档位的成本提供接近旗舰的智能体与编程能力。

它和匿名测试的 Ox Alpha 是什么关系?

是同一个模型。发布前它以 ox-alpha 的匿名身份在 OpenCode 与 OpenRouter 上公开测试,官方在发布时确认了对应关系,Ox Alpha、ox-alpha、stealth/ox-alpha 仍作为别名保留。

支持视频输入吗?

匿名测试阶段 OpenRouter 曾展示过视频输入,但 Z.ai 正式 API 文档目前只提供文本参数和 image_url 图片输入方式,官方视频基准也对不原生接收视频的模型采用 1 fps 抽帧。因此确认的正式输入模态是文本与图片。

调用时推荐什么参数?

文本参数与 GLM-5.3 一致:reasoning_effort 支持 low、high、max 三档,官方推荐 max;thinking.type 只支持 enabled,即思考不可关闭,并建议 thinking.clear_thinking=false;流式调用建议同时开启 stream 与 tool_stream。

权重开源吗?可以商用吗?

权重已发布到 Hugging Face,许可证为 MIT License,商用没有附加条件。仓库提供 FP8 权重、62 个 safetensors 文件,索引总大小约 328.3 GB,官方支持 SGLang、vLLM、TokenSpeed 与 KTransformers。

API 价格是多少?

Z.ai 标价为每百万 tokens 输入 0.15 美元、缓存输入 0.03 美元、输出 0.50 美元,缓存存储限时免费。发布期 5 折:输入 0.075 美元、缓存输入 0.015 美元、输出 0.25 美元,官方注明截至 2026 年 9 月 9 日 24:00(UTC+8)。

相比旗舰 GLM-5.3 差多少?

在官方共有评测项目上,终端操作、软件工程、仓库生成等工程任务的差距在 4 分以内,工具编排类项目(Toolathlon Verified)甚至更高,主要差距出现在高难度学术推理 HLE(55.3 对 62.5)。详见本站的评测分析页。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码