DataLearner 标志

GLM-5.3-FlashvsQwen3.8-Flash-Next

在 6 个同模式 benchmark 中,GLM-5.3-Flash 整体领先:GLM-5.3-Flash 领先 4 项,Qwen3.8-Flash-Next 领先 2 项,持平 0 项,平均分差 +1.63。另有 6 项测试模式不同,仅供参考。

智谱AI
GLM-5.3-Flash

智谱AI · 2026-08-26 · 多模态大模型

阿里巴巴
Qwen3.8-Flash-Next

阿里巴巴 · 2026-08-26 · 推理大模型

GLM-5.3-Flash4 项(67%)(33%)2 项Qwen3.8-Flash-Next

评测分数

按能力类目分组,每组内按分差大小排列;共 6 项。

客服与业务流程

GLM-5.3-Flash 领先 1/1
评测项GLM-5.3-FlashQwen3.8-Flash-Next分差
τ³-Banking47.2010 / 168Thinking (With Tools)45.4016 / 168Thinking (With Tools)+1.80

文档与图表理解

Qwen3.8-Flash-Next 领先 1/1
评测项GLM-5.3-FlashQwen3.8-Flash-Next分差
GDP.pdf15.4060 / 122Thinking (No Tools)15.6059 / 122Thinking (No Tools)-0.20

科学知识与推理

GLM-5.3-Flash 领先 1/1
评测项GLM-5.3-FlashQwen3.8-Flash-Next分差
CritPt15.4055 / 204Thinking (No Tools)11.1071 / 204Thinking (No Tools)+4.30

科学计算与科研编程

GLM-5.3-Flash 领先 1/1
评测项GLM-5.3-FlashQwen3.8-Flash-Next分差
SciCode51.6062 / 134Thinking (No Tools)50.6069 / 134Thinking (No Tools)+1

自主开发与终端任务

GLM-5.3-Flash 领先 1/1
评测项GLM-5.3-FlashQwen3.8-Flash-Next分差
Terminal-Bench 4.032.8030 / 102Thinking (With Tools)25.3035 / 102Thinking (With Tools)+7.50

跨能力综合测试

Qwen3.8-Flash-Next 领先 1/1
评测项GLM-5.3-FlashQwen3.8-Flash-Next分差
LiveBench71.5969 / 157Reported best (effort unspecified)76.1933 / 157Reported best (effort unspecified)-4.60

测试模式不同的成绩

共 6 项。两款模型的公开成绩来自不同测试模式,分数不直接可比,不计入胜负和平均分差。

评测项GLM-5.3-FlashQwen3.8-Flash-Next
CharXiv RQ89.40Max (With Tools)90.60Extra-High (With Tools)
HLE55.30Max (With Tools)35.90Extra-High (No Tools)
DeepSWE63.39Max (With Tools)58.70Extra-High (With Tools)
NL2Repo-Bench56.30Max (With Tools)48.10Extra-High (With Tools)
GPQA Diamond90.15Max (No Tools)91.70Extra-High (No Tools)
Toolathlon-Verified78.40Max (With Tools)73.50Extra-High (With Tools)

规格对比

字段GLM-5.3-FlashQwen3.8-Flash-Next
发布机构智谱AI阿里巴巴
发布时间2026-08-262026-08-26
模型类型多模态大模型推理大模型
架构MoE 架构MoE 架构
参数规模3200亿1250亿
上下文长度1M256K(原生,可扩展至 1M)
最大输出128K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GLM-5.3-FlashQwen3.8-Flash-Next
文本输入$0.15 / 1M tokens¥1 / 1M tokens
文本输出$0.5 / 1M tokens¥3 / 1M tokens
缓存读取$0.03 / 1M tokens暂无公开价格

小结

  • GLM-5.3-Flash在以下类目领先:客服与业务流程 (1/1)、科学知识与推理 (1/1)、科学计算与科研编程 (1/1)、自主开发与终端任务 (1/1)
  • Qwen3.8-Flash-Next在以下类目领先:文档与图表理解 (1/1)、跨能力综合测试 (1/1)

6 个同模式 benchmark 上,GLM-5.3-Flash 平均高出 1.63 分。

单项差距最大的 benchmark:Terminal-Bench 4.0 — GLM-5.3-Flash 32.80,Qwen3.8-Flash-Next 25.30(分差 +7.50)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。