DataLearner 标志
GL

GLM-4.7-Flash

推理大模型GLM FlashGLM-4.7

GLM-4.7-Flash

发布时间: 2026-01-19更新于: 2026-07-17 23:18:24.8842,379
模型参数
310亿
上下文长度
200K
中文支持
支持
推理能力

GLM-4.7-Flash 是智谱AI于 2026-01-19 发布的推理大模型。支持文本输入和文本输出,上下文窗口为 200K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GLM-4.7-Flash

模型基本信息

推理过程
支持
思考模式
常规模式
上下文长度
200K tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本 → 文本
发布时间
2026-01-19
模型文件大小
62.5GB
MoE架构
总参数 / 激活参数
310亿 / 30亿
知识截止
暂无数据
GLM-4.7-Flash

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
在线体验
GLM-4.7-Flash

官方介绍与博客

GLM-4.7-Flash

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-¥0.0000/ 1M¥0.0000/ 1M
GLM-4.7-Flash

评测结果

GLM-4.7-Flash 当前已收录的代表性评测结果包括 τ²-Bench - Telecom(12 / 35,得分 96)、AIME2025(37 / 107,得分 91.60)、τ²-Bench(16 / 43,得分 79.50)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
75.20
98 / 187
66
133 / 187
14.40
134 / 170
6.10
160 / 170

编程与软件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
59.20
81 / 111

数学推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
91.60
37 / 107

Agent能力评测

共 5 项评测
评测名称 / 模式
得分
排名/总数

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
68
18 / 30
55
23 / 30

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
42.80
46 / 52

和其他模型对比

暂时没有为该模型整理的相关对比页面。

想自定义其他组合?打开对比工具

GLM-4.7-Flash

发布机构

GLM-4.7-Flash

模型解读

GLM-4.7-Flash 是由 Z.ai(zai-org)发布并开源的大型语言模型,属于 GLM-4.7 系列。模型已在 Hugging Face 平台公开,提供完整权重与模型卡信息,面向文本生成类任务。

该模型主要支持中文与英文输入,适用于通用对话、代码生成、推理问答等典型大模型使用场景。

模型规模与架构信息

GLM-4.7-Flash 的参数规模约为 31B,采用 BF16 / FP32 精度格式发布。

从模型标注信息来看,其配置被归类为轻量级 MoE(Mixture-of-Experts)相关实现,定位于在算力与模型能力之间取得平衡。

在 GLM-4.7 系列中,Flash 版本与完整体量模型(数百 B 参数规模)形成区分,主要面向单机或中等规模集群的部署场景。

基准测试结果

根据模型卡中公开的评测数据,GLM-4.7-Flash 在多项常见基准测试中给出了量化结果,包括:

  • 数学与逻辑推理类评测(如 AIME)
  • 通用知识与问答类评测(如 GPQA)
  • 代码生成与修复评测(如 LiveCodeBench、SWE-bench)
  • 工具使用与多步推理相关评测(如 τ²-Bench、BrowseComp)

在这些测试中,GLM-4.7-Flash 与同参数量级模型(如 20B–30B 区间)存在数值差异,具体表现以官方公布的单项得分为准。

需要注意的是,上述结果均来自统一评测设置下的自动基准,未包含真实业务场景下的定制化测试。

推理与部署方式

GLM-4.7-Flash 支持多种主流推理框架和部署方式,包括:

  • 使用 vLLM 进行高吞吐推理服务部署
  • 使用 SGLang 启动模型服务
  • 通过 Hugging Face Transformers 接口直接加载模型进行本地推理

模型卡中给出了对应的加载与推理示例,涵盖 tokenizer 初始化、模型加载与文本生成流程。

此外,该模型也可通过 Z.ai 提供的 API 平台进行调用,用于云端推理服务。

许可与使用限制

GLM-4.7-Flash 以 MIT License 形式发布。

该许可允许用户在遵循协议条款的前提下进行修改、分发和商业使用。

模型卡未额外标注使用领域限制或访问限制。

模型系列背景

GLM-4.7-Flash 隶属于 GLM 系列模型,该系列由 Z.ai 持续维护和发布,涵盖多种参数规模与使用场景的模型版本。

从公开信息来看,Flash 版本是 GLM-4.7 系列中针对部署效率和资源使用进行调整的一个分支。

社区讨论中对该模型的关注点主要集中在其参数规模、推理成本、基准分数以及与其他同级模型的对比。

总结

GLM-4.7-Flash 是一个约 31B 参数规模的开源语言模型,面向通用文本生成与推理任务。

模型提供了标准化的权重发布、基准评测数据与多种部署方式支持,并采用 MIT 许可。

对于需要在有限算力条件下使用 GLM-4.7 系列模型的场景,GLM-4.7-Flash 是当前公开版本之一,其具体适用性仍需结合实际任务与部署环境进行评估。

GLM-4.7-Flash

常见问题

GLM-4.7-Flash 是什么模型?

GLM-4.7-Flash 是智谱AI于 2026-01-19 发布的推理大模型。支持文本输入和文本输出,上下文窗口为 200K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

GLM-4.7-Flash 支持哪些输入和输出模态?

当前官方资料记录其支持文本输入,并生成文本输出。

GLM-4.7-Flash 的上下文窗口和最大输出是多少?

上下文窗口为 200K,最大输出为 128K。未公开或无法确认的规格不做推测。

GLM-4.7-Flash 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

GLM-4.7-Flash 是否提供 API,价格如何查看?

页面已收录 智谱AI 的 2 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

GLM-4.7-Flash 是否开源?

代码与模型权重按 MIT License 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码