DataLearner 标志
GR

Grok 4 Fast

已下架 · 2026-05-15聊天大模型Grok 4

Grok 4 Fast

发布时间: 2025-09-19更新于: 2026-09-18退役: 2026-05-15浏览量: 1,198
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
2000K
多语言支持
支持
推理能力
4/5

Grok 4 Fast 是由 xAI 发布的 AI 模型,发布时间为 2025-09-19,定位为 聊天大模型,上下文长度为 2000K,采用 不开源 许可,在 Text Arena (Coding) 上取得 1149.00 分。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Grok 4 Fast

模型基本信息

推理过程
支持
思考模式
常规模式 (默认)思考模式
上下文长度
2000K tokens
最大输出长度
4K tokens
模型类型
聊天大模型
输入/输出模态
文本、图像 → 文本
发布时间
2025-09-19
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Grok 4 Fast

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Grok 4 Fast

官方介绍与博客

Grok 4 Fast

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.200/ 1M tokens$0.500/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Grok 4 Fast

评测结果

Grok 4 Fast 当前已收录的代表性评测结果包括 SimpleQA(3 / 46,得分 95)、Fiction.liveBench(3 / 16,得分 94.40)、AIME2025(45 / 215,得分 92)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合知识考试

共 3 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
4.50
506 / 568
HLE
思考模式
20
292 / 568
HLE
思考模式
19.10
305 / 568

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
60.60
375 / 461
GPQA Diamond
思考模式
85.70
152 / 461
CritPt
思考模式
2.90
119 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
思考模式工具
95
3 / 46

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
40.10
186 / 251
LiveCodeBench
思考模式
80
53 / 251

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
41.30
167 / 215
AIME2025
思考模式
92
45 / 215

客服与业务流程

共 5 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
63.70
152 / 264
τ²-Bench - Telecom
思考模式工具
65.80
145 / 264
SAGE
常规模式工具
15.99
63 / 64
SAGE
思考模式工具
29.76
60 / 64
τ³-Banking
高工具
15.72
106 / 167

指令与格式遵循

共 2 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
37.70
234 / 282
IF Bench
思考模式
50.50
155 / 282

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
12.10
178 / 244
Terminal Bench Hard
思考模式工具
18.90
150 / 244

跨长文理解与整合

共 2 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
94.40
3 / 16
AA-LCR
常规模式
24
169 / 174

图像感知与视觉推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
48.10
206 / 229
MMMU-Pro
思考模式
61.80
170 / 229

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
42.86
45 / 52

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1149
35 / 35

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
Vibe Code Bench v1.1
思考模式工具
0
58 / 60

临床工作与医疗决策

共 4 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
常规模式工具
79.72
41 / 66
MedScribe
思考模式工具
81.63
38 / 66
MedCode
常规模式工具
30.04
60 / 64
MedCode
思考模式工具
37.38
51 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
144.21
80 / 167
Grok 4 Fast

发布机构

Grok 4 Fast

模型解读

关于Grok 4 Fast更深度分析可以参考我们的博客: https://www.datalearner.com/blog/1051758459872078 

xAI 于 2025 年 9 月 19 日发布了 Grok-4 Fast 模型。该模型是一种高效的推理模型,旨在提供高性能的同时降低成本。

模型特性

Grok-4 Fast 支持 2M 令牌的上下文窗口,能够处理较长的对话或复杂数据集。其架构统一,支持通过系统提示在推理模式和非推理模式之间切换。模型通过端到端的工具使用强化学习训练,能够根据需要调用工具,如代码执行或网页浏览。此外,它具备代理搜索功能,可浏览网页和 X(前 Twitter),并处理图像和视频等媒体,以获取实时数据。

基准测试结果

Grok-4 Fast 在多项基准测试中表现出色,与前代模型 Grok 3 Mini 相比,使用了平均 40% 更少的思考令牌。以下是部分测试结果(均为 pass@1,无工具,除非注明):

基准测试Grok-4 Fast 分数备注

GPQA Diamond85.7%高难度推理

AIME 202592.0%数学竞赛级问题

HMMT 202593.3%高级数学挑战

HLE (Human Level Eval)20.0%人类水平评估

LiveCodeBench (Jan-May)80.0%实际编码任务

在搜索相关评估中,其分数为:BrowseComp 44.9%、SimpleQA 95.0%、Reka Research Eval 66.0%。在 LMSYS Arena 中,启用搜索的变体(grok-4-fast-search,代号“menlo”)Elo 分数为 1163,排名第一;基础模型(“tahoe”)在 Text Arena 中排名第八。

性能与成本比较

根据 Artificial Analysis 的独立评估,Grok-4 Fast 在价格与智能指数的比率上处于领先地位,其性能接近 Grok-4,但成本降低了 98%。在智能指数与价格图表中,该模型优于 Gemini 2.5 Flash 和 DeepSeek V3.1 等模型,适用于实时应用,具有较低的延迟和令牌成本。

可用性和定价

Grok-4 Fast 现已可用,用户可通过 grok.com、iOS 和 Android 应用访问,选择“Fast”或“Auto”模式。对于 API 用户,xAI 提供 grok-4-fast-reasoning 和 grok-4-fast-non-reasoning 变体,定价如下:

  • 输入令牌:小于 128k 时 $0.20 / 1M,大于等于 128k 时 $0.40 / 1M
  • 输出令牌:小于 128k 时 $0.50 / 1M,大于等于 128k 时 $1.00 / 1M
  • 缓存输入:$0.05 / 1M

未来发展

xAI 计划根据 X 上的反馈持续改进模型,包括增强多模态功能和代理工具支持。截至 2025 年 9 月 21 日,该模型已准备用于企业和消费者应用。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码