DataLearner 标志

Grok 4 Fast 评测详情

Grok 4 Fast 当前已收录的代表性评测结果包括 SimpleQA(3 / 46,得分 95)、Fiction.liveBench(3 / 16,得分 94.40)、AIME2025(45 / 215,得分 92)。

评测结果

Grok 4 Fast

评测结果

思考模式
工具使用

综合知识考试

共 3 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
4.50
506 / 568
HLE
思考模式
20
292 / 568
HLE
思考模式
19.10
305 / 568

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
60.60
375 / 461
GPQA Diamond
思考模式
85.70
152 / 461
CritPt
思考模式
2.90
119 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
思考模式工具
95
3 / 46

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
40.10
186 / 251
LiveCodeBench
思考模式
80
53 / 251

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
41.30
167 / 215
AIME2025
思考模式
92
45 / 215

客服与业务流程

共 5 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
63.70
152 / 264
τ²-Bench - Telecom
思考模式工具
65.80
145 / 264
SAGE
常规模式工具
15.99
63 / 64
SAGE
思考模式工具
29.76
60 / 64
τ³-Banking
思考水平·高工具
15.72
106 / 167

指令与格式遵循

共 2 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
37.70
234 / 282
IF Bench
思考模式
50.50
155 / 282

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
12.10
178 / 244
Terminal Bench Hard
思考模式工具
18.90
150 / 244

跨长文理解与整合

共 2 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
94.40
3 / 16
AA-LCR
常规模式
24
169 / 174

图像感知与视觉推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
48.10
206 / 229
MMMU-Pro
思考模式
61.80
170 / 229

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
42.86
45 / 52

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1149
35 / 35

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
Vibe Code Bench v1.1
思考模式工具
0
58 / 60

临床工作与医疗决策

共 4 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
常规模式工具
79.72
41 / 66
MedScribe
思考模式工具
81.63
38 / 66
MedCode
常规模式工具
30.04
60 / 64
MedCode
思考模式工具
37.38
51 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
144.21
80 / 167