DataLearner 标志

Grok 4 评测详情

Grok 4 当前已收录的代表性评测结果包括 AIME2025(14 / 215,得分 98.80)、MMLU Pro(15 / 176,得分 87)、IMO 2024(1 / 10,得分 23.20)。

评测结果

Grok 4

评测结果

思考模式
工具使用
联网能力

综合评估

共 9 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
开启思考
87
15 / 176
ARC-AGI-1
开启思考
66.70
87 / 147
LiveBench
常规模式
62.02
61 / 117
HLE
开启思考
26.70
234 / 563
HLE
开启思考
25.40
243 / 563
HLE
开启思考工具
38.60
141 / 563
HLE
开启思考工具联网
38.60
141 / 563
ARC-AGI-2
开启思考
15.90
88 / 136
CritPt
开启思考
2
127 / 200

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
开启思考
87
133 / 462

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
开启思考
81.90
44 / 250
SWE-bench Verified
开启思考
58.60
85 / 116
WeirdML v2
常规模式工具
45.73
41 / 52

数学推理

共 9 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
开启思考
91.70
45 / 215
AIME2025
开启思考工具
98.80
14 / 215
IMO-ProofBench
开启思考
46.70
4 / 16
23.30
10 / 16
IMO 2025
开启思考
29.20
1 / 9
IMO 2024
开启思考
23.20
1 / 10
18.60
12 / 24
FrontierMath
常规模式
12.10
22 / 60
2.10
56 / 80

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench
开启思考工具
38
13 / 35

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
开启思考
60.50
33 / 93

Agent能力评测

共 5 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
110.07
13 / 22
Aider-Polyglot
思考水平·高
79.60
7 / 59
τ²-Bench - Telecom
开启思考工具
74.90
125 / 264
BALROG
常规模式工具
43.60
4 / 12
Terminal Bench Hard
开启思考工具
37.90
59 / 244

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
开启思考
53.70
142 / 282

多模态理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
开启思考
68.80
139 / 227
GeoBench ACW
常规模式
45
20 / 20

长上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
94.40
3 / 16