DataLearner 标志

Grok 3 评测详情

Grok 3 当前已收录的代表性评测结果包括 MMMU(22 / 74,得分 78)、AIME 2024(22 / 61,得分 84.20)、LiveCodeBench(92 / 251,得分 70.60)。

评测结果

Grok 3

评测结果

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
4.10
525 / 568

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
80.40
232 / 461

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
43.40
18 / 46

数学

共 4 项评测
评测名称 / 模式
得分
排名/总数
AIME 2024
常规模式
84.20
22 / 61
AIME2025
常规模式
77.10
104 / 215
FrontierMath
常规模式
3.80
45 / 60
0
72 / 80

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
70.60
92 / 251

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1183.50
80 / 106

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
78
22 / 74

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
36.10
71 / 93

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
53.30
30 / 59
Terminal Bench Hard
常规模式工具
11.40
181 / 244

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
48.80
175 / 264

指令与格式遵循

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
46.90
171 / 282

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
138.34
102 / 167