DataLearner 标志

Grok 4.5 评测详情

Grok 4.5 当前已收录的代表性评测结果包括 GPQA Diamond(18 / 271,得分 93.43)、SWE-Bench Pro - Public(7 / 60,得分 64.70)、SimpleBench(15 / 92,得分 70)。本页还提供与 6 个竞品模型及 3 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

Grok 4.5

评测结果

思考模式
工具使用

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
93.43
18 / 271

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1576
38 / 99

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
70
15 / 92

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
66.70
5 / 5
64.70
7 / 60
56.60
5 / 6
APEX-SWE
工具
53.60
3 / 3
DeepSWE
工具
53
26 / 35
SWE-Marathon
工具
29
5 / 6

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
83.30
18 / 49
15.70
6 / 7
12.42
12 / 13

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
56
16 / 28

生产力知识

共 2 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
工具
1526
15 / 25
Harvey Lab-AA
工具
12.90
4 / 6

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
APEX-Agents
工具
47.10
4 / 6

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
57.19
24 / 58
24.39
24 / 41

竞品对比

Grok 4.5 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项Grok 4.5当前GPT-5.6 SolClaude Fable 5GLM-5.2Claude Sonnet 5GPT-5.6 TerraKimi K3
GPQA Diamond
科学与综合推理
93.43思考水平·高
93.50思考水平·高
85.86思考水平·高
91.86思考水平·高
90.53思考水平·极高
93.31思考水平·高
93.50思考水平·高
Creative Writing
写作和创作
1576.00常规模式
1964.10常规模式
1933.20常规模式
1750.90常规模式
1787.60常规模式
1850.00常规模式
2070.80常规模式
SimpleBench
常识推理
70.00思考水平·高
64.80思考水平·极高
81.90常规模式
58.80常规模式
60.60常规模式
48.90思考水平·极高
60.70思考水平·高
APEX-SWE
编程与软件工程
53.60思考水平·高 | 工具
--
58.80思考水平·高 | 工具
--
--
--
--
CursorBench 3.2
编程与软件工程
66.70思考水平·高 | 工具
67.20思考水平·高 | 工具
70.50思考水平·高 | 工具
--
--
--
--
DeepSWE
编程与软件工程
53.00思考水平·高 | 工具
72.70思考水平·极高 | 工具
70.00深度思考模式 | 工具
44.00深度思考模式 | 工具
54.00深度思考模式 | 工具
69.60思考水平·极高 | 工具
67.50思考水平·高 | 工具
FrontierCode 1.1
编程与软件工程
56.60思考水平·高 | 工具
60.60思考水平·高 | 工具
63.60思考水平·高 | 工具
--
--
--
--
SWE-Bench Pro - Public
编程与软件工程
64.70思考水平·高 | 工具
64.60思考水平·极高 | 工具
80.30深度思考模式 | 工具
62.10开启思考 | 工具
--
--
--
SWE-Marathon
编程与软件工程
29.00思考水平·高 | 工具
--
--
13.00思考水平·高 | 工具
--
--
42.00思考水平·高 | 工具
Terminal-Bench 2.1
AI Agent - 工具使用
83.30思考水平·高 | 工具
88.80思考水平·高
88.00思考水平·高 | 工具
81.00思考水平·高 | 工具
80.40思考水平·极高 | 工具
87.40思考水平·高
88.30思考水平·高 | 工具
Terminal-Bench 3.0
AI Agent - 工具使用
15.70思考水平·高 | 工具
34.60思考水平·高 | 工具
34.10思考水平·高 | 工具
--
--
--
--
Terminal-Bench 4.0
AI Agent - 工具使用
12.42思考水平·高 | 工具
37.27思考水平·高 | 工具
44.55思考水平·高 | 工具
--
12.42思考水平·高 | 工具
21.52思考水平·高 | 工具
--
其余 6 个 benchmark 仍可在上方图表中查看。

Grok 4.5 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。

这些模型的价格币种或计费单位不一致,暂不直接绘制统一柱状图,以下展示原始价格。

Grok 4.5
供应商: xAI
标准输入: $2 / 1M tokens
标准输出: $6 / 1M tokens
GPT-5.6 Sol
供应商: OpenAI
标准输入: $4 / 1M tokens
标准输出: $20 / 1M tokens
Claude Fable 5
供应商: Anthropic
标准输入: $10 / 1M tokens
标准输出: $50 / 1M tokens
GLM-5.2
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
Claude Sonnet 5
供应商: Anthropic
标准输入: $2 / 1M tokens
标准输出: $10 / 1M tokens
GPT-5.6 Terra
供应商: OpenAI
标准输入: $2 / 1M tokens
标准输出: $12 / 1M tokens
Kimi K3
供应商: Moonshot AI
标准输入: ¥20 / 1M tokens
标准输出: ¥100 / 1M tokens
模型供应商标准输入标准输出标准价适用于
Grok 4.5
xAI$2 / 1M tokens$6 / 1M tokens
GPT-5.6 Sol
OpenAI$4 / 1M tokens$20 / 1M tokens
Claude Fable 5
Anthropic$10 / 1M tokens$50 / 1M tokens
GLM-5.2
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens
Claude Sonnet 5
Anthropic$2 / 1M tokens$10 / 1M tokens
GPT-5.6 Terra
OpenAI$2 / 1M tokens$12 / 1M tokens
Kimi K3
Moonshot AI¥20 / 1M tokens¥100 / 1M tokens

历代版本对比

Grok 4.5 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

3 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项Grok 4.5当前Grok 4.3 Beta
GPQA Diamond
科学与综合推理
93.43思考水平·高
88.83思考水平·高
24.39思考水平·高
14.63思考水平·高
FrontierMath v2
数学推理
57.19思考水平·高
42.81思考水平·高

单评测历史趋势图

当前查看:GPQA Diamond · 科学与综合推理

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

Grok 4.5 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

Grok 4.20: 标准价适用于 <= 200000
模型供应商标准输入标准输出标准价适用于
Grok 4.5
xAI$2 / 1M tokens$6 / 1M tokens
Grok 4.20
xAI$1.25 / 1M tokens$2.5 / 1M tokens<= 200000