DataLearner 标志

Grok 4.6vsGrok 4.5

在 24 个共同 benchmark 中,Grok 4.6 整体领先:Grok 4.6 领先 21 项,Grok 4.5 领先 3 项,持平 0 项,平均分差 +2.20。

xAI
Grok 4.6

xAI · 2026-08-12 · 编程大模型

xAI
Grok 4.5

xAI · 2026-07-08 · 编程大模型

Grok 4.621 项(88%)(13%)3 项Grok 4.5

评测分数

按能力类目分组,每组内按分差大小排列;共 24 项。

法律

Grok 4.6 领先 2/3
评测项Grok 4.6Grok 4.5分差
Harvey Lab-AA15.8043 / 44Thinking High (With Tools)92.429 / 44Thinking High (With Tools)-76.62
Legal Research Bench48.087 / 42Thinking High (With Tools)37.9824 / 42Thinking High (With Tools)+10.10
Harvey's Legal Agent Benchmark15.835 / 43Thinking High (With Tools)12.926 / 43Thinking High (With Tools)+2.91

自主开发与终端任务

Grok 4.6 领先 3/3
评测项Grok 4.6Grok 4.5分差
Terminal-Bench 3.0267 / 11Thinking High (With Tools)15.709 / 11Thinking High (With Tools)+10.30
Terminal-Bench 4.020.3037 / 97Thinking High (With Tools)12.4254 / 97Thinking High (With Tools)+7.88
CursorBench 3.269.903 / 5Thinking High (With Tools)66.705 / 5Thinking High (With Tools)+3.20

临床工作与医疗决策

胶着 2/2
评测项Grok 4.6Grok 4.5分差
MedCode44.7129 / 64Thinking High (With Tools)43.2935 / 64Thinking High (With Tools)+1.42
MedScribe86.5315 / 66Thinking High (With Tools)86.8812 / 66Thinking High (With Tools)-0.35

客服与业务流程

胶着 2/2
评测项Grok 4.6Grok 4.5分差
SAGE28.9061 / 64Thinking High (With Tools)34.9750 / 64Thinking High (With Tools)-6.07
τ³-Banking50.703 / 167Thinking High (With Tools)47.948 / 167Thinking High (With Tools)+2.76

程序生成与编辑

Grok 4.6 领先 2/2
评测项Grok 4.6Grok 4.5分差
Vibe Code Bench v1.176.2421 / 60Thinking High (With Tools)6927 / 60Thinking High (With Tools)+7.24
FrontierCode 1.1 Extended61.304 / 7Thinking High (With Tools)56.606 / 7Thinking High (With Tools)+4.70

金融

Grok 4.6 领先 2/2
评测项Grok 4.6Grok 4.5分差
EMB (Excel Modeling)62.7322 / 42Thinking High (With Tools)52.9132 / 42Thinking High (With Tools)+9.82
Finance Agent v253.6821 / 42Thinking High (With Tools)48.3533 / 42Thinking High (With Tools)+5.33

专业数据分析

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
AA-AnalystAgent41.2512 / 29Thinking High (With Tools + Internet)3515 / 29Thinking High (With Tools + Internet)+6.25

仓库修复与多文件工程

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
APEX-SWE56.402 / 3Thinking High (With Tools)53.603 / 3Thinking High (With Tools)+2.80

常识推理

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
SimpleBench75.9013 / 96Thinking High (No Tools)7019 / 96Thinking High (No Tools)+5.90

数学

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
ProofBench v1.1 (Lean 4)5117 / 28Thinking High (With Tools)3122 / 28Thinking High (With Tools)+20

科学知识与推理

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
GPQA Diamond949 / 253Thinking High (No Tools)93.4315 / 253Thinking High (No Tools)+0.57

科学计算与科研编程

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
SciCode56.5025 / 134Thinking High (No Tools)5539 / 134Thinking High (No Tools)+1.50

算法与竞赛编程

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
IOI (Vals v2)47.6119 / 26Thinking High (With Tools)40.5622 / 26Thinking High (With Tools)+7.05

维护、优化与工程管理

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
Code Migration44.5714 / 43Thinking High (With Tools)36.6023 / 43Thinking High (With Tools)+7.97

跨应用与工具编排

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
APEX-Agents57.502 / 7Thinking High (With Tools)47.104 / 7Thinking High (With Tools)+10.40

跨能力聚合指数

Grok 4.6 领先 1/1
评测项Grok 4.6Grok 4.5分差
Vals Index59.1717 / 42Thinking High (With Tools)51.5330 / 42Thinking High (With Tools)+7.64

规格对比

字段Grok 4.6Grok 4.5
发布机构xAIxAI
发布时间2026-08-122026-07-08
模型类型编程大模型编程大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度500K500K
最大输出暂无数据暂无数据

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Grok 4.6Grok 4.5
文本输入$2 / 1M tokens$2 / 1M tokens
文本输出$6 / 1M tokens$6 / 1M tokens
缓存读取$0.5 / 1M tokens$0.5 / 1M tokens

小结

  • Grok 4.6在以下类目领先:法律 (2/3)、自主开发与终端任务 (3/3)、程序生成与编辑 (2/2)、金融 (2/2)、专业数据分析 (1/1)、仓库修复与多文件工程 (1/1)、常识推理 (1/1)、数学 (1/1)、科学知识与推理 (1/1)、科学计算与科研编程 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、跨应用与工具编排 (1/1)、跨能力聚合指数 (1/1)
  • 胶着类目:临床工作与医疗决策、客服与业务流程

24 个共同 benchmark 上,Grok 4.6 平均高出 2.20 分。

单项差距最大的 benchmark:Harvey Lab-AA — Grok 4.6 15.80,Grok 4.5 92.42(分差 -76.62)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。