Grok 4.6vsGrok 4.5
在 24 个共同 benchmark 中,Grok 4.6 整体领先:Grok 4.6 领先 21 项,Grok 4.5 领先 3 项,持平 0 项,平均分差 +2.20。
Grok 4.621 项(88%)(13%)3 项Grok 4.5
评测分数
按能力类目分组,每组内按分差大小排列;共 24 项。
法律
Grok 4.6 领先 2/3| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| Harvey Lab-AA | 15.8043 / 44Thinking High (With Tools) | 92.429 / 44Thinking High (With Tools) | -76.62 |
| Legal Research Bench | 48.087 / 42Thinking High (With Tools) | 37.9824 / 42Thinking High (With Tools) | +10.10 |
| Harvey's Legal Agent Benchmark | 15.835 / 43Thinking High (With Tools) | 12.926 / 43Thinking High (With Tools) | +2.91 |
自主开发与终端任务
Grok 4.6 领先 3/3| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| Terminal-Bench 3.0 | 267 / 11Thinking High (With Tools) | 15.709 / 11Thinking High (With Tools) | +10.30 |
| Terminal-Bench 4.0 | 20.3037 / 97Thinking High (With Tools) | 12.4254 / 97Thinking High (With Tools) | +7.88 |
| CursorBench 3.2 | 69.903 / 5Thinking High (With Tools) | 66.705 / 5Thinking High (With Tools) | +3.20 |
临床工作与医疗决策
胶着 2/2| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| MedCode | 44.7129 / 64Thinking High (With Tools) | 43.2935 / 64Thinking High (With Tools) | +1.42 |
| MedScribe | 86.5315 / 66Thinking High (With Tools) | 86.8812 / 66Thinking High (With Tools) | -0.35 |
客服与业务流程
胶着 2/2| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| SAGE | 28.9061 / 64Thinking High (With Tools) | 34.9750 / 64Thinking High (With Tools) | -6.07 |
| τ³-Banking | 50.703 / 167Thinking High (With Tools) | 47.948 / 167Thinking High (With Tools) | +2.76 |
程序生成与编辑
Grok 4.6 领先 2/2| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| Vibe Code Bench v1.1 | 76.2421 / 60Thinking High (With Tools) | 6927 / 60Thinking High (With Tools) | +7.24 |
| FrontierCode 1.1 Extended | 61.304 / 7Thinking High (With Tools) | 56.606 / 7Thinking High (With Tools) | +4.70 |
金融
Grok 4.6 领先 2/2| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| EMB (Excel Modeling) | 62.7322 / 42Thinking High (With Tools) | 52.9132 / 42Thinking High (With Tools) | +9.82 |
| Finance Agent v2 | 53.6821 / 42Thinking High (With Tools) | 48.3533 / 42Thinking High (With Tools) | +5.33 |
专业数据分析
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| AA-AnalystAgent | 41.2512 / 29Thinking High (With Tools + Internet) | 3515 / 29Thinking High (With Tools + Internet) | +6.25 |
仓库修复与多文件工程
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| APEX-SWE | 56.402 / 3Thinking High (With Tools) | 53.603 / 3Thinking High (With Tools) | +2.80 |
常识推理
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| SimpleBench | 75.9013 / 96Thinking High (No Tools) | 7019 / 96Thinking High (No Tools) | +5.90 |
数学
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| ProofBench v1.1 (Lean 4) | 5117 / 28Thinking High (With Tools) | 3122 / 28Thinking High (With Tools) | +20 |
科学知识与推理
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| GPQA Diamond | 949 / 253Thinking High (No Tools) | 93.4315 / 253Thinking High (No Tools) | +0.57 |
科学计算与科研编程
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| SciCode | 56.5025 / 134Thinking High (No Tools) | 5539 / 134Thinking High (No Tools) | +1.50 |
算法与竞赛编程
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| IOI (Vals v2) | 47.6119 / 26Thinking High (With Tools) | 40.5622 / 26Thinking High (With Tools) | +7.05 |
维护、优化与工程管理
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| Code Migration | 44.5714 / 43Thinking High (With Tools) | 36.6023 / 43Thinking High (With Tools) | +7.97 |
跨应用与工具编排
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| APEX-Agents | 57.502 / 7Thinking High (With Tools) | 47.104 / 7Thinking High (With Tools) | +10.40 |
跨能力聚合指数
Grok 4.6 领先 1/1| 评测项 | Grok 4.6 | Grok 4.5 | 分差 |
|---|---|---|---|
| Vals Index | 59.1717 / 42Thinking High (With Tools) | 51.5330 / 42Thinking High (With Tools) | +7.64 |
规格对比
| 字段 | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 发布机构 | xAI | xAI |
| 发布时间 | 2026-08-12 | 2026-07-08 |
| 模型类型 | 编程大模型 | 编程大模型 |
| 架构 | 稠密模型 | 稠密模型 |
| 参数规模 | 暂无数据 | 暂无数据 |
| 上下文长度 | 500K | 500K |
| 最大输出 | 暂无数据 | 暂无数据 |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 文本输入 | $2 / 1M tokens | $2 / 1M tokens |
| 文本输出 | $6 / 1M tokens | $6 / 1M tokens |
| 缓存读取 | $0.5 / 1M tokens | $0.5 / 1M tokens |
小结
- Grok 4.6在以下类目领先:法律 (2/3)、自主开发与终端任务 (3/3)、程序生成与编辑 (2/2)、金融 (2/2)、专业数据分析 (1/1)、仓库修复与多文件工程 (1/1)、常识推理 (1/1)、数学 (1/1)、科学知识与推理 (1/1)、科学计算与科研编程 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、跨应用与工具编排 (1/1)、跨能力聚合指数 (1/1)
- 胶着类目:临床工作与医疗决策、客服与业务流程
24 个共同 benchmark 上,Grok 4.6 平均高出 2.20 分。
单项差距最大的 benchmark:Harvey Lab-AA — Grok 4.6 15.80,Grok 4.5 92.42(分差 -76.62)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。