DataLearner 标志
GR

Grok 4.6

编程大模型Grok 4

Grok 4.6

发布时间: 2026-08-12更新于: 2026-08-13知识截止: 2026-02-01浏览量: 2,164
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
500K
多语言支持
暂无数据
推理能力
4/5

Grok 4.6 是 SpaceXAI(原 xAI)于 2026 年 8 月 12 日发布的旗舰模型,距上一代 Grok 4.5 仅隔一个多月,已在官方 API、Grok Build、Cursor、OpenRouter、Vercel 和 Cloudflare 提供。重点方向是长周期智能体、编程、知识工作与交互式视觉项目:官方称其做了比 4.5 更长的补充训练,加入模型生成的推理数据与高质量工程数据并改进优化器,强化学习覆盖通用编程、内核优化、Web 开发和计算机辅助设计等环境,模型在长轨迹中表现出更多主动自测与验证行为。支持文本与图像输入,上下文 500,000 tokens,官方标注无输出长度上限,reasoning_effort 比 4.5 多一档,支持 low/medium/high/xhigh。官方成绩包括 AA Intelligence Index 61、GDPVal-AA v2 1753、CursorBench v3.2 69.9%、DeepSWE v1.1 65.9%,而难度更高的 Terminal-Bench v3.0 仅 26.0%、Harvey LAB 15.8%。价格按提示长度分段:低于 200K tokens 时输入 2.00 / 缓存 0.50 / 输出 6.00 美元,达到或超过 200K 后翻倍为 4.00 / 1.00 / 12.00 美元。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Grok 4.6

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 极高 (Extra-High)
上下文长度
500K tokens
最大输出长度
暂无数据
模型类型
编程大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-08-12
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-02-01
Grok 4.6

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Grok 4.6

官方介绍与博客

DataLearnerAI博客
暂无
Grok 4.6

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本上下文长度 < 200000$2.00/ 1M tokens$6.00/ 1M tokens
文本上下文长度 >= 200000, 上下文长度 <= 500000$4.00/ 1M tokens$12.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.500/ 1M tokens
上下文长度 < 200000
文本-—$1.00/ 1M tokens
上下文长度 >= 200000, 上下文长度 <= 500000

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Grok 4.6

评测结果

Grok 4.6 当前已收录的代表性评测结果包括 τ³-Banking(3 / 167,得分 50.70)、GPQA Diamond(9 / 253,得分 94)、ECI(18 / 167,得分 156.48)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 10 项评测
评测名称 / 模式
得分
排名/总数
74.83
97 / 176
87.50
70 / 176
87
73 / 176
ARC-AGI-1
高工具
87
73 / 176
ARC-AGI-1
极高
87
73 / 176
27.64
100 / 164
61.25
64 / 164
65.14
59 / 164
ARC-AGI-2
极高
67.08
54 / 164

科学知识与推理

共 7 项评测
评测名称 / 模式
得分
排名/总数
94
9 / 253
93.18
19 / 253
30.63
8 / 13
5.70
92 / 204
17.70
46 / 204
17.10
50 / 204
CritPt
极高
19.70
41 / 204

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
75.90
13 / 96

多轮记忆与持续上下文

共 5 项评测
评测名称 / 模式
得分
排名/总数
74.16
52 / 126
81.36
37 / 126
79.03
42 / 126
80.94
38 / 126
EBR-bench
极高工具
30.48
9 / 23

仓库修复与多文件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
低工具
41.65
76 / 91
DeepSWE
中工具
67.48
30 / 91
DeepSWE
高工具
65.19
41 / 91
DeepSWE
极高工具
66.74
36 / 91
APEX-SWE
高工具
56.40
2 / 3

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
156.48
18 / 167
Vals Index
高工具
59.17
17 / 42

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
APEX-Agents
高工具
57.50
2 / 7

科学计算与科研编程

共 5 项评测
评测名称 / 模式
得分
排名/总数
49.40
77 / 134
55.90
31 / 134
56.50
25 / 134
SciCode
极高
53
55 / 134
7.10
10 / 12

客服与业务流程

共 6 项评测
评测名称 / 模式
得分
排名/总数
66.85
9 / 26
τ³-Banking
低工具
38.10
39 / 167
τ³-Banking
中工具
44.30
20 / 167
τ³-Banking
高工具
50.70
3 / 167
τ³-Banking
极高工具
43.30
22 / 167
SAGE
高工具
28.90
61 / 64

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
48.08
7 / 42
15.83
5 / 43
Harvey Lab-AA
高工具
15.80
43 / 44

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
70.79
5 / 20
62.73
22 / 42
53.68
21 / 42

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
65.96
18 / 58
51
17 / 28
31.71
17 / 42

自主开发与终端任务

共 10 项评测
评测名称 / 模式
得分
排名/总数
69.90
3 / 5
33.40
28 / 46
36.10
23 / 46
40.40
18 / 46
CursorBench 4.0
极高工具
41.40
15 / 46
26
7 / 11
3
70 / 96
13.10
48 / 96
Terminal-Bench 4.0
极高工具
17.20
42 / 96

程序生成与编辑

共 2 项评测
评测名称 / 模式
得分
排名/总数
76.24
21 / 60
61.30
4 / 7

文档与图表理解

共 4 项评测
评测名称 / 模式
得分
排名/总数
15.80
57 / 122
17.80
47 / 122
17
54 / 122
GDP.pdf
极高
17.20
52 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
高工具联网
41.25
12 / 29

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
47
9 / 11

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
44.57
14 / 43

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
高工具
47.61
19 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
86.53
15 / 66
MedCode
高工具
44.71
29 / 64

和其他模型对比

Grok 4.6

发布机构

Grok 4.6

模型解读

一个月内的第二次旗舰更新

Grok 4.6 是 SpaceXAI(原 xAI)于 2026 年 8 月 12 日发布的旗舰模型,距离上一代 Grok 4.5 只隔了一个多月。API 模型名为 grok-4.6,已在官方 API、Grok Build、Cursor、OpenRouter、Vercel 和 Cloudflare 上提供。

官方给这一代划的重点是「更长」:长周期智能体任务、编程、知识工作,以及交互式和视觉类项目。

训练上到底改了什么

SpaceXAI 说明,Grok 4.6 相比 4.5 做了更长时间的补充训练,加入了模型自身生成的推理数据、高级技术概念数据和高质量工程数据,并改进了优化器与训练配方。监督微调轨迹覆盖 STEM、软件工程和知识工作;强化学习环境则铺得很开——通用编程、知识工作、内核优化、Web 开发和计算机辅助设计都在内。

官方特别强调的一点是行为层面的变化:模型更擅长跨多个步骤持续工作,并在较长的执行轨迹中表现出更多主动自测与验证行为。对做智能体应用的人来说,这类「自己会回头检查」的倾向往往比单次跑分更重要。

规格与推理档位

接受文本与图像输入、输出文本,上下文窗口 500,000 tokens,知识截止 2026 年 2 月 1 日,官方标注无文本输出长度上限。推理强度通过 reasoning_effort 配置,比 4.5 多出一档,支持 low / medium / high / xhigh 四档并默认 high。接口支持 Responses API 与 Chat Completions,工具能力包括函数调用、Web 搜索、X 搜索和代码执行,并支持结构化输出。

官方评测:注意 Terminal-Bench v3.0 那个数字

官方发布页列出的 Grok 4.6 High 档成绩为:AA Intelligence Index 61、GDPVal-AA v2 1753、CursorBench v3.2 69.9%、DeepSWE v1.1 65.9%、FrontierCode v1.1 Extended 61.3%、APEX-Agents 57.5%、APEX-SWE 56.4%、AA-Briefcase 1577、Terminal-Bench v3.0 26.0%、Harvey LAB 15.8%。

后两项低得很显眼,但这不是模型的问题,而是基准的难度层级不同:Terminal-Bench 从 2.x 升到 3.0 后大幅提高了长程与开放度要求,Harvey LAB 则是专业法律领域的高难度评测。把 26.0% 和同页的 69.9% 放在一起看,恰恰能说明当前一代模型的能力边界在哪。这些基准的任务集、agent harness、工具权限和计分尺度都不一致,不应脱离各自条件横向比较。

价格:注意 200K 这条分界线

官方价格表按提示长度分段计费,这是它和 Grok 4.5 最实际的差别:

  • 提示低于 200K tokens:每百万 tokens 输入 2.00 美元、缓存输入 0.50 美元、输出 6.00 美元——与 Grok 4.5 同价。
  • 提示达到或超过 200K tokens:分别涨到 4.00、1.00 和 12.00 美元,正好翻倍。

也就是说,只要提示控制在 200K 以内,从 4.5 升级到 4.6 不会多花钱;但如果你正是冲着 500K 上下文来的,实际单价要按翻倍那一档算。发布页另提到存在两倍价格的快速变体,但官方模型目录中目前没有独立的 fast API 模型名,因此本页只收录 grok-4.6 的标准价格。模型权重、参数规模与训练细节未完整公开。

官方来源

Grok 4.6

常见问题

Grok 4.6 适合哪些场景?

官方将其定位于编程、Agentic 任务和知识工作,尤其强调长周期研究、跨代码库工作、信息分析,以及把产品想法持续实现并迭代为交互式应用或工作成果。

Grok 4.6 支持多长的上下文和哪些输入?

官方文档列出的上下文窗口为 500,000 tokens,支持文本和图像输入、文本输出,知识截止日期为 2026 年 2 月 1 日,并标注无文本输出长度上限。

Grok 4.6 支持哪些推理档位和工具?

reasoning_effort 支持 low、medium、high、xhigh 四档,默认 high。官方 API 文档列出的工具包括函数调用、Web 搜索、X 搜索和代码执行,并支持结构化输出。

Grok 4.6 的 API 价格是多少?

提示低于 200K tokens 时,每 100 万 tokens 输入 2 美元、缓存输入 0.5 美元、输出 6 美元;达到或超过 200K 时分别为 4、1 和 12 美元。发布页还提到两倍价格的快速变体,但官方模型目录当前没有列出独立 fast API 名称。

Grok 4.6 的官方评测成绩如何?

官方发布页报告 Grok 4.6 High 的 AA Intelligence Index 为 61、GDPVal-AA v2 为 1753、CursorBench 3.2 为 69.9%、DeepSWE 1.1 为 65.9%、FrontierCode 1.1 Extended 为 61.3%,并同时公布了 APEX-Agents、Terminal-Bench 3.0、APEX-SWE、AA-Briefcase 和 Harvey LAB 成绩。

Grok 4.6 是否开源?

目前未公开模型权重或参数规模;模型可通过 SpaceXAI API、Grok Build、Cursor 以及官方列出的模型网关使用。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码