Grok 4.5 适合哪些场景?
官方将其定位于编程、Agentic 任务和知识工作,典型场景包括多步骤软件工程、使用工具完成研究任务、代码生成与调试,以及文档、表格和演示文稿等办公任务。
Grok 4.5 是 SpaceXAI 于 2026 年 7 月 8 日发布的旗舰模型,面向编程、Agentic 任务和知识工作,支持文本与图像输入、500K 上下文、函数调用、联网搜索、代码执行与 low/medium/high 三档推理;知识截止日期为 2026 年 2 月 1 日。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
Grok 4.5 当前已收录的代表性评测结果包括 SWE-Bench Pro - Public(4 / 51,得分 64.70)、TerminalBench 2.1(8 / 25,得分 83.30)、DeepSWE(10 / 17,得分 53)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
暂时没有为该模型整理的相关对比页面。
想自定义其他组合?打开对比工具
Grok 4.5 是 SpaceXAI 于 2026 年 7 月 8 日发布的旗舰模型,定位于编程、Agentic 任务和知识工作,并在 Grok Build、Cursor、SpaceXAI API 及多家模型网关提供。DataLearner 当前机构目录沿用 xAI 名称,本条目按该目录归档。
官方开发者文档显示,API 模型名为 grok-4.5,支持 Responses API 与 Chat Completions。模型接受文本和图像输入并输出文本,上下文窗口为 500,000 tokens,知识截止日期为 2026 年 2 月 1 日。推理强度通过 reasoning_effort 配置,支持 low、medium、high 三档并默认 high。工具能力包括函数调用、Web 搜索、X 搜索和代码执行;官方文档也提供 Grok 4.5 的结构化输出示例。
SpaceXAI 表示模型在数万张 NVIDIA GB300 GPU 上训练,数据覆盖编程、科学、工程和数学,强化学习阶段聚焦多步骤软件工程与技术任务。官方发布评测中,Grok 4.5 在 DeepSWE 1.0、DeepSWE 1.1、SWE-Marathon、Terminal Bench 2.1 和 SWE-Bench Pro 上分别取得 62.0%、53.0%、29.0%、83.3% 和 64.7%。这些结果使用的基准版本与工具环境不同,不宜脱离各自测试条件直接横向比较。
官方发布页称服务速度约为 80 tokens/s;在 SWE-Bench Pro 任务上平均输出 15,954 tokens,约为对比模型 Opus 4.8(max)的四分之一。官方价格表列出的 500K 上下文标准价格为每 100 万 tokens:输入 2.00 美元、缓存输入 0.50 美元、输出 6.00 美元;Web 搜索、X 搜索和代码执行等服务端工具按调用另行计费。模型目前未开源权重,参数规模与最大输出长度尚未公开。
官方将其定位于编程、Agentic 任务和知识工作,典型场景包括多步骤软件工程、使用工具完成研究任务、代码生成与调试,以及文档、表格和演示文稿等办公任务。
官方价格表列出的上下文窗口为 500K tokens。模型支持文本与图像输入、文本输出,知识截止日期为 2026 年 2 月 1 日。
reasoning_effort 支持 low、medium、high 三档,默认 high。官方 API 文档列出的工具包括函数调用、Web 搜索、X 搜索和代码执行,并支持结构化输出。
标准价格为每 100 万 tokens 输入 2 美元、缓存输入 0.5 美元、输出 6 美元。Web 搜索、X 搜索、代码执行等服务端工具还会按调用次数单独计费。
官方发布页报告 DeepSWE 1.0 为 62.0%、DeepSWE 1.1 为 53.0%、SWE-Marathon 为 29.0%、Terminal Bench 2.1 为 83.3%、SWE-Bench Pro 为 64.7%。不同基准采用不同任务集与工具环境,分数不应脱离测试条件直接比较。
目前未公开模型权重,也未公布参数规模和最大输出长度;可通过 SpaceXAI API、Grok Build、Cursor 及官方列出的模型网关使用。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
