DataLearner 标志

Kimi K3vsGPT-5.6 Sol

在 21 个共同 benchmark 中,GPT-5.6 Sol 整体领先:Kimi K3 领先 5 项,GPT-5.6 Sol 领先 16 项,持平 0 项,平均分差 +0.51。

Moonshot AI
Kimi K3

Moonshot AI · 2026-07-16 · 推理大模型

OpenAI
GPT-5.6 Sol

OpenAI · 2026-06-26 · 推理大模型

Kimi K35 (24%)(76%)16 GPT-5.6 Sol

评测分数

按能力类目分组,每组内按分差大小排列;共 21 项。

Productivity Knowledge

Kimi K3 领先 3/5
评测项Kimi K3GPT-5.6 Sol分差
Harvey Lab-AA94.601 / 6Max (With Tools)2.506 / 6Max (With Tools)+92.10
GDPval-AA v21,68610 / 27Max (With Tools)1,7289 / 27Max (With Tools)-42
AA-Briefcase1,5288 / 20Max (With Tools)1,4949 / 20Max (With Tools)+34.28
AA-AnalystAgent38.757 / 12Max (With Tools + Internet)47.505 / 12Max (With Tools + Internet)-8.75
AutomationBench46.707 / 17Max (With Tools)45.808 / 17Max (With Tools)+0.90

AI Agent - Tool Usage

GPT-5.6 Sol 领先 4/4
评测项Kimi K3GPT-5.6 Sol分差
Terminal-Bench 4.012.6013 / 16Max (With Tools)39.905 / 16Max (With Tools)-27.30
Terminal-Bench 3.017.708 / 11Max (With Tools)34.402 / 11Max (With Tools)-16.70
Terminal-Bench-Science 0.17.109 / 11Max (With Tools)22.404 / 11Max (With Tools)-15.30
CyberGym805 / 8Max (With Tools)84.502 / 8Max (With Tools)-4.50

Coding and Software Engineer

GPT-5.6 Sol 领先 2/3
评测项Kimi K3GPT-5.6 Sol分差
DeepSWE67.5011 / 38Max (With Tools)736 / 38Max (With Tools)-5.50
Program Bench17.5010 / 11Max (With Tools)237 / 11Max (With Tools)-5.50
NL2Repo-Bench586 / 16Max (With Tools)56.809 / 16Max (With Tools)+1.20

Multimodal Understanding

GPT-5.6 Sol 领先 3/3
评测项Kimi K3GPT-5.6 Sol分差
ZeroBench Main414 / 6Max (With Tools)531 / 6Max (With Tools)-12
Chartography68.106 / 8Max (With Tools)79.903 / 8Max (With Tools)-11.80
BabyVision85.705 / 9Max (With Tools)88.904 / 9Max (With Tools)-3.20

Agent Level Benchmark

GPT-5.6 Sol 领先 2/2
评测项Kimi K3GPT-5.6 Sol分差
APEX-Agents415 / 6Max (With Tools)56.703 / 6Max (With Tools)-15.70
τ³-Banking33.406 / 13Max (With Tools)44.331 / 13Max (With Tools)-10.93

Long Context

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
AA-LCR74.708 / 29Max (No Tools)77.674 / 29Max (No Tools)-2.97

Math and Reasoning

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
FrontierMath v272.1813 / 58Max (No Tools)89.121 / 58Max (No Tools)-16.94

Text Embedding

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
Context Arena71.7559 / 126Max (No Tools)97.632 / 126Max (No Tools)-25.88

Writing and Creative Capabilities

Kimi K3 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
Creative Writing2,0714 / 106Normal (No Tools)1,9636 / 106Normal (No Tools)+107.20

规格对比

字段Kimi K3GPT-5.6 Sol
发布机构Moonshot AIOpenAI
发布时间2026-07-162026-06-26
模型类型推理大模型推理大模型
架构MoE 架构稠密模型
参数规模2.8万亿暂无数据
上下文长度1M1.05M
最大输出1M128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Kimi K3GPT-5.6 Sol
文本输入¥20 / 1M tokens$4 / 1M tokens
文本输出¥100 / 1M tokens$20 / 1M tokens
缓存读取¥2 / 1M tokens$0.4 / 1M tokens
缓存写入暂无公开价格$5 / 1M tokens

小结

  • Kimi K3在以下类目领先:Productivity Knowledge (3/5)、Writing and Creative Capabilities (1/1)
  • GPT-5.6 Sol在以下类目领先:AI Agent - Tool Usage (4/4)、Coding and Software Engineer (2/3)、Multimodal Understanding (3/3)、Agent Level Benchmark (2/2)、Long Context (1/1)、Math and Reasoning (1/1)、Text Embedding (1/1)

21 个共同 benchmark 上,Kimi K3 平均高出 0.51 分。

单项差距最大的 benchmark:Creative Writing — Kimi K3 2,071,GPT-5.6 Sol 1,963(分差 +107.20)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。