DataLearner 标志

Kimi K3vsClaude Opus 4.8

在 14 个共同 benchmark 中,Kimi K3 整体领先:Kimi K3 领先 8 项,Claude Opus 4.8 领先 6 项,持平 0 项,平均分差 +25.43。

Moonshot AI
Kimi K3

Moonshot AI · 2026-07-16 · 推理大模型

Anthropic
Claude Opus 4.8

Anthropic · 2026-05-28 · 推理大模型

Kimi K38 (57%)(43%)6 Claude Opus 4.8

评测分数

按能力类目分组,每组内按分差大小排列;共 14 项。

AI Agent - Tool Usage

Kimi K3 领先 3/4
评测项Kimi K3Claude Opus 4.8分差
Terminal-Bench 2.188.304 / 49Max (With Tools)78.9025 / 49Thinking High (With Tools)+9.40
Terminal-Bench-Science 0.17.108 / 10Max (With Tools)10.505 / 10Max (With Tools)-3.40
MCP-Atlas84.204 / 41Max (With Tools)82.208 / 41Deep Thinking (With Tools)+2
OSWorld-Verified84.802 / 26Max (With Tools)83.404 / 26Extended (with tools)+1.40

Coding and Software Engineer

Kimi K3 领先 2/2
评测项Kimi K3Claude Opus 4.8分差
Text Arena (Coding)1,6822 / 35最高(无工具)1,5459 / 35Normal (No Tools)+136.70
DeepSWE67.508 / 34Max (With Tools)5919 / 34Deep Thinking (With Tools)+8.50

Math and Reasoning

Claude Opus 4.8 领先 2/2
评测项Kimi K3Claude Opus 4.8分差
FrontierMath Tier 4 v239.0213 / 40最高(无工具)56.109 / 40最高(无工具)-17.07
FrontierMath v272.1813 / 58最高(无工具)809 / 58最高(无工具)-7.82

AI Agent - Information Search

Kimi K3 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
BrowseComp91.201 / 55Max (With Tools + Internet)84.309 / 55Thinking High (With Tools + Internet)+6.90

General Knowledge

Claude Opus 4.8 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
HLE5616 / 189Max (With Tools)57.9010 / 189Extended (with tools)-1.90

Text Embedding

Claude Opus 4.8 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
Context Arena71.7559 / 126最高(无工具)90.0415 / 126最高(无工具)-18.29

Writing and Creative Capabilities

Kimi K3 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
Creative Writing2,0712 / 99Normal (No Tools)1,83513 / 99Normal (No Tools)+235.50

常识推理

Claude Opus 4.8 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
SimpleBench60.7029 / 92最高(无工具)64.8019 / 92Normal (No Tools)-4.10

科学与综合推理

Kimi K3 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
GPQA Diamond93.5015 / 270最高(无工具)85.3596 / 270Normal (No Tools)+8.15

规格对比

字段Kimi K3Claude Opus 4.8
发布机构Moonshot AIAnthropic
发布时间2026-07-162026-05-28
模型类型推理大模型推理大模型
架构MoE 架构稠密模型
参数规模2.8万亿暂无数据
上下文长度1M1M
最大输出1M125K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Kimi K3Claude Opus 4.8
文本输入¥20 / 1M tokens$5 / 1M tokens
文本输出¥100 / 1M tokens$25 / 1M tokens
缓存读取¥2 / 1M tokens$0.5 / 1M tokens
缓存写入暂无公开价格$6.25 / 1M tokens

小结

  • Kimi K3在以下类目领先:AI Agent - Tool Usage (3/4)、Coding and Software Engineer (2/2)、AI Agent - Information Search (1/1)、Writing and Creative Capabilities (1/1)、科学与综合推理 (1/1)
  • Claude Opus 4.8在以下类目领先:Math and Reasoning (2/2)、General Knowledge (1/1)、Text Embedding (1/1)、常识推理 (1/1)

14 个共同 benchmark 上,Kimi K3 平均高出 25.43 分。

单项差距最大的 benchmark:Creative Writing — Kimi K3 2,071,Claude Opus 4.8 1,835(分差 +235.50)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。