Kimi K3vsClaude Opus 4.8
在 14 个共同 benchmark 中,Kimi K3 整体领先:Kimi K3 领先 8 项,Claude Opus 4.8 领先 6 项,持平 0 项,平均分差 +25.43。
Kimi K3
Moonshot AI · 2026-07-16 · 推理大模型
Claude Opus 4.8
Anthropic · 2026-05-28 · 推理大模型
Kimi K38 项(57%)(43%)6 项Claude Opus 4.8
评测分数
按能力类目分组,每组内按分差大小排列;共 14 项。
AI Agent - Tool Usage
Kimi K3 领先 3/4| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.304 / 49Max (With Tools) | 78.9025 / 49Thinking High (With Tools) | +9.40 |
| Terminal-Bench-Science 0.1 | 7.108 / 10Max (With Tools) | 10.505 / 10Max (With Tools) | -3.40 |
| MCP-Atlas | 84.204 / 41Max (With Tools) | 82.208 / 41Deep Thinking (With Tools) | +2 |
| OSWorld-Verified | 84.802 / 26Max (With Tools) | 83.404 / 26Extended (with tools) | +1.40 |
Coding and Software Engineer
Kimi K3 领先 2/2| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| Text Arena (Coding) | 1,6822 / 35最高(无工具) | 1,5459 / 35Normal (No Tools) | +136.70 |
| DeepSWE | 67.508 / 34Max (With Tools) | 5919 / 34Deep Thinking (With Tools) | +8.50 |
Math and Reasoning
Claude Opus 4.8 领先 2/2| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| FrontierMath Tier 4 v2 | 39.0213 / 40最高(无工具) | 56.109 / 40最高(无工具) | -17.07 |
| FrontierMath v2 | 72.1813 / 58最高(无工具) | 809 / 58最高(无工具) | -7.82 |
AI Agent - Information Search
Kimi K3 领先 1/1| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| BrowseComp | 91.201 / 55Max (With Tools + Internet) | 84.309 / 55Thinking High (With Tools + Internet) | +6.90 |
General Knowledge
Claude Opus 4.8 领先 1/1| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| HLE | 5616 / 189Max (With Tools) | 57.9010 / 189Extended (with tools) | -1.90 |
Text Embedding
Claude Opus 4.8 领先 1/1| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| Context Arena | 71.7559 / 126最高(无工具) | 90.0415 / 126最高(无工具) | -18.29 |
Writing and Creative Capabilities
Kimi K3 领先 1/1| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| Creative Writing | 2,0712 / 99Normal (No Tools) | 1,83513 / 99Normal (No Tools) | +235.50 |
常识推理
Claude Opus 4.8 领先 1/1| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| SimpleBench | 60.7029 / 92最高(无工具) | 64.8019 / 92Normal (No Tools) | -4.10 |
科学与综合推理
Kimi K3 领先 1/1| 评测项 | Kimi K3 | Claude Opus 4.8 | 分差 |
|---|---|---|---|
| GPQA Diamond | 93.5015 / 270最高(无工具) | 85.3596 / 270Normal (No Tools) | +8.15 |
规格对比
| 字段 | Kimi K3 | Claude Opus 4.8 |
|---|---|---|
| 发布机构 | Moonshot AI | Anthropic |
| 发布时间 | 2026-07-16 | 2026-05-28 |
| 模型类型 | 推理大模型 | 推理大模型 |
| 架构 | MoE 架构 | 稠密模型 |
| 参数规模 | 2.8万亿 | 暂无数据 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 1M | 125K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | Kimi K3 | Claude Opus 4.8 |
|---|---|---|
| 文本输入 | ¥20 / 1M tokens | $5 / 1M tokens |
| 文本输出 | ¥100 / 1M tokens | $25 / 1M tokens |
| 缓存读取 | ¥2 / 1M tokens | $0.5 / 1M tokens |
| 缓存写入 | 暂无公开价格 | $6.25 / 1M tokens |
小结
- Kimi K3在以下类目领先:AI Agent - Tool Usage (3/4)、Coding and Software Engineer (2/2)、AI Agent - Information Search (1/1)、Writing and Creative Capabilities (1/1)、科学与综合推理 (1/1)
- Claude Opus 4.8在以下类目领先:Math and Reasoning (2/2)、General Knowledge (1/1)、Text Embedding (1/1)、常识推理 (1/1)
14 个共同 benchmark 上,Kimi K3 平均高出 25.43 分。
单项差距最大的 benchmark:Creative Writing — Kimi K3 2,071,Claude Opus 4.8 1,835(分差 +235.50)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。