Qwen3.8-MaxvsKimi K3
在 11 个共同 benchmark 中,Kimi K3 整体领先:Qwen3.8-Max 领先 3 项,Kimi K3 领先 8 项,持平 0 项,平均分差 -2.48。
Qwen3.8-Max
阿里巴巴 · 2026-08-03 · 推理大模型
Kimi K3
Moonshot AI · 2026-07-16 · 推理大模型
Qwen3.8-Max3 项(27%)(73%)8 项Kimi K3
评测分数
按能力类目分组,每组内按分差大小排列;共 11 项。
AI Agent - Tool Usage
Kimi K3 领先 3/3| 评测项 | Qwen3.8-Max | Kimi K3 | 分差 |
|---|---|---|---|
| Toolathlon-Verified | 72.504 / 5极高强度思考(工具) | 76.501 / 5Max (With Tools) | -4 |
| AutomationBench | 27.305 / 8极高强度思考(工具) | 30.803 / 8Max (With Tools) | -3.50 |
| Terminal-Bench 2.1 | 86.608 / 44极高强度思考(工具) | 88.302 / 44Max (With Tools) | -1.70 |
Coding and Software Engineer
Kimi K3 领先 3/3| 评测项 | Qwen3.8-Max | Kimi K3 | 分差 |
|---|---|---|---|
| DeepSWE | 56.6014 / 27极高强度思考(工具) | 67.505 / 27Max (With Tools) | -10.90 |
| FrontierSWE | 73.504 / 4极高强度思考(工具) | 81.201 / 4Max (With Tools) | -7.70 |
| MLS Bench | 412 / 4极高强度思考(工具) | 48.301 / 4Max (With Tools) | -7.30 |
Math and Reasoning
Qwen3.8-Max 领先 2/2| 评测项 | Qwen3.8-Max | Kimi K3 | 分差 |
|---|---|---|---|
| FrontierMath Tier 4 v2 | 46.3411 / 34极高强度思考(无工具) | 39.0213 / 34最高(无工具) | +7.32 |
| FrontierMath v2 | 74.7411 / 34极高强度思考(无工具) | 72.1813 / 34最高(无工具) | +2.55 |
Agent Level Benchmark
Kimi K3 领先 1/1| 评测项 | Qwen3.8-Max | Kimi K3 | 分差 |
|---|---|---|---|
| Agents' Last Exam | 277 / 11极高强度思考(工具) | 28.305 / 11Max (With Tools) | -1.30 |
General Knowledge
Qwen3.8-Max 领先 1/1| 评测项 | Qwen3.8-Max | Kimi K3 | 分差 |
|---|---|---|---|
| HLE | 56.2013 / 181极高强度思考(工具) | 5614 / 181Max (With Tools) | +0.20 |
科学与综合推理
Kimi K3 领先 1/1| 评测项 | Qwen3.8-Max | Kimi K3 | 分差 |
|---|---|---|---|
| GPQA Diamond | 92.6021 / 226极高强度思考(无工具) | 93.5013 / 226最高(无工具) | -0.90 |
规格对比
| 字段 | Qwen3.8-Max | Kimi K3 |
|---|---|---|
| 发布机构 | 阿里巴巴 | Moonshot AI |
| 发布时间 | 2026-08-03 | 2026-07-16 |
| 模型类型 | 推理大模型 | 推理大模型 |
| 架构 | MoE 架构 | MoE 架构 |
| 参数规模 | 2.4万亿 | 2.8万亿 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 128K | 1M |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | Qwen3.8-Max | Kimi K3 |
|---|---|---|
| 文本输入 | ¥12 / 1M tokens | ¥20 / 1M tokens |
| 文本输出 | ¥36 / 1M tokens | ¥100 / 1M tokens |
| 缓存读取 | ¥1.5 / 1M tokens | ¥2 / 1M tokens |
小结
- Qwen3.8-Max在以下类目领先:Math and Reasoning (2/2)、General Knowledge (1/1)
- Kimi K3在以下类目领先:AI Agent - Tool Usage (3/3)、Coding and Software Engineer (3/3)、Agent Level Benchmark (1/1)、科学与综合推理 (1/1)
11 个共同 benchmark 上,Kimi K3 平均高出 2.48 分。
单项差距最大的 benchmark:DeepSWE — Qwen3.8-Max 56.60,Kimi K3 67.50(分差 -10.90)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。