DataLearner 标志

Qwen3.8-Max-0902vsKimi K3

在 9 个共同 benchmark 中,Qwen3.8-Max-0902 整体领先:Qwen3.8-Max-0902 领先 6 项,Kimi K3 领先 3 项,持平 0 项,平均分差 -1.06。

阿里巴巴
Qwen3.8-Max-0902

阿里巴巴 · 2026-09-02 · 推理大模型

Moonshot AI
Kimi K3

Moonshot AI · 2026-07-16 · 推理大模型

Qwen3.8-Max-09026 (67%)(33%)3 Kimi K3

评测分数

按能力类目分组,每组内按分差大小排列;共 9 项。

Coding and Software Engineer

Qwen3.8-Max-0902 领先 3/4
评测项Qwen3.8-Max-0902Kimi K3分差
Program Bench285 / 7极高强度思考(工具)77.801 / 7Max (With Tools)-49.80
SWE-Marathon44.801 / 6极高强度思考(工具)423 / 6Max (With Tools)+2.80
DeepSWE69.304 / 32极高强度思考(工具)67.506 / 32Max (With Tools)+1.80
MLS Bench50.101 / 5极高强度思考(工具)48.302 / 5Max (With Tools)+1.80

AI Agent - Tool Usage

胶着 2/2
评测项Qwen3.8-Max-0902Kimi K3分差
AutomationBench50.801 / 12极高强度思考(工具)30.807 / 12Max (With Tools)+20
Toolathlon-Verified73.307 / 10极高强度思考(工具)76.502 / 10Max (With Tools)-3.20

Multimodal Understanding

胶着 2/2
评测项Qwen3.8-Max-0902Kimi K3分差
BabyVision93.801 / 6极高强度思考(工具)85.702 / 6Max (With Tools)+8.10
MMMU-Pro82.702 / 8极高强度思考(无工具)83.401 / 8Max (With Tools)-0.70

Agent Level Benchmark

Qwen3.8-Max-0902 领先 1/1
评测项Qwen3.8-Max-0902Kimi K3分差
Job Bench641 / 4极高强度思考(工具)54.304 / 4Max (With Tools)+9.70

规格对比

字段Qwen3.8-Max-0902Kimi K3
发布机构阿里巴巴Moonshot AI
发布时间2026-09-022026-07-16
模型类型推理大模型推理大模型
架构MoE 架构MoE 架构
参数规模2.4万亿2.8万亿
上下文长度1M1M
最大输出131K1M

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Qwen3.8-Max-0902Kimi K3
文本输入$2 / 1M tokens¥20 / 1M tokens
文本输出$6 / 1M tokens¥100 / 1M tokens
缓存读取$0.25 / 1M tokens¥2 / 1M tokens
缓存写入$2.5 / 1M tokens暂无公开价格

小结

  • Qwen3.8-Max-0902在以下类目领先:Coding and Software Engineer (3/4)、Agent Level Benchmark (1/1)
  • 胶着类目:AI Agent - Tool Usage、Multimodal Understanding

9 个共同 benchmark 上,Kimi K3 平均高出 1.06 分。

单项差距最大的 benchmark:Program Bench — Qwen3.8-Max-0902 28,Kimi K3 77.80(分差 -49.80)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。