DataLearner 标志
KI

Kimi K3

推理大模型编程大模型Kimi K3

Kimi K3

发布时间: 2026-07-16更新于: 2026-08-22浏览量: 10,873
模型参数
2.8万亿
上下文长度
1M
多语言支持
支持
推理能力
5/5

Moonshot AI 于 2026 年 7 月 16 日发布的旗舰模型,2.8 万亿总参数 / 1040 亿激活的 MoE 架构,1M 上下文与 1M 最大输出,权重按 Kimi K3 License 在 Hugging Face 开放(MXFP4 精度约 1.42 TiB、96 个分片)。支持文本、图像、视频输入。它的定位非常清晰:智能体与专业生产力任务。在 DataLearner 已收录的 55 条成绩中拿下 14 个第一,包括 BrowseComp 91.20(54 个模型)、Toolathlon-Verified 76.50、MCPMark-Verified 94.50、FrontierSWE 81.20、Program Bench 77.80、Harvey Lab-AA 94.60、MathVision 97.80,以及 CorpFin v2、Office QA Pro、Finance Agent v2、Legal Research Bench、SpreadsheetBench 2 等一批垂直办公评测。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Kimi K3

模型基本信息

推理过程
支持
思考模式
思考水平 · 最高 (Max) (默认)思考水平 · 低 (Low)思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
1M tokens
模型类型
推理大模型
输入/输出模态
文本、图像、视频 → 文本
发布时间
2026-07-16
模型文件大小
约 1.42 TiB(MXFP4,96 个 Safetensors 分片)
MoE架构
总参数 / 激活参数
2.8万亿 / 1040亿
知识截止
暂无数据
Kimi K3

开源和体验地址

代码开源状态
预训练权重开源
Kimi K3 License- 有条件免费商用授权
在线体验
Kimi K3

官方介绍与博客

DataLearnerAI博客
暂无
Kimi K3

API接口信息

接口速度
2/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-¥20.00/ 1M¥100.00/ 1M
international
类型适用条件输入输出
文本-$3.00/ 1M$15.00/ 1M
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.300/ 1M

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Kimi K3

评测结果

Kimi K3 当前已收录的代表性评测结果包括 BrowseComp(1 / 54,得分 91.20)、Creative Writing(2 / 99,得分 2070.80)、Terminal-Bench 2.1(2 / 47,得分 88.30)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合评估

共 3 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高
43.50
52 / 185
HLE
最高工具
56
14 / 185
CritPt
最高
23.40
1 / 3

科学与综合推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
84.85
88 / 226
91.92
25 / 226
93.50
13 / 226

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
2070.80
2 / 99

AI Agent - 信息收集

共 2 项评测
评测名称 / 模式
得分
排名/总数
DeepSearchQA
最高工具联网
95
1 / 2
BrowseComp
最高工具联网
91.20
1 / 54

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
最高
74.70
2 / 18

AI Agent - 工具使用

共 8 项评测
评测名称 / 模式
得分
排名/总数
MCPMark-Verified
最高工具
94.50
1 / 3
Terminal-Bench 2.1
最高工具
88.30
2 / 47
OSWorld-Verified
最高工具
84.80
2 / 26
MCP-Atlas
最高工具
84.20
4 / 40
76.50
2 / 8
SaaS-Bench
最高工具
60.10
1 / 1
OSWorld 2.0
最高工具
58.30
3 / 5
AutomationBench
最高工具
30.80
5 / 10

编程与软件工程

共 9 项评测
评测名称 / 模式
得分
排名/总数
1681.75
2 / 35
FrontierSWE
最高工具
81.20
1 / 4
Program Bench
最高工具
77.80
1 / 6
72.90
1 / 3
DeepSWE
最高工具
67.50
5 / 31
SciCode
最高工具
58.70
2 / 5
MLS Bench
最高工具
48.30
1 / 4
SWE-Marathon
最高工具
42
2 / 5
PostTrain Bench
最高工具
36.60
3 / 5

Agent能力评测

共 4 项评测
评测名称 / 模式
得分
排名/总数
Job Bench
最高工具
54.30
3 / 3
APEX-Agents
最高工具
41
5 / 6
τ³-Banking
最高工具
33.40
1 / 3
Agents' Last Exam
最高工具
28.30
5 / 14

生产力知识

共 9 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
最高工具
1686
7 / 16
AA-Briefcase
最高工具
1548
4 / 6
Harvey Lab-AA
最高工具
94.60
1 / 6
ResearchRubrics
最高工具联网
76.20
1 / 1
CorpFin v2
最高工具
71.60
1 / 1
Office QA Pro
最高工具
63.30
2 / 3
Finance Agent v2
最高工具
54.40
1 / 1
44.20
1 / 1
SpreadsheetBench 2
最高工具
34.80
1 / 1

多模态理解

共 14 项评测
评测名称 / 模式
得分
排名/总数
94.30
5 / 12
MathVision
最高工具
97.80
1 / 12
84.80
11 / 18
CharXiv RQ
最高工具
91.30
1 / 18
91.10
1 / 3
90
1 / 1
BabyVision
最高工具
85.70
1 / 5
MMMU-Pro
最高
81.60
3 / 7
MMMU-Pro
最高工具
83.40
1 / 7
MMVU
最高
82.10
1 / 2
58.50
1 / 1
23
3 / 3
ZeroBench Main
最高工具
41
1 / 3

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
72.18
13 / 34
39.02
13 / 34

和其他模型对比

Kimi K3

发布机构

Kimi K3

模型解读

Kimi K3 与开放权重

Kimi K3 是 Moonshot AI 于 2026 年 7 月 16 日发布的原生多模态智能体旗舰模型。官方称其为首个开放的 3T 级模型:总参数量 2.8T、每 token 激活约 104B 参数,支持 1,048,576 tokens 上下文。完整模型权重、推理代码与技术报告已于北京时间 2026 年 7 月 28 日开放,可从 Hugging Face 和 GitHub 获取。

架构与技术规格

K3 采用 Stable LatentMoE:共 93 层,其中 1 个稠密层;注意力层由 69 层 Kimi Delta Attention(KDA)和 24 层 Gated MLA 组成。模型拥有 896 个路由专家,每个 token 选择 16 个专家,另有 2 个共享专家;隐藏维度为 7168,96 个注意力头,词表规模约 160K。视觉编码器为 401M 参数的 MoonViT-V2。

模型从 SFT 阶段开始采用量化感知训练,发布权重为 MXFP4,激活为 MXFP8。Hugging Face 仓库包含 96 个 Safetensors 分片,权重及相关大文件约 1.42 TiB。官方推荐 vLLM、SGLang 与 TokenSpeed 作为推理引擎。

能力与 API

K3 面向长周期软件工程、知识工作、深度推理和视觉任务,支持文本、图像和视频输入以及文本输出。API 支持函数与工具调用、严格 JSON Schema 结构化输出、Partial Mode、动态工具加载、自动上下文缓存,以及 OpenAI/Anthropic 兼容调用方式。

K3 始终启用思考,reasoning_effort 支持 low、high、max 三档,默认 max。多轮对话和工具调用必须原样回传上一轮完整 assistant message,包括 reasoning_contenttool_calls

官方评测

官方开放权重模型卡给出的评测表相当完整:共 45 个基准、50 条成绩,其中 5 组同时提供无工具与工具增强两个结果。所有 K3 成绩均使用 max reasoning effort 与 temperature=1.0;单步推理和无工具视觉任务采用 top_p=0.95,智能体任务采用 top_p=1.0。代表性结果包括 GPQA Diamond 93.5、DeepSWE 67.5、Terminal-Bench 2.1 88.3、BrowseComp 91.2、MCPMark-Verified 94.5、OSWorld-Verified 84.8、OmniDocBench 91.1。

价格与访问条件

官方 API 按每百万 tokens 计费:中国区缓存命中输入 ¥2、缓存未命中输入 ¥20、输出 ¥100;国际区分别为 $0.30、$3、$15。K3 API 需账户成功充值至少 1 美元后解锁,账户等级决定并发和速率限制。

Kimi K3 License

代码、权重、配置与相关文档均采用 Kimi K3 License。该许可允许使用、复制、修改、分发、再许可、销售、部署和微调,但须保留版权与许可声明并遵守适用法律。若许可方或关联方经营 MaaS 且任意连续 12 个月总收入超过 2,000 万美元,商业使用前须与 Moonshot AI 另签协议;若商业产品月活超过 1 亿或月收入超过 2,000 万美元,界面须显著展示“Kimi K3”。内部使用、官方产品和认证推理合作伙伴适用例外条款。

使用限制

  • API 的 temperature=1.0、top_p=0.95、n=1、presence_penalty=0 和 frequency_penalty=0 为固定值。
  • 视觉输入不支持直接使用公网图片 URL,应使用 base64 或已上传文件的 ms:// 地址。
  • 官方 Web Search 正在更新,当前不建议用于生产工作流。
  • 自部署需要极高的存储、显存、互联和推理引擎适配成本,开放权重不等于普通工作站可运行。

官方资料

Hugging Face 权重与模型卡 · GitHub 代码与技术报告 · 官方技术博客 · API 快速开始 · 官方价格

Kimi K3

常见问题

Kimi K3 的权重开源了吗?用什么许可?

权重已在 Hugging Face 开放,采用 Kimi K3 License——这是自定义许可而非 Apache 2.0、MIT 这类标准开源协议,商用前需要核对条款。官方同时开放了 GitHub 仓库和技术报告 PDF。发布的权重为 MXFP4 精度,约 1.42 TiB、拆成 96 个 Safetensors 分片,属于多机集群部署级别。

Kimi K3 最擅长什么?

智能体和专业办公,而且优势很明显。在库内已收录成绩里它拿了 14 个第一:信息收集方面 BrowseComp 91.20(54 个模型中第 1)、DeepSearchQA 95;工具使用方面 MCPMark-Verified 94.50、Toolathlon-Verified 76.50、SaaS-Bench 60.10 均第 1,Terminal-Bench 2.1 88.30 和 OSWorld-Verified 84.80 均第 2;编程方面 FrontierSWE 81.20、Program Bench 77.80、Kimi Code Bench 2.0 72.90、MLS Bench 48.30 第 1;垂直办公方面 Harvey Lab-AA 94.60、CorpFin v2 71.60、Office QA Pro 63.30、Finance Agent v2 54.40、Legal Research Bench 44.20、SpreadsheetBench 2 34.80、ResearchRubrics 76.20 全部第 1。多模态的 MathVision 97.80 也是 10 个模型中第 1。

Kimi K3 有什么短板?

综合难题和纯 Agent 长程评测上不是最强。HLE 带工具 56 分在 181 个模型中排第 14,不带工具 43.50 掉到第 50;APEX-Agents 41 分在 5 个模型中垫底;GDPval-AA v2 1686 排 13 个第 6,AA-Briefcase 1548 排 6 个第 4,PostTrain Bench 36.60 排 4 个第 3。它的强项集中在有明确工具和流程的任务上,纯靠内部推理的硬核难题不占优。

Kimi K3 的上下文和输出有多长?

上下文 1M tokens,最大输出也是 1M tokens——输出上限做到和上下文等长在同期模型中很少见(多数是 128K 或 256K)。长上下文实测 AA-LCR 74.70 在 18 个模型中排第 2。

Kimi K3 的 API 价格是多少?

美元计价为每百万 tokens 输入 $3.00、缓存命中输入 $0.30、输出 $15.00;人民币计价为输入 20 元、缓存命中 2 元、输出 100 元。官方定价文档在 platform.kimi.com 的 chat-k3 页面。

Kimi K3 相比 K2.6、K2.7 Code 有什么不同?

K3 是新一代基座,参数规模来到 2.8 万亿总参 / 1040 亿激活,并把上下文和输出都拉到 1M,同时首次加入图像和视频输入。K2.7 Code 是上一代面向编程的专门版本,K2.6 是上一代通用版本。从库内成绩看,K3 的提升主要体现在智能体工具链和垂直办公场景,而不只是编程分数。

What does self-hosting Kimi K3 require?

Moonshot recommends vLLM, SGLang, or TokenSpeed. The MXFP4 release is roughly 1.42 TiB, so deployment still requires large accelerator memory, high-speed interconnects, storage, and compatible serving software.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码