DataLearner 标志
KI

Kimi K2.5

多模态大模型Kimi K2Kimi K2.5

Kimi K2.5

发布时间: 2026-01-27更新于: 2026-07-17 21:57:43.155知识截止: 2024-046,195
模型参数
1万亿
上下文长度
256K
中文支持
支持
推理能力

Kimi K2.5 是Moonshot AI于 2026-01-27 发布的多模态大模型。支持文本、图像输入和文本输出,上下文窗口为 256K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Kimi K2.5

模型基本信息

推理过程
支持
思考模式
常规模式思考水平 · 扩展 (Extended)
上下文长度
256K tokens
最大输出长度
16K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-01-27
模型文件大小
595GB
MoE架构
总参数 / 激活参数
1万亿 / 320亿
知识截止
2024-04
Kimi K2.5

开源和体验地址

代码开源状态
预训练权重开源
Modified MIT License- 免费商用授权
Kimi K2.5

官方介绍与博客

Kimi K2.5

API接口信息

接口速度
2/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.600/ 1M$3.00/ 1M
图像-$0.600/ 1M-
缓存定价Prompt缓存
类型有效期写入读取
文本--$0.100/ 1M
图像--$0.100/ 1M
Kimi K2.5

评测结果

Kimi K2.5 当前已收录的代表性评测结果包括 LiveCodeBench(16 / 123,得分 85)、HLE(25 / 170,得分 50.20)、AIME2025(21 / 107,得分 96.10)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合评估

共 7 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考模式
87.60
37 / 187
MMLU Pro
思考模式
78.50
69 / 132
LiveBench
思考模式
69.07
42 / 115
ARC-AGI
思考模式
65.30
33 / 67
HLE
思考模式
30.10
87 / 170
HLE
思考模式工具
50.20
25 / 170
ARC-AGI-2
思考模式
11.80
38 / 61

编程与软件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
思考模式
85
16 / 123
SWE-bench Verified
思考模式工具
76.80
29 / 111
73
12 / 22
SWE-Bench Pro - Public
思考模式工具
50.70
38 / 51

数学推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
思考模式
96.10
21 / 107
AIME 2026
思考模式
92.50
12 / 18
IMO-AnswerBench
思考模式
81.80
16 / 21
4.20
40 / 80

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Simple Bench
思考模式
46.80
30 / 63

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式工具联网
60.60
35 / 52

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
常规模式工具
64.40
19 / 27
Terminal Bench 2.0
思考模式工具
50.80
34 / 47

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
思考模式
40
15 / 21

长上下文能力

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
思考模式
65
11 / 14
LongBench v2
常规模式
61
5 / 11

OpenClaw智能体能力综合测评

共 2 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
84.80
17 / 37
Claw Bench
思考模式工具
81.70
18 / 29

和其他模型对比

Kimi K2.5

发布机构

Kimi K2.5

模型解读

Kimi K2.5 是 Moonshot AI 于 2026 年 1 月推出的新一代开源多模态大语言模型。作为 Kimi K2 系列的迭代版本,K2.5 延续了前代模型的混合专家架构(Mixture-of-Experts, MoE),并在视觉理解、工具使用能力和智能体(Agentic)功能方面进行了升级。该模型基于约 15 万亿个混合视觉与文本 token 在 Kimi-K2-Base 基础上进行持续预训练,实现了原生多模态能力与高级智能体功能的整合。

Moonshot AI 采用了"静默发布"策略,用户通过网页端访问时发现原有 K2 模型已自动切换为 K2.5 版本,这种部署方式旨在收集真实用户反馈并持续优化模型表现。

二、核心技术架构

2.1 基础架构参数

Kimi K2.5 保持了与 K2 系列一致的 MoE 架构设计,具体技术规格如下:


技术参数数值
总参数量1 万亿(1T)
激活参数量320 亿(32B)
架构类型混合专家模型(MoE)
层数(含稠密层)61 层
稠密层数量1 层
注意力隐藏层维度7168
专家隐藏层维度(每专家)2048
注意力头数量64
专家总数384
每 token 选定专家数8
共享专家数量1
词表大小160K
上下文长度256K tokens
注意力机制MLA(Multi-head Latent Attention)
激活函数SwiGLU
视觉编码器MoonViT(4 亿参数)

2.2 架构特点

稀疏激活机制: 通过 384 个专家中仅激活 8 个的方式,模型在保持 1 万亿参数规模的同时,推理时仅需计算 320 亿参数。

长上下文窗口: 256K tokens 的上下文长度是 K2 系列(128K)的两倍,使模型能够处理更长的文档、视频序列和多轮对话。

视觉编码器 MoonViT: 集成 4 亿参数的视觉编码器,支持对图像和视频内容的原生理解,无需依赖外部视觉模型进行模态转换。

三、核心能力特性

3.1 原生多模态能力

Kimi K2.5 实现了视觉-语言联合建模:

  • 视觉知识理解: 基于视觉-语言 token 的预训练,模型在视觉知识问答、跨模态推理方面具备能力
  • 视觉 grounded 工具使用: 能够基于视觉输入进行智能体工具调用,例如根据界面截图执行操作
  • 图像到代码生成: 支持从 UI 设计图、视频工作流直接生成对应代码实现
  • 视频理解: 可处理视频输入并进行内容描述、分析和推理(注:视频对话功能目前仅在官方 API 中提供实验性支持)

3.2 双模式推理系统

K2.5 提供两种互补的推理模式,通过 API 参数进行切换:

思考模式(Thinking Mode):

  • 启用深度推理过程,输出包含 reasoning_content 和最终回答
  • 推荐温度参数:1.0
  • 适用于数学证明、复杂逻辑推理、代码调试等需要逐步分析的任务

即时模式(Instant Mode):

  • 直接生成回答,无显式推理过程
  • 推荐温度参数:0.6
  • 适用于日常对话、简单问答、快速响应场景

用户可通过在 API 请求中设置 extra_body={'thinking': {'type': 'disabled'}} 来切换到即时模式。

3.3 智能体集群(Agent Swarm)

K2.5 引入了从单智能体向多智能体协同的范式转变:

  • 任务分解: 能够自动将复杂任务分解为可并行执行的子任务
  • 动态实例化: 根据任务领域动态创建专门的领域特定智能体
  • 协调执行: 支持最多 100 个子智能体的自组织、协调式执行方案
  • 工具链编排: 可自主编排工具链进行视觉数据处理,实现端到端的自动化工作流

四、训练与优化技术

4.1 持续预训练

K2.5 在 Kimi-K2-Base 基础上进行了持续预训练:

  • 训练数据规模: 约 15 万亿混合视觉与文本 token
  • 数据构成: 包含视觉-语言对齐数据、代码-图像配对数据、多模态对话数据等
  • 训练稳定性: 沿用了 K2 系列的 MuonClip 优化器,实现了大规模训练中的零不稳定现象

4.2 强化学习与对齐

继承了 K2 系列的强化学习技术:

  • 可验证与不可验证奖励结合: 对于数学、编程等可验证任务使用确定性奖励,对于开放式任务采用模型自评判机制
  • rubric-based 评估: 模型作为自身的评判者,为不可验证任务提供可扩展的评分反馈
  • 在线策略更新: 使用可验证奖励的在线 rollout 持续更新评判模型,保持评估准确性与策略同步进化

五、API 使用与部署

5.1 接口兼容性

Kimi K2.5 提供与 OpenAI/Anthropic 兼容的 API 接口,支持以下功能:

  • 标准对话补全: 支持文本、图像、视频输入
  • 工具调用(Tool Calling): 支持 function calling 和外部工具集成
  • 流式输出: 支持 SSE 流式响应
  • 推理过程可见: 思考模式下可通过 reasoning_content 字段获取模型推理过程

5.2 推荐推理参数

根据官方文档建议:

  • top_p: 0.95
  • temperature:思考模式:1.0即时模式:0.6
  • 最大输出长度: 根据任务需求设置(支持最高 8192 tokens)

5.3 部署支持

模型支持主流推理引擎部署:

  • vLLM
  • SGLang
  • KTransformers
  • TensorRT-LLM

推荐硬件配置包括 NVIDIA Hopper(H100、H200)和 Blackwell(B100、B200、GB200)系列 GPU。

六、模型定位与开源策略

6.1 版本演进关系

Kimi K2.5 是 K2 系列的重要迭代,而非全新架构:

  • Kimi K2(2025年7月): 基础 MoE 模型,文本模态,128K 上下文
  • Kimi K2 Thinking(2025年11月): 增加深度推理能力,256K 上下文
  • Kimi K2.5(2026年1月): 整合视觉能力、优化智能体功能,实现多模态统一

6.2 开源许可

K2.5 延续了 Moonshot AI 的开放策略,模型权重托管于 Hugging Face。开源协议为修改版 MIT 许可证,对月活跃用户超过 1 亿或月收入超过 2000 万美元的企业要求标注"Kimi K2"品牌标识。

七、技术局限性与注意事项

根据官方文档披露,当前版本存在以下限制:

  1. 推理效率: 在处理困难推理任务或工具定义不明确时,模型可能生成过量 token,导致输出截断或不完整的工具调用
  2. 工具使用权衡: 在某些任务上启用工具使用可能导致性能下降
  3. 软件开发场景: 单次提示(one-shot prompting)在完成完整软件项目时表现不如基于智能体框架的使用方式
  4. 视频功能: 视频对话功能目前仅在官方 API 中作为实验性功能提供

八、总结

Kimi K2.5 是 Moonshot AI 在开源多模态大模型领域的最新发布。通过保持 1 万亿参数规模的 MoE 架构,同时增加原生视觉理解能力和智能体集群功能,K2.5 在效率与能力之间取得了平衡。其 256K 上下文窗口、双模式推理系统和工具使用能力,使其成为当前开源生态中具备竞争力的通用人工智能基础模型。

该模型的发布体现了 Moonshot AI 在"智能体智能"(Agentic Intelligence)领域的技术路线,展示了中国 AI 公司在模型架构创新、训练效率优化和开源生态建设方面的投入。随着多模态能力和智能体功能的完善,K2.5 为研究人员和开发者提供了一个可扩展、可部署的高性能基础模型选择。

Kimi K2.5

常见问题

Kimi K2.5 是什么模型?

Kimi K2.5 是Moonshot AI于 2026-01-27 发布的多模态大模型。支持文本、图像输入和文本输出,上下文窗口为 256K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

Kimi K2.5 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

Kimi K2.5 的上下文窗口和最大输出是多少?

上下文窗口为 256K,最大输出为 16K。未公开或无法确认的规格不做推测。

Kimi K2.5 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

Kimi K2.5 是否提供 API,价格如何查看?

页面已收录 Moonshot AI 的 5 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

Kimi K2.5 是否开源?

代码与模型权重按 Modified MIT License 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码