DataLearner 标志

Kimi K2 评测详情

Kimi K2 当前已收录的代表性评测结果包括 MMLU(13 / 124,得分 89.50)、MATH-500(12 / 46,得分 97.40)、Creative Writing(36 / 110,得分 1665.70)。

评测结果

Kimi K2

评测结果

思考模式
工具使用

综合知识考试

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
89.50
13 / 124
MMLU-Pro
常规模式
81.10
60 / 177
HLE
常规模式
4.70
231 / 238

抽象归纳与泛化

共 1 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
13.30
206 / 221

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
75.10
159 / 255

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
31
23 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
51.80
97 / 119

数学

共 6 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
97.40
12 / 46
AIME 2024
常规模式
69.60
39 / 61
AIME2025
常规模式
54
95 / 111
7.10
16 / 24
FrontierMath
常规模式
2.10
48 / 61
0.01
71 / 80

算法与竞赛编程

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
53.70
91 / 126
IOI 2025 (Vals v1)
常规模式工具
2
7 / 9
IOI 2024 (Vals v1)
常规模式工具
0.50
10 / 10

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1665.70
36 / 110

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
59.10
24 / 59
Terminal-Bench 1.0
常规模式工具
37.50
15 / 32
Terminal Bench Hard
常规模式工具
15.90
165 / 244

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
26.30
83 / 96

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
思考模式工具
65.80
25 / 31
τ²-Bench
常规模式工具
64.30
29 / 44
τ²-Bench
思考模式工具
64.30
29 / 44

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
48.10
142 / 157