DataLearner logo

Kimi K2 Thinking Benchmark Details

Kimi K2 Thinking currently shows benchmark results led by AIME2025 (1 / 106, score 100), Terminal-Bench (4 / 35, score 47.10), HLE (27 / 185, score 51).

Benchmark Results

Kimi K2 Thinking

Benchmark Results

Thinking
Tool usage
Parallel

General Knowledge

5 evaluations
Benchmark / mode
Score
Rank/total
MMLU Pro
Thinking Mode
84.60
34 / 133
LiveBench
Thinking Mode
61.59
63 / 115
HLE
Thinking Mode
23.90
120 / 185
HLE
Thinking ModeTools
44.90
47 / 185
HLE
Thinking Level · HighTools
51
27 / 185

Other

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Thinking Mode
84.50
106 / 270

Coding and Software Engineer

2 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Thinking Mode
83.10
25 / 127
SWE-bench Verified
Thinking ModeTools
71.30
56 / 114

Math and Reasoning

4 evaluations
Benchmark / mode
Score
Rank/total
AIME2025
Thinking Mode
94.50
27 / 106
AIME2025
Thinking ModeTools
99.10
12 / 106
AIME2025
Thinking Level · HighTools
100
1 / 106
0
72 / 80

Writing and Creative Capabilities

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1627.80
31 / 99

AI Agent - Tool Usage

1 evaluations
Benchmark / mode
Score
Rank/total
Terminal-Bench
Thinking ModeTools
47.10
4 / 35

Common Sense Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Standard Mode
39.60
45 / 67

Agent Level Benchmark

1 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench - Telecom
Thinking ModeTools
93
18 / 35

Instruction Following

1 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Thinking Mode
68
21 / 34

AI Agent - Information Search

1 evaluations
Benchmark / mode
Score
Rank/total
BrowseComp
Thinking ModeTools
60.20
37 / 54

Claw-style Agent Evaluation

1 evaluations
Benchmark / mode
Score
Rank/total
Claw Bench
Thinking ModeTools
82.50
17 / 29