DataLearner logo

DeepSeek-V3.1 Terminus Benchmark Details

DeepSeek-V3.1 Terminus currently shows benchmark results led by SimpleQA (2 / 47, score 96.80), MMLU Pro (27 / 133, score 85), LiveCodeBench (33 / 127, score 80).

Benchmark Results

DeepSeek-V3.1 Terminus

Benchmark Results

Thinking
Tool usage

General Knowledge

4 evaluations
Benchmark / mode
Score
Rank/total
MMLU Pro
Standard Mode
85
27 / 133
MMLU Pro
Thinking Mode
85
27 / 133
HLE
Standard Mode
21.70
123 / 185
HLE
Thinking Mode
15.20
147 / 185

Other

2 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
80.70
140 / 270
GPQA Diamond
Thinking Mode
79
150 / 270

Common Sense

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleQA
Standard Mode
96.80
2 / 47

Coding and Software Engineer

3 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Standard Mode
74.90
43 / 127
LiveCodeBench
Thinking Mode
80
33 / 127
SWE-bench Verified
Standard Mode
68.40
69 / 114

Math and Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
AIME2025
Standard Mode
54
85 / 106
AIME2025
Thinking Mode
90
37 / 106

AI Agent - Tool Usage

2 evaluations
Benchmark / mode
Score
Rank/total
Terminal-Bench
Standard ModeTools
30
22 / 35
Terminal-Bench
Thinking ModeTools
28
24 / 35

Agent Level Benchmark

2 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench
Standard ModeTools
37
39 / 43
τ²-Bench
Thinking ModeTools
37
39 / 43