DataLearner 标志

DeepSeek-V3.1 Terminus 评测详情

DeepSeek-V3.1 Terminus 当前已收录的代表性评测结果包括 SimpleQA(2 / 47,得分 96.80)、MMLU Pro(27 / 133,得分 85)、LiveCodeBench(32 / 126,得分 80)。

评测结果

DeepSeek-V3.1 Terminus

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
常规模式
85
27 / 133
MMLU Pro
思考模式
85
27 / 133
HLE
常规模式
21.70
119 / 181
HLE
思考模式
15.20
143 / 181

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
80.70
115 / 224
GPQA Diamond
思考模式
79
124 / 224

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
96.80
2 / 47

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
74.90
42 / 126
LiveCodeBench
思考模式
80
32 / 126
SWE-bench Verified
常规模式
68.40
69 / 114

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
54
85 / 106
AIME2025
思考模式
90
37 / 106

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench
常规模式工具
30
22 / 35
Terminal-Bench
思考模式工具
28
24 / 35

Agent能力评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
37
39 / 43
τ²-Bench
思考模式工具
37
39 / 43