DataLearner 标志

DeepSeek-V3.1 Terminus 评测详情

DeepSeek-V3.1 Terminus 当前已收录的代表性评测结果包括 SimpleQA(2 / 46,得分 96.80)、MMLU-Pro(28 / 177,得分 85)、LiveCodeBench(34 / 126,得分 80)。

评测结果

DeepSeek-V3.1 Terminus

评测结果

思考模式
工具使用

综合知识考试

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
常规模式
85
28 / 177
MMLU-Pro
思考模式
85
28 / 177
HLE
常规模式
21.70
152 / 240
HLE
思考模式
15.20
182 / 240

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
80.70
129 / 255
GPQA Diamond
思考模式
79
139 / 255
CritPt
思考模式
1.70
135 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
96.80
2 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
68.40
72 / 119

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
74.90
44 / 126
LiveCodeBench
思考模式
80
34 / 126

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
54
95 / 111
AIME2025
思考模式
90
41 / 111

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 1.0
常规模式工具
36.70
18 / 32
Terminal-Bench 1.0
思考模式工具
28
24 / 32
Terminal Bench Hard
常规模式工具
31.80
100 / 244
Terminal Bench Hard
思考模式工具
30.30
110 / 244

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
37
40 / 44
τ²-Bench
思考模式工具
37
40 / 44
τ³-Banking
思考模式工具
21
88 / 167

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考模式
38
115 / 134

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考模式
5.40
98 / 122