DataLearner 标志

DeepSeek-V3.1 评测详情

DeepSeek-V3.1 当前已收录的代表性评测结果包括 MMLU(1 / 124,得分 93.40)、SimpleQA(4 / 47,得分 93.40)、AIME 2024(7 / 62,得分 93.10)。

评测结果

DeepSeek-V3.1

评测结果

思考模式
工具使用

综合评估

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
91.80
4 / 124
MMLU
思考模式
93.40
1 / 124
MMLU Pro
常规模式
83.70
44 / 134
MMLU Pro
思考模式
85
27 / 134
HLE
思考模式
15.90
156 / 197

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
74.90
175 / 274
GPQA Diamond
思考模式
80.10
146 / 274

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
思考模式
93.40
4 / 47

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
56.40
84 / 128
LiveCodeBench
思考模式
74.80
44 / 128
SWE-bench Verified
常规模式
66
76 / 116

数学推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
AIME 2024
常规模式
66.30
40 / 62
AIME 2024
思考模式
93.10
7 / 62
AIME2025
常规模式
49.80
88 / 107
AIME2025
思考模式
88.40
42 / 107

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1433.20
57 / 106

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench
常规模式工具
31.30
19 / 35

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
40
68 / 94