DataLearner 标志

DeepSeek-V4-Flash 评测详情

DeepSeek-V4-Flash 当前已收录的代表性评测结果包括 LiveCodeBench(5 / 127,得分 91.60)、MMLU Pro(17 / 133,得分 86.40)、CodeForces(3 / 20,得分 3052)。本页还提供与 3 个竞品模型及 2 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

DeepSeek-V4-Flash

评测结果

思考模式
工具使用

综合评估

共 9 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
常规模式
83
46 / 133
86.40
17 / 133
MMLU Pro
最高
86.20
18 / 133
LiveBench
常规模式
67.25
49 / 115
HLE
常规模式
8.10
172 / 189
HLE
29.40
104 / 189
HLE
工具
40.30
71 / 189
HLE
最高
34.80
85 / 189
HLE
思考水平·极高工具
45.10
49 / 189

科学与综合推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
71.20
188 / 270
87.40
76 / 270
88.10
67 / 270

编程与软件工程

共 18 项评测
评测名称 / 模式
得分
排名/总数
2816
5 / 20
3052
3 / 20
1576.54
6 / 35
LiveCodeBench
常规模式
55.20
87 / 127
88.40
11 / 127
91.60
5 / 127
SWE-bench Verified
常规模式工具
73.70
45 / 115
78.60
23 / 115
SWE-bench Verified
思考水平·极高工具
79
20 / 115
SWE-bench Multilingual
常规模式工具
69.70
22 / 28
70.20
20 / 28
SWE-bench Multilingual
思考水平·极高工具
73.30
15 / 28
DeepSWE
最高工具
54.40
22 / 34
NL2Repo-Bench
最高工具
54.20
8 / 12
SWE-Bench Pro - Public
常规模式工具
49.10
49 / 60
52.30
41 / 60
SWE-Bench Pro - Public
思考水平·极高工具
52.60
39 / 60
WeirdML v2
工具
43.76
44 / 52

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1555.70
46 / 106

常识推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
61.10
27 / 92
SimpleBench
常规模式
46.30
55 / 92

AI Agent - 信息收集

共 2 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
工具
53.50
43 / 58
BrowseComp
思考水平·极高工具
73.20
31 / 58

AI Agent - 工具使用

共 6 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
最高工具
82.70
21 / 49
CyberGym
最高工具
76.70
4 / 5
70.30
10 / 10
Terminal Bench 2.0
常规模式工具
49.10
36 / 48
56.60
28 / 48
Terminal Bench 2.0
思考水平·极高工具
56.90
26 / 48

文本向量检索

共 2 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
26.47
117 / 126
Context Arena
开启思考
69.42
66 / 126

数学推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
IMO-AnswerBench
常规模式
41.90
23 / 24
85.10
12 / 24
88.40
7 / 24

生产力知识

共 2 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
思考水平·极高工具
1395
6 / 21
AutomationBench
最高工具
25.10
15 / 16

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
25.20
11 / 14

竞品对比

DeepSeek-V4-Flash 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项DeepSeek-V4-Flash当前GLM 5.1Qwen3.6-27BGemini 3.5 Flash
HLE
Accuracy
综合评估
45.10思考水平·极高 | 工具
52.30开启思考 | 工具
24.00开启思考
40.20思考水平·高 | 工具
LiveBench
Accuracy
综合评估
67.25常规模式
70.18常规模式
65.56常规模式
75.02思考水平·高
MMLU Pro
Accuracy
综合评估
86.40思考水平·高
--
86.20开启思考
--
GPQA Diamond
Accuracy
科学与综合推理
88.10思考水平·高
86.20开启思考
87.80开启思考
92.80思考水平·高
DeepSWE
Pass@1 (DeepSWE v1.1)
编程与软件工程
54.40思考水平·高 | 工具
--
--
37.00思考水平·中 | 工具
LiveCodeBench
Pass @K
编程与软件工程
91.60思考水平·高
--
83.90开启思考
--
SWE-bench Multilingual
Accuracy
编程与软件工程
73.30思考水平·极高 | 工具
--
71.30开启思考 | 工具
--
SWE-Bench Pro - Public
Accuracy
编程与软件工程
52.60思考水平·极高 | 工具
58.40开启思考 | 工具
53.50开启思考 | 工具
55.10思考水平·高 | 工具
SWE-bench Verified
Accuracy
编程与软件工程
79.00思考水平·极高 | 工具
--
77.20开启思考 | 工具
--
Text Arena (Coding)
Arena Score
编程与软件工程
1576.54思考水平·高
1534.00常规模式
--
--
WeirdML v2
Average accuracy across 17 tasks (%)
编程与软件工程
43.76思考水平·高 | 工具
57.10常规模式 | 工具
--
--
Creative Writing
Elo、大模型评判两两对战
写作和创作
1555.70常规模式
1589.20常规模式
--
--
其余 6 个 benchmark 仍可在上方图表中查看。

DeepSeek-V4-Flash 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
DeepSeek-V4-Flash
DeepSeek-AI$0.14 / 1M tokens$0.28 / 1M tokens
GLM 5.1
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens
Gemini 3.5 Flash
DeepMind$1.5 / 1M tokens$9 / 1M tokens

历代版本对比

DeepSeek-V4-Flash 系列各版本的评测成绩纵向对比

DeepSeek-V4-FlashDeepSeek V4DeepSeek V3.2
评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

10 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项DeepSeek-V4-Flash当前DeepSeek V3.2
HLE
Accuracy
综合评估
45.10思考水平·极高 | 工具
25.10开启思考
LiveBench
Accuracy
综合评估
67.25常规模式
62.20开启思考
GPQA Diamond
Accuracy
科学与综合推理
88.10思考水平·高
82.40开启思考
CodeForces
Accuracy
编程与软件工程
3052.00思考水平·高
2386.00开启思考
LiveCodeBench
Pass @K
编程与软件工程
91.60思考水平·高
83.30开启思考
SWE-Bench Pro - Public
Accuracy
编程与软件工程
52.60思考水平·极高 | 工具
40.90开启思考
SWE-bench Verified
Accuracy
编程与软件工程
79.00思考水平·极高 | 工具
73.10开启思考 | 工具
Creative Writing
Elo、大模型评判两两对战
写作和创作
1555.70常规模式
1511.20常规模式
BrowseComp
Accuracy
AI Agent - 信息收集
73.20思考水平·极高 | 工具
51.40开启思考
Terminal Bench 2.0
Accuracy
AI Agent - 工具使用
56.90思考水平·极高 | 工具
46.40开启思考 | 工具

单评测历史趋势图

当前查看:HLE · 综合评估

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

DeepSeek-V4-Flash 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
DeepSeek-V4-Flash
DeepSeek-AI$0.14 / 1M tokens$0.28 / 1M tokens
DeepSeek V3.2
DeepSeek-AI$0.28 / 1M tokens$0.42 / 1M tokens