DataLearner 标志

Qwen3.8-Flash-Next 评测深度分析

与同代开放权重的 Qwen3.8-27B 相比,Qwen3.8-Flash-Next 在共有项目上全面领先,且增量集中在 DeepSWE 这类多轮工具调用的智能体任务;与同档竞品 DeepSeek-V4-Flash 相比,它在 SWE-bench 系列的存量代码库修复上稳定占优,但在从零生成整个仓库的 NL2Repo-Bench 上落后;与闭源旗舰 Claude Opus 4.6 相比,GPQA Diamond 与 HLE 已基本持平,LiveCodeBench 明显更高,但复杂指令遵循(IFBench)仍落后约 12.7 分。所有成绩来自厂商公布数据,带工具与不带工具的口径需分开看。

本页把 Qwen3.8-Flash-Next 与三类参照对象放在一起看:同家族的开放权重小杯 Qwen3.8-27B,用来判断这套新架构相对同代常规模型的增量;同为“快”档定位的 DeepSeek-V4-Flash,属于最直接的同档竞品;以及闭源旗舰 Claude Opus 4.6,用作能力上限的参照。下面只讨论双方都有分数的项目,并在每一节标明测试口径。

相对同代 Qwen3.8-27B:编程与智能体是主要增量

在两者共有的项目上,Qwen3.8-Flash-Next 全面领先,但领先幅度分布很不均匀:

  • DeepSWE:58.7 对 42.2(+16.5)
  • NL2Repo-Bench:48.1 对 42.3(+5.8)
  • LiveCodeBench v6:91.9 对 90.3(+1.6)
  • SWE-bench Pro:62.5 对 61.7(+0.8)
  • MathVision:90.6 对 90.0;带代码解释器时 95.7 对 94.6

差距最大的 DeepSWE 是需要模型在真实仓库里连续操作工具的智能体式评测,而差距最小的 LiveCodeBench 与 SWE-bench Pro 更接近单轮或短流程的代码能力考察。这一分布与官方对该架构的说明方向一致——混合注意力与稀疏注意力的组合主要为长上下文智能体负载服务;换句话说,这次架构改动在“长流程、多轮工具调用”上的收益,明显大于在纯代码生成上的收益。MathVision 上不足 1 分的差距则说明,视觉数学推理并不是这一代架构改动的受益方向。

相对 DeepSeek-V4-Flash:软件工程强,仓库级生成弱

同为面向效率的“快”档模型,两者在四个共有项目上互有胜负:

  • SWE-bench Pro:62.5 对 52.6(+9.9)
  • SWE-bench Multilingual:81.0 对 73.3(+7.7)
  • DeepSWE:58.7 对 54.4(+4.3)
  • NL2Repo-Bench:48.1 对 54.2(−6.1)

三项 SWE 系列评测考察的是在既有代码库中定位并修复问题,Qwen3.8-Flash-Next 的优势稳定,其中多语言场景(SWE-bench Multilingual)的领先幅度尤其值得注意。唯一落后的 NL2Repo-Bench 方向相反——它考察的是从自然语言描述出发生成整个仓库。因此如果任务是在存量项目上改 bug、补功能,这里的数据更支持 Qwen3.8-Flash-Next;如果是从零搭建完整项目骨架,DeepSeek-V4-Flash 在这一项上暂时更好。四项均在 xhigh 思考档位、带工具的智能体环境下取得。

相对 Claude Opus 4.6:科学推理接近,指令遵循仍有差距

与闭源旗舰的对比出现了明显的两极分化(四项均为无工具口径):

  • GPQA Diamond:91.7 对 91.31
  • HLE:35.9 对 34.44
  • LiveCodeBench v6:91.9 对 76.0
  • IFBench:81.3 对 94.0

前两项几乎持平,说明在研究生级科学问答和高难度综合题上,这个每 token 只激活约 60 亿参数的模型已经能贴近旗舰水准。LiveCodeBench 上 15.9 分的领先幅度较大,但该项属于竞赛式编程题,训练数据的覆盖与评测版本差异都会明显影响结果,不宜直接外推到工程实践。真正需要留意的是 IFBench 落后 12.7 分:这项考察的是对复杂、多重约束指令的遵循能力,而这恰恰是把模型接入自动化流程时最影响可靠性的一环。也就是说,在“会不会做”上两者已经接近,在“按要求做”上差距依然存在。

口径与数据限制

  • 本页成绩以厂商官方公布数据为主,不是同一套第三方 harness 下的复测结果,不同模型的推理档位、工具配置和评测版本可能并不一致。
  • Qwen3.8-Flash-Next 的编程与智能体类成绩(DeepSWE、SWE-bench 系列、NL2Repo-Bench)在默认 xhigh 思考档位、带工具的智能体环境下取得;GPQA Diamond、HLE、LiveCodeBench、IFBench 为无工具口径;MathVision 与 CharXiv 分别给出了带/不带代码解释器两组分数。带工具与不带工具的成绩不能直接比较。
  • 与前代 Qwen3.7-Plus 目前没有足够的共有评测项目,暂不做直接对比。
  • 选型时建议把这些分数当作方向性参考,并在自己的真实任务上做一次小规模验证。

评测结果

Qwen3.8-Flash-Next

评测结果

思考模式
工具使用

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
极高
35.90
78 / 183

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
91.70
27 / 225

编程与软件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
91.90
3 / 127
81
3 / 26
62.50
9 / 58
DeepSWE
极高工具
58.70
16 / 30
NL2Repo-Bench
极高工具
48.10
8 / 10

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
极高
81.30
3 / 34

AI Agent - 工具使用

共 5 项评测
评测名称 / 模式
得分
排名/总数
AndroidWorld
极高工具
84.50
1 / 1
73.50
4 / 7
ClawEval-MM
极高工具
60.40
1 / 1
OSWorld 2.0
极高工具
52.30
4 / 5
RecreationBench
极高工具
49.90
1 / 1

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
CoWorkBench
极高工具
73.90
1 / 1
Job Bench
极高工具
55.70
1 / 2
Agents' Last Exam
极高工具
24.30
12 / 13

多模态理解

共 8 项评测
评测名称 / 模式
得分
排名/总数
90.60
7 / 12
MathVision
极高工具
95.70
2 / 12
84.60
12 / 18
CharXiv RQ
极高工具
90.60
2 / 18
88.50
1 / 1
LVBench
极高
76.60
2 / 2
ERQA
极高
72.30
1 / 1
Vision2Web
极高工具
64
1 / 1

竞品对比

Qwen3.8-Flash-Next 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

11 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项Qwen3.8-Flash-Next当前Qwen3.8-27BDeepSeek-V4-Flash
HLE
综合评估
35.90思考水平·极高
30.80开启思考
45.10思考水平·极高 | 工具
GPQA Diamond
科学与综合推理
91.70思考水平·极高
89.20开启思考
88.10思考水平·高
DeepSWE
编程与软件工程
58.70思考水平·极高 | 工具
42.20开启思考 | 工具
54.40思考水平·高 | 工具
LiveCodeBench
编程与软件工程
91.90思考水平·极高
90.30开启思考
91.60思考水平·高
NL2Repo-Bench
编程与软件工程
48.10思考水平·极高 | 工具
42.30开启思考 | 工具
54.20思考水平·高 | 工具
SWE-bench Multilingual
编程与软件工程
81.00思考水平·极高 | 工具
--
73.30思考水平·极高 | 工具
SWE-Bench Pro - Public
编程与软件工程
62.50思考水平·极高 | 工具
61.70开启思考 | 工具
52.60思考水平·极高 | 工具
Toolathlon-Verified
AI Agent - 工具使用
73.50思考水平·极高 | 工具
--
70.30思考水平·高 | 工具
Agents' Last Exam
Agent能力评测
24.30思考水平·极高 | 工具
20.40开启思考 | 工具
25.20思考水平·高 | 工具
CharXiv RQ
多模态理解
90.60思考水平·极高 | 工具
90.20开启思考 | 工具
--
MathVision
多模态理解
95.70思考水平·极高 | 工具
94.60开启思考 | 工具
--

Qwen3.8-Flash-Next 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
DeepSeek-V4-Flash
DeepSeek-AI$0.14 / 1M tokens$0.28 / 1M tokens

历代版本对比

Qwen3.8-Flash-Next 系列各版本的评测成绩纵向对比

Qwen3.8-Flash-NextQwen3.7-Plus
当前筛选暂无评测数据。

Qwen3.8-Flash-Next 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · CNY / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

Qwen3.7-Plus: 标准价适用于 <= 256000
模型供应商标准输入标准输出标准价适用于
Qwen3.7-Plus
阿里巴巴¥2 / 1M tokens¥8 / 1M tokens<= 256000

数据来源