本页把 Qwen3.8-Flash-Next 与三类参照对象放在一起看:同家族的开放权重小杯 Qwen3.8-27B,用来判断这套新架构相对同代常规模型的增量;同为“快”档定位的 DeepSeek-V4-Flash,属于最直接的同档竞品;以及闭源旗舰 Claude Opus 4.6,用作能力上限的参照。下面只讨论双方都有分数的项目,并在每一节标明测试口径。
相对同代 Qwen3.8-27B:编程与智能体是主要增量
在两者共有的项目上,Qwen3.8-Flash-Next 全面领先,但领先幅度分布很不均匀:
- DeepSWE:58.7 对 42.2(+16.5)
- NL2Repo-Bench:48.1 对 42.3(+5.8)
- LiveCodeBench v6:91.9 对 90.3(+1.6)
- SWE-bench Pro:62.5 对 61.7(+0.8)
- MathVision:90.6 对 90.0;带代码解释器时 95.7 对 94.6
差距最大的 DeepSWE 是需要模型在真实仓库里连续操作工具的智能体式评测,而差距最小的 LiveCodeBench 与 SWE-bench Pro 更接近单轮或短流程的代码能力考察。这一分布与官方对该架构的说明方向一致——混合注意力与稀疏注意力的组合主要为长上下文智能体负载服务;换句话说,这次架构改动在“长流程、多轮工具调用”上的收益,明显大于在纯代码生成上的收益。MathVision 上不足 1 分的差距则说明,视觉数学推理并不是这一代架构改动的受益方向。
相对 DeepSeek-V4-Flash:软件工程强,仓库级生成弱
同为面向效率的“快”档模型,两者在四个共有项目上互有胜负:
- SWE-bench Pro:62.5 对 52.6(+9.9)
- SWE-bench Multilingual:81.0 对 73.3(+7.7)
- DeepSWE:58.7 对 54.4(+4.3)
- NL2Repo-Bench:48.1 对 54.2(−6.1)
三项 SWE 系列评测考察的是在既有代码库中定位并修复问题,Qwen3.8-Flash-Next 的优势稳定,其中多语言场景(SWE-bench Multilingual)的领先幅度尤其值得注意。唯一落后的 NL2Repo-Bench 方向相反——它考察的是从自然语言描述出发生成整个仓库。因此如果任务是在存量项目上改 bug、补功能,这里的数据更支持 Qwen3.8-Flash-Next;如果是从零搭建完整项目骨架,DeepSeek-V4-Flash 在这一项上暂时更好。四项均在 xhigh 思考档位、带工具的智能体环境下取得。
相对 Claude Opus 4.6:科学推理接近,指令遵循仍有差距
与闭源旗舰的对比出现了明显的两极分化(四项均为无工具口径):
- GPQA Diamond:91.7 对 91.31
- HLE:35.9 对 34.44
- LiveCodeBench v6:91.9 对 76.0
- IFBench:81.3 对 94.0
前两项几乎持平,说明在研究生级科学问答和高难度综合题上,这个每 token 只激活约 60 亿参数的模型已经能贴近旗舰水准。LiveCodeBench 上 15.9 分的领先幅度较大,但该项属于竞赛式编程题,训练数据的覆盖与评测版本差异都会明显影响结果,不宜直接外推到工程实践。真正需要留意的是 IFBench 落后 12.7 分:这项考察的是对复杂、多重约束指令的遵循能力,而这恰恰是把模型接入自动化流程时最影响可靠性的一环。也就是说,在“会不会做”上两者已经接近,在“按要求做”上差距依然存在。
口径与数据限制
- 本页成绩以厂商官方公布数据为主,不是同一套第三方 harness 下的复测结果,不同模型的推理档位、工具配置和评测版本可能并不一致。
- Qwen3.8-Flash-Next 的编程与智能体类成绩(DeepSWE、SWE-bench 系列、NL2Repo-Bench)在默认 xhigh 思考档位、带工具的智能体环境下取得;GPQA Diamond、HLE、LiveCodeBench、IFBench 为无工具口径;MathVision 与 CharXiv 分别给出了带/不带代码解释器两组分数。带工具与不带工具的成绩不能直接比较。
- 与前代 Qwen3.7-Plus 目前没有足够的共有评测项目,暂不做直接对比。
- 选型时建议把这些分数当作方向性参考,并在自己的真实任务上做一次小规模验证。