DataLearner 标志
QW

Qwen3.8-Flash-Next

推理大模型编程大模型

Qwen3.8-Flash-Next

别名:Qwen3.8 Flash Next / Qwen 3.8 Flash Next / 千问3.8-Flash-Next

发布时间: 2026-08-26更新于: 2026-08-31浏览量: 1,891
模型参数
1250亿
上下文长度
256K(原生,可扩展至 1M)
多语言支持
支持
推理能力
4/5

Qwen3.8-Flash-Next 是阿里巴巴通义千问团队 2026 年 8 月 26 日发布的开放权重多模态 MoE 模型,官方定位为 Qwen4 架构的实验性预览版:主模型 1250 亿参数、每 token 激活约 60 亿,另有 510 亿 n-gram 嵌入与 40 亿 MTP 参数,采用 Gated DeltaNet 与 Qwen Sparse Attention 的混合注意力。支持文本、图像、视频输入,原生 262K 上下文可经 YaRN 扩展至约 100 万 tokens,思考强度分 low/medium/xhigh 三档并默认 xhigh。官方成绩集中在编程与智能体方向。BF16 权重约 360GB,需多卡服务器或云端部署;许可为附条件商用的 Qwen Community License 1.0,与线上服务 Qwen3.8-Flash 是两个不同的东西。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Qwen3.8-Flash-Next

模型基本信息

推理过程
支持
思考模式
思考水平 · 极高 (Extra-High) (默认)常规模式思考水平 · 低 (Low)思考水平 · 中 (Medium)
上下文长度
256K(原生,可扩展至 1M) tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像、视频 → 文本
发布时间
2026-08-26
模型文件大小
约 360 GB(BF16,131 个 safetensors 分片)
MoE架构
总参数 / 激活参数
1250亿 / 60亿
知识截止
暂无数据
Qwen3.8-Flash-Next

开源和体验地址

代码开源状态
预训练权重开源
Qwen Community License 1.0- 有条件免费商用授权
在线体验
Qwen3.8-Flash-Next

官方介绍与博客

Qwen3.8-Flash-Next

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-¥1.00/ 1M¥3.00/ 1M
international
类型适用条件输入输出
文本-$0.160/ 1M$0.470/ 1M

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Qwen3.8-Flash-Next

评测结果

Qwen3.8-Flash-Next 当前已收录的代表性评测结果包括 LiveCodeBench(3 / 127,得分 91.90)、IF Bench(3 / 35,得分 81.30)、CharXiv RQ(2 / 19,得分 90.60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
极高
35.90
83 / 189

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
91.70
31 / 270

编程与软件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
91.90
3 / 127
81
4 / 28
62.50
10 / 60
DeepSWE
极高工具
58.70
20 / 34
NL2Repo-Bench
极高工具
48.10
10 / 12

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
极高
81.30
3 / 35

AI Agent - 工具使用

共 5 项评测
评测名称 / 模式
得分
排名/总数
AndroidWorld
极高工具
84.50
1 / 1
73.50
6 / 10
ClawEval-MM
极高工具
60.40
2 / 2
OSWorld 2.0
极高工具
52.30
7 / 8
RecreationBench
极高工具
49.90
1 / 1

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
CoWorkBench
极高工具
73.90
2 / 2
Job Bench
极高工具
55.70
4 / 5
Agents' Last Exam
极高工具
24.30
12 / 14

多模态理解

共 8 项评测
评测名称 / 模式
得分
排名/总数
90.60
7 / 12
MathVision
极高工具
95.70
2 / 12
84.60
13 / 19
CharXiv RQ
极高工具
90.60
2 / 19
88.50
1 / 1
LVBench
极高
76.60
4 / 4
ERQA
极高
72.30
2 / 2
Vision2Web
极高工具
64
1 / 1

和其他模型对比

Qwen3.8-Flash-Next

发布机构

Qwen3.8-Flash-Next

模型解读

发布背景:一次面向 Qwen4 的架构预演

Qwen3.8-Flash-Next 由阿里巴巴通义千问团队于 2026 年 8 月 26 日以开放权重形式发布,同步上线 Hugging Face 与 ModelScope。官方对它的定位并不是常规的版本迭代,而是下一代 Qwen4 架构的实验性预览版:团队把注意力机制、残差连接、嵌入层和训练优化器上的一系列改动提前放进一个可下载的模型里,先接受社区检验,再在此基础上构建完整的 Qwen4 系列。官方模型卡把这套改动概括为“对现代大模型核心组件在大规模下如何相互作用的一次重新思考”。

需要和名字相近的 Qwen3.8-Flash 区分开:后者是基于 Flash-Next 构建的线上生产服务,默认提供 100 万 tokens 上下文并内置官方工具;而 Flash-Next 是可下载、可自行部署的权重版本。本页记录的是开放权重版本,因此不套用 Qwen3.8-Flash 的 API 价格表。

架构:混合注意力、稀疏 MoE 与 n-gram 嵌入

主模型总参数量 1250 亿,每个 token 仅激活约 60 亿参数;此外还有官方单独列出的 510 亿 n-gram 嵌入参数和 40 亿多 token 预测(MTP)参数。48 层网络由 12 组重复单元堆叠而成,每组是“3 层 Gated DeltaNet + 1 层 Qwen Sparse Attention(QSA)”。QSA 以微块(micro-block)为粒度筛选上下文中的重要片段,预算为 512 个块、2048 个 token,官方称这一混合设计显著降低了智能体类长上下文任务的延迟。

MoE 部分包含 512 个专家,每个 token 路由到 10 个专家外加 1 个共享专家。残差通路采用四分支的 Gated Residual 设计,用逐元素门控和分支级标量写门控制加宽残差流上的读写,官方给出的理由是在提升表达能力的同时保持训练稳定。n-gram 嵌入则是一种通过短 n-gram 索引扩展参数量的方式,目标是在显存受限的加速器上以较低代价扩大模型容量。训练侧,Muon 与 AdamW 被分配给不同的参数组,配合重新拟合的 scaling law,取消了传统的 batch size warmup 并支持更大的学习率。

上下文、模态与思考档位

模型接受文本、图像和视频输入,输出文本。原生上下文长度为 262,144 tokens,可通过 YaRN 扩展到约 100 万 tokens。在 1M 上下文部署下,官方建议为思考内容预留至多 262,144 tokens,最终回答上限 131,072 tokens。思考模式默认开启,可用 enable_thinking=false 关闭;推理强度提供 low / medium / xhigh 三档,默认 xhigh。

官方评测:重心在编程与智能体

官方公布的成绩集中在编程与智能体方向:DeepSWE 1.1 为 58.7,SWE-bench Pro 62.5,SWE-bench Multilingual 81.0,NL2Repo-Bench 48.1,LiveCodeBench v6 91.9;长周期办公与工具任务方面,CoWorkBench 73.9,JobBench 55.7,Toolathlon Verified 73.5,Agents' Last Exam Pass@1 24.3。通用推理上,GPQA Diamond 91.7,HLE 35.9,IFBench 81.3。多模态方面,AndroidWorld 84.5、RealWorldQA 88.5、LVBench 76.6、ERQA 72.3、Vision2Web 64.0、OSWorld 2.0 部分完成分 52.3、RecreationBench 49.9、ClawEval-MM 平均 60.4;MathVision 在不带代码解释器时为 90.6、带解释器时 95.7,CharXiv (RQ) 对应 84.6 与 90.6。官方模型卡称其成绩可与 Claude Opus 4.6、Qwen3.7-Plus 等规模更大的系统相比较。

阅读这些数字时要注意口径:以上均为厂商自测结果,且编程与智能体类项目在 xhigh 思考档位、带工具环境下取得,MathVision 与 CharXiv 明确区分了有无代码解释器,不能与无工具成绩直接混用。

权重规模与部署

标准 BF16 权重约 360 GB,分为 131 个 safetensors 分片,这意味着它不是消费级单卡或个人电脑能够承载的模型,实际部署通常需要多卡服务器或云端环境。官方文档给出了 Transformers、SGLang、vLLM、TokenSpeed 和 llama.cpp 的支持说明。若不打算自建推理集群,可以通过 Qwen Cloud 的托管 API 使用,QwenWork 的 Standard 模式也基于该模型。

许可:可商用,但附带条件

权重采用 Qwen Community License 1.0,允许使用、修改、分发、部署、托管与微调,但附带若干条件:月活跃用户超过 1 亿或月收入超过 2000 万美元的商业产品与服务,须显著标注模型名称;以编码或办公生产力为核心的商业 MaaS(模型即服务)业务和 AI 工作助手业务,需要另行获得 Qwen 的授权。内部使用以及许可中明确排除的情形另作规定。落地前建议按自身的产品规模与业务形态逐条核对许可原文。

官方资料

Qwen3.8-Flash-Next

常见问题

Qwen3.8-Flash-Next 和 Qwen3.8-Flash 有什么区别?

Qwen3.8-Flash 是基于 Flash-Next 构建的线上生产服务,默认提供 100 万 tokens 上下文并内置官方工具;Flash-Next 则是可下载、可自行部署的开放权重版本。本页记录的是开放权重版本,因此不列 Qwen3.8-Flash 的 API 价格。

为什么说它是 Qwen4 的预览版?

官方把它定位为下一代 Qwen4 架构的实验性预览:混合注意力(Gated DeltaNet + Qwen Sparse Attention)、四分支 Gated Residual、n-gram 嵌入以及 Muon/AdamW 分组优化等改动先在这一模型上验证,之后再用于构建完整的 Qwen4 系列。

参数量和激活参数是多少?

主模型总参数 1250 亿,每个 token 激活约 60 亿。官方另外单独列出 510 亿 n-gram 嵌入参数和 40 亿多 token 预测(MTP)参数,这两部分不计入主模型参数量。MoE 部分有 512 个专家,每 token 路由 10 个专家加 1 个共享专家。

支持多长上下文?可以关闭思考吗?

原生上下文 262,144 tokens,可通过 YaRN 扩展到约 100 万 tokens,最终回答建议上限 131,072 tokens。思考默认开启,可用 enable_thinking=false 关闭;推理强度提供 low、medium、xhigh 三档,默认 xhigh。

自己部署需要什么条件?

标准 BF16 权重约 360 GB、131 个 safetensors 分片,个人电脑和消费级单卡无法承载,实际需要多卡服务器或云端环境。官方给出了 Transformers、SGLang、vLLM、TokenSpeed 和 llama.cpp 的支持说明;不自建集群的话可以走 Qwen Cloud 托管 API。

可以商用吗?

Qwen Community License 1.0 允许商用,但附带条件:月活超过 1 亿或月收入超过 2000 万美元的产品须显著标注模型名称;以编码或办公生产力为核心的商业 MaaS 业务和 AI 工作助手业务需要另行获得 Qwen 授权。落地前应按自身规模和业务形态核对许可原文。

页面上的评测成绩是什么口径?

目前收录的成绩来自官方模型卡,属于厂商自测。编程与智能体类项目在 xhigh 思考档位、带工具环境下取得,MathVision 与 CharXiv 区分了有无代码解释器,因此不能与无工具成绩直接混用,选型时建议结合独立评测和自己的真实任务测试。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码