Qwen3.8-Flash-Next 和 Qwen3.8-Flash 有什么区别?
Qwen3.8-Flash 是基于 Flash-Next 构建的线上生产服务,默认提供 100 万 tokens 上下文并内置官方工具;Flash-Next 则是可下载、可自行部署的开放权重版本。本页记录的是开放权重版本,因此不列 Qwen3.8-Flash 的 API 价格。
Qwen3.8-Flash-Next
别名:Qwen3.8 Flash Next / Qwen 3.8 Flash Next / 千问3.8-Flash-Next
Qwen3.8-Flash-Next 是阿里巴巴通义千问团队 2026 年 8 月 26 日发布的开放权重多模态 MoE 模型,官方定位为 Qwen4 架构的实验性预览版:主模型 1250 亿参数、每 token 激活约 60 亿,另有 510 亿 n-gram 嵌入与 40 亿 MTP 参数,采用 Gated DeltaNet 与 Qwen Sparse Attention 的混合注意力。支持文本、图像、视频输入,原生 262K 上下文可经 YaRN 扩展至约 100 万 tokens,思考强度分 low/medium/xhigh 三档并默认 xhigh。官方成绩集中在编程与智能体方向。BF16 权重约 360GB,需多卡服务器或云端部署;许可为附条件商用的 Qwen Community License 1.0,与线上服务 Qwen3.8-Flash 是两个不同的东西。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Qwen3.8-Flash-Next 当前已收录的代表性评测结果包括 LiveCodeBench(3 / 127,得分 91.90)、IF Bench(3 / 35,得分 81.30)、CharXiv RQ(2 / 19,得分 90.60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Qwen3.8-Flash-Next 由阿里巴巴通义千问团队于 2026 年 8 月 26 日以开放权重形式发布,同步上线 Hugging Face 与 ModelScope。官方对它的定位并不是常规的版本迭代,而是下一代 Qwen4 架构的实验性预览版:团队把注意力机制、残差连接、嵌入层和训练优化器上的一系列改动提前放进一个可下载的模型里,先接受社区检验,再在此基础上构建完整的 Qwen4 系列。官方模型卡把这套改动概括为“对现代大模型核心组件在大规模下如何相互作用的一次重新思考”。
需要和名字相近的 Qwen3.8-Flash 区分开:后者是基于 Flash-Next 构建的线上生产服务,默认提供 100 万 tokens 上下文并内置官方工具;而 Flash-Next 是可下载、可自行部署的权重版本。本页记录的是开放权重版本,因此不套用 Qwen3.8-Flash 的 API 价格表。
主模型总参数量 1250 亿,每个 token 仅激活约 60 亿参数;此外还有官方单独列出的 510 亿 n-gram 嵌入参数和 40 亿多 token 预测(MTP)参数。48 层网络由 12 组重复单元堆叠而成,每组是“3 层 Gated DeltaNet + 1 层 Qwen Sparse Attention(QSA)”。QSA 以微块(micro-block)为粒度筛选上下文中的重要片段,预算为 512 个块、2048 个 token,官方称这一混合设计显著降低了智能体类长上下文任务的延迟。
MoE 部分包含 512 个专家,每个 token 路由到 10 个专家外加 1 个共享专家。残差通路采用四分支的 Gated Residual 设计,用逐元素门控和分支级标量写门控制加宽残差流上的读写,官方给出的理由是在提升表达能力的同时保持训练稳定。n-gram 嵌入则是一种通过短 n-gram 索引扩展参数量的方式,目标是在显存受限的加速器上以较低代价扩大模型容量。训练侧,Muon 与 AdamW 被分配给不同的参数组,配合重新拟合的 scaling law,取消了传统的 batch size warmup 并支持更大的学习率。
模型接受文本、图像和视频输入,输出文本。原生上下文长度为 262,144 tokens,可通过 YaRN 扩展到约 100 万 tokens。在 1M 上下文部署下,官方建议为思考内容预留至多 262,144 tokens,最终回答上限 131,072 tokens。思考模式默认开启,可用 enable_thinking=false 关闭;推理强度提供 low / medium / xhigh 三档,默认 xhigh。
官方公布的成绩集中在编程与智能体方向:DeepSWE 1.1 为 58.7,SWE-bench Pro 62.5,SWE-bench Multilingual 81.0,NL2Repo-Bench 48.1,LiveCodeBench v6 91.9;长周期办公与工具任务方面,CoWorkBench 73.9,JobBench 55.7,Toolathlon Verified 73.5,Agents' Last Exam Pass@1 24.3。通用推理上,GPQA Diamond 91.7,HLE 35.9,IFBench 81.3。多模态方面,AndroidWorld 84.5、RealWorldQA 88.5、LVBench 76.6、ERQA 72.3、Vision2Web 64.0、OSWorld 2.0 部分完成分 52.3、RecreationBench 49.9、ClawEval-MM 平均 60.4;MathVision 在不带代码解释器时为 90.6、带解释器时 95.7,CharXiv (RQ) 对应 84.6 与 90.6。官方模型卡称其成绩可与 Claude Opus 4.6、Qwen3.7-Plus 等规模更大的系统相比较。
阅读这些数字时要注意口径:以上均为厂商自测结果,且编程与智能体类项目在 xhigh 思考档位、带工具环境下取得,MathVision 与 CharXiv 明确区分了有无代码解释器,不能与无工具成绩直接混用。
标准 BF16 权重约 360 GB,分为 131 个 safetensors 分片,这意味着它不是消费级单卡或个人电脑能够承载的模型,实际部署通常需要多卡服务器或云端环境。官方文档给出了 Transformers、SGLang、vLLM、TokenSpeed 和 llama.cpp 的支持说明。若不打算自建推理集群,可以通过 Qwen Cloud 的托管 API 使用,QwenWork 的 Standard 模式也基于该模型。
权重采用 Qwen Community License 1.0,允许使用、修改、分发、部署、托管与微调,但附带若干条件:月活跃用户超过 1 亿或月收入超过 2000 万美元的商业产品与服务,须显著标注模型名称;以编码或办公生产力为核心的商业 MaaS(模型即服务)业务和 AI 工作助手业务,需要另行获得 Qwen 的授权。内部使用以及许可中明确排除的情形另作规定。落地前建议按自身的产品规模与业务形态逐条核对许可原文。
Qwen3.8-Flash 是基于 Flash-Next 构建的线上生产服务,默认提供 100 万 tokens 上下文并内置官方工具;Flash-Next 则是可下载、可自行部署的开放权重版本。本页记录的是开放权重版本,因此不列 Qwen3.8-Flash 的 API 价格。
官方把它定位为下一代 Qwen4 架构的实验性预览:混合注意力(Gated DeltaNet + Qwen Sparse Attention)、四分支 Gated Residual、n-gram 嵌入以及 Muon/AdamW 分组优化等改动先在这一模型上验证,之后再用于构建完整的 Qwen4 系列。
主模型总参数 1250 亿,每个 token 激活约 60 亿。官方另外单独列出 510 亿 n-gram 嵌入参数和 40 亿多 token 预测(MTP)参数,这两部分不计入主模型参数量。MoE 部分有 512 个专家,每 token 路由 10 个专家加 1 个共享专家。
原生上下文 262,144 tokens,可通过 YaRN 扩展到约 100 万 tokens,最终回答建议上限 131,072 tokens。思考默认开启,可用 enable_thinking=false 关闭;推理强度提供 low、medium、xhigh 三档,默认 xhigh。
标准 BF16 权重约 360 GB、131 个 safetensors 分片,个人电脑和消费级单卡无法承载,实际需要多卡服务器或云端环境。官方给出了 Transformers、SGLang、vLLM、TokenSpeed 和 llama.cpp 的支持说明;不自建集群的话可以走 Qwen Cloud 托管 API。
Qwen Community License 1.0 允许商用,但附带条件:月活超过 1 亿或月收入超过 2000 万美元的产品须显著标注模型名称;以编码或办公生产力为核心的商业 MaaS 业务和 AI 工作助手业务需要另行获得 Qwen 授权。落地前应按自身规模和业务形态核对许可原文。
目前收录的成绩来自官方模型卡,属于厂商自测。编程与智能体类项目在 xhigh 思考档位、带工具环境下取得,MathVision 与 CharXiv 区分了有无代码解释器,因此不能与无工具成绩直接混用,选型时建议结合独立评测和自己的真实任务测试。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
