DataLearner 标志
QW

Qwen3.8-Max

推理大模型编程大模型

Qwen3.8-Max

发布时间: 2026-08-03更新于: 2026-08-31浏览量: 4,120
模型参数
2.4万亿
上下文长度
1M
多语言支持
支持
推理能力
5/5

Qwen3.8-Max 是阿里巴巴于 2026-08-03 正式发布的千问旗舰大模型,总参数 2.4T、激活参数 95B,支持视觉理解与约 1M 上下文。2026-08-12 阿里在 Hugging Face 以 Qwen3.8-Max License 开源了其底座权重 Qwen3.8-2.4T-A95B(BF16 与 FP8 两版,约 4.89 TB),成为千问 Max 级别旗舰首次开源权重;开源版为纯文本、仅思考模式、原生 262K 上下文,API 版额外提供视觉输入、非思考模式、默认 1M 上下文与官方内置工具。同期宣布的 Qwen3.8-27B 已于 2026-08-14 以 Apache 2.0 开源。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Qwen3.8-Max

模型基本信息

推理过程
支持
思考模式
思考水平 · 极高 (Extra-High) (默认)思考水平 · 低 (Low)思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像、视频 → 文本
发布时间
2026-08-03
模型文件大小
约 4.89 TB(BF16,213 个 safetensors 分片)
MoE架构
总参数 / 激活参数
2.4万亿 / 950亿
知识截止
暂无数据
Qwen3.8-Max

开源和体验地址

代码开源状态
预训练权重开源
Qwen3.8-Max License- 有条件免费商用授权
GitHub 源码
暂无
在线体验
Qwen3.8-Max

官方介绍与博客

Qwen3.8-Max

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-¥12.00/ 1M¥36.00/ 1M
international
类型适用条件输入输出
文本-$2.00/ 1M$6.00/ 1M
缓存定价Prompt缓存
类型有效期写入读取
文本-¥1.50/ 1M

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Qwen3.8-Max

评测结果

Qwen3.8-Max 当前已收录的代表性评测结果包括 Context Arena(3 / 126,得分 96.92)、LongBench v2(1 / 13,得分 66.30)、HLE(15 / 189,得分 56.20)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合评估

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
极高
43.60
54 / 189
HLE
极高工具
56.20
15 / 189

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
92.60
24 / 270

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1842
10 / 99

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
62.50
22 / 92

编程与软件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
FrontierSWE
极高工具
73.50
4 / 4
67.70
5 / 60
DeepSWE
极高工具
56.60
21 / 34
NL2Repo-Bench
极高工具
55.90
7 / 12
MLS Bench
极高工具
41
3 / 5

文本向量检索

共 3 项评测
评测名称 / 模式
得分
排名/总数
92.79
9 / 126
95.15
5 / 126
96.92
3 / 126

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
极高工具
86.60
10 / 49
72.50
9 / 10

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
66.30
1 / 13

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
极高工具
27
7 / 14

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
极高工具
27.30
12 / 16

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
74.74
11 / 58
46.34
11 / 40

和其他模型对比

Qwen3.8-Max

发布机构

Qwen3.8-Max

模型解读

发布背景与定位

Qwen3.8-Max 是阿里巴巴通义千问团队于 2026 年 8 月 3 日正式发布的 Qwen 系列旗舰大模型,区别于 2026 年 7 月 19 日上线的预览版 Qwen3.8-Max-Preview。官方将其定位为面向编程、专业办公、科研分析与长程任务端到端交付的「超大杯」旗舰模型,已通过千问 AI 平台开放 API 服务,并集成到阿里同期发布的智能体产品「Qwen Office」中。

开源权重(2026-08-12)

阿里在发布会上承诺的开源已于 2026 年 8 月 12 日兑现:Qwen3.8-Max 的底座权重以 Qwen3.8-2.4T-A95B 之名发布于 Hugging Face,提供 BF16 原版与 FP8 量化版两个仓库,BF16 权重约 4.89 TB、拆分为 213 个 safetensors 分片,官方标注可配合 vLLM、SGLang、TokenSpeed 部署。这是通义千问 Max 级别旗舰模型首次开源权重。

需要注意开源权重与 API 版本并不完全等同。官方模型卡明确说明「Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多特性」:API 版 Qwen3.8-Max 额外提供视觉输入、非思考模式、默认 1M 上下文以及官方内置工具;而开源的 Qwen3.8-2.4T-A95B 为纯文本模型、所有交互均需思考模式、原生上下文 262,144 tokens(可通过外推扩展至约 1,010,000 tokens)。因此下载权重自建服务时,无法直接复现 API 版的多模态与非思考能力。

许可协议为专有的 Qwen3.8-Max License(非 Apache 2.0):允许商业使用,但设有两道门槛——产品月活跃用户超过 1 亿或月收入超过 2000 万美元的,须在用户界面显著位置标注模型名称;对外提供大模型推理或微调服务(含编程助手、办公软件等 AI 办公助手类产品,单一用途工具与垂直领域助手除外)且连续 12 个月合计收入超过 5000 万美元的,须另行获取商业授权。不对第三方开放的纯内部使用不受上述收入门槛限制。

架构与技术规格

Qwen3.8-Max 采用稀疏 MoE 架构与混合注意力机制的联合优化,总参数量 2.4 万亿(2.4T),单 token 激活参数约 950 亿(95B)。开源权重的 config.json 显示:92 层,专家总数 512、每 token 激活 10 个专家,隐藏层维度 8192,词表 248,320;注意力采用门控 DeltaNet 线性注意力与全注意力混合排布,每 4 层插入一层全注意力。API 版上下文窗口官方云平台元数据为 983,616 tokens(约 1M),最大输出 131,072 tokens。模型仅支持思考模式、无法关闭推理,提供 low / high / xhigh 三档强度,默认 xhigh。

性能表现

随开源权重发布的官方模型卡首次给出了完整基准表(表头列名为 Qwen3.8-Max,对比对象为 Opus 4.8、Fable 5、GPT 5.6 Sol max 与上代 Qwen3.7-Max)。代表性成绩:Terminal Bench 2.1 得 86.6,SWE-bench Pro 得 67.7,DeepSWE 1.1 得 56.6,FrontierSWE 得 73.5,NL2Repo-Bench 得 55.9,PaperBench 得 93.0,Toolathlon Verified 得 72.5,Automation-Bench(Pass@1)得 27.3,Agents' Last Exam 通过率 27.0(分数 52.4),WideSearch 得 81.9,GPQA Diamond 得 92.6,HLE 得 43.6,LongBench v2 得 66.3。其中 PaperBench、WideSearch、IFBench、HealthBench 等项超过全部对比模型,而 DeepSWE 1.1、HLE、Terminal Bench 2.1 等项仍落后于 Fable 5 或 GPT 5.6 Sol max。以上均为厂商自测口径,独立第三方复测结果待跟进。

应用案例

发布会展示了法律合同审查(每小时处理 1284 条条款)、量化投研(6000+ 因子回测)等企业级应用场景,以及模型自主编程 16 天、在 oh-my-cli 项目完成 265 次代码提交等长程自主任务演示。

访问方式与价格

API 已通过千问 AI 平台开放,国内定价为输入 12 元/百万 tokens、输出 36 元/百万 tokens,隐式缓存命中价格 1.5 元/百万 tokens。国际定价官方口径为 Anthropic Claude Opus 5 输入价格的 40%、输出价格的 24%(按 Opus 5 官方价格折算约合 2 美元/百万 tokens 输入、6 美元/百万 tokens 输出;此为换算结果,非官方直接公布的绝对美元数字)。自建部署可直接下载 Hugging Face 上的开源权重。

发布会同期宣布的开源模型 Qwen3.8-27B 已于 2026 年 8 月 14 日在 Hugging Face 上线,采用 Apache 2.0 许可——比 Max 权重的专有 Qwen3.8-Max License 更宽松,无月活或收入门槛。

Qwen3.8-Max

常见问题

开源的 Qwen3.8-2.4T-A95B 和 API 版 Qwen3.8-Max 是同一个模型吗?

不完全等同,这一点官方模型卡写得很明确:「Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多特性」。API 版额外提供视觉输入、非思考模式、默认 1M 上下文以及官方内置工具;开源的底座权重为纯文本模型、仅思考模式、原生 262K 上下文。也就是说下载权重自建服务,拿不到 API 版的视觉能力和内置工具。

Qwen3.8-Max 的开源许可有什么限制?可以商用吗?

可以商用,但有门槛条款。它用的是专有的 Qwen3.8-Max License,对月活超 1 亿或 MaaS 收入超 5000 万美元的场景附加了标注与另行授权要求。对绝大多数团队没有实际影响,但大型平台方需要注意。相比之下同系列的 Qwen3.8-27B 用的是 Apache 2.0,完全没有这类门槛。

自己部署 Qwen3.8-Max 权重需要什么规模的机器?

门槛很高。BF16 权重约 4.89 TB,拆成 213 个 safetensors 分片;官方同时提供 FP8 量化版仓库,可把体积大致减半。即便如此这也是多机多卡集群级别的部署,不是单机能承载的。官方标注可配合 vLLM、SGLang、TokenSpeed 部署。这是通义千问 Max 级别旗舰模型首次开源权重。

Qwen3.8-Max 最强的是什么能力?

长上下文。LongBench v2 66.30 在 DataLearner 已收录的 13 个模型中排第 1。编程侧 SWE-Bench Pro(Public)67.70 排 57 个模型第 5,Terminal-Bench 2.1 86.60 排 44 个第 8,都属于第一梯队;科学推理 GPQA Diamond 92.60 排 226 个第 21。

Qwen3.8-Max 有什么短板?

长程仓库级任务和智能体自动化相对弱。DeepSWE 56.60 在 27 个模型中排第 14,NL2Repo-Bench 55.90 排 8 个第 4,FrontierSWE 73.50 在 4 个模型中垫底,AutomationBench 27.30 排 8 个第 5,Agents' Last Exam 27 排 11 个第 7。综合评估 HLE 在带工具的极高强度思考下 56.20 能排 181 个模型第 13,但去掉工具后掉到 43.60、第 49——对工具的依赖比较明显。

Qwen3.8-Max、Qwen3.8-Max-Preview 和 Qwen3.8-27B 怎么选?

Qwen3.8-Max-Preview 是 2026 年 7 月 19 日上线的预览版,正式版于 8 月 3 日发布,新项目应直接用正式版。Max 与 27B 是「超大杯 vs 单卡可跑」的关系:Max 定位编程、专业办公、科研分析与长程任务的端到端交付,走 API 或集群部署;27B 是 270 亿稠密参数、Apache 2.0、55.6GB 权重,适合单卡或小集群自建。两者在同一场发布会上宣布。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码