开源的 Qwen3.8-2.4T-A95B 和 API 版 Qwen3.8-Max 是同一个模型吗?
不完全等同,这一点官方模型卡写得很明确:「Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多特性」。API 版额外提供视觉输入、非思考模式、默认 1M 上下文以及官方内置工具;开源的底座权重为纯文本模型、仅思考模式、原生 262K 上下文。也就是说下载权重自建服务,拿不到 API 版的视觉能力和内置工具。
Qwen3.8-Max
Qwen3.8-Max 是阿里巴巴于 2026-08-03 正式发布的千问旗舰大模型,总参数 2.4T、激活参数 95B,支持视觉理解与约 1M 上下文。2026-08-12 阿里在 Hugging Face 以 Qwen3.8-Max License 开源了其底座权重 Qwen3.8-2.4T-A95B(BF16 与 FP8 两版,约 4.89 TB),成为千问 Max 级别旗舰首次开源权重;开源版为纯文本、仅思考模式、原生 262K 上下文,API 版额外提供视觉输入、非思考模式、默认 1M 上下文与官方内置工具。同期宣布的 Qwen3.8-27B 已于 2026-08-14 以 Apache 2.0 开源。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | ¥12.00/ 1M | ¥36.00/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $2.00/ 1M | $6.00/ 1M |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | - | — | ¥1.50/ 1M |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Qwen3.8-Max 当前已收录的代表性评测结果包括 Context Arena(3 / 126,得分 96.92)、LongBench v2(1 / 13,得分 66.30)、HLE(15 / 189,得分 56.20)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Qwen3.8-Max 是阿里巴巴通义千问团队于 2026 年 8 月 3 日正式发布的 Qwen 系列旗舰大模型,区别于 2026 年 7 月 19 日上线的预览版 Qwen3.8-Max-Preview。官方将其定位为面向编程、专业办公、科研分析与长程任务端到端交付的「超大杯」旗舰模型,已通过千问 AI 平台开放 API 服务,并集成到阿里同期发布的智能体产品「Qwen Office」中。
阿里在发布会上承诺的开源已于 2026 年 8 月 12 日兑现:Qwen3.8-Max 的底座权重以 Qwen3.8-2.4T-A95B 之名发布于 Hugging Face,提供 BF16 原版与 FP8 量化版两个仓库,BF16 权重约 4.89 TB、拆分为 213 个 safetensors 分片,官方标注可配合 vLLM、SGLang、TokenSpeed 部署。这是通义千问 Max 级别旗舰模型首次开源权重。
需要注意开源权重与 API 版本并不完全等同。官方模型卡明确说明「Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多特性」:API 版 Qwen3.8-Max 额外提供视觉输入、非思考模式、默认 1M 上下文以及官方内置工具;而开源的 Qwen3.8-2.4T-A95B 为纯文本模型、所有交互均需思考模式、原生上下文 262,144 tokens(可通过外推扩展至约 1,010,000 tokens)。因此下载权重自建服务时,无法直接复现 API 版的多模态与非思考能力。
许可协议为专有的 Qwen3.8-Max License(非 Apache 2.0):允许商业使用,但设有两道门槛——产品月活跃用户超过 1 亿或月收入超过 2000 万美元的,须在用户界面显著位置标注模型名称;对外提供大模型推理或微调服务(含编程助手、办公软件等 AI 办公助手类产品,单一用途工具与垂直领域助手除外)且连续 12 个月合计收入超过 5000 万美元的,须另行获取商业授权。不对第三方开放的纯内部使用不受上述收入门槛限制。
Qwen3.8-Max 采用稀疏 MoE 架构与混合注意力机制的联合优化,总参数量 2.4 万亿(2.4T),单 token 激活参数约 950 亿(95B)。开源权重的 config.json 显示:92 层,专家总数 512、每 token 激活 10 个专家,隐藏层维度 8192,词表 248,320;注意力采用门控 DeltaNet 线性注意力与全注意力混合排布,每 4 层插入一层全注意力。API 版上下文窗口官方云平台元数据为 983,616 tokens(约 1M),最大输出 131,072 tokens。模型仅支持思考模式、无法关闭推理,提供 low / high / xhigh 三档强度,默认 xhigh。
随开源权重发布的官方模型卡首次给出了完整基准表(表头列名为 Qwen3.8-Max,对比对象为 Opus 4.8、Fable 5、GPT 5.6 Sol max 与上代 Qwen3.7-Max)。代表性成绩:Terminal Bench 2.1 得 86.6,SWE-bench Pro 得 67.7,DeepSWE 1.1 得 56.6,FrontierSWE 得 73.5,NL2Repo-Bench 得 55.9,PaperBench 得 93.0,Toolathlon Verified 得 72.5,Automation-Bench(Pass@1)得 27.3,Agents' Last Exam 通过率 27.0(分数 52.4),WideSearch 得 81.9,GPQA Diamond 得 92.6,HLE 得 43.6,LongBench v2 得 66.3。其中 PaperBench、WideSearch、IFBench、HealthBench 等项超过全部对比模型,而 DeepSWE 1.1、HLE、Terminal Bench 2.1 等项仍落后于 Fable 5 或 GPT 5.6 Sol max。以上均为厂商自测口径,独立第三方复测结果待跟进。
发布会展示了法律合同审查(每小时处理 1284 条条款)、量化投研(6000+ 因子回测)等企业级应用场景,以及模型自主编程 16 天、在 oh-my-cli 项目完成 265 次代码提交等长程自主任务演示。
API 已通过千问 AI 平台开放,国内定价为输入 12 元/百万 tokens、输出 36 元/百万 tokens,隐式缓存命中价格 1.5 元/百万 tokens。国际定价官方口径为 Anthropic Claude Opus 5 输入价格的 40%、输出价格的 24%(按 Opus 5 官方价格折算约合 2 美元/百万 tokens 输入、6 美元/百万 tokens 输出;此为换算结果,非官方直接公布的绝对美元数字)。自建部署可直接下载 Hugging Face 上的开源权重。
发布会同期宣布的开源模型 Qwen3.8-27B 已于 2026 年 8 月 14 日在 Hugging Face 上线,采用 Apache 2.0 许可——比 Max 权重的专有 Qwen3.8-Max License 更宽松,无月活或收入门槛。
不完全等同,这一点官方模型卡写得很明确:「Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多特性」。API 版额外提供视觉输入、非思考模式、默认 1M 上下文以及官方内置工具;开源的底座权重为纯文本模型、仅思考模式、原生 262K 上下文。也就是说下载权重自建服务,拿不到 API 版的视觉能力和内置工具。
可以商用,但有门槛条款。它用的是专有的 Qwen3.8-Max License,对月活超 1 亿或 MaaS 收入超 5000 万美元的场景附加了标注与另行授权要求。对绝大多数团队没有实际影响,但大型平台方需要注意。相比之下同系列的 Qwen3.8-27B 用的是 Apache 2.0,完全没有这类门槛。
门槛很高。BF16 权重约 4.89 TB,拆成 213 个 safetensors 分片;官方同时提供 FP8 量化版仓库,可把体积大致减半。即便如此这也是多机多卡集群级别的部署,不是单机能承载的。官方标注可配合 vLLM、SGLang、TokenSpeed 部署。这是通义千问 Max 级别旗舰模型首次开源权重。
长上下文。LongBench v2 66.30 在 DataLearner 已收录的 13 个模型中排第 1。编程侧 SWE-Bench Pro(Public)67.70 排 57 个模型第 5,Terminal-Bench 2.1 86.60 排 44 个第 8,都属于第一梯队;科学推理 GPQA Diamond 92.60 排 226 个第 21。
长程仓库级任务和智能体自动化相对弱。DeepSWE 56.60 在 27 个模型中排第 14,NL2Repo-Bench 55.90 排 8 个第 4,FrontierSWE 73.50 在 4 个模型中垫底,AutomationBench 27.30 排 8 个第 5,Agents' Last Exam 27 排 11 个第 7。综合评估 HLE 在带工具的极高强度思考下 56.20 能排 181 个模型第 13,但去掉工具后掉到 43.60、第 49——对工具的依赖比较明显。
Qwen3.8-Max-Preview 是 2026 年 7 月 19 日上线的预览版,正式版于 8 月 3 日发布,新项目应直接用正式版。Max 与 27B 是「超大杯 vs 单卡可跑」的关系:Max 定位编程、专业办公、科研分析与长程任务的端到端交付,走 API 或集群部署;27B 是 270 亿稠密参数、Apache 2.0、55.6GB 权重,适合单卡或小集群自建。两者在同一场发布会上宣布。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
