DataLearner 标志
MI

Mistral Medium 3.5

聊天大模型编程大模型

Mistral Medium 3.5

发布时间: 2026-05-01更新于: 2026-08-23 11:43:34.540145
在线体验GitHubHugging FaceCompare
模型参数
未披露
上下文长度
暂无数据
中文支持
不支持
推理能力

Mistral AI 于 2026 年 4 月底发布的中端旗舰模型,128B 稠密架构(不是 MoE),256K 上下文,支持文本与图像输入、文本输出,用一套权重同时覆盖指令跟随、推理和编程。权重按 Modified MIT License 开放,允许商业与非商业使用,但对大营收公司设有例外条款。推理模式可按请求在 reasoning_effort='none'(标准快速推理)与 'high'(启用测试时计算增强推理)之间切换,官方建议 high 档温度取 0.7、标准模式按任务在 0.0–0.7 之间取值。部署门槛相对友好——官方推荐的 vLLM 配置为 --tensor-parallel-size 8(8 卡张量并行)。官方 benchmark:SWE-Bench Verified 77.6%、τ³-Telecom 91.4%,并称在所有基准上超越此前的 Devstral 系列。它同时是 Mistral 的 Le Chat 与 Vibe 编程智能体的底层模型。API 价格为每百万 tokens 输入 $1.50、输出 $7.50。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Mistral Medium 3.5

模型基本信息

推理过程
不支持
思考模式
不支持思考模式
上下文长度
暂无数据
最大输出长度
暂无数据
模型类型
聊天大模型
输入/输出模态
暂无数据
发布时间
2026-05-01
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不涉及
知识截止
暂无数据
Mistral Medium 3.5

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无GitHub开源地址
Hugging Face
暂无开源HuggingFace地址
在线体验
暂无在线体验地址
Mistral Medium 3.5

官方介绍与博客

官方论文
暂无官方论文
DataLearnerAI博客
暂无介绍博客
Mistral Medium 3.5

API接口信息

接口速度
暂无数据
暂无公开的 API 定价信息。
Mistral Medium 3.5

评测结果

当前尚无可展示的评测数据。

和其他模型对比

暂时没有为该模型整理的相关对比页面。

想自定义其他组合?打开对比工具

Mistral Medium 3.5

发布机构

Mistral Medium 3.5

模型解读

模型定位

Mistral Medium 3.5 是 Mistral AI 于 2026 年 4 月底发布的中端旗舰模型,官方 Hugging Face 仓库为 mistralai/Mistral-Medium-3.5-128B。它的设计目标是用一套权重同时覆盖指令跟随、推理和编程三类任务,面向智能体工作流、编程和复杂多步推理场景,并作为 Mistral 自家产品 Le Chat 与 Vibe 编程智能体的底层模型。

架构与规格

模型为 128B 稠密架构——不是混合专家(MoE),全部参数参与计算。上下文窗口 256K tokens;输入支持文本与图像,输出为文本。官方模型卡未明确给出最大输出长度。

推理模式

支持按请求切换的两档 reasoning effort:'none' 为标准快速推理,'high' 启用测试时计算增强推理。官方给出的采样建议是:reasoning_effort="high" 时温度取 0.7;标准模式下按任务性质在 0.0 到 0.7 之间取值。这种「一个模型两档模式」的设计避免了在快模型和慢模型之间切换的工程成本。

开放权重与许可

权重按 Modified MIT License 开放,允许商业与非商业使用,但对大营收公司设有例外条款——落地前需要核对自身是否触发该条款。这与标准 MIT 不同,不能按完全自由的开源协议对待。

部署要求

官方推荐的 vLLM 部署配置为 --tensor-parallel-size 8,即 8 卡张量并行。相比动辄需要多机集群的万亿参数模型,128B 稠密模型的自建门槛明显更低,单机 8 卡即可承载。

官方评测

Mistral 公布的成绩包括:SWE-Bench Verified 77.6%、τ³-Telecom 智能体评测 91.4%,官方并称其在所有基准上超越了此前的 Devstral 系列模型。

价格

API 价格为每百万 tokens 输入 $1.50、输出 $7.50

Mistral Medium 3.5

常见问题

Mistral Medium 3.5 是开源的吗?可以商用吗?

权重是开放的,但许可不是标准开源协议。它采用 Modified MIT License,允许商业与非商业使用,但对大营收公司设有例外条款。落地前需要核对自身营收规模是否触发该条款,不能直接按完全自由的 MIT 对待。

自建 Mistral Medium 3.5 需要什么配置?

官方推荐的 vLLM 部署配置是 --tensor-parallel-size 8,也就是 8 卡张量并行。128B 稠密模型的门槛比万亿参数 MoE 低很多——单机 8 卡即可承载,不需要多机集群,这是它在自部署场景下的主要优势。

它是 MoE 还是稠密模型?

稠密模型,128B 参数全部参与计算,不是混合专家架构。这意味着它的推理成本与参数量直接相关,不像 MoE 那样能靠稀疏激活压低单次推理开销;但换来的是部署简单、行为稳定,且不需要处理专家路由带来的负载不均问题。

reasoning effort 的两档怎么用?

按请求切换:'none' 是标准快速推理,'high' 启用测试时计算增强推理。官方的采样建议不同——high 档用温度 0.7,标准模式按任务在 0.0 到 0.7 之间取。好处是不用在快模型和慢模型之间切换部署,同一套权重就能覆盖两种延迟需求。

Mistral Medium 3.5 的编程能力如何?

官方给出的 SWE-Bench Verified 成绩为 77.6%,智能体评测 τ³-Telecom 为 91.4%,并称其在所有基准上超越了此前的 Devstral 系列(Mistral 的编程专用线)。它也是 Mistral 自家 Vibe 编程智能体的底层模型。

它支持图片输入吗?上下文多长?

支持文本与图像输入,输出为文本。上下文窗口 256K tokens。官方模型卡没有明确给出最大输出长度。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码