DataLearner 标志
MI

Mistral Large 4

预览版多模态大模型Mistral

Mistral Large 4

别名:Le Chonk / mistral-large-4-0

发布时间: 2026-10-06更新于: 2026-10-06浏览量: 1
在线体验GitHubHugging Face对比
模型参数
1.1万亿
上下文长度
1M
多语言支持
160+ 种语言
推理能力
暂无数据

Mistral AI 的原生多模态 MoE 模型,1.05T 总参数、49B 激活参数,支持 1M 上下文和 160+ 语种;API 已公开预览,权重计划 2026 年 10 月底开放。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Mistral Large 4

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
暂无数据
模型类型
多模态大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-10-06
模型文件大小
暂无数据
MoE架构
是
总参数 / 激活参数
1.1万亿 / 490亿
知识截止
暂无数据
Mistral Large 4

开源和体验地址

代码开源状态
暂无数据
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
Mistral Large 4

官方介绍与博客

DataLearnerAI博客
暂无
Mistral Large 4

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.680/ 1M tokens$2.09/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.070/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Mistral Large 4

评测结果

Mistral Large 4 当前已收录的代表性评测结果包括 Harvey's Legal Agent Benchmark(6 / 50,得分 15.83)、SWE-Atlas-QnA(2 / 7,得分 59.40)、Terminal-Bench 4.0(31 / 100,得分 28.30)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

仓库修复与多文件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
思考模式工具
61.70
48 / 97
SWE-Atlas-QnA
思考模式工具
59.40
2 / 7
AA Cyber Index
思考模式工具
49.51
1 / 1

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
63.29
13 / 21
56.21
34 / 46
54.68
17 / 44

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
31.73
32 / 46
15.83
6 / 50

生物与基因

共 1 项评测
评测名称 / 模式
得分
排名/总数
67.04
14 / 21

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
思考模式工具
28.30
31 / 100
22.73
37 / 100
14.26
1 / 1

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
30.56
33 / 48

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.40
22 / 65

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
高工具
45.28
23 / 30

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
10
28 / 29

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
80.43
40 / 67
40.69
45 / 65

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
12.16
14 / 14

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
48.05
29 / 37
Mistral Large 4

发布机构

Mistral Large 4

模型解读

Mistral Large 4(别名 Le Chonk)是 Mistral AI 于 2026 年 10 月 6 日开放 API 公开预览的原生多模态 MoE 模型。官方文档列出 1.05T 总参数、49B 激活参数和 1.6B 视觉编码器,支持文本与图像输入、文本输出。发布文章将它定位为融合指令、推理与智能体能力的模型。当前强化学习训练仍在继续,月底计划发布权重;本次公开预览不能等同于最终权重版已经上线。

1M 上下文和 160+ 语种已获官方确认

官方模型页标注 1M 上下文,支持函数调用、结构化输出与工具使用,调用示例采用 high 推理档位。发布文章称模型原生支持 160 多种语言,训练数据覆盖欧盟全部官方语言,但未公布完整的支持语种清单。Mistral 称训练从头在其欧洲自有数据中心的 3,800 张 NVIDIA Grace Blackwell GPU 上完成,公开预览也由同一基础设施提供服务。模型先进行监督微调,再通过覆盖科学、编程、安全和长程工具使用的环境开展强化学习,后者尚未结束。

Vals 模型页记录 512K 上下文、256,000 最大输出 token、temperature 1、top-p 0.95 和 high 推理档位。这些属于第三方测试设置,不能直接替代官方规格。官方最大输出长度、知识截止日期和完整语种清单仍未披露。

专业任务已有独立成绩,官方编程成绩还包含私下评测

截至 2026 年 10 月 6 日,AA 模型页给出的 AutomationBench-AA 得分为 59.9%,AA Cyber Index 原始值为 49.51,发布图取整为 50。Vals 的 Finance Agent v2 为 54.68%,Harvey’s Legal Agent Benchmark 为 15.83%,Vals Index v2.1 为 48.05%。这些成绩支持模型在部分业务和安全任务上的表现,但各基准覆盖范围不同,单项结果不能证明官方所称的美国或欧洲开放权重模型综合领先。

官方文章另报 DeepSWE v1.1 为 61.7%、SWE-Atlas-QnA 为 59.4%、Terminal-Bench 4.0 为 28.3%,并注明它们来自 AA 在新 harness 公开前进行的私下评测,计划在 harness 发布后进入 Coding Agent Index。具体 harness 与推理预算尚未公开。这组 Terminal-Bench 成绩不能与 Vals 通过 Mini-SWE-agent 测得的 22.73%合并。文章中的 Coding Agent Index 为 49.8%,但未说明指数版本,因此这里只保留发布方转述。

视觉定位的领先证据集中在特定测试

Mistral 在 Dense 200 上报告 42%,对比 GPT-6 Astra 的 41%,差距为 1 个百分点。这是官方测试结果,不能扩展为所有视觉任务都优于闭源前沿模型。其展示还涵盖工程图纸核验、PDF 证据检索和大型卫星图像搜索。安全方面,官方报告 Cybench 为 93%、Lakera B3 攻击抵抗率为 93.3%;文章没有提供这两项成绩的完整测试配置。当前 API 与面向经过审核的安全合作伙伴的测试设置也需区分,后者使用降低内容限制的同一模型。

首发优惠持续两周,自部署仍需等待权重和许可证

官方文档当前提供两周五折首发优惠:每百万 token 输入 0.68 美元、缓存输入 0.07 美元、输出 2.09 美元,对应原价 1.36、0.14 和 4.18 美元。发布文章页尾及 Vals 的价格采用原价口径。当前可通过 Mistral API 使用公开预览;需要欧洲基础设施和原生视觉、长上下文工具能力的团队可以据此评估。需要自行部署的用户仍须等待月底权重与许可证,官方文档中的两项都标为 Coming soon。

来源:Mistral 官方发布文章;官方模型文档;Artificial Analysis 模型评测;AA Cyber Index;Vals AI 模型评测。资料读取日期:2026-10-06。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码