MiniMax H3
多模态大模型MiniMax H3
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布并于 8 月 2 日开放权重的通用全模态音视频生成模型,采用约 33B 参数的稠密 H3-Omni-Transformer,可统一理解文本、图像、视频与音频上下文,生成最长 15 秒、最高 2K、24 FPS 且带 32 kHz 原生立体声的视频。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 图像 | 请求类型 = more_than_5_input_images | ¥0.200/ img | - |
| 音频 | - | ¥0.0000/ sec | - |
| 视频 | 请求类型 = resolution_768p | ¥0.500/ sec | ¥0.500/ sec |
| 视频 | 请求类型 = resolution_2k | ¥0.800/ sec | ¥0.800/ sec |
评测结果
和其他模型对比
暂时没有为该模型整理的相关对比页面。
想自定义其他组合?打开对比工具
发布机构
模型解读
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日正式发布的通用全模态生成模型,模型权重于 2026 年 8 月 2 日按 MiniMax H3 Community License 开放。H3 可统一理解由文本、图像、视频和音频组成的多模态上下文,并联合生成带原生立体声音频的视频;官方开放了 GitHub 代码仓库 和 Hugging Face 权重。
模型架构与开放组件
H3-Base 将文本、视觉与音频编码为统一的多模态序列,由单流 H3-Omni-Transformer 联合预测视频和音频 latent。该 Transformer 是约 33B 参数的稠密模型,其中约 13B 参数位于 AdaLN 相关分支;纯推理部署时这些调制结果可预计算并缓存。模型使用三维 Multimodal RoPE 表示时间与两个空间维度的位置关系,并原生支持稀疏注意力训练与推理,但首批开放版本仅提供全注意力推理实现,稀疏注意力代码将后续发布。
H3-Encoder 使用完整的 Qwen3-VL-32B 预训练权重,并向生成 Transformer 提供第 50 层隐藏状态。视觉部分采用时序因果 H3-VisualVAE,空间压缩 16 倍、时间压缩 4 倍;音频部分采用 H3-AudioVAE,分别处理左右声道后重新组合为立体声。Hugging Face 仓库公开的 safetensors 参数统计约为 33.12B,整个双检查点仓库占用约 354 GB。
生成规格与输入方式
H3 可输出 4–15 秒、24 FPS 的视频,默认短边为 768 像素,并可通过 H3-Regenerate-2K 流程生成 2K 结果;音频输出为 32 kHz 原生立体声。官方列出的稳定对白语言包括中文、英语、阿拉伯语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
开放权重包含两个任务检查点:H3-Base-FL2VA 支持文生音视频,以及零、一或两张首尾帧图片控制;H3-Base-Ref2VA 支持全能参考生成,可输入最多 9 张图片、3 段视频和 3 段音频,视频与音频参考的各自总时长不超过 15 秒,混合素材总数不超过 12 个。官方推荐通过 SGLang、vLLM、Diffusers 或 ComfyUI 部署 BF16 检查点。
完整系统与开放范围
完整 H3 系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三部分组成。此次开放的是负责 768P 音视频生成的 H3-Base 及 FL2VA、Ref2VA 两类检查点;依赖多阶段托管模型与服务的 H3-Context-IR 没有随首批权重开放,2K 再生成模块 H3-Regenerate-2K 也尚未开放。开发者可通过 MiniMax 开放平台 API 组合托管的上下文解析和再生成服务,或自行构建提示词处理流程。
API 价格与许可限制
MiniMax 中国区开放平台按生成时长计费:768P 输出为 0.50 元/秒,2K 输出为 0.80 元/秒;参考视频输入按目标分辨率采用相同的每秒价格,音频输入免费,图片输入前 5 张免费、超出部分为 0.20 元/张。H3-Regeneration 与 H3-Context-IR 是独立计费接口,不与 H3-Base 的主价格混合。
开放权重采用 MiniMax H3 Community License Agreement,不是 MIT 或 Apache 2.0。协议允许在适用地区使用、修改、分发和创建衍生模型,也允许受条件约束的商业使用;但适用地区明确排除欧盟、英国、韩国和美国,商业产品或服务年收入超过 2000 万美元时需另行取得 MiniMax 书面授权,部署方还需遵守标识、安全防护和可接受使用政策等要求。DataLearner 已使用独立的 H3 Community License 条目记录该协议,具体使用仍应以 官方协议原文 为准。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
