MiniMax H3 能生成多长、多高清的视频?
单次最长 15 秒,最高 2K 分辨率、24 FPS,并且带 32 kHz 原生立体声音频。它的特点是音视频联合生成——不是先出画面再配音,而是由同一个 Transformer 联合预测视频和音频 latent,因此音画同步是模型内建的而非后期对齐。
MiniMax H3
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布并于 8 月 2 日开放权重的通用全模态音视频生成模型,采用约 33B 参数的稠密 H3-Omni-Transformer,可统一理解文本、图像、视频与音频上下文,生成最长 15 秒、最高 2K、24 FPS 且带 32 kHz 原生立体声的视频。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 图像 | 请求类型 = more_than_5_input_images | ¥0.200/ img | — |
| 音频 | - | ¥0.0000/ sec | — |
| 视频 | 请求类型 = resolution_768p | ¥0.500/ sec | ¥0.500/ sec |
| 视频 | 请求类型 = resolution_2k | ¥0.800/ sec | ¥0.800/ sec |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日正式发布的通用全模态生成模型,模型权重于 2026 年 8 月 2 日按 MiniMax H3 Community License 开放。H3 可统一理解由文本、图像、视频和音频组成的多模态上下文,并联合生成带原生立体声音频的视频;官方开放了 GitHub 代码仓库 和 Hugging Face 权重。
H3-Base 将文本、视觉与音频编码为统一的多模态序列,由单流 H3-Omni-Transformer 联合预测视频和音频 latent。该 Transformer 是约 33B 参数的稠密模型,其中约 13B 参数位于 AdaLN 相关分支;纯推理部署时这些调制结果可预计算并缓存。模型使用三维 Multimodal RoPE 表示时间与两个空间维度的位置关系,并原生支持稀疏注意力训练与推理,但首批开放版本仅提供全注意力推理实现,稀疏注意力代码将后续发布。
H3-Encoder 使用完整的 Qwen3-VL-32B 预训练权重,并向生成 Transformer 提供第 50 层隐藏状态。视觉部分采用时序因果 H3-VisualVAE,空间压缩 16 倍、时间压缩 4 倍;音频部分采用 H3-AudioVAE,分别处理左右声道后重新组合为立体声。Hugging Face 仓库公开的 safetensors 参数统计约为 33.12B,整个双检查点仓库占用约 354 GB。
H3 可输出 4–15 秒、24 FPS 的视频,默认短边为 768 像素,并可通过 H3-Regenerate-2K 流程生成 2K 结果;音频输出为 32 kHz 原生立体声。官方列出的稳定对白语言包括中文、英语、阿拉伯语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
开放权重包含两个任务检查点:H3-Base-FL2VA 支持文生音视频,以及零、一或两张首尾帧图片控制;H3-Base-Ref2VA 支持全能参考生成,可输入最多 9 张图片、3 段视频和 3 段音频,视频与音频参考的各自总时长不超过 15 秒,混合素材总数不超过 12 个。官方推荐通过 SGLang、vLLM、Diffusers 或 ComfyUI 部署 BF16 检查点。
完整 H3 系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三部分组成。此次开放的是负责 768P 音视频生成的 H3-Base 及 FL2VA、Ref2VA 两类检查点;依赖多阶段托管模型与服务的 H3-Context-IR 没有随首批权重开放,2K 再生成模块 H3-Regenerate-2K 也尚未开放。开发者可通过 MiniMax 开放平台 API 组合托管的上下文解析和再生成服务,或自行构建提示词处理流程。
MiniMax 中国区开放平台按生成时长计费:768P 输出为 0.50 元/秒,2K 输出为 0.80 元/秒;参考视频输入按目标分辨率采用相同的每秒价格,音频输入免费,图片输入前 5 张免费、超出部分为 0.20 元/张。H3-Regeneration 与 H3-Context-IR 是独立计费接口,不与 H3-Base 的主价格混合。
开放权重采用 MiniMax H3 Community License Agreement,不是 MIT 或 Apache 2.0。协议允许在适用地区使用、修改、分发和创建衍生模型,也允许受条件约束的商业使用;但适用地区明确排除欧盟、英国、韩国和美国,商业产品或服务年收入超过 2000 万美元时需另行取得 MiniMax 书面授权,部署方还需遵守标识、安全防护和可接受使用政策等要求。该协议在本站按独立的 H3 Community License 条目记录,具体使用仍应以 官方协议原文 为准。
单次最长 15 秒,最高 2K 分辨率、24 FPS,并且带 32 kHz 原生立体声音频。它的特点是音视频联合生成——不是先出画面再配音,而是由同一个 Transformer 联合预测视频和音频 latent,因此音画同步是模型内建的而非后期对齐。
权重确实公开了,2026 年 8 月 2 日在 Hugging Face 上线,GitHub 也开放了代码仓库。但许可是 MiniMax H3 Community License Agreement,属于自定义社区许可而非 Apache 2.0、MIT 这类标准开源协议,商用前需要自行核对条款。
权重约 354 GB,采用双检查点仓库结构,属于多卡部署级别。另需注意首批开放版本仅提供全注意力推理实现——模型原生支持稀疏注意力训练与推理,但稀疏注意力代码要后续才发布,因此当前推理的显存和算力开销高于模型的理论最优状态。
分三块。H3-Base 把文本、视觉与音频编码为统一的多模态序列,由单流 H3-Omni-Transformer 联合预测视频和音频 latent,这个 Transformer 约 33B 稠密参数,其中约 13B 位于 AdaLN 相关分支(纯推理部署时这些调制结果可预计算并缓存)。H3-Encoder 直接使用完整的 Qwen3-VL-32B 预训练权重,向生成 Transformer 提供第 50 层隐藏状态。视觉侧是时序因果 H3-VisualVAE,空间压缩 16 倍、时间压缩 4 倍;音频侧是 H3-AudioVAE,分别处理左右声道后重新组合为立体声。位置编码使用三维 Multimodal RoPE,同时表示时间与两个空间维度。
文本、图像、视频、音频四种输入都支持,输出为音频和视频。它的定位是「通用全模态生成」,可以理解由这四类内容混合组成的多模态上下文再进行生成,而不只是单纯的文生视频。官方体验入口在海螺 AI 的 H3 工具页。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
