MiniMax H3 能生成多长、多高清的视频?
单次最长 15 秒,最高 2K 分辨率、24 FPS,并且带 32 kHz 原生立体声音频。它的特点是音视频联合生成——不是先出画面再配音,而是由同一个 Transformer 联合预测视频和音频 latent,因此音画同步是模型内建的而非后期对齐。
MiniMax H3
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布并于 8 月 2 日开放权重的通用全模态音视频生成模型,采用约 33B 参数的稠密 H3-Omni-Transformer,可统一理解文本、图像、视频与音频上下文,生成最长 15 秒、最高 2K、24 FPS 且带 32 kHz 原生立体声的视频。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 图像 | 请求类型 = more_than_5_input_images | ¥0.200/ img | — |
| 图像 | 请求类型 = more_than_5_input_images | $0.040/ img | — |
| 音频 | - | ¥0.0000/ 1 sec | — |
| 音频 | - | $0.0000/ 1 sec | — |
| 视频 | 请求类型 = resolution_768p | ¥0.500/ 1 sec | ¥0.500/ 1 sec |
| 视频 | 请求类型 = resolution_2k | ¥0.800/ 1 sec | ¥0.800/ 1 sec |
| 视频 | 请求类型 = resolution_768p | $0.080/ 1 sec | $0.080/ 1 sec |
| 视频 | 请求类型 = resolution_2k | $0.130/ 1 sec | $0.130/ 1 sec |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
MiniMax H3 当前已收录的代表性评测结果包括 AA Image-to-Video Arena(1 / 1,得分 1351)、AA Text-to-Video Arena(1 / 1,得分 1302)、AA Text-to-Video Arena (Audio)(1 / 1,得分 1226)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日正式发布的通用全模态生成模型,模型权重于 2026 年 8 月 2 日按 MiniMax H3 Community License 开放。H3 可统一理解由文本、图像、视频和音频组成的多模态上下文,并联合生成带原生立体声音频的视频;官方开放了 GitHub 代码仓库 和 Hugging Face 权重。
H3-Base 将文本、视觉与音频编码为统一的多模态序列,由单流 H3-Omni-Transformer 联合预测视频和音频 latent。该 Transformer 是约 33B 参数的稠密模型,其中约 13B 参数位于 AdaLN 相关分支;纯推理部署时这些调制结果可预计算并缓存。模型使用三维 Multimodal RoPE 表示时间与两个空间维度的位置关系,并原生支持稀疏注意力训练与推理,但首批开放版本仅提供全注意力推理实现,稀疏注意力代码将后续发布。
H3-Encoder 使用完整的 Qwen3-VL-32B 预训练权重,并向生成 Transformer 提供第 50 层隐藏状态。视觉部分采用时序因果 H3-VisualVAE,空间压缩 16 倍、时间压缩 4 倍;音频部分采用 H3-AudioVAE,分别处理左右声道后重新组合为立体声。Hugging Face 仓库公开的 safetensors 参数统计约为 33.12B,整个双检查点仓库占用约 354 GB。
H3 可输出 4–15 秒、24 FPS 的视频,默认短边为 768 像素,并可通过 H3-Regenerate-2K 流程生成 2K 结果;音频输出为 32 kHz 原生立体声。官方列出的稳定对白语言包括中文、英语、阿拉伯语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
开放权重包含两个任务检查点:H3-Base-FL2VA 支持文生音视频,以及零、一或两张首尾帧图片控制;H3-Base-Ref2VA 支持全能参考生成,可输入最多 9 张图片、3 段视频和 3 段音频,视频与音频参考的各自总时长不超过 15 秒,混合素材总数不超过 12 个。官方推荐通过 SGLang、vLLM、Diffusers 或 ComfyUI 部署 BF16 检查点。
完整 H3 系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三部分组成。此次开放的是负责 768P 音视频生成的 H3-Base 及 FL2VA、Ref2VA 两类检查点;依赖多阶段托管模型与服务的 H3-Context-IR 没有随首批权重开放,2K 再生成模块 H3-Regenerate-2K 也尚未开放。开发者可通过 MiniMax 开放平台 API 组合托管的上下文解析和再生成服务,或自行构建提示词处理流程。
MiniMax 中国区开放平台按生成时长计费:768P 输出为 0.50 元/秒,2K 输出为 0.80 元/秒;参考视频输入按目标分辨率采用相同的每秒价格,音频输入免费,图片输入前 5 张免费、超出部分为 0.20 元/张。H3-Regeneration 与 H3-Context-IR 是独立计费接口,不与 H3-Base 的主价格混合。
MiniMax 国际站(platform.minimax.io)按美元计费:768P 输出 0.08 美元/秒,2K 输出 0.13 美元/秒,参考视频输入按目标分辨率同价计费,音频输入免费,图片前 5 张免费、超出部分 0.04 美元/张。独立接口方面,H3-Regeneration(768P→2K)为 0.05 美元/秒,H3-Context-IR 为输入 0.90 美元/百万 tokens、输出 3.60 美元/百万 tokens(2026 年 9 月 11 日官方价目)。
开放权重采用 MiniMax H3 Community License Agreement,不是 MIT 或 Apache 2.0。协议允许在适用地区使用、修改、分发和创建衍生模型,也允许受条件约束的商业使用;但适用地区明确排除欧盟、英国、韩国和美国,商业产品或服务年收入超过 2000 万美元时需另行取得 MiniMax 书面授权,部署方还需遵守标识、安全防护和可接受使用政策等要求。该协议在本站按独立的 H3 Community License 条目记录,具体使用仍应以 官方协议原文 为准。
MiniMax 官方博客与开源说明均未发布量化 benchmark 分数,完整技术报告尚未公开。在 Artificial Analysis Video Arena 的盲测投票中(截至 2026 年 9 月 14 日),MiniMax H3 在带音频的文生视频榜 Elo 为 1226(第 4 名,8,866 个样本),带音频的图生视频榜 Elo 为 1190(第 3 名,7,472 个样本),并在无音频的文生视频与图生视频榜分别取得约 1302 与 1351 的 Elo,是这些榜单中排名最高的开放权重模型之一。Arena Elo 会随投票持续变化,请以 Artificial Analysis 页面 为准。
另外,fal 基于 H3 后训练推出了 H3 Max,该衍生模型在同一 Arena 中的带音频图生视频榜位列第一;H3 Max 并非 MiniMax 官方版本,本页数据均指 MiniMax 官方 H3。
单次最长 15 秒,最高 2K 分辨率、24 FPS,并且带 32 kHz 原生立体声音频。它的特点是音视频联合生成——不是先出画面再配音,而是由同一个 Transformer 联合预测视频和音频 latent,因此音画同步是模型内建的而非后期对齐。
权重确实公开了,2026 年 8 月 2 日在 Hugging Face 上线,GitHub 也开放了代码仓库。但许可是 MiniMax H3 Community License Agreement,属于自定义社区许可而非 Apache 2.0、MIT 这类标准开源协议,商用前需要自行核对条款。
权重约 354 GB,采用双检查点仓库结构,属于多卡部署级别。另需注意首批开放版本仅提供全注意力推理实现——模型原生支持稀疏注意力训练与推理,但稀疏注意力代码要后续才发布,因此当前推理的显存和算力开销高于模型的理论最优状态。
分三块。H3-Base 把文本、视觉与音频编码为统一的多模态序列,由单流 H3-Omni-Transformer 联合预测视频和音频 latent,这个 Transformer 约 33B 稠密参数,其中约 13B 位于 AdaLN 相关分支(纯推理部署时这些调制结果可预计算并缓存)。H3-Encoder 直接使用完整的 Qwen3-VL-32B 预训练权重,向生成 Transformer 提供第 50 层隐藏状态。视觉侧是时序因果 H3-VisualVAE,空间压缩 16 倍、时间压缩 4 倍;音频侧是 H3-AudioVAE,分别处理左右声道后重新组合为立体声。位置编码使用三维 Multimodal RoPE,同时表示时间与两个空间维度。
文本、图像、视频、音频四种输入都支持,输出为音频和视频。它的定位是「通用全模态生成」,可以理解由这四类内容混合组成的多模态上下文再进行生成,而不只是单纯的文生视频。官方体验入口在海螺 AI 的 H3 工具页。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
