DataLearner 标志
MI

MiniMax H3

多模态大模型

MiniMax H3

发布时间: 2026-07-31更新于: 2026-08-31浏览量: 573
模型参数
330亿
上下文长度
15s
多语言支持
支持
推理能力
3/5

MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布并于 8 月 2 日开放权重的通用全模态音视频生成模型,采用约 33B 参数的稠密 H3-Omni-Transformer,可统一理解文本、图像、视频与音频上下文,生成最长 15 秒、最高 2K、24 FPS 且带 32 kHz 原生立体声的视频。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

MiniMax H3

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
15s tokens
最大输出长度
15秒 tokens
模型类型
多模态大模型
输入/输出模态
文本、图像、音频、视频 → 音频、视频
发布时间
2026-07-31
模型文件大小
约354GB(双检查点仓库)
MoE架构
总参数 / 激活参数
330亿 / 不适用
知识截止
暂无数据
MiniMax H3

开源和体验地址

MiniMax H3

官方介绍与博客

DataLearnerAI博客
暂无
MiniMax H3

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
图像请求类型 = more_than_5_input_images¥0.200/ img
音频-¥0.0000/ sec
视频请求类型 = resolution_768p¥0.500/ sec¥0.500/ sec
视频请求类型 = resolution_2k¥0.800/ sec¥0.800/ sec

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

MiniMax H3

发布机构

MiniMax H3

模型解读

MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日正式发布的通用全模态生成模型,模型权重于 2026 年 8 月 2 日按 MiniMax H3 Community License 开放。H3 可统一理解由文本、图像、视频和音频组成的多模态上下文,并联合生成带原生立体声音频的视频;官方开放了 GitHub 代码仓库Hugging Face 权重


模型架构与开放组件

H3-Base 将文本、视觉与音频编码为统一的多模态序列,由单流 H3-Omni-Transformer 联合预测视频和音频 latent。该 Transformer 是约 33B 参数的稠密模型,其中约 13B 参数位于 AdaLN 相关分支;纯推理部署时这些调制结果可预计算并缓存。模型使用三维 Multimodal RoPE 表示时间与两个空间维度的位置关系,并原生支持稀疏注意力训练与推理,但首批开放版本仅提供全注意力推理实现,稀疏注意力代码将后续发布。

H3-Encoder 使用完整的 Qwen3-VL-32B 预训练权重,并向生成 Transformer 提供第 50 层隐藏状态。视觉部分采用时序因果 H3-VisualVAE,空间压缩 16 倍、时间压缩 4 倍;音频部分采用 H3-AudioVAE,分别处理左右声道后重新组合为立体声。Hugging Face 仓库公开的 safetensors 参数统计约为 33.12B,整个双检查点仓库占用约 354 GB。


生成规格与输入方式

H3 可输出 4–15 秒、24 FPS 的视频,默认短边为 768 像素,并可通过 H3-Regenerate-2K 流程生成 2K 结果;音频输出为 32 kHz 原生立体声。官方列出的稳定对白语言包括中文、英语、阿拉伯语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。

开放权重包含两个任务检查点:H3-Base-FL2VA 支持文生音视频,以及零、一或两张首尾帧图片控制;H3-Base-Ref2VA 支持全能参考生成,可输入最多 9 张图片、3 段视频和 3 段音频,视频与音频参考的各自总时长不超过 15 秒,混合素材总数不超过 12 个。官方推荐通过 SGLang、vLLM、Diffusers 或 ComfyUI 部署 BF16 检查点。


完整系统与开放范围

完整 H3 系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三部分组成。此次开放的是负责 768P 音视频生成的 H3-Base 及 FL2VA、Ref2VA 两类检查点;依赖多阶段托管模型与服务的 H3-Context-IR 没有随首批权重开放,2K 再生成模块 H3-Regenerate-2K 也尚未开放。开发者可通过 MiniMax 开放平台 API 组合托管的上下文解析和再生成服务,或自行构建提示词处理流程。


API 价格与许可限制

MiniMax 中国区开放平台按生成时长计费:768P 输出为 0.50 元/秒,2K 输出为 0.80 元/秒;参考视频输入按目标分辨率采用相同的每秒价格,音频输入免费,图片输入前 5 张免费、超出部分为 0.20 元/张。H3-Regeneration 与 H3-Context-IR 是独立计费接口,不与 H3-Base 的主价格混合。

开放权重采用 MiniMax H3 Community License Agreement,不是 MIT 或 Apache 2.0。协议允许在适用地区使用、修改、分发和创建衍生模型,也允许受条件约束的商业使用;但适用地区明确排除欧盟、英国、韩国和美国,商业产品或服务年收入超过 2000 万美元时需另行取得 MiniMax 书面授权,部署方还需遵守标识、安全防护和可接受使用政策等要求。该协议在本站按独立的 H3 Community License 条目记录,具体使用仍应以 官方协议原文 为准。

MiniMax H3

常见问题

MiniMax H3 能生成多长、多高清的视频?

单次最长 15 秒,最高 2K 分辨率、24 FPS,并且带 32 kHz 原生立体声音频。它的特点是音视频联合生成——不是先出画面再配音,而是由同一个 Transformer 联合预测视频和音频 latent,因此音画同步是模型内建的而非后期对齐。

MiniMax H3 的权重是真开源吗?

权重确实公开了,2026 年 8 月 2 日在 Hugging Face 上线,GitHub 也开放了代码仓库。但许可是 MiniMax H3 Community License Agreement,属于自定义社区许可而非 Apache 2.0、MIT 这类标准开源协议,商用前需要自行核对条款。

本地部署 MiniMax H3 需要什么配置?

权重约 354 GB,采用双检查点仓库结构,属于多卡部署级别。另需注意首批开放版本仅提供全注意力推理实现——模型原生支持稀疏注意力训练与推理,但稀疏注意力代码要后续才发布,因此当前推理的显存和算力开销高于模型的理论最优状态。

MiniMax H3 的架构是怎么组成的?

分三块。H3-Base 把文本、视觉与音频编码为统一的多模态序列,由单流 H3-Omni-Transformer 联合预测视频和音频 latent,这个 Transformer 约 33B 稠密参数,其中约 13B 位于 AdaLN 相关分支(纯推理部署时这些调制结果可预计算并缓存)。H3-Encoder 直接使用完整的 Qwen3-VL-32B 预训练权重,向生成 Transformer 提供第 50 层隐藏状态。视觉侧是时序因果 H3-VisualVAE,空间压缩 16 倍、时间压缩 4 倍;音频侧是 H3-AudioVAE,分别处理左右声道后重新组合为立体声。位置编码使用三维 Multimodal RoPE,同时表示时间与两个空间维度。

MiniMax H3 支持哪些输入?

文本、图像、视频、音频四种输入都支持,输出为音频和视频。它的定位是「通用全模态生成」,可以理解由这四类内容混合组成的多模态上下文再进行生成,而不只是单纯的文生视频。官方体验入口在海螺 AI 的 H3 工具页。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码