MiniMax 今天开源了 H3,一个 33B 参数的全模态生成模型,能生成带原生立体声的 2K 视频。没有发布会,没有预告,直接扔了篇文章出来,权重已经上传至 Hugging Face。

去年国内的视频生成模型还在追 Runway 和 Pika 的参数,今天 MiniMax H3 从架构到许可都摆上台面了。一个模型,三个模块,两个开源。
H3 由三个模块组成:H3-Context-IR 负责多模态指令理解和编排(闭源,提供 API);H3-Base 是核心生成模型,33B 参数,负责 768p 音视频生成(开源);H3-Regenerate-2K 负责 in-context 重新生成 2K 分辨率(闭源,提供 API)。简单说,理解和精修的部分闭源,生成的部分开源。

H3-Base 有三个技术点值得关注。第一,编码器用了 Qwen3-VL-32B 的完整预训练权重,取第 50 层 hidden states 喂给生成模型。一个 32B 的视觉语言模型,在 H3 里只是一个编码器。第二,Omni Transformer 是纯粹的 dense single-stream 结构,33B 参数,其中约 13B 在 AdaLN 分支中,推理时这部分可以预计算并缓存,不需要加载。没有 per-modality 的 attention 或 FFN 层,模态差异只体现在输入输出层和 AdaLN 分支。第三,原生支持稀疏注意力训练和推理,但首次开源版本只给了全注意力,稀疏注意力「后续更新中发布」。

视觉 VAE 的压缩率是 f16t4d24——空间 16 倍、时间 4 倍,24 个 latent channel。进 Transformer 前再 patchify 成 1×2×2,最终等效空间下采样 32 倍。音频 VAE 把 32 kHz 音频压到 40 Hz 的 latent token 率,左右声道独立编解码后合成立体声。
2K 输出没有用传统的超分辨率模块。H3 的做法是把 768p 生成结果连同原始上下文一起送回模型,让模型用 in-context 的方式重新生成。这个思路的好处是清楚的自洽:不需要额外训练一个超分模型,高分辨率输出能直接复用原始多模态上下文补充细节,而不是靠超分模块「猜」。
H3-Base 发了两个 checkpoint:FL2VA(首尾帧模式,0-2 张图输入)和 Ref2VA(全模态参考模式,最多 9 张图、3 段视频、3 段音频混合输入)。支持 SGLang、vLLM、diffusers、ComfyUI 部署。官方给出的 SGLang 部署示例需要 4 张 GPU。
许可证是 MiniMax H3 Community License,不是标准的开源协议。
参考来源: