上个月 MiniMax 刚用 M3 在文本模型上刷了一波存在感,今天 H3 来了——一款全模态生成模型,而且承诺几天内开源权重。
先看能力边界。H3 接受文本、图像、视频、声音任意组合作为输入(它叫多模态上下文),输出带原生双声道音频的视频,最高 15 秒 2K 分辨率。举个例子:扔进去一段参考视频(取它的希区柯克运镜)、一张人物图片、一段歌声录音,用自然语言告诉模型你要什么——H3 自己搞定剩下的。

这个"自己搞定"说起来轻巧,背后的训练范式变化不小。
MiniMax 之前做过两代视频模型(Hailuo 01 和 02),每一代都是按任务拆分的专家模型:文生图一个、图编辑一个、主体参考一个、动作参考一个、音色参考一个——搞过模型的人都知道这套路的痛苦,每个子任务一个 pipeline,维护成本指数级。H3 的选择是把这些墙全推了。文生图、文生视频、文生音频、图到图、图到视频、音频到音频、音视频到音视频——全部塞进同一个预训练框架,用自然语言描述任务关系。
这个思路 MiniMax 把它叫"任务泛化"。架构上砍掉了 Hailuo-02 里一些曾经带来优势但不利于泛化的设计(原话是"架构技巧应为模型定义让路"),换了一套更简洁的 H3-Omni Transformer,理解和生成部分做异构训练。最终端到端训练吞吐提升了近 30%。
技术栈里还有两个值得提的点。
一个是 H3-VAE。Tokenizer 彻底重写,压缩率带来 4 倍的序列长度收益,这是 H3 能在 2K 分辨率下把推理成本压下来的关键。
另一个是 In-context Regeneration。常规做法是训一个专用超分模块把低分辨率结果放大,H3 没用这条路——它让基座模型自己看自己的低分辨率输出,结合原始多模态上下文重新生成高分辨率版本。好处是超分不再靠"猜"——原来低分辨率看不清的小文字和细节,可以在重生成时利用原始上下文补回来。
价格方面,MiniMax 给的数据是:2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2。这个定价配合开源,态度很明确——不留溢价空间。
开源的承诺是"未来几天内,在符合相关法律法规的前提下,开放模型权重"。设计初期就考虑了国产芯片兼容性,这对国内开发者是个实际利好。
应用场景上,MiniMax 展示了电影片头、游戏 UI 动画、动态海报、广告电商四个方向。从演示来看,H3 在文字渲染和品牌信息呈现上比前代有明显提升——这是商业场景里最要命的一点,视频生成模型经常把 logo 和文字画得面目全非。
H3 也不是没有短板。MiniMax 自己承认:多模态上下文理解还有巨大提升空间,部分场景的画面精细度仍需打磨,模型规模限制了某些能力的完成度。他们的下一张牌是把 H 系列和 M 系列(文本模型)的能力融合。
一个有意思的细节:为了做多模态上下文的描述(Caption),MiniMax 定制了专门的模型管线,大部分素材消耗 100K Token 推理才能产出平均 4K Token 的描述。这个 25:1 的压缩比说明了一件事——让模型真正理解视频、图片、音频之间的关系,比生成它们难得多。
参考来源: