MiniMax H3 开源:33B 全模态模型,一个视觉语言模型只够当它的编码器
MiniMax 今天开源了 H3,一个 33B 参数的全模态生成模型,能生成带原生立体声的 2K 视频。没有发布会,没有预告,直接扔了篇文章出来,权重已经上传至 Hugging Face。 去年国内的视频生成模型还在追 Runway 和 Pika 的参数,今天 MiniMax H3 从架构到许可都摆上台面了。一个模型,三个模块,两个开源。 H3 由三个模块组成:H3-Context-IR 负责多模态指令理解和编排(闭源,提供 API);H3-Base 是核心生成模型,33B 参数,负责 768p 音视频生成(开源);H3-Regenerate-2K 负责 in-context 重新生成 2K ...


