MiniMax H3:打破任务和模态的边界

AIVideo GenerationMultimodalH3
MiniMax H3 banner image
MiniMax H3 banner image

今天,我们正式发布 MiniMax H3。这是一款通用的全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持 15s 2K 分辨率。

根据前期的邀测反馈,MiniMax H3 具备商用级的多场景内容生成能力,在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可实现精准、可控的多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

同时,得益于 Contextual Omni Representation, H3-VAE, H3-Omni Transformer, In-context Regeneration 等多项技术,我们有能力提供行业内最优的性价比。我们默认提供 2K 的分辨率,模型在 2K 分辨率下每秒价格不到主流模型的 1/3, 768P 分辨率下是主流模型720P的1/2。

长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。为了推动开源社区的发展、加速国产芯片适配(H3 设计初期就考虑了多款现有国产芯片的兼容性),以及方便有需要的用户定制自己的版本。我们计划在未来几天内,在符合相关法律法规的前提下,开放模型权重。

H3 的模型特色

视频 1

H3 multimodal input screenshot - figure 2

图 2

音频 3

H3 生成视频:

H3 的应用案例

H3 的设计理念

打破任务的边界:从专用迈向通用

我们之前研发过两代模型:Hailuo 01 从 0 到 1 构建系统、Hailuo 02 专注于架构效率、数据质量和规模等核心组件的提升。

在 H3 的设计过程中,我们意识到过往生成模型在任务上的局限性:图片生成往往分为独立的 T2I/Editing/主体参考/动作参考/风格参考等为独立的专家模型,声音生成中的人声、音效、音乐也多作为独立的领域被研究,视频生成更是分为文生视频、图生视频、首尾帧、主体参考、动作参考、音色参考、视频编辑等细分功能;图像、视频、音频之间也有着清晰的边界。

这些任务/能力/模态的隔离限制了使用上的自由度,也从训练范式上限定了模型的泛化能力。这两点对应着应用范式和训练范式的巨大变革空间。因此,H3 构建过程的第一纲领,即是任务的统一和泛化。

基于此,简要概括一下 H3 的预训练范式 ——

这些选择导向同一个目标:让 H3 在预训练阶段就具备广泛的多模态上下文理解和生成能力。

前面我们讨论了训练范式的变化,视频模型的应用形态正在发生怎样的变化呢?

我们看到,创作者可以直接用自然语言描述任务,而不仅是输入一段简单的画面提示词。随着多模态理解、指令遵循和复杂任务执行能力持续提升,视频模型将能够理解更完整的创作意图,处理更复杂的内容需求,并逐步从"生成一段视频",走向真正参与内容生产的全过程。

H3 的技术选择

简单分享一些 H3 的核心技术:

后续我们会发布更加详细的 H3 Tech Report,欢迎更多的朋友们交流。

Vision & What's Next

语言、图片、视频、音频是广泛存在的自然模态,它们紧密交织在一起,是人与世界交互的基本媒介。由它们构成的多模态上下文,可以高效的表达广泛的信息,而信息的表达和传递本身就是一种生产力。

对于多模态理解和生成来说,我们可以把语言看作一套可泛化可 Scaling 的计算系统,因此我们认为多模态应该紧密关联语言。

H3 目前还存在一些局限性,以下是我们后续版本会提升的方向:

Intelligence with Everyone.