MiniMax H3 是稀宇科技(MiniMax)于2026年7月31日正式发布的新一代通用全模态生成模型,也是该公司首款计划开源的多模态视频生成模型(部分语境下也被称为Hailuo H3)。它打破了以往视频模型在生成、编辑、参考等任务之间的清晰边界,实现了文本、图像、视频与音频的统一上下文理解与生成。

核心能力

H3 能够理解由文本、图片、视频和音频共同构成的多模态上下文,并直接生成带原生双声道立体声音频的视频。输出最高支持15秒、2K分辨率(默认),支持多种宽高比(包括21:9、16:9、4:3、1:1、3:4、9:16等),帧率约24fps。

主要生成与编辑模式包括:

  • 文本生视频(Text-to-Video)
  • 图像生视频(Image-to-Video,支持首帧)
  • 首尾帧过渡(First-to-Last Keyframe)
  • 多模态参考生视频(Reference-to-Video):可同时输入最多约9张图片、3段视频及音频,通过自然语言描述各元素关系进行条件生成
  • 视频编辑与视频到视频动作迁移(V2V Motion Transfer)

早期测试与第三方评测显示,H3在指令遵循、准确文字与品牌信息呈现、商业级内容可控性方面表现突出。Artificial Analysis视频模型榜单中,其视频编辑能力位居全球第一,文本生视频与图像生视频也位居前列。

适用场景广泛覆盖广告、品牌、电商、产品设计、UI/UX、游戏等商业内容创作需求。

关键技术亮点

H3 采用了多项自研技术,强调从预训练阶段就实现任务与模态的通用化:

  • Contextual Omni Representation(上下文全模态表征):强化Caption能力,构建专用全模态理解管线,将复杂素材(通常需约10万Token推理)蒸馏为平均约4K Token的描述,用语言作为桥梁统一任务表达。
  • H3-VAE:全新Tokenizer,大幅提升重建质量与可学习性,高压缩比带来约4倍有效序列长度增益,是原生2K支持与成本控制的关键。
  • H3-Omni Transformer:为任务通用化设计的架构,分离理解与生成负载,提升训练吞吐近30%。
  • In-Context Regeneration(上下文内再生):2K高分辨率并非依赖传统超分模块,而是由基模对自身低分辨率结果进行上下文再生成,能更好地保留细小文字与细节,复用基模生成能力。

设计哲学从Hailuo系列前代(聚焦系统构建与核心组件优化)转向“打破任务边界”,将文本生图/视频、原生音频联合建模、广义参考与编辑等能力在预训练中深度融合,追求更强的泛化与创意自由度。

定价与可用性

官方按量计费(中国区参考):

  • 2K分辨率:约0.80元/秒
  • 768P分辨率:约0.50元/秒
  • 音频输入免费;前5张参考图免费,超出部分约0.20元/张;视频输入按输出分辨率同价计费。

该价格显著低于多数主流旗舰视频模型(2K约为主流模型的三分之一,768P也具明显优势)。目前主要通过MiniMax API按量计费使用,暂不纳入Token Plan或视频资源包。同时已上线Vercel AI Gateway等平台,并支持在Hailuo AI App中体验。

MiniMax计划在符合相关法律法规的前提下,于发布后几天内开放模型权重(预计采用MiniMax Community License),以推动开源生态、硬件适配与用户自定义版本开发。硬件兼容性在设计初期即被重点考虑。

定位与展望

H3 代表了MiniMax从“特化任务模型”向“通用多模态智能”迈进的重要一步。它不再把生成、编辑、参考等能力割裂,而是让模型在多模态上下文中直接理解创作意图,完成更自然、连贯的表达。官方表示后续将持续加强多模态理解(计划融合M系列能力)、扩大模型规模、提升视觉细节与更高分辨率。

总体来看,MiniMax H3以较强的指令遵循、原生音视频一体化、高性价比2K输出以及即将开源的姿态,成为2026年中后期视频生成领域值得关注的新选项,尤其适合需要商业可控性与多参考复杂创作的用户与企业。技术报告预计很快公开,感兴趣者可关注MiniMax官方渠道获取最新权重与文档。

主题授权提示:请在后台主题设置-主题授权-激活主题的正版授权,授权购买:RiTheme官网

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。