MiniMax H3 是稀宇科技(MiniMax)于2026年7月31日正式发布的新一代通用全模态生成模型,也是该公司首款计划开源的多模态视频生成模型(部分语境下也被称为Hailuo H3)。它打破了以往视频模型在生成、编辑、参考等任务之间的清晰边界,实现了文本、图像、视频与音频的统一上下文理解与生成。
核心能力
H3 能够理解由文本、图片、视频和音频共同构成的多模态上下文,并直接生成带原生双声道立体声音频的视频。输出最高支持15秒、2K分辨率(默认),支持多种宽高比(包括21:9、16:9、4:3、1:1、3:4、9:16等),帧率约24fps。
主要生成与编辑模式包括:
- 文本生视频(Text-to-Video)
- 图像生视频(Image-to-Video,支持首帧)
- 首尾帧过渡(First-to-Last Keyframe)
- 多模态参考生视频(Reference-to-Video):可同时输入最多约9张图片、3段视频及音频,通过自然语言描述各元素关系进行条件生成
- 视频编辑与视频到视频动作迁移(V2V Motion Transfer)
早期测试与第三方评测显示,H3在指令遵循、准确文字与品牌信息呈现、商业级内容可控性方面表现突出。Artificial Analysis视频模型榜单中,其视频编辑能力位居全球第一,文本生视频与图像生视频也位居前列。
适用场景广泛覆盖广告、品牌、电商、产品设计、UI/UX、游戏等商业内容创作需求。
关键技术亮点
H3 采用了多项自研技术,强调从预训练阶段就实现任务与模态的通用化:
- Contextual Omni Representation(上下文全模态表征):强化Caption能力,构建专用全模态理解管线,将复杂素材(通常需约10万Token推理)蒸馏为平均约4K Token的描述,用语言作为桥梁统一任务表达。
- H3-VAE:全新Tokenizer,大幅提升重建质量与可学习性,高压缩比带来约4倍有效序列长度增益,是原生2K支持与成本控制的关键。
- H3-Omni Transformer:为任务通用化设计的架构,分离理解与生成负载,提升训练吞吐近30%。
- In-Context Regeneration(上下文内再生):2K高分辨率并非依赖传统超分模块,而是由基模对自身低分辨率结果进行上下文再生成,能更好地保留细小文字与细节,复用基模生成能力。
设计哲学从Hailuo系列前代(聚焦系统构建与核心组件优化)转向“打破任务边界”,将文本生图/视频、原生音频联合建模、广义参考与编辑等能力在预训练中深度融合,追求更强的泛化与创意自由度。
定价与可用性
官方按量计费(中国区参考):
- 2K分辨率:约0.80元/秒
- 768P分辨率:约0.50元/秒
- 音频输入免费;前5张参考图免费,超出部分约0.20元/张;视频输入按输出分辨率同价计费。
该价格显著低于多数主流旗舰视频模型(2K约为主流模型的三分之一,768P也具明显优势)。目前主要通过MiniMax API按量计费使用,暂不纳入Token Plan或视频资源包。同时已上线Vercel AI Gateway等平台,并支持在Hailuo AI App中体验。
MiniMax计划在符合相关法律法规的前提下,于发布后几天内开放模型权重(预计采用MiniMax Community License),以推动开源生态、硬件适配与用户自定义版本开发。硬件兼容性在设计初期即被重点考虑。
定位与展望
H3 代表了MiniMax从“特化任务模型”向“通用多模态智能”迈进的重要一步。它不再把生成、编辑、参考等能力割裂,而是让模型在多模态上下文中直接理解创作意图,完成更自然、连贯的表达。官方表示后续将持续加强多模态理解(计划融合M系列能力)、扩大模型规模、提升视觉细节与更高分辨率。
总体来看,MiniMax H3以较强的指令遵循、原生音视频一体化、高性价比2K输出以及即将开源的姿态,成为2026年中后期视频生成领域值得关注的新选项,尤其适合需要商业可控性与多参考复杂创作的用户与企业。技术报告预计很快公开,感兴趣者可关注MiniMax官方渠道获取最新权重与文档。
主题授权提示:请在后台主题设置-主题授权-激活主题的正版授权,授权购买:RiTheme官网

评论(0)