铭鸿体育资讯网

MiniMax H3(又称Hailuo 3.0) ▁▁▁▁▁▁▁▁▁   MiniMax H3(也常被社区称为 Hailuo 3.0)是中国AI公司MiniMax于2026年7月31日正式发布的新一代通用全模态生成模型。它是Hailuo系列视频模型的重大升级,定位从单一的文生视频/图生视频工具,转向能统一理解和生成文本、图像、视频、音频的全模态 ​

MiniMax H3(又称Hailuo 3.0)▁▁▁▁▁▁▁▁▁  MiniMax H3(也常被社区称为 Hailuo 3.0)是中国AI公司MiniMax于2026年7月31日正式发布的新一代通用全模态生成模型。它是Hailuo系列视频模型的重大升级,定位从单一的文生视频/图生视频工具,转向能统一理解和生成文本、图像、视频、音频的全模态系统。

◆ 核心能力与技术特点

  H3的最大亮点是真正的多模态统一上下文理解。它不需要把不同任务拆成多个模型流水线,而是在一次生成中同时处理文字描述、参考图片、参考视频和参考音频,并直接输出带有同步立体声音轨的视频。

  主要输出规格包括:

• 时长:4–15秒(整数秒)• 分辨率:默认短边768p;通过H3-Regenerate-2K模块可实现原生2K(约1440p短边,宽屏可达约2976×1248)• 帧率:24 fps• 音频:32 kHz原生立体声,包含对话、音效、环境声,与画面同步生成• 宽高比:支持21:9、16:9、4:3、1:1、3:4、9:16等多种比例,也支持自适应模式• 提示词长度:最长约7000字符,可支持多镜头叙事描述

  输入方面,H3支持两种主要模式:

1. 首尾帧模式(FL2VA):纯文本、单首帧、单尾帧或首尾帧组合,适合从静态图像生成连贯视频。2. 全参考模式(Ref2VA / Omni-reference):最多可输入9张图片 + 3段视频(总时长≤15秒) + 3段音频(总时长≤15秒),总文件数不超过12个。可精确锁定人物身份、动作、声音和风格。

  此外,它还支持基于指令的视频编辑,例如修改人物、背景、对话或声音,同时尽量保持其他元素不变。

  底层采用了多项自研技术,包括Contextual Omni Representation(上下文全模态表征)、H3-VAE、H3-Omni Transformer以及In-context Regeneration(上下文内重生成)。这些技术让模型在预训练阶段就具备较强的任务泛化能力,指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等表现突出。

  完整系统由三个模块构成:

• H3-Context-IR:负责深度理解并提炼复杂的多模态指令,转化为模型更易处理的中间表示(对最终质量影响很大,官方强烈推荐使用)。• H3-Base:基于中间表示生成带音频的768p视频。• H3-Regenerate-2K:将低分辨率结果连同原始上下文送回模型,重新生成更高精度的2K结果,能更好地保留细节(尤其是小字、品牌标识等)。

◆ 开源与使用方式

  2026年8月3日,MiniMax正式开源了H3的基础权重(H3-Base),可在Hugging Face和魔搭社区下载。开源版本主要支持本地生成768p结果,完整的Context-IR和2K重生成仍依赖官方API服务。社区已有多种本地部署方案(ComfyUI、Diffusers等),在经过量化和优化后,可在16GB甚至更低显存的消费级显卡上运行(速度较慢)。

  线上体验可通过Hailuo AI应用或MiniMax官方API(模型ID为MiniMax-H3)。定价方面,MiniMax宣称在2K分辨率下每秒价格不到主流模型的1/3,768p下约为主流720p的一半,性价比较高。

◆ 应用场景与定位

  H3特别适合广告、品牌宣传、电商产品展示、游戏过场、UI/UX演示、短剧分镜等需要精准控制和多模态参考的商业内容创作。它能一次性完成“参考某视频的镜头运动 + 让某图片中的人物按某音频唱歌”这类复杂指令,大幅降低多工具拼接的成本。

  与前代Hailuo 2.3相比,H3在分辨率(原生2K vs 最高1080p)、时长(最长15秒 vs 约10秒)、原生音频、多参考输入和指令编辑等方面都有明显提升,是MiniMax视频生成能力的一次质变。

  总体而言,MiniMax H3代表了当前开源视频生成领域向“通用全模态”迈进的重要一步,既保留了较高的商用潜力,又通过开源推动了生态发展。