Hailuo H3 使用指南:功能、提示词与视频案例

Monipix Teamon 13 days ago

Hailuo H3 多模态 AI 视频与原生立体声音频工作流

Hailuo H3 不只是一个无声的文生视频模型。MiniMax 将文本、图片、视频和音频放进同一个生成上下文,让短视频的画面、镜头、对白、环境声与音乐能够围绕同一创意协同生成。真正重要的问题不是“H3 的功能多不多”,而是怎样把这些能力变成可控制、可复现的结果。

快速结论: Hailuo H3 适合生成 4–15 秒的短视频,尤其适用于画面、镜头运动、对白、环境声和音乐需要统一导演的场景。第一次尝试时,先设计一个明确的视觉事件,只使用一种主要运镜,并把画面内声音和背景音乐分开描述。

最后更新:2026 年 8 月 11 日。本文依据 MiniMax 已发布的 H3 模型卡与官方提示词指南编写。

Hailuo H3 是什么?

Hailuo H3 也被称为 MiniMax H3 或 Hailuo 03,是 MiniMax 的通用多模态生成系统。它可以根据文字生成视频、让首帧图片动起来、连接首尾帧,也能在受支持的工作流中引用图片、视频或音频。生成结果可以直接包含立体声音轨,不必再单独完成一次音频生成。

与 Hailuo 02 相比,H3 的重点也发生了变化。MiniMax 将 Hailuo 02 描述为对架构、数据质量和模型规模的提升;H3 则把过去分散的视频生成、参考控制、编辑和音频能力统一起来。当声音与画面必须同步,或需要多模态参考时,优先选择 H3;如果只是测试无声运动,更简单的模型可能更省成本。

Hailuo H3 规格速览

规格 H3 数值
时长 4–15 秒
帧率 24 FPS
音频 32 kHz 立体声
基础输出 短边 768px
托管输出 最高 2K

H3 更适合一个场景、一个广告节拍、一个产品镜头或一段社交媒体短片。24 FPS 提供常见的电影感节奏;原生音频可同时生成对白、环境声、动作音效和音乐。托管版的 2K 输出属于结合上下文的重新生成,并不是普通锐化滤镜。

支持的画幅包括 21:9、16:9、4:3、1:1、3:4 和 9:16。官方列出的稳定对白语言有 11 种,包括中文、英文、日文、韩文和西班牙文。根据具体工作流,文本以及图片、视频、音频参考可以分别控制主体、首帧、动作、声音或配乐。

MiniMax 官方 H3 模型卡是这些规格的依据。不同平台可能只开放完整研究系统中的一部分控制项,因此实际生成时应以当前生成器展示的时长、比例、分辨率和引用方式为准。

Hailuo H3 视频案例:四种能力直接看

下面四个官方案例分别展示原生人声、2K 细节、立体声空间感和片头设计控制。每张预览图下方都可打开 MP4 并收听原始音轨。

1. 原生人声与镜头运动

Hailuo H3 户外咖啡馆歌手原生音频案例

打开 MP4(含原声)

这个咖啡馆表演把可见歌手、移动镜头和生成音频放在同一镜头中。观察运镜时的嘴部、面部和背景变化,可以判断声音与运动是否保持连贯。

2. 2K 纹理与微距细节

Hailuo H3 睫角守宫 2K 微距细节案例

打开 MP4(含原声)

守宫特写很适合检验 2K 输出。鳞片、眼睛和浅景深背景会放大纹理漂移、局部变软以及连续帧细节丢失,比宽阔风景更容易发现问题。

3. 立体声与空间氛围

Hailuo H3 工业电梯走廊立体声案例

打开 MP4(含原声)

工业走廊案例突出环境声的方向变化。戴上耳机,在镜头穿过空间时比较左右声道,就能更清楚地感受空间音频是否跟随画面移动。

4. 字体与片头序列控制

Hailuo H3 黑胶唱片电影片头案例

打开 MP4(含原声)

黑色电影风格的唱片片头测试的不只是写实度,还包括灯光、平面构图、镜头节奏和画面文字。它是一种很容易暴露提示词遵循能力的复合任务。

如何在 Monipix 使用 Hailuo H3

  1. 打开模型页面。 进入 Hailuo H3 视频生成器,模型设置和官方案例可以在同一页面查看。
  2. 选择文本或图片输入。 文生视频更适合探索新构图;图生视频更适合固定首帧、产品、角色身份或画幅。
  3. 先定义一个交付目标。 在写提示词前确定时长、发布渠道、主体、主要动作、结束画面和一个必须出现的声音。
  4. 按播放顺序写事件。 先交代开场构图,再描述动作和运镜,最后写对白与声音。不要只堆互不相关的视觉形容词。
  5. 检查格式与积分。 提交前确认页面显示的时长、比例、分辨率和积分报价;整体积分规则可查看 Monipix 价格页面
  6. 画面和声音一起审核。 检查人物一致性、手部、产品结构、可见文字、对白时机、口型、左右声道平衡和最后一帧。每轮只修改一个指令,问题更容易定位。

第一次生成要有意保持简单。创建一条 5 秒 Hailuo H3 测试视频,再投入复杂的 15 秒镜头。一个运镜和一个声音事件,比五个同时竞争的创意更容易判断成败。

Hailuo H3 官方提示词结构

Hailuo H3 主体、时间线、镜头、画面和音频提示词蓝图

日常生成可以先使用这条易读公式:

主体与首帧 → 按时间发生的动作 → 镜头 → 视觉处理 → 对白与画内声 → 背景音乐 → 一致性限制

MiniMax 的官方 H3 提示词指南把同一思路拆成三个字段:

integrated_multimodal_description:
[Shot 1] ...

overall_soundscape:
...

non_diegetic_music:
...
  • integrated_multimodal_description 用来写可见动作、镜头、运镜、说话者、对白和场景内真实存在的声音。
  • overall_soundscape 汇总雨声、脚步、衣料摩擦、碰撞或呼吸等环境与物理声音。
  • non_diegetic_music 描述观众能听到、角色却听不到的配乐。不需要音乐时写 N/A

把三者分开可以避免一个常见失败:把对白、房间声、动作音效和音乐塞进一句模糊描述,导致模型无法判断时间与优先级。

精确描述分镜与运镜

第一镜直接从 [Shot 1] 开始,不需要时间戳。如果确实需要切镜,在下一镜写类似 [Shot 2] At 00:03.500, the camera cuts to...。只有切换镜头能带来新信息时才使用剪切;如果只是改变构图,优先使用运镜。

官方指南把镜头指令拆成“运动类型 + 幅度 + 速度”。不要只写“动态电影镜头”,可以写“镜头以小幅度、慢速向前推进”。在短视频里,一种相容的运镜通常比同时要求平移、环绕、变焦和手持更稳定。

让模型始终识别说话者

给每位说话者一个固定 ID,并且只把真正要说出的句子放进语言标签:

The radio operator with a low,
calm voice (S1) says:
<d>[Chinese]
七号频道,大桥已开放。
</d>

跨镜头时继续使用同一个 (S1)。如果是画外音,要明确写 off-screen voiceover,并说明画面中角色保持闭嘴。短对白更容易在短片时长内自然完成,不要塞入整段广告文案。

两个 Hailuo H3 提示词案例

文生视频:带原生音频的无线电操作员

integrated_multimodal_description:
[Shot 1] Live-action cinematic style.
A tired radio operator in a navy field
jacket stands in a rain-streaked rooftop
control room at blue hour.
A medium tracking shot follows her as she
reconnects one loose cable; the signal
changes from red to green.
The camera pushes in with small amplitude
at slow speed. She leans toward the mic.
The operator with a low, steady voice (S1)
says: <d>[English] Channel Seven,
the bridge is open.</d>
She closes her lips and watches the green
light through the final frame.
Rain, one relay click, and radio static stay
synchronized with the action.
Keep her face, jacket, earpiece, and the
control-panel layout consistent.

overall_soundscape:
Steady rain hits the metal roof while low
radio static fills the room. One cable click
and one relay snap match the visible action.

non_diegetic_music:
N/A

Monipix 实测: 我们通过秘塔 MiniMax H3 API 使用上面的结构生成了下方样片。交付的 MP4 时长 5 秒,分辨率 2688×1536,帧率 24 FPS,并包含 32 kHz 立体声 AAC 音轨。

Monipix Hailuo H3 夜班无线电操作员实测画面

打开 MP4(含原声)

生成画面在同一构图中保留了操作员、无线电控制台、雨夜窗户和低调电影灯光。打开 MP4 可以检查镜头运动并收听生成音频。

图生视频:保持产品外形并加入运动

当来源图片已经提供准确首帧时,重点描述“要发生的变化”,不要重复图片里已经明确的全部内容:

The source image is the exact opening frame.
Preserve the speaker's shape, grille pattern,
control layout, pedestal, and charcoal studio
background. Over 6 seconds, a narrow warm
light travels across the fabric texture while
the camera performs one slow arc shot of about
30 degrees. Tiny water droplets rise once with
a deep bass note, then settle as the camera
stops on a clean three-quarter hero view.
Audio: one bass pulse, subtle room reflection,
and a quiet power-button click. No hands, logo
changes, extra text, or shape distortion.

需要自由探索新场景时使用文生视频;当构图、产品或人物身份必须稳定时,使用图生视频

Hailuo H3 常见问题与修正方法

  • 对白随机或说错: 对白可能混进了描述性文字。分配 (S1),并把准确台词放入 <d>[Language] ...</d>
  • 镜头指令被忽略: 短时长里可能有多个运镜互相竞争。保留一种运镜,并写清类型、幅度和速度。
  • 人物或产品漂移: 纯文本既要创造主体又要维持主体。使用干净的参考图,并点名少数绝对不能变化的特征。
  • 切镜显得仓促: 4–15 秒里塞入了太多事件。删除一次切镜,或者分别生成镜头后再剪辑。
  • 音频过于拥挤: 环境、音效、对白与音乐没有层级。把 soundscape 与非叙事音乐分开,并删除不重要的声音。
  • 文字或手部错误: 2K 不会消除生成瑕疵。缩短可见文字,避免关键手部交互,并逐帧检查最终结果。

Hailuo H3 是开源模型吗?

Hailuo H3 已开放发布,但完整的托管 2K 系统并未全部开源。MiniMax 以 Community License 发布 H3-Base-FL2VA 和 H3-Base-Ref2VA 权重。H3-Base 生成 768p 级别输出;托管的 H3-Context-IR 预处理系统和 H3-Regenerate-2K 模块目前不在开放版本中。

这一区别会影响部署选择。开发者可以运行和适配已发布的基础权重,但要复现官方 2K 流程,仍需使用托管 API 组件或自行构建提示词处理与再生成系统。只需要成片的创作者,通常使用托管工作流比维护完整模型栈更直接。

局限与负责任使用

H3 最长 15 秒,更适合集中表达一个镜头,而不是一次生成完整电影。较长故事可以用相同的人物描述或参考图分别生成多个片段,再进入剪辑。原生音频减少了制作交接,但不能代替最终声音审核。

请在全分辨率下检查脸部、手指、产品结构、反射、字体和对白。MiniMax 也说明部分场景的视觉细节仍有提升空间。同时确认自己有权使用每一张上传图片、视频、声音、Logo 和角色;生成相貌或声音不等于获得模仿真人的许可。

总结

Hailuo H3 的优势在于让短视频画面和声音遵循同一份制作简报。它支持 4–15 秒、24 FPS、原生立体声、多种画幅、多模态参考,以及用于分镜、对白、环境声和音乐的官方提示词结构。

先从一个镜头和一个必须出现的声音开始;外观必须准确时使用参考图;对白要明确标记;只有切镜能提供新信息时再增加镜头。准备好后,可以使用 Hailuo H3 生成器开始测试,并用同一份画面与声音检查清单比较每次修改。

常见问题

Hailuo H3 是什么?

Hailuo H3,也称 MiniMax H3 或 Hailuo 03,是一个能够理解文本、图片、视频和音频的多模态生成系统。它可以制作 4–15 秒、24 FPS、带原生立体声的短视频,并支持文生视频、首帧引导和参考控制工作流。托管版本还可以通过上下文再生成达到最高 2K 输出。

Hailuo H3 可以同时生成视频和声音吗?

可以。Hailuo H3 会在生成画面的同时生成 32 kHz 立体声音轨。提示词能够协调对白、环境氛围、动作音效和背景音乐。台词越短越准确、声景只保留重要事件,并把观众听到的配乐与角色所在空间的声音分开,结果通常越容易控制。

Hailuo H3 视频最长多久、分辨率是多少?

Hailuo H3 支持 4–15 秒、24 FPS 的视频。开放发布的 H3-Base 默认以短边 768 像素输出,完整托管流程可结合上下文把结果重新生成到最高 2K。各平台开放的时长、比例和分辨率可能不同,提交前应以生成器当前显示为准。

Hailuo H3 提示词里的对白应该怎么写?

先给每个说话者分配固定 ID,例如 (S1),再把准确台词放进 <d>[Chinese] 你的台词。</d> 这样的语言标签。说话者的音色描述应写在标签外,并跨镜头保持同一 ID。画外音要明确标注为 off-screen,同时说明可见角色保持闭嘴。

Hailuo H3 完全开源吗?

不是。MiniMax 已用 Community License 发布两个 H3-Base 权重,但完整官方流程只开放了一部分。托管的 H3-Context-IR 预处理系统和 H3-Regenerate-2K 模块不在当前开源版本中,因此本地 H3-Base 主要输出 768p,除非开发者结合托管组件或自行构建替代方案。