- Blog
- Guía de Hailuo H3: funciones, prompts y uso
Guía de Hailuo H3: funciones, prompts y uso

Hailuo H3 no es otro modelo de texto a vídeo sin sonido. MiniMax lo diseñó para interpretar texto, imágenes, vídeo y audio dentro de un mismo contexto y generar un clip cuya imagen, cámara, diálogo, ambiente, efectos y música respondan a una sola dirección creativa. La cuestión útil no es cuántas funciones incluye, sino cómo convertirlas en un resultado controlable.
Respuesta rápida: Hailuo H3 funciona mejor en vídeos de 4 a 15 segundos donde imagen y sonido deben coordinarse. Para una primera prueba fiable, plantea una sola acción visual, descríbela en orden cronológico, utiliza un movimiento de cámara con propósito y separa los sonidos de la escena de la música de fondo.
Última actualización: 11 de agosto de 2026. Esta guía se basa en la ficha del modelo H3 y la guía oficial de prompts publicadas por MiniMax.
¿Qué es Hailuo H3?
Hailuo H3, también llamado MiniMax H3 o Hailuo 03, es el sistema de generación multimodal de propósito general de MiniMax. Puede crear vídeo a partir de texto, animar una imagen inicial, conectar el primer y último fotograma y usar referencias de imagen, vídeo o audio en los flujos compatibles. El resultado puede incorporar audio estéreo nativo sin una fase de sonido independiente.
H3 también cambia el enfoque respecto a Hailuo 02. MiniMax presenta Hailuo 02 como una mejora de arquitectura, calidad de datos y escala; H3 unifica tareas que antes estaban separadas, como generación, referencias, edición y audio. Conviene elegir H3 cuando importan la coordinación audiovisual o el control multimodal. Para una prueba de movimiento sin sonido, un modelo más sencillo puede resultar más económico.
Especificaciones principales de Hailuo H3
| Especificación | Valor H3 |
|---|---|
| Duración | 4–15 s |
| Fotogramas | 24 FPS |
| Audio | Estéreo a 32 kHz |
| Salida base | Lado corto de 768 px |
| Salida alojada | Hasta 2K |
H3 encaja bien en una escena, un momento de anuncio, un plano de producto o un clip social breve. Los 24 FPS ofrecen una cadencia cinematográfica habitual. El audio nativo puede generar diálogo, ambiente, efectos y música junto a la imagen. La salida 2K alojada es una regeneración consciente del contexto, no un filtro genérico de enfoque.
Las relaciones de aspecto compatibles incluyen 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16. El diálogo estable abarca 11 idiomas indicados por MiniMax, entre ellos español, inglés, chino, japonés y coreano. Según el flujo, las referencias de texto, imagen, vídeo y audio pueden controlar el sujeto, el fotograma inicial, el movimiento, la voz o la banda sonora.
La ficha oficial de MiniMax H3 respalda estas especificaciones. Cada plataforma puede exponer solo una parte del sistema completo, por lo que los controles visibles en el generador son la referencia final para una ejecución concreta.
Ejemplos de Hailuo H3: cuatro capacidades en vídeo
Los cuatro ejemplos oficiales siguientes aíslan voz nativa, detalle 2K, sonido estéreo y control de una secuencia de títulos. Debajo de cada imagen puedes abrir el MP4 y escuchar su audio original.
1. Voz nativa y movimiento de cámara

La actuación combina una cantante visible, cámara en movimiento y sonido generado. Observa boca, rostro y fondo mientras cambia el encuadre: esos elementos permiten juzgar si audio y movimiento conservan coherencia dentro del mismo plano.
2. Textura 2K y detalle macro

El primer plano del gecko es una prueba práctica de 2K. Las escamas, el ojo y el fondo desenfocado hacen que la pérdida de textura, la suavidad o las variaciones entre fotogramas sean más fáciles de detectar que en un paisaje amplio.
3. Sonido estéreo y atmósfera espacial

Este corredor industrial destaca la dirección del sonido ambiental. Utiliza auriculares y compara los canales izquierdo y derecho mientras la cámara recorre el espacio; la escena facilita comprobar si el audio espacial acompaña a la imagen.
4. Tipografía y secuencia de títulos

La secuencia noir del disco prueba más que realismo. Combina iluminación, composición gráfica, ritmo de cámara y texto en pantalla, una petición de varias capas que revela con rapidez si el modelo sigue la dirección dada.
Cómo usar Hailuo H3 en Monipix
- Abre la página del modelo. En el generador de vídeo Hailuo H3 encontrarás el flujo H3 y los vídeos oficiales en un mismo lugar.
- Elige texto o imagen. El texto a vídeo sirve para explorar una composición nueva. La imagen a vídeo es mejor cuando debes fijar el primer fotograma, un producto, un personaje o la relación de aspecto.
- Define una sola entrega. Antes de redactar, decide duración, destino, sujeto, acción principal, fotograma final y un sonido imprescindible.
- Escribe los eventos en orden de reproducción. Establece la composición inicial, describe la acción, dirige la cámara y termina con diálogo y sonido. Evita listas de adjetivos visuales inconexos.
- Comprueba formato y créditos. Revisa duración, proporción, resolución y coste en créditos antes de enviar. La página de precios de Monipix explica el sistema general.
- Evalúa imagen y sonido juntos. Comprueba identidad, manos, geometría del producto, texto visible, tiempo del diálogo, labios, balance estéreo y fotograma final. Modifica una instrucción cada vez.
La primera ejecución debe ser pequeña a propósito. Crea una prueba de Hailuo H3 de 5 segundos antes de preparar una secuencia compleja de 15 segundos. Una cámara y un evento sonoro permiten diagnosticar mejor el resultado que cinco ideas en competencia.
Estructura oficial de prompts para Hailuo H3
Para el trabajo diario, empieza con esta fórmula legible:
Sujeto y fotograma inicial → acción cronológica → cámara → tratamiento visual → diálogo y sonido de escena → música de fondo → restricción de consistencia
La guía oficial de prompts de H3 formaliza la misma idea mediante tres campos:
integrated_multimodal_description:
[Shot 1] ...
overall_soundscape:
...
non_diegetic_music:
...
integrated_multimodal_descriptioncontiene acción visible, planos, cámara, hablantes, diálogo y sonidos que existen dentro de la escena.overall_soundscaperesume ambiente y sonidos físicos, como lluvia, pasos, tela, golpes o respiración.non_diegetic_musicdescribe música que oye la audiencia pero no los personajes. EscribeN/Asi no quieres música.
Esta separación evita un error habitual: pedir diálogo, sonido de sala, efectos y música en una sola frase sin establecer tiempos ni prioridades.
Describe planos y cámara con precisión
Empieza con [Shot 1] sin marca temporal. Si el vídeo necesita un corte real, inicia el siguiente plano con algo como [Shot 2] At 00:03.500, the camera cuts to.... Cada corte debe revelar información nueva; si solo cambia el encuadre, utiliza movimiento de cámara.
La guía oficial descompone la dirección de cámara en tipo de movimiento + amplitud + velocidad. En lugar de “cámara dinámica y cinematográfica”, escribe “la cámara avanza lentamente con poca amplitud”. Un movimiento compatible suele funcionar mejor que acumular paneo, órbita, zoom y cámara en mano.
Mantén identificable a cada hablante
Asigna un ID estable a cada hablante y coloca solo las palabras pronunciadas dentro de una etiqueta de idioma:
The radio operator with a low,
calm voice (S1) says:
<d>[Spanish]
Canal Siete, el puente está abierto.
</d>
Conserva (S1) entre planos. Para una voz en off, indica off-screen voiceover y especifica que el personaje visible mantiene los labios cerrados. Un diálogo corto cabe de forma más natural en un clip breve que un párrafo publicitario.
Dos ejemplos de prompts para Hailuo H3
Texto a vídeo con audio nativo
integrated_multimodal_description:
[Shot 1] Live-action cinematic style.
A tired radio operator in a navy field
jacket stands in a rain-streaked rooftop
control room at blue hour.
A medium tracking shot follows her as she
reconnects one loose cable; the signal
changes from red to green.
The camera pushes in with small amplitude
at slow speed. She leans toward the mic.
The operator with a low, steady voice (S1)
says: <d>[English] Channel Seven,
the bridge is open.</d>
She closes her lips and watches the green
light through the final frame.
Rain, one relay click, and radio static stay
synchronized with the action.
Keep her face, jacket, earpiece, and the
control-panel layout consistent.
overall_soundscape:
Steady rain hits the metal roof while low
radio static fills the room. One cable click
and one relay snap match the visible action.
non_diegetic_music:
N/A
Prueba de Monipix: Generamos el ejemplo siguiente mediante la API de MiniMax H3 de Metaso utilizando esta estructura. El MP4 entregado dura cinco segundos, mide 2688×1536, funciona a 24 FPS y contiene una pista AAC estéreo a 32 kHz.

El fotograma conserva operadora, consola, ventanas iluminadas por la lluvia y luz cinematográfica tenue en una composición coherente. Abre el MP4 para revisar la cámara y escuchar el audio generado.
Imagen a vídeo para conservar un producto
Cuando la imagen de origen ya proporciona el primer fotograma exacto, describe el cambio en vez de repetir todo lo visible:
The source image is the exact opening frame.
Preserve the speaker's shape, grille pattern,
control layout, pedestal, and charcoal studio
background. Over 6 seconds, a narrow warm
light travels across the fabric texture while
the camera performs one slow arc shot of about
30 degrees. Tiny water droplets rise once with
a deep bass note, then settle as the camera
stops on a clean three-quarter hero view.
Audio: one bass pulse, subtle room reflection,
and a quiet power-button click. No hands, logo
changes, extra text, or shape distortion.
Usa texto a vídeo para explorar escenas nuevas y imagen a vídeo cuando la composición o identidad sea prioritaria.
Problemas comunes de Hailuo H3 y cómo corregirlos
- Diálogo aleatorio o incorrecto: El texto hablado está mezclado con la descripción. Asigna
(S1)y coloca la frase exacta dentro de<d>[Language] ...</d>. - La cámara ignora la instrucción: Varios movimientos compiten en pocos segundos. Conserva uno e indica tipo, amplitud y velocidad.
- El personaje o producto cambia: El texto debe inventar y mantener el sujeto. Parte de una imagen limpia y nombra los pocos rasgos que no pueden variar.
- Los cortes se sienten apresurados: Hay demasiados momentos en 4–15 segundos. Elimina un corte o genera los planos por separado para editarlos después.
- El audio está saturado: Ambiente, efectos, diálogo y música no tienen jerarquía. Separa el paisaje sonoro de la música no diegética y quita sonidos secundarios.
- El texto o las manos fallan: 2K no elimina los artefactos generativos. Acorta el texto visible, evita interacciones manuales críticas y revisa cada fotograma final.
¿Hailuo H3 es de código abierto?
Hailuo H3 se ha publicado abiertamente, pero el sistema 2K alojado completo no es totalmente abierto. MiniMax distribuye los modelos H3-Base-FL2VA y H3-Base-Ref2VA con su Community License. H3-Base produce una salida con lado corto de 768 px; H3-Context-IR y H3-Regenerate-2K no forman parte de la versión abierta actual.
La diferencia importa para el despliegue. Los desarrolladores pueden ejecutar y adaptar los modelos base publicados, pero reproducir la canalización 2K oficial requiere componentes de API alojados o construir un sistema alternativo de procesamiento y regeneración. Para quien solo necesita clips terminados, un flujo alojado suele ser más sencillo que operar toda la pila del modelo.
Limitaciones y uso responsable
El máximo de 15 segundos favorece planos enfocados, no películas completas. Para una historia larga, genera varios clips con la misma descripción de personaje o imagen de referencia y edítalos juntos. El audio nativo reduce pasos de producción, pero no sustituye la revisión final del sonido.
Examina caras, dedos, geometría de producto, reflejos, tipografía y palabras habladas a resolución completa. MiniMax también reconoce que el detalle visual puede mejorar en algunas situaciones. Confirma además que tienes derechos sobre cada imagen, vídeo, voz, logotipo y personaje subido. Poder generar una apariencia o voz no concede permiso para imitar a una persona real.
Conclusión
Hailuo H3 destaca cuando imagen y sonido deben seguir el mismo briefing de producción. Ofrece clips de 4–15 segundos, 24 FPS, audio estéreo nativo, varias relaciones de aspecto, referencias multimodales y una gramática oficial para planos, diálogo, ambiente y música.
Empieza con un plano y un sonido imprescindible. Usa una imagen cuando la apariencia exacta sea importante, da formato explícito al diálogo y añade cortes solo si revelan información nueva. Después, prueba el generador Hailuo H3 y compara cada versión con la misma lista de control visual y sonora.
Preguntas frecuentes
¿Qué es Hailuo H3?
Hailuo H3, también llamado MiniMax H3 o Hailuo 03, es un sistema multimodal que interpreta texto, imágenes, vídeo y audio. Genera vídeos de 4 a 15 segundos, 24 FPS y sonido estéreo nativo. Admite texto a vídeo, generación guiada por fotogramas y referencias. La versión alojada puede alcanzar 2K mediante regeneración contextual.
¿Hailuo H3 genera audio junto con el vídeo?
Sí. Hailuo H3 genera audio estéreo a 32 kHz junto con la imagen. El prompt puede coordinar diálogo, ambiente, efectos físicos y música. Los resultados son más controlables cuando el diálogo es corto y exacto, el paisaje sonoro contiene solo eventos importantes y la música para la audiencia se describe por separado.
¿Cuánto duran los vídeos de Hailuo H3 y qué resolución usan?
Hailuo H3 admite de 4 a 15 segundos a 24 FPS. El modelo H3-Base publicado utiliza un lado corto de 768 píxeles, mientras que el flujo alojado completo puede regenerar hasta 2K. Duración, relación de aspecto y resolución disponibles pueden variar entre plataformas, así que conviene revisar el generador antes de enviar.
¿Cómo se escribe el diálogo en un prompt de Hailuo H3?
Asigna a cada hablante un ID estable como (S1) y coloca solo sus palabras exactas dentro de una etiqueta como <d>[Spanish] Tu frase.</d>. Describe la voz fuera de la etiqueta y conserva el mismo ID entre planos. Para narración, indica que es una voz en off y que el personaje visible mantiene los labios cerrados.
¿Hailuo H3 es completamente de código abierto?
No. MiniMax publicó dos modelos H3-Base con su Community License, pero la canalización oficial completa solo está parcialmente disponible. H3-Context-IR y H3-Regenerate-2K no se incluyen, por lo que H3-Base local trabaja con lado corto de 768 px salvo que el desarrollador combine componentes alojados o cree alternativas.
