Guía de Prompts de AKOOL: Sintaxis de Kling 3.0, Referencias y Control de Sonido

Actualizado:
September 10, 2026
Aprende a escribir prompts de video de IA que controlen el movimiento de cámara, sonido y estilo — con consejos específicos del modelo para Kling, Wan, Veo y Seedance en AKOOL.
Tabla de contenido

Un buen video de IA raramente comienza con una larga lista de adjetivos. Comienza con dirección.

Si tu prompt solo dice "una mujer cinemática caminando por Tokio", el modelo tiene que decidir cómo se ve la mujer, cómo camina, dónde se sienta la cámara, cómo se mueve, qué hora del día es, y si la escena tiene diálogo, ambiente o silencio. Cada opción indefinida crea otra oportunidad para que la salida se aleje de lo que imaginaste.

Los prompts de video de IA más confiables funcionan más como briefs de tomas compactos. Le dicen al modelo qué hay en pantalla, qué cambia con el tiempo, cómo la cámara lo observa, cuál debería ser el lenguaje visual, y qué debería escuchar la audiencia.

Esta guía de prompts de video de IA te da una estructura reutilizable para escribir mejores prompts, y luego muestra cómo adaptarla para Kling 3.0, Wan 2.7, Veo 3.1 y Seedance 2.0 en AKOOL.

La Anatomía de un Gran Prompt de Video de IA

El marco más simple y útil es:

Sujeto → Acción → Cámara → Estilo → Sonido

Usa estos cinco componentes en ese orden cuando escribas prompts de texto a video. No necesitas un párrafo elaborado para cada generación; necesitas suficiente información para eliminar la ambigüedad más importante.

1. Sujeto — ¿Qué estamos mirando?

Identifica a la persona, producto, objeto o ambiente con los detalles visuales que importan.

Débil:

Una mujer en una ciudad.

Mejor:

Una mujer de principios de los 30 años con un abrigo tipo trinchera rojo oscuro se para sola en una calle mojada por la lluvia en el centro de Tokio por la noche.

No describas cada detalle visible. Prioriza anclas de identidad — guardarropa, material, color, edad, forma del producto u otras características que deben permanecer estables.

2. Acción — ¿Qué cambia durante la toma?

El video necesita una instrucción temporal. Usa verbos concretos y describe un arco de movimiento comprensible.

Débil:

Una zapatilla cinemática.

Mejor:

Una zapatilla de running blanca cae sobre el pavimento mojado, se comprime en el impacto, y luego salpica agua hacia afuera mientras un corredor se impulsa.

Evita apilar seis acciones no relacionadas en una toma de cinco segundos. Más instrucciones no crean automáticamente más control.

3. Cámara — ¿Cómo deberíamos ver la acción?

Establece explícitamente el encuadre y el movimiento cuando importe.

Débil:

Cámara dinámica.

Mejor:

Plano de ángulo bajo, plano medio cerrado. La cámara sigue al corredor, luego se acerca lentamente a la zapatilla mientras golpea el pavimento.

El vocabulario útil incluye plano general, plano medio, primer plano, vista aérea, ángulo bajo, handheld, travelling, órbita, paneo, inclinación, enfoque selectivo, y acercamiento lento.

Cuando el texto solo no puede reproducir un movimiento complejo de manera confiable, los flujos de trabajo basados en referencias suelen ser más precisos. La guía de AKOOL sobre controlar movimiento y estilo con Video Reference explica cómo un clip existente puede guiar el movimiento de cámara, la acción y la atmósfera en lugar de describir todo verbalmente. (Akool)

4. Estilo — ¿Cómo debería sentirse la toma?

Describe iluminación, paleta, textura, género y tratamiento fotográfico en lugar de depender de la palabra "cinemático".

En lugar de:

Anuncio comercial cinemático.

Intenta:

Aspecto comercial de deportes premium, sombras azules frías, luces prácticas cálidas, pavimento mojado reflexivo, alto contraste, profundidad de campo superficial, grano de película moderado.

Las relaciones visuales específicas le dan al modelo información más útil que etiquetas genéricas de calidad como "épico", "profesional" o "masterpiece en 4K".

5. Sonido — ¿Qué deberíamos escuchar?

Para modelos con audio nativo, el sonido pertenece al prompt desde el principio.

Ejemplo:

Audio: pasos rápidos en asfalto mojado, agua salpicando con cada zancada, tráfico distante, bajo electrónico pulsante bajo. Sin diálogo.

Si se necesita diálogo, mantenlo breve y atribuye claramente la línea:

La mujer mira hacia la cámara y dice, "Solo estamos comenzando".
Audio: sonido ambiente de ciudad tranquila y lluvia ligera detrás de su voz.

La evolución de Kling hacia la generación audiovisual integrada comenzó antes de 3.0; el resumen de AKOOL sobre audio nativo de Kling 2.6 cubre diálogo sincronizado, ambiente y efectos como parte del mismo proceso de generación. (Akool)

Consejos de Prompts Específicos del Modelo

El marco de cinco partes funciona en todos los modelos, pero los prompts de generación de video idénticos no siempre producirán comportamiento idéntico. Los diferentes modelos recompensan diferentes tipos de dirección.

AKOOL también soporta modelos unificados de generación/edición como Kling O1; entender esos características de Kling O1 es útil cuando tu flujo de trabajo combina prompting con referencias, extensión de toma o edición en lenguaje natural. (Akool)

Prompting de Kling 3.0 para narrativa de múltiples tomas y consistencia de caracteres

Kling 3.0 es especialmente útil cuando tu prompt describe una secuencia corta en lugar de una composición estática. AKOOL documenta generación de 3-15 segundos, audio nativo, consistencia de sujeto mejorada, y un sistema tipo AI Director que puede estructurar planos generales, primeros planos y tomas de cutaway desde una sola descripción. (Akool)

Para una mentalidad de guía de prompts de Kling, describe la historia en beats ordenados. Dile al modelo qué permanece constante entre esos beats.

Ejemplo:

Comercial cinemático de café de 15 segundos.

Toma 1: Plano general de una cocina tranquila al amanecer. Una mujer con un suéter crema entra en el encuadre y coloca una taza de cerámica negra en el mostrador.

Toma 2: Plano medio cerrado. Vierte café fresco en la misma taza; el vapor sube a través de la luz cálida de la mañana.

Toma 3: Primer plano de sus manos levantando la taza, luego corte a ella sonriendo después del primer sorbo.

Mantén la misma mujer, suéter crema, taza negra, diseño de cocina y calificación de color ámbar cálido en cada toma.

Audio: sonido suave del café siendo vertido, contacto de cerámica sobre madera, tono de habitación matutina tranquila, música acústica sutil.

La técnica importante es el lenguaje de continuidad: identifica explícitamente qué carácter, guardarropa, accesorio o ambiente debe permanecer sin cambios. Ver narrativa de múltiples tomas de Kling 3.0 para las capacidades de múltiples tomas, audio nativo y referencias del modelo. (Akool)

Prompting de Wan 2.7 para control de movimiento y estilización

Wan 2.7 se aborda mejor con una trayectoria de movimiento claramente definida más un tratamiento visual estable. La vista previa publicada de AKOOL enfatiza movimiento más natural, estilización más fuerte, consistencia, control de fotograma inicial/final, entradas de referencia y edición basada en instrucciones. (Akool)

En lugar de agregar cinco estilos compitiendo, establece una dirección de arte y explica cómo evoluciona el movimiento.

Ejemplo:

Un auto deportivo rojo vintage entra desde la izquierda y acelera por una carretera costera sinuosa. La cámara comienza en un plano de seguimiento de ángulo bajo, se mueve al lado de la puerta del conductor, y luego se rezaga gradualmente mientras el auto sale de la curva.

Estética de cine de carreteras europeo de los años 70, sombras ligeramente desaturadas de color azul verdoso, luz solar cálida, grano de película sutil, movimiento de suspensión realista y contacto de neumáticos. Mantén la misma pintura roja, proporciones del auto y calificación de color en todo momento.

Cuando el flujo de trabajo seleccionado proporciona controles de referencia o fotograma clave, úsalos en lugar de poner cada restricción de apariencia en prosa. La descripción general de control de movimiento de Wan 2.7 cubre su dirección de movimiento, consistencia de estilo, referencia y fotograma inicial/final. (Akool)

Prompting de Veo 3.1 para realismo cinemático

Veo 3.1 responde bien al lenguaje natural tipo guión que conecta sujeto, acción, ambiente, cámara y sonido. La guía de Veo de AKOOL recomienda una estructura que combine estilo cinemático, detalle de carácter, movimiento, ambiente/iluminación, claves de audio y dirección técnica de cámara. (Akool)

Usa causa-y-efecto físico en lugar de cadenas de palabras clave desconectadas.

Ejemplo:

Un chef cansado cierra un restaurante pequeño después de medianoche. Apaga la última luz colgante y camina hacia la puerta trasera mientras la habitación cae en la oscuridad sección por sección.

Travelling lento hacia atrás a la altura de los ojos, perspectiva cinemática de 50 mm, micro-movimiento handheld natural. La luz tungsteno cálida transiciona a luz azul fría del callejón.

Audio: sillas metálicas raspando levemente, zumbido del refrigerador, un auto distante pasando afuera, luego el clic del último interruptor de luz.

Veo es particularmente útil cuando la dirección de cámara y el sonido son parte de la misma lógica de escena. AKOOL actualmente describe Veo 3.1 como soportando consistencia guiada por referencia y control de movimiento preciso. (Akool)

Prompting de Seedance 2.0 para video sincronizado con audio

Seedance 2.0 se beneficia de pensar más allá del texto solo. La interfaz de generación de video actual de AKOOL lista Seedance 2.0, mientras que su cobertura de modelos enfatiza el uso multimodal de referencias de texto, imagen, video y audio.

Cuando la música o la voz establece el tiempo, escribe el prompt alrededor de la estructura de beat.

Ejemplo:

Crea un video de streetwear rápido de 12 segundos sincronizado con el beat subido.

0-3s: modelo se para quieto bajo una luz de metro; acercamiento lento.
3-6s: en el primer beat fuerte, corte a una toma de caminata de ángulo bajo.
6-9s: toma de tracking lateral rápida mientras el modelo se gira hacia la cámara.
9-12s: primer plano del logo de la chaqueta, terminando exactamente en el beat final.

Mantén el mismo modelo, chaqueta negra, accesorios de plata, ambiente de estación subterránea e iluminación fluorescente verde.

Usa el audio subido como referencia de tiempo. Los cortes y movimientos corporales principales deben alinearse con los beats más fuertes.

Para Seedance, las referencias pueden llevar información que de otra manera haría que el prompt de texto fuera innecesariamente largo. Deja que la imagen establezca la apariencia, el video establezca el movimiento, y el audio establezca el ritmo; usa el texto para explicar cómo esos elementos deberían interactuar.

Errores Comunes en Prompts (y Cómo Solucionarlos)

Error 1: Escribir un prompt de imagen en lugar de un prompt de video.
"Un reloj de lujo sobre mármol, iluminación cinemática" describe la apariencia pero no el tiempo.

Solución:

Macro primer plano de un reloj de lujo sobre mármol oscuro. La manecilla de segundos se mueve suavemente mientras la cámara realiza una órbita lenta de 20 grados. Una luz estrecha barre la bisel pulida, revelando reflejos gradualmente.

Error 2: Pedir demasiado en una sola toma.
Si el sujeto corre, salta, cambia ropa, entra en un auto, maneja, y llega a otra ciudad en ocho segundos, el modelo debe comprimir demasiados cambios de estado.

Solución: divide el concepto en múltiples tomas o usa un modelo capaz de múltiples tomas.

Error 3: Usar lenguaje de cámara vago.

En lugar de:

Movimiento cinemático genial.

Escribe:

Plano medio. Acercamiento handheld lento mientras el sujeto permanece centrado; movimiento natural ligero del operador, sin órbita y sin zoom.

Error 4: Contradecirte a ti mismo.
"Cámara estática bloqueada" y "movimiento de cámara de barrido dinámico" no deberían aparecer en la misma instrucción a menos que describan diferentes tomas.

Error 5: Redescribir una imagen subida en lugar de describir movimiento.

Para imagen a video, deja que la imagen establezca lo que ya existe.

Mejor:

El sujeto se gira lentamente hacia la ventana y sonríe. Las cortinas se mueven suavemente con la brisa. La cámara retrocede un metro mientras preserva la iluminación original, guardarropa, identidad facial y diseño de habitación.

10 Plantillas de Prompts Listos para Usar

1. Anuncio de Producto — Toma Hero Premium

Un [PRODUCTO] se sienta sobre [SUPERFICIE]. [ACCIÓN DEL PRODUCTO]. Macro primer plano en transición a una órbita lenta de tres cuartos. [ILUMINACIÓN] crea reflejos controlados a través del producto. Estilo comercial premium, [PALETA DE COLOR], materiales realistas. Audio: [SFX], [ESTILO DE MÚSICA] sutil.

2. Anuncio de Producto — Demostración de Estilo de Vida

Un [USUARIO OBJETIVO] usa [PRODUCTO] en [AMBIENTE]. El usuario [ACCIÓN PRINCIPAL], demostrando claramente [BENEFICIO]. Toma de tracking medio seguida de un primer plano del producto en uso. Iluminación natural de [HORA DEL DÍA], aspecto auténtico de anuncio de estilo de vida. Audio: ambience ambiental más música de fondo sutil.

3. Anuncio de Producto — Comercial Social de Tres Tomas

Crea un anuncio de 12 segundos de tres tomas para [PRODUCTO].

Toma 1: [GANCHO].
Toma 2: [BENEFICIO DEL PRODUCTO EN ACCIÓN].
Toma 3: [TOMA HERO / VISUAL DE CTA].

Mantén el mismo diseño de producto, colores, ambiente e iluminación en todas las tomas. Transiciones rápidas pero limpias. Audio: [MÚSICA] con SFX de producto sincronizado.

4. Explicador — Concepto Visual

Muestra [CONCEPTO] visualmente usando [SUJETO/OBJETO]. Comienza con [ESTADO INICIAL], luego demuestra [CAMBIO], terminando con [RESULTADO]. Encuadre limpio plano medio-general con acercamiento lento. Estilo visual minimalista moderno, fondo neutro, separación clara de objetos. Audio: espacio de narración tranquila con sonido ambiental ligero.

5. Explicador — Escena de Presentador

Un [DESCRIPCIÓN DEL PRESENTADOR] se para en [AMBIENTE] y explica [TEMA]. Plano medio, cámara a la altura de los ojos, acercamiento muy lento. El presentador gesticula naturalmente mientras dice: "[DIÁLOGO CORTO]". Iluminación suave profesional, fondo limpio, colores de marca moderados. Audio: discurso claro con tono de habitación sutil.

6. Clip Social — Gancho Rápido

Video social vertical 9:16. Abre inmediatamente en [ACCIÓN INESPERADA / GANCHO VISUAL]. Primo plano handheld, acercamiento rápido durante el primer segundo, luego estabiliza en un plano medio mientras [ACCIÓN DEL SUJETO]. Estilo contemporáneo de alta energía. Audio: SFX de apertura afilado seguido por [TIPO DE MÚSICA].

7. Clip Social — Transformación

Comienza con [ESTADO ANTERIOR]. El sujeto realiza [ACCIÓN DE ACTIVACIÓN]. Durante el movimiento, transforma la escena en [ESTADO POSTERIOR] mientras preservas la identidad y posición del sujeto. La cámara realiza una media órbita suave a través de la transición. Audio: sonido de transición creciente terminando en un beat fuerte.

8. Corto Cinemático — Diálogo Beat

Interior nocturno. [CARÁCTER A] se sienta frente a [CARÁCTER B] en [UBICACIÓN]. Comienza con un plano de dos personas tranquilo, luego acercamiento lento hacia Character A mientras dicen: "[LÍNEA]". Character B reacciona sin hablar. Iluminación de clave baja motivada, lámparas prácticas, profundidad de campo superficial. Audio: ambience de habitación moderada y diálogo natural.

9. Corto Cinemático — Toma de Acción

[CARÁCTER] corre a través de [AMBIENTE] mientras [AMENAZA/EVENTO] se desarrolla detrás de ellos. La cámara de tracking de ángulo bajo mantiene el ritmo al lado del carácter antes de girar por detrás para el movimiento final. Peso realista, impulso, escombros y física de contacto. Iluminación dramática direccional. Audio: pasos, respiración, impactos ambientales, sin música.

10. Corto Cinemático — Toma de Establecimiento Atmosférica

Plano general de establecimiento de [UBICACIÓN] en [HORA/CLIMA]. [ACCIONES AMBIENTALES PEQUEÑAS] crean movimiento sutil en todo el encuadre. La cámara realiza un lento movimiento de grúa hacia adelante y hacia abajo, revelando [DETALLE DE LA HISTORIA]. [ESTILO DE PELÍCULA], [PALETA DE COLOR], atmósfera volumétrica realista. Audio: ambience ambiental en capas con [SONIDO ESPECÍFICO] distante.

Estas plantillas son estructuras iniciales, no fórmulas mágicas. Reemplaza los corchetes con información concreta, elimina secciones que no necesites, y prueba una variable a la vez.

Preguntas frecuentes
¿Cómo escribo un buen prompt de video de IA?
¿Qué debe incluir un prompt de video de IA?
¿En qué se diferencia el prompting para Kling de Sora o Veo?
¿Puedo controlar el movimiento de la cámara con un prompt de texto?
¿Por qué mis prompts de video de IA no coinciden con lo que espero?
AKOOL Content Team
Obtenga más información
Referencias

También te puede gustar
No se ha encontrado ningún artículo.
AKOOL Content Team