Un prompt JSON de Veo organiza una toma en campos como sujeto, acción, cámara, iluminación y audio. La interfaz del modelo determina si puedes pegar JSON directamente. En AKOOL, usa JSON como formato de planificación y traduce sus valores a un prompt de video normal, a menos que la interfaz actual documente explícitamente la entrada estructurada en JSON.
Si buscaste un veo3 json prompt generator, esta distinción importa. El JSON puede hacer que un brief creativo sea más fácil de leer, reutilizar y validar, pero no es automáticamente un lenguaje de prompts especial de Veo.
¿Qué es un prompt JSON de Veo 3.1?
Un prompt JSON de Veo 3.1 se entiende mejor como una forma estructurada de organizar instrucciones creativas, a menos que la interfaz o API que uses defina explícitamente esos campos JSON.
Por ejemplo:
{
"subject": "botella de agua azul sobre una mesa de piedra",
"action": "la condensación se desliza lentamente por la botella",
"camera": "acercamiento lento en primer plano",
"lighting": "suave luz matinal de ventana",
"audio": "tono tranquilo de habitación, sin diálogo"
}
Esto es JSON válido. También es fácil de leer para una persona u otro sistema.
Pero no es un esquema oficial de Veo solo porque las claves se llamen subject, camera o lighting.
La API real de Gemini de Google usa una solicitud de API estructurada con campos documentados como prompt, aspectRatio, durationSeconds y resolution. Esos parámetros pertenecen al contrato de la API de Google, no a una sintaxis universal de prompts en JSON.
El JSON de planificación anterior se puede convertir en este prompt ordinario:
Una botella de agua azul reposa sobre una mesa de piedra. La condensación se desliza lentamente por la botella mientras la cámara realiza un suave acercamiento en primer plano. Una suave luz matinal de ventana cae sobre la escena. El audio es un tono tranquilo de habitación sin diálogo.
Ese es el flujo de trabajo central del json prompting veo3: primero estructura la idea y luego envía al modelo la forma de entrada que la interfaz real acepta.
Las claves no compatibles simplemente pueden no tener efecto si la aplicación no las procesa.
¿Cómo debes estructurar un prompt de video de Veo?
Un esquema de planificación útil separa el sujeto y la acción de la cámara, la iluminación y el sonido. Mantén los controles de la interfaz como la duración, la resolución y la relación de aspecto fuera del JSON creativo, a menos que el producto específico documente esos campos.
Sujeto y acción
El sujeto le dice a Veo qué está presente. La acción le indica qué cambia durante el clip.
{
"subject": "chef de pie, solo, en un pequeño restaurante",
"action": "el chef apaga la última lámpara colgante y camina hacia la puerta trasera"
}
Usa un movimiento concreto. “Se ve cinematográfico” le da al modelo menos información temporal que “apaga la luz y camina hacia la puerta.”
Cámara e iluminación
Los campos de cámara son útiles porque te obligan a distinguir el movimiento del sujeto del movimiento de la cámara.
{
"camera": "travelling lento hacia atrás a la altura de los ojos",
"lighting": "cálida luz de tungsteno que se desvanece en una fría luz azul de callejón"
}
Evita valores vagos como "camera": "dinámico".
Usa instrucciones físicas como acercamiento, paneo, órbita, travelling, grúa o cuadro estático.
Diálogo y sonido
Veo 3.1 admite audio nativo. La documentación actual de Google indica que Veo 3.1 genera audio junto con el video, incluidos el diálogo y el sonido dirigidos por el prompt.
Mantén el diálogo atribuido:
{
"dialogue": [
{
"speaker": "amigo A",
"line": "Lo logramos."
}
],
"ambient_audio": "suave murmullo de café y el tintineo lejano de una taza"
}
No mezcles tres hablantes, música, Foley complejo y múltiples acciones simultáneas en un clip corto, a menos que tengas una razón para probar esa complejidad.
Relación de aspecto y duración
Trata la duración, la relación de aspecto y la resolución como ajustes de la interfaz o la API, no como supuestas claves JSON creativas.
La documentación actual de la API de Google admite la generación con Veo 3.1 de 4, 6 u 8 segundos, relaciones de aspecto 16:9 y 9:16, y 720p, 1080p o 4K según la configuración.
La página pública actual del generador de AKOOL indica Veo 3.1 con hasta 8 segundos, 16:9 y 9:16, con audio nativo y hasta 4K.
Esos son ajustes de la plataforma. No asumas que este objeto de planificación los controla:
{
"aspect_ratio": "9:16",
"duration": "8s",
"resolution": "4K"
}
a menos que la interfaz o la API actual de AKOOL documente explícitamente esas claves.
¿Cómo se usan los prompts de estilo JSON en AKOOL?
Usa JSON para planificar la toma y luego convierte los valores en un brief conciso en lenguaje natural antes de generar en AKOOL. La documentación pública de AKOOL confirma actualmente la disponibilidad de Veo 3.1, pero no documenta el JSON sin procesar como un modo dedicado de entrada de prompts.
Una correspondencia práctica se ve así:
| JSON field | Planning value | AKOOL-ready prose |
|---|---|---|
subject | blue bottle on stone table | “A blue bottle sits on a stone table” |
action | condensation rolls downward | “Condensation slowly rolls down the bottle” |
camera | slow close-up push-in | “The camera slowly pushes closer” |
lighting | soft morning window light | “Soft morning window light falls from the left” |
audio | quiet room tone | “Quiet room tone, no dialogue” |
Combinado:
Una botella azul reposa sobre una mesa de piedra. La condensación se desliza lentamente por la botella mientras la cámara realiza un suave acercamiento en primer plano. Una suave luz matinal de ventana cae desde la izquierda. Tono tranquilo de habitación, sin diálogo.
Para generar un video con Veo en AKOOL, elige Veo 3.1 en el selector de modelos actual, introduce el prompt convertido y luego configura las opciones que ofrece la interfaz. AKOOL posiciona actualmente Veo 3.1 como un modelo para movimiento realista y sonido nativo.
Para una orientación más amplia sobre el lenguaje de cámara, las referencias y los prompts cinematográficos, usa la guía general de prompts de Veo 3.1 de AKOOL. Este artículo se centra específicamente en la organización y conversión de JSON.
¿Cuáles son cinco ejemplos copiables de prompts JSON de Veo 3.1?
Los siguientes cinco objetos son JSON válidos para el analizador. Las claves son un esquema editorial de planificación, no una afirmación de que AKOOL o Veo requieran oficialmente estos nombres exactos de campos.
1. Anuncio de producto
Caso de uso: toma de producto premium
{
"subject": "botella de agua azul cobalto mate sobre una mesa de piedra clara",
"action": "la condensación se desliza lentamente por la botella mientras la botella permanece inmóvil",
"camera": "acercamiento lento en primer plano",
"lighting": "suave luz matinal de ventana desde la izquierda de la cámara",
"audio": "tono tranquilo de habitación, sin diálogo"
}
Versión en lenguaje natural:
Una botella de agua azul cobalto mate reposa sobre una mesa de piedra clara. La condensación se desliza lentamente por la botella mientras esta permanece inmóvil. La cámara realiza un acercamiento lento en primer plano. Una suave luz matinal de ventana llega desde la izquierda de la cámara. Tono tranquilo de habitación, sin diálogo.
Ajustes de AKOOL: Selecciona Veo 3.1 y establece la duración, la relación de aspecto y la calidad usando la interfaz actual.
Resultado probado: El clip generado debería mantener estable la botella de agua mientras la condensación se mueve de forma natural y la cámara realiza un acercamiento lento. Comprueba si el color, la forma, la posición y la condensación de la botella se mantienen consistentes a lo largo de la toma.
Revisión para probar:
Mantén la botella completamente estática. Reduce el movimiento de cámara a un acercamiento muy lento del 10 por ciento. Conserva el color y la silueta de la botella.
Material: Inserta el clip generado más un fotograma representativo.
2. Escena con diálogo
Caso de uso: diálogo corto
{
"scene": "dos amigos sentados uno frente al otro en un café tranquilo",
"shot": "plano medio de dos personas, cámara estática",
"action": "el amigo A levanta la vista de la mesa y sonríe",
"dialogue": [
{
"speaker": "amigo A",
"line": "Lo logramos."
}
],
"ambient_audio": "suave murmullo de café, tintineo lejano de una taza"
}
Versión en lenguaje natural:
Dos amigos se sientan uno frente al otro en un café tranquilo. Plano medio de dos personas con una cámara estática. El amigo A levanta la vista de la mesa, sonríe y dice: “Lo logramos.” Un suave murmullo de café continúa de fondo con un tintineo lejano de una taza.
Google recomienda una descripción clara de los personajes y un habla atribuida explícitamente al dar prompts de diálogo a Veo.
Resultado probado: El clip generado debería mantener al amigo A como el único hablante, con el diálogo “Lo logramos.” claramente atribuido al amigo A. Comprueba la consistencia del hablante, la sincronización labial, la expresión facial y si el amigo B permanece en silencio.
Revisión para probar: Si la atribución del hablante se desvía, elimina el movimiento del segundo personaje y especifica: “Solo habla el amigo A. El amigo B permanece en silencio.”
3. Aérea cinematográfica
Caso de uso: plano de situación
{
"subject": "costa rocosa al amanecer",
"action": "nubes bajas se desplazan sobre los acantilados mientras las olas rompen abajo",
"camera": "ascenso aéreo lento y retroceso",
"lighting": "amanecer dorado con sombras azules frías",
"audio": "oleaje del mar y viento lejano, sin música"
}
Versión en lenguaje natural:
Una costa rocosa al amanecer. Nubes bajas se desplazan sobre los acantilados mientras las olas rompen abajo. La cámara asciende lentamente y retrocede para revelar más de la costa. La luz solar dorada cae sobre las rocas con sombras azules frías. Oleaje del mar y viento lejano, sin música.
Resultado probado: El clip generado debería mostrar un ascenso aéreo suave y lento y un retroceso sobre la costa mientras mantiene estables los acantilados, las nubes y las olas. Comprueba si el movimiento de cámara se mantiene consistente y si el paisaje evita una distorsión visible.
Revisión para probar: Si el movimiento de cámara se vuelve demasiado rápido, cámbialo a: “Ascenso aéreo muy lento. Velocidad constante. Sin rotación.”
4. Primer plano de comida
Caso de uso: publicidad de restaurante o comida
{
"subject": "tazón de ramen fresco sobre una encimera de madera oscura",
"action": "el vapor se eleva mientras una cuchara levanta suavemente una hebra de fideos",
"camera": "primer plano macro con un acercamiento muy lento",
"lighting": "cálidas luces prácticas de restaurante con reflejos suaves",
"audio": "tono tranquilo de habitación, un hervor sutil, sin diálogo"
}
Versión en lenguaje natural:
Un tazón de ramen fresco reposa sobre una encimera de madera oscura. El vapor se eleva mientras una cuchara levanta suavemente una hebra de fideos. Primer plano macro con un acercamiento de cámara muy lento. Las cálidas luces prácticas de restaurante crean reflejos suaves. Tono tranquilo de habitación y un hervor sutil, sin diálogo.
Resultado probado: El clip generado debería mantener la forma y la apariencia del tazón de ramen mientras el vapor se eleva de forma natural y la cuchara levanta una hebra de fideos. Comprueba la consistencia de la comida, el comportamiento del vapor, la interacción de la cuchara y la estabilidad de la cámara.
Revisión para probar: Si la comida cambia de forma, elimina la interacción de la cuchara y mantén solo el vapor más el movimiento de cámara.
5. Anuncio social vertical
Caso de uso: gancho corto de producto
{
"subject": "zapatilla deportiva blanca sobre pavimento mojado al anochecer",
"action": "la zapatilla aterriza una vez, creando una pequeña salpicadura realista, luego se mantiene en el cuadro",
"camera": "movimiento rápido en travelling a ras de suelo que se asienta en un primer plano fijo",
"lighting": "reflejos cálidos de escaparate contra una fría luz de atardecer",
"audio": "un solo paso, salpicadura de agua, ligero ambiente urbano"
}
Versión en lenguaje natural:
Una zapatilla deportiva blanca aterriza una vez sobre pavimento mojado al anochecer, creando una pequeña salpicadura realista. Un movimiento rápido en travelling a ras de suelo sigue el aterrizaje y se asienta en un primer plano fijo. Los reflejos cálidos de escaparate contrastan con la fría luz de atardecer. El audio incluye un paso, la salpicadura y un ligero ambiente urbano.
Para la entrega vertical, elige 9:16 en la interfaz en lugar de depender de un campo JSON personalizado. Tanto Google como AKOOL documentan actualmente la compatibilidad con el formato vertical para Veo 3.1.
Resultado probado: El clip generado debería mostrar la zapatilla deportiva aterrizando una vez, produciendo una pequeña salpicadura, seguida de un primer plano estable. Comprueba la geometría de la zapatilla, el realismo de la salpicadura, la estabilidad de la cámara en travelling y si la escena se mantiene correctamente encuadrada en 9:16.
Revisión para probar: Si la geometría de la zapatilla se desvía, reduce el movimiento de cámara y acorta la acción a un impacto más una pausa.
¿Cómo debes escribir diálogo y audio sin errores comunes?
Mantén el diálogo corto, identifica claramente al hablante y separa el habla del ambiente y los efectos de sonido.
Estructura de planificación débil:
{
"audio": "la gente habla, sonidos de café, música, alguien dice lo logramos"
}
Mejor:
{
"dialogue": [
{
"speaker": "amigo A",
"line": "Lo logramos."
}
],
"ambient_audio": "suave murmullo de café",
"sound_effects": "un tintineo lejano de una taza de cerámica",
"music": "ninguna"
}
El beneficio no es que Veo entienda mágicamente mejor el JSON. El beneficio es que tú puedes ver si el brief contiene instrucciones de audio en conflicto antes de convertirlo a prosa.
Mantén las frases habladas lo bastante cortas como para encajar en el clip seleccionado. La API actual de Veo 3.1 admite clips de hasta 8 segundos, así que un párrafo largo de diálogo no es una petición realista para una sola generación.
Luego prueba la sincronización labial y la asignación de hablantes en el resultado real. No asumas que un prompt correctamente estructurado garantiza una sincronización exacta.
Prompt en JSON frente a texto plano: ¿cuál deberías usar?
Usa JSON cuando la estructura y la reutilización ayuden a tu flujo de trabajo. Usa texto plano cuando escribas prompts directamente dentro de una interfaz que espera lenguaje natural. Ninguno de los dos formatos produce intrínsecamente una mejor calidad visual.
| Factor | JSON planning prompt | Plain-text prompt |
|---|---|---|
| Readability | Strong for structured teams | Strong for natural creative direction |
| Reuse | Easy to template and store | Easy to copy and revise |
| Direct AKOOL UI support | Not publicly documented as a dedicated mode | Yes, normal prompting is documented |
| Syntax errors | Possible | No JSON syntax to break |
| API use | Only when matching an actual API schema | Usually becomes the API's prompt value |
| Creative result | Depends on model interpretation after conversion | Depends on model interpretation |
| Best use | Planning, automation, databases, prompt builders | Direct generation and iteration |
Por lo tanto, un veo3 json prompt generator puede ser útil como herramienta organizativa de front-end. Su salida aún debe asignarse a los campos o a la sintaxis de prompt que admite la aplicación de destino.
El JSON es estructura, no un multiplicador de calidad.
¿Por qué falló mi prompt JSON de Veo?
La mayoría de los fallos provienen de JSON inválido, valores creativos vagos, demasiadas acciones simultáneas, claves no compatibles o instrucciones de audio que no encajan en el clip.
| Problem | Example | Fix |
|---|---|---|
| Invalid JSON | {"subject":"shoe",} | Remove the trailing comma |
| Wrong quote marks | {'subject':'shoe'} | Use valid double quotes |
| Vague action | "action":"cinematic" | Describe physical movement |
| Vague camera | "camera":"dynamic" | Use “slow dolly in” or another real move |
| Too many events | Six actions in one 8-second shot | Split into separate shots |
| Unsupported key | "lens_magic":"epic" | Remove it or convert the intention into prose |
| UI setting inside planning JSON | "aspect_ratio":"9:16" | Set 9:16 in the actual interface |
| Audio mismatch | 60-word dialogue in a short clip | Shorten the spoken line |
| Subject drift | Complex product movement | Keep product static and move the camera |
| JSON pasted literally into unsupported UI | Model interprets braces as prompt text | Convert field values into natural language |
Por ejemplo, este JSON es válido pero creativamente débil:
{
"subject": "coche",
"action": "movimiento genial",
"camera": "cinematográfico",
"lighting": "bonita"
}
Reemplaza los valores ambiguos:
{
"subject": "cupé vintage verde oscuro en una carretera costera",
"action": "el coche entra en una curva a la izquierda a velocidad constante",
"camera": "travelling frontal bajo de tres cuartos",
"lighting": "luz solar del atardecer con largos reflejos cálidos"
}
Luego convierte esos valores en un prompt normal de Veo.

