Guía · Seedance 2.5 · Prompts de producción

Seedance 2.5 Prompt Guide:
prompts que funcionan.

Todo el mundo está buscando cómo promptear Seedance 2.5, y casi todo lo publicado son plantillas genéricas escritas por gente que nunca facturó un video. Esta guía es distinta. Son las reglas que uso en producción real, con clientes reales, destiladas después de cientos de generaciones. Cada regla existe porque me costó créditos aprenderla.

9 secciones Prompts reales Actualizada agosto 2026
Demo de Seedance 2.5
Lo que Seedance 2.5 es capaz de generar. Mirá el demo y después aprendé a pedírselo.
01

Qué es Seedance 2.5 y qué trae de nuevo

Los números verificados, no copiados
La sección en una imagen

30 segundos, 50 referencias.

El modelo de video más dirigible que existe hoy.

Seedance 2.5 es el modelo de video de ByteDance, y hoy es el mejor generador de video con IA que podés usar. Ya está disponible en Magnific, que es donde trabajo todo mi sistema, y también en Dreamina.

Los números que importan, verificados contra la plataforma y no copiados de otro blog:

  • Duración: de 4 a 30 segundos por generación.

    El doble que Seedance 2.0, que llega a 15.

  • Referencias: hasta 50 en total.

    30 imágenes, 10 videos y 10 audios, todos citables con @ dentro del prompt. Los videos de referencia, de 2 a 30 segundos cada uno.

  • Audio de referencia: hasta 30 segundos.

    En mp3 o wav, para lip-sync y voz. Le das una voz y el personaje la habla. Y a diferencia de 2.0, ya no exige una referencia visual acompañando el audio.

  • Prompt: hasta 10.000 caracteres.

    Aunque casi nunca vas a necesitar más de 500.

  • Cámara dirigible: 52 movimientos.

    El modelo los entiende por su nombre técnico. Los repasamos en la sección 5.

  • Multishot: hasta 6 planos en una generación.

    De 1 a 12 segundos cada uno.

  • Resolución: 720p o 480p nativo.

    Mi flujo es generar en 720p y escalar con Topaz. Sale mejor y más barato que pelear por resolución nativa.

Contra Seedance 2.0, el salto es concreto: de 15 a 30 segundos, de 9 a 30 imágenes de referencia, de 3 a 10 audios, y videos de referencia mucho más largos. Lo único que resigna es la resolución nativa (2.0 llega a 4K, 2.5 se queda en 720p), y por eso el camino es escalar con Topaz.

Y hay un cambio menos visible pero más importante. Seedance 2.5 razona. Lee tus referencias, entiende qué es cada cosa y completa lo que no le dijiste. Eso cambia la forma de promptear. Con buenas referencias, los prompts cortos funcionan mejor que los kilométricos.

Pro El límite de 10.000 caracteres es una trampa para novatos. El modelo pondera más lo primero que escribís. Un prompt de 300 caracteres bien estructurado le gana siempre a uno de 3.000 divagando.
02

La regla de oro: la referencia es el 80%, el prompt acompaña

Preparar antes de escribir
La sección en una imagen

La referencia manda.

El prompt dirige la escena que traen tus referencias.

Antes de escribir una sola palabra tenés que entender esto. En Seedance, la imagen de referencia es el 80% del resultado. El prompt solo dirige la escena que ya traen tus referencias.

Por eso las referencias se preparan antes:

  • Recortá todo lo más pulido posible.

    Si querés el logo, sacá el eslogan. Si querés la ropa de una foto, sacá la cara. Que cada referencia diga una sola cosa.

  • Formato exacto.

    La referencia recortada al formato del video (9:16 para reels). Formatos mezclados = deformaciones y bordes negros.

  • Calidad mínima 1080x1920.

    Referencia pixelada = textura inventada por el modelo.

  • Para personas: de 3 a 5 fotos.

    Frente, perfiles, cuerpo entero. Más fotos no suman, meten ruido.

Las imágenes se conectan como referencias, no como frame inicial y final. Y cada una se cita con @ en el prompt. Con eso controlás el modelo en vez de tirar los dados. Si querés ver cómo estas referencias alimentan un sistema completo de producción, eso lo cuento en mi tutorial de anuncios con IA.

Tip ¿Cuándo sí usar first & last frame? Cuando el plano es una transición simple entre dos imágenes que ya tenés. Para todo lo demás, referencias con @. Y ojo, los keyframes y las referencias no se pueden combinar en la misma generación.

Esa exclusión tiene un costo alto que conviene saber antes de gastar créditos. Si usás primer frame, perdés las referencias de identidad y también las de boca abierta. El frame te clava el encuadre al pixel, pero la performance de habla baja de forma notoria porque el modelo se queda sin material de labios y dientes. Para talking heads, referencias siempre. El keyframe se guarda para transiciones sin diálogo.

03

Anatomía de un prompt de Seedance 2.5

El orden que el modelo pondera
La sección en una imagen

Estilo, escena, acción, cámara, audio.

En ese orden. El modelo pondera lo primero.

Todo prompt que funciona tiene este orden, porque el modelo pondera más lo que va primero.

  • Estilo, primero que nada.

    La dirección visual abre el prompt: "Comercial cinematográfico de lujo, estilo oscuro, sombras profundas". Si el estilo va al final, el modelo ya decidió otro.

  • La escena y las referencias.

    Qué pasa y quién es quién: "La mujer @01 camina por el pasillo del hotel @02".

  • Micro-acciones, nunca adjetivos.

    El modelo no entiende emociones, entiende física. "Está triste" no genera nada. "Baja la mirada, los hombros caen, gira la cara hacia la ventana" genera exactamente eso.

  • La cámara, con nombre técnico.

    "Slow push-in", "tracking shot", "extreme close-up". Nunca "un ángulo interesante".

  • El audio, al final.

    SFX específicos y la instrucción de música (sección 6).

Un prompt con esta anatomía, del tipo que uso en anuncios de producto:

Prompt
> Escena de 5 segundos donde la caja en el piso @01 se abre y todos los productos salen volando @02, quedan suspendidos en cámara lenta en el aire. Por último, aparece un texto centrado en pantalla que dice "Summer Glow Kit" @03. Escena continua, en una sola toma. Solo SFX y sonido ambiente.

Fijate lo que NO tiene: adjetivos de emoción, descripciones de estética que ya está en las referencias, y relleno.

Ojo Los textos en pantalla generados por el modelo salen mal la mayoría de las veces. Si el texto es importante (un logo, un claim), pasale la referencia exacta con @ como en el ejemplo, o directamente agregalo en edición.
04

El sistema @: referencias con propósito

El corazón de Seedance 2.5
La sección en una imagen

Cada @ con un propósito.

Una referencia sin rol es una moneda al aire.

El @ es el corazón de Seedance 2.5. Pero la mayoría lo usa mal. Tira cinco referencias y espera que el modelo adivine.

Cada @ necesita un propósito declarado

Mal: "@01 @02 @03 hacé un video". Bien: "@01 es el personaje principal, la escena ocurre en el bar @02, el movimiento de cámara sigue el estilo de @video1". El modelo tiene que saber qué aporta cada referencia.

Los objetos llevan la continuidad, las caras no

Entre generación y generación, un frasco de perfume, una laptop o una taza quedan clavados idénticos. Las caras derivan. Por eso las historias se anclan en objetos, y las personas se sostienen repitiendo la misma referencia y la misma descripción física en cada prompt.

Referencias quirúrgicas para los detalles difíciles

Dientes, interior de la boca, gestos complejos. Nunca los describas con texto, porque la descripción anatómica desestabiliza toda la generación. En su lugar, poné una referencia inline en el momento exacto: "ríe a carcajadas @05", donde @05 es un primer plano certificado de esa risa exacta. Con el tiempo armás una biblioteca de gestos aprobados y los reusás.

El orden importa

El modelo pondera más las primeras referencias. La identidad del personaje va primero; el detalle decorativo, último.

Pro Un truco de identidad que uso siempre. En vez de 4 fotos sueltas, una sola grilla generada con Seedream 4.5, de frente, de costado, de espalda y plano detalle del rostro, con el vestuario del anuncio. Una referencia, identidad completa.
05

Cámara: hablale como a un director de fotografía

El lente, los 52 movimientos y el video de referencia
La sección en una imagen

El cine ya inventó el idioma.

Push-in, tracking, orbit. El modelo lo habla.

Seedance 2.5 entiende 52 movimientos de cámara por su nombre técnico. Esto significa que el vocabulario de cine ES el lenguaje de prompting. Los que más uso:

  • push-in / slow push-inAcercamiento lento; tensión, intimidad.
  • tracking shotLa cámara sigue al sujeto; energía, persecución.
  • orbit / 360 orbitLa cámara gira alrededor; producto héroe, reveal.
  • whip panBarrido violento; transición con energía.
  • crane up / crane downLa cámara sube o baja; apertura o cierre de escena.
  • handheldCámara en mano; realismo, urgencia, UGC.
  • rack focus (focus change)El foco pasa de un plano a otro; dirigir la mirada.
  • extreme close-upDetalle extremo; textura, emoción.
  • static shotCámara fija; dejá que la acción hable.

Y para cuando quieras impresionar: FPV drone (vuelo en primera persona), crash zoom (zoom violento al rostro), dutch angle (cámara inclinada, incomodidad) y snorricam (cámara clavada al actor, el mundo se mueve detrás). Existen y funcionan.

Antes del movimiento, el lente

Todo el vocabulario de cámara habla de movimientos y casi nadie habla de óptica. En producción, la mayoría de los problemas de encuadre que parecen de ángulo son de lente.

El modelo por defecto te da gran angular. Fondo nítido hasta el horizonte, líneas que se estiran en diagonal, y una sensación de cámara de seguridad que arruina cualquier intento de look caro. Y hay algo peor. Un gran angular apoyado apenas por encima de la línea de los ojos te fabrica un plano picado solo, aunque el lente esté horizontal. Si tu plano sale "un poco desde arriba" y no entendés por qué, mirá el lente antes que el ángulo.

La instrucción que lo arregla:

Prompt
> Telephoto lens, background heavily compressed and thrown well out of focus, only the subject is sharp. Shallow depth of field.

Y dos anclas geométricas que valen más que cualquier adjetivo de ángulo. Que no se vea piso entre la cámara y el sujeto, y que el horizonte quede apenas por encima de su cabeza. Con eso el picado desaparece. De regalo, con el fondo blando la acción de fondo se sugiere en vez de exhibirse, que casi siempre es lo que querés.

Zoom de lente y desplazamiento de cámara no son lo mismo

De los 52 movimientos, esta es la distinción que más plata ahorra. Zoom in / zoom out mueven el lente y la cámara se queda quieta. Push-in / pull-out mueven la cámara por el espacio. Son cosas distintas y el modelo las distingue.

Si escribís "zoom out to a full shot", el modelo lee cambio de tamaño de plano, lo resuelve como desplazamiento y te devuelve un plano dron alejándose. Ese es el error clásico. Para un zoom de camarógrafo real hay que nombrar el lente y prohibir el desplazamiento explícitamente: "fast lens zoom out, the camera never moves through space".

Un movimiento por plano

Dos como máximo. Apilar "cámara en mano, después zoom out, después reencuadre, después zoom in" es la receta del desastre. El modelo agarra la instrucción que entiende mejor y resuelve el resto a su manera. Si necesitás un movimiento compuesto, nombrá el principal y después el secundario, nunca cuatro.

Cuando las palabras no alcanzan: video de referencia

Si hay un movimiento de cámara que no lográs describir, filmalo. Cinco segundos con el celular apuntando a cualquier cosa, haciendo el movimiento exacto. Lo subís como referencia de video y le decís que define la cámara. Es la herramienta más subutilizada de 2.5.

El modelo copia solo la trayectoria. El look, la luz y el color siguen viniendo de tu prompt de texto. Con el mismo video de referencia y prompts distintos, el movimiento sale idéntico y el clima cambia por completo.

Dos condiciones para que funcione. El clip tiene que durar entre 3 y 8 segundos con un movimiento limpio de un solo propósito, y hay que recortar el primer segundo, donde el operador todavía está acomodando la cámara. Clips largos que mezclan movimientos hacen que el modelo agarre partes al azar en cada corrida.

Y una regla que no es de cámara pero lo parece. Pensá en planos, no en escenas. "Agarro la botella, corto" es un plano. "Agarro la botella, tomo, miro por la ventana y vuelvo a la compu" es una escena, y ahí el modelo alucina. Tu video es una suma de planos cortos que unís en edición.

Tip Si el plano es continuo, decilo explícito: "Escena continua, en una sola toma". Si no lo aclarás, el modelo puede meterte un corte de edición donde no querías.
06

Audio y lip-sync: el hack que nadie te cuenta

El audio, el texto escrito y los negativos
La sección en una imagen

El "no" que el modelo no escucha.

Pedí audio diegético, no ausencia de música.

Seedance 2.5 genera el audio junto con la imagen. Eso es una ventaja enorme y una trampa.

La trampa: si escribís "sin música de fondo" o "no background music", el modelo ignora el "no" y te pone música. En todos los clips. Cada uno con SU música. Imposible de unificar en edición.

El hack: nunca negar, siempre afirmar lo que SÍ querés:

Prompt
> Natural ambient sounds and raw Foley sound effects only. Pure diegetic audio.

O en mi versión corta en español, terminar el prompt con "Solo SFX y sonido ambiente". Y al final de cada bloque, los SFX específicos: "SFX: suspiro pesado, pasos sobre madera, motor de auto arrancando".

Los negativos en 2.5 sí funcionan, si los escribís bien

Afirmar sigue siendo la mejor práctica para el audio, y esa parte no cambia. Lo que cambió es el resto. En 2.0 los negativos directamente no se seguían, y en 2.5 sí funcionan cuando van como oraciones completas y al final del prompt, que es donde el modelo los lee de forma más confiable. Palabras sueltas tipo "sin sombras" o "no música" siguen fallando, porque ahí el modelo lee la palabra clave y se olvida del "no".

Prompt
> Do not use a wide angle lens. Do not keep the background in focus. Do not cut at any point.

Ese bloque final de negativos es lo que me salvó un plano continuo de 27 segundos.

Ojo Un dato que no está documentado en ningún lado. Seedance 2.5 no tiene campo de negative prompt separado. Si tu plataforma te ofrece uno, para este modelo se descarta en silencio. Los negativos van adentro del prompt, al final, escritos como frases.

Diálogo y lip-sync

Describí la acción física y poné las palabras exactas entre comillas:

Prompt
> Mira directo a cámara y dice: "Esto lo hice en una tarde, sin cámara y sin actores".

El modelo genera el lip-sync de esas palabras exactas. Y con Seedance 2.5 podés ir más lejos. Conectás un audio de referencia de hasta 30 segundos (tu voz real, un cliente, una locución de Fish Audio) y el personaje lo habla con tu timbre.

Pero el audio solo no alcanza, y esto es lo que más créditos me costó aprender. El audio le da el ritmo y el timbre, y los fonemas se los dan las palabras escritas. Si conectás el audio y no escribís el diálogo entre comillas, el modelo arma movimientos de boca aproximados y el personaje termina balbuceando. Van las dos cosas siempre, el audio de referencia conectado y el texto exacto entre comillas dobles dentro del prompt.

Y el texto tiene que coincidir palabra por palabra con el audio, incluido el voseo. Si el audio dice "ejecutás" y el texto dice "ejecutas", el modelo tiene dos fuentes distintas para los mismos fonemas y la boca se le desarma.

Una última de producción. La duración del video se elige a partir del audio, nunca al revés. Un audio de 26,68 segundos necesita un clip de 27. Si generás 26, perdés el final, que suele ser justo el llamado a la acción.

Ojo Activá el sonido en la plataforma antes de generar, porque suele venir desactivado por defecto. Generar sin audio y darte cuenta después es tirar créditos.
07

Duración, timestamps y extensiones

El sweet spot: 5 a 10 segundos
La sección en una imagen

Que aguante 30 no significa 30.

Planos cortos, montaje tuyo.

El sweet spot es 5 a 10 segundos. Que el modelo aguante 30 no significa que 30 sea la jugada. Los planos cortos salen más estables, más baratos de iterar, y el montaje lo hacés vos.

Si igual necesitás una toma larga, se puede. El riesgo ahí es la deriva. A los veinte segundos la temperatura de color se te fue y la cara del personaje ya cambió. Eso se ancla nombrando explícitamente que la luz mantiene el mismo tono de punta a punta, y que cara, pelo y ropa quedan idénticos del primer al último frame. Con esas dos líneas adentro del prompt, 27 segundos en una sola toma se sostienen.

Para secuencias con cortes de 10 segundos o más, bloques con timestamps. El modelo necesita saber qué pasa cuándo:

Prompt
> Comercial cinematográfico, luz cálida de atardecer.
0-4 segundos: la mujer @01 entra al café, la cámara la sigue en tracking shot.
4-8 segundos: se sienta junto a la ventana, slow push-in hacia su rostro.
8-12 segundos: mira la taza @02, sonríe apenas, extreme close-up del vapor.
Solo SFX y sonido ambiente. SFX: murmullo de café, tazas, pasos.

Cuándo NO usar timestamps

Los timestamps sirven cuando querés cortes. En un plano continuo te los fabrican.

Escribir "0-4s pasa esto, 4-8s pasa aquello" le da al modelo bloques separados, y el modelo los separa como sabe, cortando. Peor todavía si cada evento entra y sale dentro de su ventana, porque entre uno y otro el cuadro queda vacío y ese vacío es la costura donde mete el corte. Me pasó con un plano de seis eventos de fondo, con cortes en cada transición, aunque el prompt pedía explícitamente no cortar.

En toma continua se escribe con simultaneidad. Nada de horarios, y las acciones pisándose entre sí:

Prompt
> Detrás de él el campo está ocupado todo el tiempo. Varias cosas pasan a la vez a distintas profundidades, entrando y saliendo a su propio ritmo. En ningún momento el campo queda vacío. Al principio cruza un carrito sin conductor con un tipo de traje corriéndolo. Mientras él todavía corre, dos tipos ya están entrando con un sofá que se les cae justo cuando pasa alguien con un flamenco inflable en dirección contraria. Una banda cruza el fondo lejano mientras el flamenco todavía está saliendo.

Las palabras que hacen el trabajo son "mientras", "todavía" y "en ningún momento el campo queda vacío". Eso es lenguaje de simultaneidad. Con eso el modelo entiende un solo espacio con cosas pasando, y no una lista de planos.

Multishot: hasta 6 planos en una generación, de 1 a 12 segundos cada uno. Útil para secuencias con cortes duros donde la continuidad la llevan los objetos y el estilo. Cada plano se describe como bloque.

Extensiones: para alargar un video que ya te gustó, la sintaxis es fija:

Prompt
> Extend @Video1 by 5s.

Y después describís SOLO lo que pasa a continuación, como si dirigieras la escena siguiente. Nunca re-describas lo que ya pasó. El modelo lee la trayectoria completa de movimiento, luz y composición de @Video1 y la continúa. Repetí la descripción física de los personajes y la línea de estilo, y los timestamps arrancan de nuevo en 0.

Ojo con dónde estás trabajando. Ese modo de extensión no está expuesto en todas las plataformas, y en Magnific hoy no aparece como parámetro del modelo. Si no lo tenés disponible, la alternativa es pasar el clip anterior como referencia de video y pedirle que continúe desde ahí.

Pro Las extensiones se encadenan indefinidamente, un prompt nuevo por tramo. Así construís una escena de un minuto sin que ningún tramo derive.
08

Prompts de Seedance 2.5 listos para copiar

Seis recetas de producción
La sección en una imagen

Copiá, pegá, adaptá.

Seis situaciones reales, seis prompts probados.

Seis situaciones reales, seis prompts para adaptar. En todos, referencias conectadas como referencias y citadas con @.

1. Producto héroe (anuncio de e-commerce)

Prompt
> Comercial cinematográfico de producto, fondo oscuro, luz dramática. El frasco @01 gira lentamente en orbit shot mientras gotas de agua caen en cámara lenta a su alrededor. Extreme close-up final de la etiqueta. Escena continua, en una sola toma. Solo SFX y sonido ambiente. SFX: gotas de agua, ambiente de estudio silencioso.

2. Personaje que habla a cámara (UGC / talking head)

Prompt
> Video estilo UGC, cámara en mano, luz natural de departamento. La mujer @01 sostiene el producto @02 a la altura del pecho, mira directo a cámara y dice: "Lo probé una semana y no vuelvo atrás". Sonríe al final. Handheld sutil, encuadre de pecho hacia arriba. Solo SFX y sonido ambiente. SFX: ambiente de habitación, tráfico lejano.

3. Escena continua con acción física

Prompt
> Estilo documental, luz de tarde. El hombre @01 agarra la taza @02 de la mesa, la levanta, sopla el vapor y da un sorbo corto. Baja la taza sin soltarla. Static shot, plano medio. Escena continua, en una sola toma. Solo SFX y sonido ambiente. SFX: cerámica sobre madera, soplido, ambiente de cocina.

4. Lip-sync con tu voz real (audio de referencia)

Prompt
> El personaje @01 está sentado frente al escritorio @02, luz cálida de lámpara. Habla a cámara con la voz de @audio1 y dice: "[acá va el texto exacto, palabra por palabra, igual al del audio]". Gesticula con las manos de forma natural. Slow push-in casi imperceptible. Solo SFX y sonido ambiente. SFX: ambiente de oficina en la noche.

El texto escrito tiene que coincidir palabra por palabra con el audio, incluido el voseo. Sin ese texto entre comillas, el audio de referencia solo te da ritmo y timbre, y el personaje termina balbuceando.

5. Talking head con acción de fondo (el gag de redes)

Prompt
> El personaje @01 está parado en el parque @02, hablando a cámara con la voz de @audio1, tranquilo, sin registrar nada de lo que pasa atrás. Dice: "[texto exacto, igual al del audio]". Telephoto lens, background heavily compressed and thrown well out of focus, only the subject is sharp. Shallow depth of field. No se ve piso entre la cámara y él, y el horizonte queda apenas por encima de su cabeza.

Detrás de él el campo está ocupado todo el tiempo, a media distancia. Varias cosas pasan a la vez a distintas profundidades, entrando y saliendo a su propio ritmo. En ningún momento el campo queda vacío. Cruza un carrito sin conductor con un tipo de traje corriéndolo. Mientras él todavía corre, dos tipos ya están entrando con un sofá que se les cae justo cuando pasa alguien con un flamenco inflable en dirección contraria.

La luz mantiene el mismo tono cálido de punta a punta. Cara, pelo y ropa quedan idénticos del primer al último frame. Solo SFX y sonido ambiente. SFX: viento suave, pájaros, ruido lejano de gente.

Do not use a wide angle lens. Do not keep the background in focus. Do not cut at any point.

6. Extensión de un plano aprobado

Prompt
> Extend @Video1 by 5s. La cámara continúa el tracking shot. La mujer llega a la puerta del café, la abre, y la luz del interior le ilumina la cara. Se detiene un instante en el umbral. Solo SFX y sonido ambiente. SFX: campanita de puerta, murmullo interior.
Tip Generá siempre tres versiones por tirada. Esto es un poco como el casino. Para ganar hay que jugar varias veces, y no siempre cambiando el prompt.
09

Los errores que te van a costar créditos

Todos los cometí yo primero
La sección en una imagen

Doce formas de quemar créditos.

Y cómo esquivar cada una.

Todos estos los cometí yo o los vi cometer en mi mentoría. En orden de gravedad:

  • Morfear humanos.

    Los objetos se pueden transformar suavemente ("el labial se transforma en frasco de perfume"). Funciona hermoso. Con personas, NUNCA. Deformaciones grotescas garantizadas. Para cambiar de actor, cortes rápidos: "fast match-cut".

  • Negar con palabras sueltas.

    "Sin sombras", "no música". Así el modelo lee la palabra clave y se olvida del "no". Pero en 2.5 los negativos sí funcionan si van como oraciones completas y al final del prompt, que es donde el modelo los lee de forma más confiable. "Do not use a wide angle lens. Do not keep the background in focus. Do not cut at any point." Ese bloque final es lo que salva un plano de 27 segundos.

  • Adjetivos de emoción.

    "Se ve feliz" no es dirección. "Sonríe amplio, los ojos se le achinan, echa la cabeza levemente hacia atrás" sí.

  • Describir anatomía difícil con texto.

    Dientes, lenguas, dedos entrelazados. Referencia inline o nada.

  • Escenas largas con múltiples locaciones en una toma continua.

    El modelo clona personajes y alucina. Cortes duros y planos detalle.

  • Referencias sin propósito.

    Cada @ sin rol declarado es una moneda al aire.

  • Regenerar para ajustes finos.

    ¿El logo quedó 5% chico? Eso se arregla en un editor en dos minutos, no quemando otra generación.

  • Ignorar el primer frame.

    Tu video se juzga en el primer segundo. La imagen de apertura merece más iteraciones que todo el resto.

  • Acción de fondo con física compleja.

    Un tipo en monopatín tirado por tres perros son cuatro cuerpos coordinados y el modelo se rompe. Los gags que aguantan son de física simple: alguien camina, corre, carga algo, algo se cae. El mismo tipo caminando arrastrado por los perros funciona perfecto. Lo que rompe al modelo es la cantidad de cuerpos que tienen que moverse juntos, y no lo ambiciosa que sea la idea.

  • Pedir acción de película para el fondo.

    Explosiones, helicópteros, persecuciones de autos. En el cine real esas cosas también son VFX, así que el modelo aprendió cómo se ven en pantalla, con todo el promedio de calidad incluido, y te devuelve el efecto. Sale a croma barato y no hay prompt que lo salve. La acción de fondo que se ve real es la mundana y absurda: un carrito de golf sin conductor, dos tipos cargando un sofá, alguien con un flamenco inflable. Cosas que se filman de verdad porque pasan de verdad.

  • Poner la acción de fondo lejos.

    "Far in the background" es el enemigo. Un objeto lejano moviéndose rápido no comparte foco ni grano con el primer plano, y se lee como una capa pegada arriba. Media distancia, y que lo que pasa atrás toque el primer plano. Que el pasto cerca del sujeto se aplaste con el impacto, que la luz cambie.

  • Mezclar un frame de salida con las referencias de identidad.

    Si agarrás un frame de un video que te gustó y lo metés entre tus fotos de referencia, contamina. En una prueba, un frame generado metido junto a las 8 fotos de identidad hizo que el personaje hablara distinto y perdiera nitidez. Sacándolo, volvió. Las referencias de identidad son fotos tuyas y nada más.

Con estas reglas ya tenés más criterio que el 95% de la gente que está generando videos hoy. Lo que sigue es práctica. Elegí una receta de la sección 8, prepará dos referencias limpias y hacé tu primera tirada de tres.

¿Producís para clientes? Los números de este negocio (costos reales con IA frente al camino tradicional) están en mi guía de IA para agencias.