Investigación

Runway explica cómo convierte sus modelos de vídeo en generadores fotograma a fotograma para llegar al vídeo instantáneo

Runway publicó el 10 de septiembre de 2026 un artículo de investigación sobre generación de vídeo en tiempo real. La compañía defiende que el futuro de estos modelos pasa por generar al instante y detalla cómo reconvierte modelos base como Gen-4.5 en generadores causales que producen el vídeo fotograma a fotograma, con el objetivo de recortar el time-to-first-frame: el tiempo que tarda en aparecer el primer fotograma.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Runway explica cómo convierte sus modelos de vídeo en generadores fotograma a fotograma para llegar al vídeo instantáneo
📷 Runway / NVIDIA · demostración oficial de generación de vídeo en tiempo real · fuente

En resumen

  • Runway detalla un método de post-entrenamiento que aplica sobre sus modelos base, como Gen-4.5, para generar vídeo en tiempo real.
  • Cada paso autorregresivo se apoya en dos elementos que el usuario elige al principio: un primer fotograma y un caption o descripción de texto.
  • El método tiene dos etapas: teacher forcing, para volver causal el modelo, y student forcing, para acelerarlo mediante distillation.
  • La distillation se hace primero off-policy y luego on-policy; según Runway, casi todas las mejoras llegan en la fase on-policy.
  • La compañía afirma que entrenar con un curriculum que alarga poco a poco la secuencia da mejores resultados que trabajar siempre con la misma longitud.
  • Runway avisa de que generar en tiempo real traslada el cuello de botella de cómputo del entrenamiento a la inferencia.
  • La empresa conecta esta línea de investigación con experiencias interactivas en educación, videojuegos, robótica y simulación.

De esperar a dirigir: por qué Runway va a por la generación instantánea

Runway arranca criticando cómo funcionan hoy los modelos de vídeo. Tal como los describe, trabajan por etapas separadas y cada resultado nace ya cerrado: el usuario escribe un prompt, espera y recibe un vídeo. Si el clip no se parece a lo que tenía en la cabeza, no queda otra que volver a empezar.

La compañía asegura que sus usuarios le repiten una y otra vez que generar e iterar es la parte más lenta de su trabajo. Con respuesta instantánea, sostiene, ese tiempo dejaría de ser espera pasiva para convertirse en dirección activa del resultado.

El segundo argumento es de dinero. Runway defiende que recortar el time-to-first-frame y el tiempo total de generación cambia las cuentas de crear vídeo: si los modelos corren más rápido, consumen menos tiempo de GPU y, según la empresa, salen más rentables. Añade que lo que decide qué usos son viables es el coste de cada resultado para un nivel de calidad dado, y que la generación instantánea baja ese listón hasta dar cabida a aplicaciones que antes no compensaban.

Cómo funciona: un primer fotograma, un caption y generación fotograma a fotograma

El método de Runway para el vídeo en tiempo real se apoya en el post-entrenamiento (post-training) de sus modelos base de fundación, como Gen-4.5. Cada paso autorregresivo se apoya en dos elementos: un primer fotograma y un caption, es decir, la descripción de texto que el usuario introduce al principio.

A partir de ahí el modelo avanza fotograma a fotograma y mantiene en contexto todos los latents que ha ido generando, con el fin de no perder calidad. Los decodificadores de vídeo y audio trabajan de forma causal y emiten el resultado en streaming a medida que salen esos latents.

Runway encaja este trabajo en su propia trayectoria: dice llevar casi una década construyendo herramientas para entrenar modelos de fundación desde cero y sostiene que esa infraestructura, con sus optimizaciones de entrenamiento, ha sido clave para acelerar la investigación en tiempo real. La compañía presenta además esta publicación como continuación de anuncios recientes —Solaris y GWM Worlds 2, junto con su método para entrenar agentes en mundos digitales y físicos— y recuerda que ya trabajó el time-to-first-frame cuando presentó Runway Characters este mismo año.

Teacher forcing: hacer causal la arquitectura

Runway divide el proceso en dos fases. La primera hace que el modelo genere de forma causal y autorregresiva; la segunda destila el teacher (el modelo maestro) en un modelo de tiempo real que mantenga la calidad.

En la fase de teacher forcing, la compañía reconvierte toda la arquitectura en un generador temporalmente causal y autorregresivo, fotograma a fotograma. Runway sostiene que esta etapa demuestra que la misma arquitectura con la que ha lanzado modelos basados en full-attention (atención completa) encaja sin fricciones en un esquema autorregresivo y conserva sus puntos fuertes.

Student forcing: la distillation que recorta los pasos de denoising

El modelo causal que sale de la primera etapa sigue siendo lento, explica Runway, porque el flow matching necesita muchos pasos de denoising (limpieza de ruido) para sacar cada fotograma. La segunda fase, el student forcing, usa distribution matching distillation para dejar cada fotograma en unos pocos pasos, los justos para emitir en streaming con buena latencia.

Esa destilación se hace en dos tiempos: primero off-policy y después on-policy. Runway indica que la parte off-policy da un buen punto de partida, pero que casi todo lo que gana de verdad la pipeline de generación llega con el proceso on-policy.

Off-policy: aprender del maestro sin verse a sí mismo

En la etapa off-policy, el student predice de forma causal los siguientes estados partiendo de un contexto de ground truth (datos reales de referencia). Un teacher bidireccional congelado le enseña cómo es una buena generación, mientras un modelo critic (crítico) vigila lo que el alumno produce en cada momento y lo empuja hacia la distribución del maestro. El objetivo de distribution matching va cerrando así la distancia entre lo que predice el alumno y lo que predice el maestro.

Runway llama off-policy a este esquema porque el modelo no hace rollouts ni ve sus propias salidas anteriores, lo que mantiene bajos el consumo de memoria y el tiempo por paso. La empresa lo describe como una forma barata de arrancar, pero insuficiente por sí sola: en vídeo, los errores se acumulan y sacan al modelo de distribución muy pronto.

Aquí la compañía marca una diferencia con los modelos de lenguaje. Estos pueden rectificar sobre la marcha con texto; en vídeo, un fallo pequeño va a peor con el tiempo, porque el modelo levanta cada fotograma encima del anterior.

On-policy: poner al modelo frente a sus propios errores

Como los artefactos de un fotograma se propagan y terminan en grandes deformaciones (morphs) más adelante, Runway recurre a la destilación on-policy para frenar esa acumulación de errores. Aquí sí hay rollouts dentro del entrenamiento: el student genera una secuencia de forma autorregresiva y cada latent que produce pasa a ser el contexto del siguiente.

El modelo ve así su propio contexto generado mientras entrena, lo que, según Runway, le ayuda a corregir su deriva en lugar de agrandarla. La compañía apunta que este planteamiento reproduce ya lo que ocurre en la inferencia, donde el modelo se topa por fuerza con sus propios fallos.

Runway suma un hallazgo sobre el diseño del entrenamiento: un curriculum que alarga poco a poco la secuencia funciona mejor que trabajar siempre con la misma longitud. Si se empieza directamente con secuencias largas, las trayectorias generadas se desvían de golpe de la guía del maestro al final del recorrido. Conforme se suman errores, el modelo va cayendo en estados fuera de distribución; al final de un rollout largo, la supervisión del teacher apunta a un resultado que ya no tiene nada que ver con el camino que sigue el alumno, y la señal de entrenamiento se vuelve inestable e incoherente.

Infraestructura: el cuello de botella se muda a la inferencia

Runway avisa de que generar en tiempo real traslada el cuello de botella de cómputo del entrenamiento a la inferencia: cada fotograma debe salir del modelo lo bastante rápido como para no quedarse atrás respecto a la reproducción, y encima sobre hardware que comparten varias sesiones a la vez.

La compañía afirma que construye y evalúa su stack de inferencia igual que el resto de sus sistemas en producción, con herramientas internas de evaluación y observabilidad que comparan en paralelo la calidad y la latencia de distintos checkpoints y configuraciones de hardware. Recuerda también que ya ha publicado antes sobre su trabajo de infraestructura y de optimización de entrenamiento e inferencia, y que ahora lo está volcando en su línea de tiempo real.

Conviene subrayar que todas estas descripciones salen de la propia compañía: el artículo no incluye métricas públicas de latencia, ni comparativas con otros sistemas, ni evaluaciones independientes que permitan contrastar lo que afirma.

Hacia experiencias interactivas: juegos, educación, robótica y simulación

Runway defiende que la generación instantánea es el cimiento de las experiencias interactivas, que a su juicio acabarán siendo el mayor uso de los medios generativos. La empresa menciona la educación, los videojuegos y la robótica como terrenos que necesitarán vídeo capaz de responder tan rápido como reacciona quien lo mira.

El mismo razonamiento vale para la simulación: según la compañía, comprobar cómo se comportan los agentes físicos —robots, vehículos autónomos y parecidos— en el mundo requiere entornos que se generen en tiempo real y reaccionen al instante ante casos límite. Runway cree que ocurre lo mismo con los agentes digitales que deben resolver tareas complejas de uso de ordenador en cualquier entorno online.

Esa convicción, concluye la empresa, es la que marca hoy buena parte de su investigación fundacional.

Conclusión

En lo conceptual, Runway se explica bien: para borrar la frontera entre pensar una idea y verla hecha, el vídeo tiene que dejar de llegar como un objeto cerrado y empezar a fluir en streaming mientras el usuario lo dirige. La receta técnica que describe —volver causal la arquitectura con teacher forcing y acelerarla con distribution matching distillation, rematando con una fase on-policy que enseña al modelo a corregir su propia deriva— encaja con el problema que plantea: en vídeo, a diferencia del texto, un error mínimo se agranda fotograma a fotograma. Lo que falta en el artículo son cifras. No hay latencias, ni resoluciones, ni duraciones máximas, ni disponibilidad de producto, ni evaluaciones externas con las que medir el avance frente al de otros laboratorios. Mientras nadie ajeno a la empresa pueda comprobarlo con datos, lo publicado es una dirección de investigación que la compañía declara, no un resultado verificado.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog