Científicos rusos han creado un complemento compacto para redes neuronales generativas que ayuda a la IA a transmitir correctamente el paso del tiempo en el video. Controla la velocidad de fotogramas y la dinámica de los eventos para que las acciones rápidas no se alarguen y los procesos lentos no se aceleren inesperadamente. El desarrollo se puede conectar a una red neuronal ya existente. También permite crear datos sintéticos más físicamente precisos para entrenar la llamada IA física.

Anteriormente, la velocidad de lo que sucedía en el encuadre se establecía en gran medida por las palabras en la consulta. Sin embargo, era difícil controlar directamente la dinámica real del video. El nuevo sistema permite al modelo tener en cuenta cómo se desarrollan los eventos en el tiempo y establecer el ritmo deseado para la escena, en lugar de simplemente reproducir patrones aprendidos de antemano.

El problema es particularmente notable en los sistemas modernos de generación de video. No siempre determinan correctamente la velocidad de los eventos que ocurren. Por lo tanto, un movimiento rápido puede parecer antinaturalmente estirado, mientras que una acción lenta, por el contrario, puede detenerse o acelerarse repentinamente.

Según los científicos, esto se debe a las características de la arquitectura de tales modelos. Durante el entrenamiento, a menudo es más importante qué tan bien se ve un fotograma individual que la precisión física de lo que sucede.

Matemáticos rusos resolvieron este problema utilizando un módulo compacto de dos bloques independientes. Uno es responsable de la velocidad de fotogramas, el segundo controla la dinámica de lo que sucede en cada momento de la escena.

Para entrenar el sistema, los investigadores prepararon 40 mil videos con diferentes velocidades de fotogramas y dinámicas. El conjunto incluyó tanto escenas con acciones humanas activas como procesos naturales lentos.

El complemento puede funcionar de dos maneras. En el primer caso, se conecta a un modelo ya entrenado y hace que los movimientos en el video creado sean más suaves, sin cambiar el carácter general de la generación.

En la segunda opción, el módulo se entrena junto con la red neuronal generativa. Entonces el sistema tiene la capacidad de cambiar no solo la suavidad del movimiento, sino también la física de lo que sucede en la escena.

El desarrollo se probó en los modelos Kandinsky 5.0 Video Lite y Wan2.2. Según los resultados de las pruebas, la naturalidad de los movimientos aumentó en un 29%, la calidad visual en un 8% y la correspondencia del video con la consulta de texto en un 19%. Los investigadores publicaron el código fuente del proyecto en acceso abierto en plataformas populares para trabajar con IA.

Leer más sobre este tema:

Комментарии

правилами