Sber ha enseñado a Kandinsky a crear videos con voz, música y sonidos ambientales a la vez

El modelo genera videos de hasta cinco segundos, soporta Full HD y está disponible de forma gratuita en GigaChat

El modelo ruso Kandinsky 6.0 Video ha aprendido a crear videos con acompañamiento de sonido. La red neuronal genera voz humana, música y sonidos ambientales, y los sincroniza con lo que sucede en el encuadre. Esta nueva función está disponible de forma gratuita para los usuarios de GigaChat.

Fuente de la imagen: ChatGPT

Para crear un video, basta con describir la escena deseada con texto o subir una imagen y añadir las preferencias de sonido. El modelo forma la secuencia de video y la pista de audio por sí mismo, y si hay voz, sincroniza la voz con el movimiento de los labios del personaje. La resolución máxima después del procesamiento alcanza Full HD — 1920×1080 píxeles.

Kandinsky 6.0 Video consta de flujos de procesamiento de video y audio separados que trabajan juntos para que el sonido coincida con lo que sucede en el encuadre en tiempo y significado. Los desarrolladores también han mejorado la transmisión de movimientos de personas, animales y objetos para que las escenas generadas se vean más naturales.

Sin embargo, la tecnología todavía tiene una limitación notable: un video con sonido no dura más de cinco segundos. Los desarrolladores explican esto por la alta carga computacional y esperan aumentar la duración de la generación con el tiempo.

Además del servicio para el usuario, los desarrolladores han abierto el código y los modelos de Kandinsky 6.0 bajo la licencia MIT. La familia incluye una versión Lite simplificada con 3 mil millones de parámetros y una versión Pro más grande con 29 mil millones de parámetros, y un modelo separado aumenta la resolución del video terminado a Full HD.

Leer más sobre este tema: