El modelo ruso Kandinsky 6.0 Video ha aprendido a crear videos con acompañamiento de sonido. La red neuronal genera voz humana, música y sonidos ambientales, y los sincroniza con lo que sucede en el encuadre. Esta nueva función está disponible de forma gratuita para los usuarios de GigaChat.

Para crear un video, basta con describir la escena deseada con texto o subir una imagen y añadir las preferencias de sonido. El modelo forma la secuencia de video y la pista de audio por sí mismo, y si hay voz, sincroniza la voz con el movimiento de los labios del personaje. La resolución máxima después del procesamiento alcanza Full HD — 1920×1080 píxeles.

Kandinsky 6.0 Video consta de flujos de procesamiento de video y audio separados que trabajan juntos para que el sonido coincida con lo que sucede en el encuadre en tiempo y significado. Los desarrolladores también han mejorado la transmisión de movimientos de personas, animales y objetos para que las escenas generadas se vean más naturales.

Sin embargo, la tecnología todavía tiene una limitación notable: un video con sonido no dura más de cinco segundos. Los desarrolladores explican esto por la alta carga computacional y esperan aumentar la duración de la generación con el tiempo.

Además del servicio para el usuario, los desarrolladores han abierto el código y los modelos de Kandinsky 6.0 bajo la licencia MIT. La familia incluye una versión Lite simplificada con 3 mil millones de parámetros y una versión Pro más grande con 29 mil millones de parámetros, y un modelo separado aumenta la resolución del video terminado a Full HD.

Leer más sobre este tema:

No te pierdas nuestras noticiasAñade este sitio a tus fuentes preferidas para vernos más a menudoAñadir en Google

Сейчас на главной