Sber ha presentado la familia de modelos generativos Kandinsky WM 1.0, diseñados para crear datos de video con estricto cumplimiento de las leyes de la física. El desarrollo está orientado a entrenar sistemas de IA física, inteligencia artificial que controla robots, vehículos autónomos y equipos industriales.

Las redes neuronales resuelven el problema de la escasez de datos de entrenamiento: para preparar modelos modernos se requieren millones de horas de grabaciones de video, y la recopilación de dicho material es extremadamente difícil y costosa. Kandinsky WM permite generar escenarios raros y peligrosos (accidentes, condiciones climáticas extremas, fallas de equipos) que son imposibles de filmar en condiciones reales.

Los modelos se basan en Kandinsky 5.0 Video Lite, reentrenado con varios millones de grabaciones de video de cámaras de robots, vehículos autónomos e instalaciones industriales. Se prestó especial atención a la plausibilidad física: se verificó que los objetos no se deformaran, no desaparecieran y se movieran de forma natural. Para los escenarios automotrices, se utilizó el aprendizaje por refuerzo: modelos especiales evaluaron la calidad de los videos y proporcionaron retroalimentación.

Los modelos generan videos de aproximadamente cinco segundos de duración, que reflejan acciones individuales: manipulación de objetos, maniobras en carretera, etapas de procesos de producción. Kandinsky WM 1.0 ya es utilizado por el Centro de Robótica de Sber para entrenar robots y por el instituto AIRI para desarrollar un simulador de carretera.

El código y los pesos de los modelos se publican bajo la licencia abierta MIT, lo que permite a los desarrolladores de todo el mundo utilizarlos de forma gratuita. Según los desarrolladores, Kandinsky WM es el primer paso hacia la creación de modelos mundiales completos, capaces de simular el desarrollo de una escena en el tiempo y servir como simuladores para el entrenamiento de robots.

Leer más sobre este tema: