«Сбер» научил Kandinsky создавать видео сразу с речью, музыкой и окружающими звуками

Модель генерирует ролики до пяти секунд, поддерживает Full HD и доступна бесплатно в «ГигаЧате»

Российская модель Kandinsky 6.0 Video научилась создавать видео сразу вместе со звуковым сопровождением. Нейросеть генерирует человеческую речь, музыку и звуки окружающей среды и синхронизирует их с происходящим в кадре. Пользователям «ГигаЧата» новая возможность доступна бесплатно.

Источник изображения: ChatGPT

Для создания ролика достаточно описать нужную сцену текстом или загрузить изображение и добавить пожелания к звуку. Модель сама формирует видеоряд и аудиодорожку, а при наличии речи синхронизирует голос с движением губ персонажа. Максимальное разрешение после обработки достигает Full HD — 1920×1080 пикселей.

Kandinsky 6.0 Video состоит из отдельных потоков обработки видео и аудио, которые работают совместно, чтобы звук соответствовал происходящему в кадре по времени и смыслу. Разработчики также улучшили передачу движений людей, животных и предметов, чтобы сгенерированные сцены выглядели естественнее.

При этом у технологии пока есть заметное ограничение: один ролик со звуком длится не более пяти секунд. Разработчики объясняют это высокой вычислительной нагрузкой и рассчитывают со временем увеличить продолжительность генерации.

Помимо пользовательского сервиса, разработчики открыли код и модели Kandinsky 6.0 под лицензией MIT. Семейство включает облегчённую версию Lite на 3 млрд параметров и более крупную Pro на 29 млрд параметров, а отдельная модель повышает разрешение готового видео до Full HD.

Читайте ещё материалы по теме: