Российская модель Kandinsky 6.0 Video научилась создавать видео сразу вместе со звуковым сопровождением. Нейросеть генерирует человеческую речь, музыку и звуки окружающей среды и синхронизирует их с происходящим в кадре. Пользователям «ГигаЧата» новая возможность доступна бесплатно.

Для создания ролика достаточно описать нужную сцену текстом или загрузить изображение и добавить пожелания к звуку. Модель сама формирует видеоряд и аудиодорожку, а при наличии речи синхронизирует голос с движением губ персонажа. Максимальное разрешение после обработки достигает Full HD — 1920×1080 пикселей.
Kandinsky 6.0 Video состоит из отдельных потоков обработки видео и аудио, которые работают совместно, чтобы звук соответствовал происходящему в кадре по времени и смыслу. Разработчики также улучшили передачу движений людей, животных и предметов, чтобы сгенерированные сцены выглядели естественнее.
При этом у технологии пока есть заметное ограничение: один ролик со звуком длится не более пяти секунд. Разработчики объясняют это высокой вычислительной нагрузкой и рассчитывают со временем увеличить продолжительность генерации.
Помимо пользовательского сервиса, разработчики открыли код и модели Kandinsky 6.0 под лицензией MIT. Семейство включает облегчённую версию Lite на 3 млрд параметров и более крупную Pro на 29 млрд параметров, а отдельная модель повышает разрешение готового видео до Full HD.
Читайте ещё материалы по теме:
Не пропускайте наши новостиДобавьте сайт в предпочитаемые источники, чтобы видеть нас чащеДобавить в Google

















