Перейти к содержанию

ИИ сможет «понимать», как течёт время в созданном видео

Исследователи научили модель задавать нужный ритм сценам и делать движения естественнее

Российские учёные создали компактную надстройку для генеративных нейросетей, которая помогает ИИ правильно передавать течение времени в видео. Она управляет частотой кадров и динамикой событий, чтобы быстрые действия не растягивались, а медленные процессы не начинали неожиданно ускоряться. Разработку можно подключать к уже готовой нейросети. Она также позволяет создавать более физически достоверные синтетические данные для обучения так называемого физического ИИ.

Источник изображения: Grok

Раньше скорость происходящего в кадре во многом задавалась словами в запросе. При этом напрямую управлять реальной динамикой видео было сложно. Новая система позволяет модели учитывать то, как события разворачиваются во времени, и задавать нужный ритм сцены, а не просто воспроизводить заранее выученные шаблоны.

Проблема особенно заметна в современных системах генерации видео. Они не всегда правильно определяют скорость происходящих событий. Поэтому быстрое движение может выглядеть неестественно растянутым, а медленное действие, наоборот, способно замереть или внезапно ускориться.

По словам учёных, это связано с особенностями архитектуры таких моделей. При обучении в них часто важнее то, насколько хорошо выглядит отдельный кадр, чем физическая достоверность происходящего.

Российские математики решили эту проблему с помощью компактного модуля из двух независимых блоков. Один отвечает за частоту кадров, второй управляет динамикой происходящего в каждый момент сцены.

Для обучения системы исследователи подготовили 40 тыс. видеороликов с разной частотой кадров и различной динамикой. В набор вошли как сцены с активными действиями людей, так и медленные природные процессы.

Надстройка может работать двумя способами. В первом случае её подключают к уже обученной модели и делают движения в создаваемом видео более плавными, не меняя общий характер генерации.

Во втором варианте модуль дообучают вместе с генеративной нейросетью. Тогда система получает возможность менять не только плавность движения, но и физику происходящего в сцене.

Разработку проверили на моделях Kandinsky 5.0 Video Lite и Wan2.2. По результатам испытаний естественность движений выросла на 29%, визуальное качество — на 8%, а соответствие видео текстовому запросу — на 19%. Исходный код проекта исследователи опубликовали в открытом доступе на популярных платформах для работы с ИИ.

Читайте ещё материалы по теме: