Разметка видео для обучения роботов, которая вручную может занимать до 30 минут на один короткий ролик, существенно ускорили с помощью прототипа Praxis. Его разработали магистранты AI Talent Hub ИТМО совместно с IT Imperial. Система примерно за минуту формирует черновую разметку 30-секундного видео, после чего специалисту требуется около трёх минут на проверку и исправление результата. При подтверждении показателей на данных компании ручную часть работы планируют сократить минимум на 80%.

Чтобы робот научился повторять действия человека, обычное видео сначала нужно превратить в понятную для него последовательность шагов. В ролике отмечают, где начинается и заканчивается каждое действие, с каким объектом оно выполняется и какой кадр является ключевым. Эту предварительную работу теперь выполняет новый прототип.
Сервис автоматически готовит черновик разметки, а специалист проверяет его на временной шкале, при необходимости исправляет отдельные поля и затем выгружает данные. В отдельном эксперименте команда сравнила два варианта работы в одном редакторе — когда человек размечает видео с нуля и когда сначала получает готовый черновик от системы. Во втором случае работа оказалась в 2,2 раза быстрее.
При этом прогноз системы и исправления специалиста сохраняются отдельно. Это позволяет отдельно оценивать качество работы ИИ и использовать внесённые человеком исправления для дальнейшего обучения.
Команда проверила 30 конфигураций системы. В итоговом варианте одна модель определяет, где заканчивается одно действие и начинается другое, а вторая распознаёт само действие и объект. Такое разделение позволяет отдельно настраивать поиск временных границ и распознавание содержания. Окончательное решение всё равно принимает специалист.
Временные границы проверили на 85 роликах. Средняя ошибка составила 0,27 секунды, а в 90% случаев границы укладывались в допустимое отклонение до двух секунд.
Но полностью готовым сервис пока не стал. В сквозном тесте на трёх собственных роликах временные границы совпали с эталонной разметкой для 72% шагов, а система правильно назвала 71% совпавших действий. Отдельные части решения показали работоспособность, однако распознавание содержания и перенос системы на новые данные ещё требуют доработки.
В течение семестра команда продолжит работу над Praxis вместе с IT Imperial. Прототип проверят на роликах компании, сравнят его с текущей разметкой и отдельно измерят качество и время, которое специалист тратит на исправления.
Комментарии