Перейти к содержанию

La IA aprende a etiquetar videos para robots: el tiempo de trabajo se reduce drásticamente

Los estudiantes de maestría de ITMO crearon un prototipo que marca automáticamente las acciones humanas y los objetos en un video, y el especialista solo tiene que verificar el resultado

El etiquetado de videos para el entrenamiento de robots, que manualmente puede llevar hasta 30 minutos por cada video corto, se ha acelerado significativamente con la ayuda del prototipo Praxis. Fue desarrollado por estudiantes de maestría del AI Talent Hub de ITMO en colaboración con IT Imperial. El sistema genera un borrador de etiquetado de un video de 30 segundos en aproximadamente un minuto, después de lo cual el especialista necesita unos tres minutos para verificar y corregir el resultado. Si se confirman los indicadores con los datos de la empresa, se planea reducir la parte manual del trabajo en al menos un 80%.

Fuente de la imagen: Grok

Para que un robot aprenda a repetir las acciones humanas, un video normal primero debe convertirse en una secuencia de pasos comprensible para él. En el video se marca dónde comienza y termina cada acción, con qué objeto se realiza y qué fotograma es clave. Este trabajo preliminar ahora lo realiza el nuevo prototipo.

El servicio prepara automáticamente un borrador de etiquetado, y el especialista lo verifica en la línea de tiempo, corrige campos individuales si es necesario y luego exporta los datos. En un experimento separado, el equipo comparó dos opciones de trabajo en un editor: cuando una persona etiqueta un video desde cero y cuando primero recibe un borrador listo del sistema. En el segundo caso, el trabajo fue 2.2 veces más rápido.

Al mismo tiempo, la predicción del sistema y las correcciones del especialista se guardan por separado. Esto permite evaluar por separado la calidad del trabajo de la IA y utilizar las correcciones realizadas por el humano para un entrenamiento posterior.

El equipo probó 30 configuraciones del sistema. En la versión final, un modelo determina dónde termina una acción y comienza otra, y el segundo reconoce la acción y el objeto en sí. Esta división permite configurar por separado la búsqueda de límites temporales y el reconocimiento de contenido. La decisión final la toma el especialista de todos modos.

Los límites temporales se verificaron en 85 videos. El error promedio fue de 0.27 segundos, y en el 90% de los casos los límites se ajustaron a una desviación permitida de hasta dos segundos.

Pero el servicio aún no está completamente listo. En una prueba de extremo a extremo en tres videos propios, los límites temporales coincidieron con el etiquetado de referencia para el 72% de los pasos, y el sistema nombró correctamente el 71% de las acciones coincidentes. Partes individuales de la solución mostraron funcionalidad, pero el reconocimiento de contenido y la transferencia del sistema a nuevos datos aún requieren mejoras.

Durante el semestre, el equipo continuará trabajando en Praxis junto con IT Imperial. El prototipo se probará con los videos de la empresa, se comparará con el etiquetado actual y se medirá por separado la calidad y el tiempo que el especialista dedica a las correcciones.

Leer más sobre este tema: