El Ministerio de Desarrollo Digital y las empresas están discutiendo subvenciones y subsidios para la creación de conjuntos de datos en ruso y específicos de la industria para entrenar grandes modelos de IA. La decisión sobre las medidas de apoyo planea ser acordada antes del 30 de septiembre.
La idea es que un conjunto de datos de alta calidad pueda ser utilizado por varios equipos de investigación a la vez. Esto debería reducir la recopilación repetida de información, su limpieza y etiquetado.
Sin embargo, los expertos advierten sobre otro problema. Sin requisitos para su uso futuro, las grandes empresas podrían recibir dinero del estado, y los conjuntos de datos creados con fondos presupuestarios permanecerían cerrados.
Según Zaur Abutalimov, CEO de Ivideon, un proyecto típico de análisis de video por encargo de la compañía toma de 4 a 5 meses, y hasta el 80% de ese tiempo puede dedicarse a la recopilación, limpieza, etiquetado y verificación de datos.
El costo depende de la tarea y puede variar desde 1 millón hasta decenas de millones de rublos. Sin embargo, los parámetros de las futuras subvenciones aún no se han determinado: se desconocen el presupuesto, los requisitos para los participantes y la proporción de financiación estatal.
La idea de financiar conjuntos de datos es conceptualmente correcta, solo que el dinero podría ir a los 'gigantes' sin la obligación de publicar el resultado.
El volumen total de apoyo estatal planificado para la IA se estima en aproximadamente 71.7 mil millones de rublos. Sin embargo, los conjuntos de datos solo cubren una parte de las necesidades de los proyectos de IA: también requieren capacidad computacional, especialistas e infraestructura.