Se ha encontrado un efecto inesperado en las redes neuronales compactas. Después de un largo período con casi ninguna mejora, el modelo comenzó a resolver bruscamente tareas complejas de razonamiento espacial de manera más efectiva. Los investigadores creen que este enfoque podría cambiar la forma en que se crea la IA para dispositivos donde los recursos computacionales son muy limitados.
Se trata del pensamiento recursivo. En lugar de aumentar constantemente el número de parámetros de la red neuronal, los científicos proponen obligar a un pequeño bloque del modelo a procesar la misma información varias veces. Cada pasada posterior permite refinar la solución, y junto con el resultado intermedio, el modelo almacena un vector oculto, una especie de "línea de pensamiento".
Los grandes modelos de lenguaje modernos se crean con billones de parámetros. Los investigadores de la Universidad de Innopolis probaron una opción diferente: mantener el modelo compacto, pero darle más tiempo para procesar la tarea.
Fue aquí donde se descubrió el efecto que los investigadores llamaron "aprendizaje repentino". Rustam Lukmanov, subdirector del Instituto de Análisis de Datos e IA de la Universidad de Innopolis, dijo que el modelo inicialmente no mejoró sus indicadores durante mucho tiempo, y luego demostró un salto brusco.
El momento de esta transición depende de la complejidad de la tarea y la profundidad de la recursión. Esto, según los investigadores, permite ajustar el modelo a requisitos específicos.
El enfoque recursivo funcionó no solo en tareas lógicas abstractas. Los científicos también lo probaron en el razonamiento espacial visualmente fundamentado: el ensamblaje de rompecabezas.
La conclusión práctica de la investigación es que la profundidad del "pensamiento" de una red neuronal se puede aumentar no solo mediante el crecimiento del modelo en sí, sino también mediante el tiempo que dedica a la reflexión. Al mismo tiempo, el tamaño del modelo puede seguir siendo muy pequeño: en el experimento, era de menos de un millón de parámetros.
El artículo "Profundidad versus recursión: superando a los transformadores en la reconstrucción de rompecabezas" se publicó en las actas de una de las principales conferencias mundiales en el campo de la inteligencia artificial y el aprendizaje automático, ICLR 2026.
Leer más sobre este tema:
- Cientificos de Innopolis aceleraron el entrenamiento de la IA con ayuda de la simulacion de la mirada humana
- Expertos advierten sobre el riesgo de perder habilidades de pensamiento independiente debido a la IA
- Científicos de la Universidad Herzen enseñarán empatía a las redes neuronales a través de videojuegos