Перейти к содержанию

Нейросеть с миллионом параметров внезапно научилась думать

Учёные из Университета Иннополис обнаружили резкий скачок в рассуждении ИИ

У компактных нейросетей найден неожиданный эффект. После длительного периода почти без улучшений модель резко начинала лучше решать сложные задачи на пространственное мышление. Исследователи считают, что такой подход может изменить создание ИИ для устройств, где вычислительные ресурсы сильно ограничены.

Источник изображения: Grok

Речь идёт о рекурсивном мышлении. Вместо того чтобы постоянно увеличивать количество параметров нейросети, учёные предлагают заставлять небольшой блок модели несколько раз обрабатывать одну и ту же информацию. Каждый следующий проход позволяет уточнять решение, а рядом с промежуточным результатом модель хранит скрытый вектор — своеобразный «ход мысли».

Современные большие языковые модели создаются с триллионами параметров. Исследователи Университета Иннополис проверили другой вариант: оставить модель компактной, но дать ей больше времени на обработку задачи.

Именно здесь обнаружился эффект, который исследователи назвали «внезапным обучением». Заместитель директора Института анализа данных и ИИ Университета Иннополис Рустам Лукманов рассказал, что модель сначала долго практически не улучшала показатели, а затем продемонстрировала резкий скачок.

Момент такого перехода зависит от сложности задачи и глубины рекурсии. Это, по словам исследователей, позволяет настраивать модель под конкретные требования.

Рекурсивный подход сработал не только на абстрактных логических задачах. Учёные проверили его и на визуально обоснованном пространственном мышлении — сборке пазлов.

Практический вывод исследования заключается в том, что глубину «мышления» нейросети можно увеличивать не только за счёт роста самой модели, но и за счёт времени, которое она тратит на размышление. При этом размер модели может оставаться очень небольшим: в эксперименте он составлял менее миллиона параметров.

Статья «Глубина против рекурсии: превосходство над трансформерами в восстановлении пазлов» опубликована в сборнике одной из ведущих мировых конференций в области искусственного интеллекта и машинного обучения ICLR 2026.

Читайте ещё материалы по теме: