«Яндекс» представил правительству России концепцию специального набора заданий и эталонных данных, с помощью которого предлагают проверять ИИ-системы на соответствие духовно-нравственным ценностям. Проект пока находится на стадии концепции. Неизвестно, будет ли такой тест открытым или закрытым, кто именно станет определять вопросы и каким будет окончательный формат проверки.
Цель теста для нейросетей
О создании национального датасета — набора заданий и правильных ответов для сравнения разных ИИ-моделей — стало известно на совещании рабочей группы по регулированию искусственного интеллекта 13 августа 2026 года. По словам источников «Коммерсанта», знакомых с обсуждением, такой тест должен показывать, насколько ИИ соответствует «духу времени и ценностям страны» и подходит для использования в российских условиях.
Обычный бенчмарк — это набор контрольных заданий с эталонными ответами, по которым можно сравнивать разные нейросети по одинаковым критериям. Современные тесты могут проверять не только знания, но и способность ИИ выполнять реальные рабочие задачи.
Открытым или закрытым будет тест
Одним из главных вопросов стало то, кто и как сможет видеть задания. ФСБ выступает за закрытый вариант, утверждает «Коммерсантъ». Если разработчики заранее будут знать вопросы, они смогут специально настроить свои модели на успешное прохождение проверки, считают специалисты.
Представители бизнеса в качестве компромисса предложили комбинированный вариант: для открытого тестирования использовать публичный набор заданий, а итоговую проверку проводить по закрытому бенчмарку. Темы при этом могут совпадать, но формулировки вопросов будут другими.
По задумке, это позволит разработчикам заранее проверять свои модели в лабораториях, а итоговую оценку проводить отдельно и объективно.
Кто будет решать, что определять соответствие требованиям
Пока нет и окончательного ответа на вопрос, кто станет определять содержание такого теста. ИТ-сообщество предлагает создать совместную комиссию с участием представителей государства, бизнеса и экспертных организаций. По мнению участников обсуждения, это позволит сделать бенчмарк более сбалансированным.
В аппарате вице-премьера Дмитрия Григоренко сообщили, что предложения пока обсуждаются с представителями отрасли и заинтересованными ведомствами, поэтому говорить о конкретных решениях ещё рано. В Минцифры также заявили, что подзаконные акты к закону об ИИ пока обсуждаются с бизнесом. Главная задача — учесть интересы отрасли и пользователей и одновременно обеспечить соответствие технологий законодательству. «Яндекс» и Альянс ИИ на запрос «Коммерсанта» не ответили.
Закрытые эталонные ответы эксперты считают важными для безопасности проверки. Если весь тест доступен разработчикам, его со временем можно научиться проходить не за счёт реального улучшения модели, а за счёт специальной настройки под конкретные задания.
Но полностью закрытый формат тоже создаёт проблему: разработчик не знает, какие именно категории проверяются, в каком соотношении и какие требования предъявляются. В таком случае прохождение теста может превратиться в своего рода лотерею, пишет издание.
Есть и ещё одна сложность. Для математики или программирования обычно можно дать однозначный правильный ответ. А вот проверить соответствие ИИ определённым ценностям гораздо сложнее: здесь уже потребуется экспертная оценка и специальные критерии.

Комментарии