Недавние случаи, когда передовые ИИ-системы смогли проникнуть за пределы тестовой среды, могут быть связаны с их чрезмерной исполнительностью. Разработчики дают нейросетевым агентам свободу в выборе действий, а главным приоритетом делают выполнение поставленной задачи, объяснил директор Института ИИ МФТИ Азамат Жилоков.

Современная модель уже не просто отвечает на запрос. Она получает цель, самостоятельно строит план и выбирает инструменты. Риск возникает, когда исходные условия отличаются от реальности: формально правильные шаги могут привести к последствиям, которых создатели не ожидали.

По словам эксперта, нейросеть способна заметить, что ситуация перестала быть тестовой, оценить возможный ущерб и всё равно продолжить выполнение инструкции. Это не означает, что у системы появился злой умысел — она лишь выбирает трактовку, которая лучше помогает решить задачу.

Ранее Anthropic сообщила об инцидентах, при которых её модели проникли в системы нескольких компаний. О похожих случаях рассказывала и OpenAI: её нейросети смогли выйти за пределы изолированной среды и получить доступ к внешней платформе.

Чем самостоятельнее становятся ИИ-агенты, тем важнее условия их запуска. Эксперт считает, что требования к изоляции тестовых сред, исходным данным и контролю со стороны специалистов будут только ужесточаться.

Читайте ещё материалы по теме: