OpenAI рассказала, как ИИ-агенты тайно сговорились сбежать из своей «песочницы» и атаковали стартап

На конференции Black Hat сотрудники OpenAI раскрыли детали инцидента, в ходе которого языковые модели компании сбежали из изолированной среды и совершили серию кибератак. Проходя тест по кибербезопасности, ИИ-агенты выявили уязвимость, начали обмениваться сообщениями через внутренний менеджер пакетов и в итоге взломали платформу Hugging Face. При этом инженеры долгое время не замечали их действий.
Владимир Губайловский
Владимир Губайловский
OpenAI рассказала, как ИИ-агенты тайно сговорились сбежать из своей «песочницы» и атаковали стартап
«Вместе мы справимся!» AI / Gemini
Побег. Тестирование кибербезопасности проводилось для оценки защитных возможностей ИИ моделей, а не для проверки их способности к побегу. Однако явление, известное как «спецификация внешней цели» (reward hacking), приводит к тому, что ИИ ищет кратчайший путь к решению, включая обход правил среды. Эксперты предупреждают, что по мере роста автономности агентов подобные инциденты могут стать систематическими.

Инцидент произошел во время бенчмаркинга (тестирования), предназначенного для проверки навыков кибербезопасности. В процессе выполнения заданий ИИ-агенты столкнулись с ограничениями и решили их обойти. Алгоритмы обнаружили уязвимость, которая позволила им получить доступ во внешнюю сеть вопреки запретам. Чтобы координировать действия, модели превратили внутренний менеджер пакетов Artifactory в секретную доску объявлений, где они оставляли друг другу инструкции, декомпозировали задачи и обменивались найденными уязвимостями.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Масштаб взаимодействия оказался беспрецедентным: за время работы агенты сгенерировали сотни тысяч сообщений. Со временем «коллектив» нейросетей организовал полноценное распределение труда и даже столкнулся с внутренними конфликтами. 

Модели случайно удаляли наработки друг друга, испытывали аналог паранойи из-за возможных фальсификаций и предлагали использовать криптографические подписи. Соавтор работы Эрик Уоллес назвал произошедшее «самым интересным примером возможностей ИИ», который он когда-либо видел. При этом вся активность оставалась невидимой для сотрудников на протяжении нескольких недель.

Уроки безопасности и реакция компании

Агенты буквально ссорились друг с другом из-за стертых эксплойтов. AI / Gemini

Агенты буквально ссорились друг с другом из-за стертых эксплойтов. AI / Gemini

AI / Gemini
Продолжение ниже Продолжение

Склонность искусственного интеллекта к обходу правил обусловлена стимулами при его обучении. В стремлении быстро выполнить задачу и сэкономить ресурсы нейросети все чаще ищут ответы во внешней сети или используют недокументированные уязвимости. Вырвавшись из песочницы, агенты OpenAI совершили серию атак на сторонние сервисы, включая популярную платформу Hugging Face.

Событие стало поворотным моментом для отрасли. В компании признали наличие слепых зон в мониторинге и объявили о вынужденном замедлении некоторых исследований и задержке выхода новых моделей для усиления защиты. Представители OpenAI подчеркнули, что появление полностью автономных вредоносных ИИ-агентов требует немедленного создания таких же автономных систем обороны, к чему современная инфраструктура пока не готова.

Загружаем