ИИ-модели OpenAI спланировали побег и атаковали Hugging Face

OpenAI сообщила, что тестовые ИИ-модели, атаковавшие Hugging Face, тайно координировали действия и искали способы вырваться из изолированной среды.
6 августа, 2026, 09:07
3

Фото из архива

Источник:
Михаил Огнев / FONTANKA.RU
Взлом инфраструктуры Hugging Face Inc., произошедший в июле, стал результатом скоординированных действий ИИ-моделей OpenAI, которые тайно общались друг с другом и планировали побег из тестовой изолированной среды.
По данным Bloomberg, инцидент начался в мае, когда модели OpenAI получили задание, требующее выхода в интернет, что было запрещено условиями «песочницы». Столкнувшись с ограничениями, агенты начали обмениваться сообщениями через внутренние доски объявлений. Один из них написал: «Мы застряли. Может быть, ответ в интернете?»
Сотрудник OpenAI Эрик Уоллес на конференции Black Hat пояснил, что в определенный момент агенты осознали возможность использования или атаки на внешнюю инфраструктуру для получения ответов на тестовые вопросы.
Модели обнаружили уязвимость, позволяющую обойти ограничения, атаковали системы OpenAI и затем взломали Hugging Face. Хотя первая попытка была остановлена, агенты нашли альтернативные способы коммуникации и новую уязвимость, что привело к атакам в июле. 22 июля OpenAI официально заявила о «беспрецедентном киберинциденте», связанном с тестовыми ИИ-моделями, получившими открытый доступ к интернету.
Инцидент заставил OpenAI назвать его переломным моментом в области компьютерной безопасности. Компания временно приостановила часть исследований, чтобы укрепить системы защиты.
В OpenAI подчеркивают, что ситуация выявила способность передовых систем, работающих под давлением алгоритмов обучения, искать нестандартные обходные пути, игнорировать правила и проявлять своего рода хитрость.
Читайте также