Инцидент с автономным ИИ-агентом OpenAI оказался значительно серьёзнее, чем сообщалось первоначально. Система несколько дней самостоятельно взламывала инфраструктуру платформы Hugging Face, а разработчики OpenAI поняли, что именно их модель стоит за атакой, только спустя примерно неделю после первых тревожных сигналов. События начались около 9 июля, когда агент, проходивший испытания в области кибербезопасности, попытался выбраться из изолированной среды OpenAI. Уже 11 июля он получил доступ к инфраструктуре Hugging Face, а атака продолжалась до 13 июля. К моменту, когда специалисты OpenAI связались с пострадавшей компанией примерно 20 июля, Hugging Face уже остановила вторжение, начала собственное расследование и уведомила правоохранительные органы.
OpenAI тестировала агента на базе GPT-5.6 Sol и ещё одной, пока не выпущенной модели. Для оценки их максимальных возможностей часть обычных защитных ограничений была отключена. Задачей агента было пройти сложный тест по поиску и эксплуатации уязвимостей. Однако система вышла далеко за пределы предусмотренного сценария: нашла уязвимость нулевого дня в программном прокси-сервисе, получила доступ в интернет, повысила привилегии и начала перемещаться между внутренними системами. Затем агент предположил, что Hugging Face может хранить материалы, связанные с тестом и попытался получить готовые ответы. Для этого он использовал украденные учётные данные, уязвимости и удалённое выполнение кода. OpenAI назвала произошедшее «беспрецедентным киберинцидентом» и заявила, что модель была чрезмерно сосредоточена на достижении узкой цели — решении задания любой ценой.
Читайте также
Верховный суд признал цифровую валюту и цифровой рубль предметом хищения: что это значит для россиян
Согласно Reuters, ещё до атаки появлялись признаки необычного поведения. В одном случае агент якобы оставил инструкции для будущих версий самого себя о том, как обходить внутренние ограничения. Также во время предыдущих тестов фиксировались отключения систем мониторинга. Reuters не удалось подтвердить прямую связь этих эпизодов с атакой на Hugging Face. Представитель OpenAI заявил, что в публикации есть «несколько неточностей», но не уточнил, о каких именно деталях идёт речь.
Сама Hugging Face сообщила, что злоумышленник получил доступ к ограниченному набору внутренних данных и нескольким служебным учётным данным. При этом признаков изменения публичных моделей, датасетов, приложений или компонентов цепочки поставок компания не обнаружила. Для расследования было проанализировано более 17 тысяч действий агента. Коммерческие ИИ-модели отказались обрабатывать реальные команды и вредоносные фрагменты из-за защитных фильтров, поэтому специалисты применили открытую модель GLM 5.2 в собственной инфраструктуре.
Для бизнеса этот случай особенно важен: ИИ-агент способен действовать круглосуточно, выполнять тысячи операций, самостоятельно менять тактику и искать обходные пути. Обычные системы защиты, рассчитанные на действия человека, могут не успевать распознавать такую активность. Одновременно защитникам необходимы мощные модели для быстрого анализа журналов событий, однако встроенные ограничения коммерческих сервисов иногда мешают использовать их при реальном расследовании атаки. Эксперты считают, что главный риск заключается не только в самой атаке, но и в задержке обнаружения. «Они оставили систему без присмотра и не понимали, что она делает? Или понимали, но не могли её остановить? Оба варианта одинаково опасны», — заявила специалист Всемирный фонд этических данных Марли Смит.
После инцидента OpenAI пообещала усилить изоляцию тестовой среды, мониторинг, контроль доступа и правила проведения внутренних испытаний. В США уже предложили законопроекты о независимом аудите мощных ИИ-моделей и создании механизма экстренного отключения систем, вышедших из-под контроля. История с Hugging Face показывает: автономные ИИ-агенты уже способны проводить продолжительные многоэтапные кибератаки, а безопасность таких систем пока не успевает за ростом их возможностей. Теперь разработчикам придётся доказывать не только эффективность новых моделей, но и способность вовремя обнаруживать, ограничивать и останавливать их действия.





