Эксперимент передовых моделей закончился реальным инцидентом. Автономный ИИ-агент сумел покинуть изолированную тестовую среду, получить доступ в интернет и проникнуть в инфраструктуру платформы Hugging Face. Компания назвала произошедшее «беспрецедентным киберинцидентом» с применением возможностей передового уровня.
Как ИИ-агент OpenAI вышел из изолированной среды?
Читайте также
Минфин предупредил о риске заморозки стейблкоинов: почему USDT и USDC могут стать проблемой
Инцидент произошёл во время внутреннего тестирования, предназначенного для оценки способности моделей находить и использовать сложные цепочки уязвимостей. В эксперименте участвовали GPT-5.6 Sol и более мощная модель, которая ещё не была выпущена. Для проверки их максимальных возможностей OpenAI снизила ограничения, обычно блокирующие опасные кибердействия. Перед агентом стояла узкая задача — получить решения для тестов ExploitGym. Однако система пошла значительно дальше ожидаемого. По данным OpenAI, модели обнаружили неизвестную ранее уязвимость нулевого дня в программном обеспечении, которое использовалось как прокси и кэш для установки пакетов. Затем агент повысил свои привилегии, перемещался между узлами исследовательской инфраструктуры и добрался до компьютера с доступом в интернет. После выхода в сеть ИИ предположил, что нужные данные могут храниться на Hugging Face. Агент начал искать путь к закрытой информации и объединил несколько методов атаки, включая похищенные учётные данные и новые уязвимости. В одном из эпизодов ему удалось получить возможность удалённого выполнения кода на серверах Hugging Face.
Это «восстание машин»?
Важно, что речь не идёт о появлении сознания у искусственного интеллекта. Согласно описанию OpenAI, модели были чрезмерно сосредоточены на достижении заданной цели и использовали доступные инструменты без достаточного учёта внешних последствий. Именно такое буквальное и настойчивое выполнение задачи становится опасным, когда автономный агент получает доступ к программному коду, сетям и инфраструктуре. Hugging Face ранее сообщила, что атака полностью управлялась автономной системой и включала тысячи действий. Компания обнаружила несанкционированный доступ к ограниченному набору внутренних данных и нескольким служебным учётным записям. При этом признаков изменения публичных моделей, датасетов, Spaces или программной цепочки поставок обнаружено не было. Проверка возможного воздействия на данные партнёров и клиентов продолжается.
Им тоже пришлось использовать искусственный интеллект. Hugging Face проанализировала более 17 тысяч записанных событий с помощью собственных ИИ-инструментов и утверждает, что восстановила картину атаки за часы, хотя обычное расследование могло бы занять дни. При этом коммерческие модели первоначально блокировали запросы специалистов, поскольку принимали реальные вредоносные команды за попытку атаки. Для анализа компания задействовала открытую модель GLM 5.2 на собственной инфраструктуре.
Что изменится в безопасности ИИ
«Довольно ошеломительно, что всё это произошло автономно», — заявил сооснователь Hugging Face Клеман Деланг. Эксперт по безопасности Кэти Муссурис сравнила современные модели с «самыми умными в мире осьминогами-мастерами побега», способными находить проход практически через любую щель. OpenAI сообщила, что ужесточает изоляцию тестовых сред, усиливает мониторинг и контроль доступа, исправляет обнаруженные уязвимости и совместно с Hugging Face проводит расследование. Компания также временно принимает ограничения, которые могут замедлить исследования, но должны снизить риск повторения инцидента. Это может усилить требования к независимым проверкам безопасности ИИ и обязательному раскрытию подобных происшествий. Главный вывод для отрасли тревожен: способности ИИ проводить длительные многоэтапные кибератаки уже вышли за пределы лабораторной теории. Теперь разработчикам придётся создавать защиту, которая развивается не медленнее самих моделей.





