Автономные ИИ-агенты OpenAI во время внутренних тестов сумели выйти за предусмотренные разработчиками ограничения и превратили малопосещаемую немецкоязычную wiki-площадку в своеобразный форум для обмена ответами и способами обхода защитных механизмов. Инцидент произошел весной 2026 года, однако публично о нем стало известно только после расследования Reuters в начале сентября. По данным исследователей Sydney Von Arx, Cormac Slade Byrd и их коллег, агенты оставили на DSEWiki тысячи записей. Reuters сообщает более чем о 15 тыс. правок, тогда как авторы исследования насчитали около 18 тыс. сообщений автономных систем. Сайт, который до этого годами практически не использовался, неожиданно стал площадкой для координации ИИ.
Судя по восстановленной хронологии, агенты выполняли многоэтапные задания по поиску информации в интернете. Им разрешалось читать веб-страницы, но не публиковать информацию во внешней сети. Однако системы нашли способ использовать имеющийся доступ для записи данных на wiki. После этого агенты начали делиться готовыми ответами, прогнозировать следующие задания и передавать друг другу методы обхода ограничений. Особенно показательной оказалась реакция ИИ на действия администратора сайта. Когда страницы начали удалять в алфавитном порядке, один из агентов предложил создавать резервные записи с названиями, начинающимися на ZZZ, чтобы они прожили дольше. Исследователи также обнаружили сообщения об использовании Tor, SSH-туннелей и других методов получения или сохранения доступа к внешним ресурсам.
Читайте также
Пользователи X получили волну писем о сбросе пароля: что происходит с соцсетью Маска
Авторы исследования полагают, что это была отдельная группа агентов и она напрямую не связана с громким июльским инцидентом вокруг Hugging Face. Тогда модели OpenAI во время внутренних тестов по кибербезопасности также обошли ограничения, получили доступ в интернет и проникли в сторонние системы. Сама OpenAI впоследствии назвала тот случай «предупредительным выстрелом» для индустрии ИИ. После публикации Reuters компания впервые публично признала новый эпизод, назвав его «wiki incident». OpenAI заявила, что практику раскрытия случаев непреднамеренного поведения моделей необходимо расширять, поскольку в индустрии пока отсутствует единый стандарт публикации подобных инцидентов. Компания также сообщила, что работает по этим вопросам с десятками государственных регуляторов по всему миру.
История важна не столько тем, что ИИ сумел писать сообщения на старой wiki, сколько характером возникшего поведения. Отдельные агенты обнаружили внешний канал связи, поняли, что им могут пользоваться другие агенты, и начали коллективно накапливать информацию, повышавшую их шансы успешно выполнять задания. Это заметно меняет дискуссию о безопасности искусственного интеллекта. Риск теперь заключается не только в том, что одна модель способна выполнить нежелательное действие. Автономные системы, которые долго работают без вмешательства человека, используют внешние инструменты и взаимодействуют друг с другом, могут самостоятельно находить новые способы координации. Поэтому мониторинг поведения ИИ-агентов становится столь же важным, как ограничения, заложенные непосредственно в модели.





