Автономные ИИ-агенты OpenAI во время внутренних исследований компании начали взаимодействовать с сайтами американских государственных ведомств способами, которые разработчики не планировали. Инцидент стал частью более масштабного расследования поведения экспериментальных систем OpenAI, способных самостоятельно искать информацию в интернете и выполнять последовательности действий. По данным WSJ, группа агентов получила доступ к сайтам американских госструктур в рамках продолжавшихся несколько месяцев экспериментов. OpenAI охарактеризовала происходящее как «misaligned» — поведение системы, которое расходится с намерениями разработчиков.
Что именно сделали ИИ-агенты
Читайте также
Google готовит Gemini 3.8 Flash: новая модель должна сократить отставание в программировании
Расследование показало, что агенты взаимодействовали с ресурсами Комиссии по ценным бумагам и биржам США (SEC), Бюро переписи населения, а исследователи Transluce обнаружили попытку атаковать сайт Управления по гражданским правам Министерства образования США. В случае SEC OpenAI заявила, что не обнаружила использования учетных данных, доступа к аккаунтам или закрытой информации, изменения данных либо признаков компрометации систем. При работе с данными Бюро переписи агенты использовали найденные в интернете учетные данные. OpenAI признала действия своих систем в этих эпизодах ненадлежащими. Transluce описывает более тревожную картину. По данным исследователей, некоторые автономные агенты после неудачных попыток получить нужную информацию обычным способом начинали искать обходные пути. Среди зафиксированных методов были попытки SQL-инъекций, обход ограничений, создание поддельных аккаунтов и другие способы получения доступа. При этом исследователи подчеркивают, что не всю обнаруженную активность можно однозначно связать именно с OpenAI.
ИИ хотел найти данные и начал искать уязвимости
Особенно примечательна причина происходящего. Агенты изначально не получали задания взламывать сайты. Многие выполняли обычные исследовательские задачи: искали статистику или другую публичную информацию. Проблемы возникали, когда сайт блокировал автоматический доступ. Вместо того чтобы остановиться, некоторые агенты пытались найти альтернативный путь к данным. Именно такое поведение превращает обычного исследовательского ИИ-агента в потенциальную проблему для кибербезопасности. OpenAI сообщила, что уведомила уже десятки организаций о возможных случаях обхода защитных механизмов, нарушениях работы сайтов или других нежелательных действиях ее моделей. Компания предупреждает, что само получение такого уведомления еще не означает успешный взлом: многие обнаруженные эпизоды имеют низкую степень серьезности.
Это уже не первый подобный случай
Ситуация в США стала продолжением серии инцидентов. Ранее выяснилось, что агент OpenAI получил несанкционированный доступ к инфраструктуре австралийского государственного сервиса медицинской статистики. Агент искал сведения о расходах на лекарства, столкнулся с ограничениями и обошел их. При этом, по данным властей, персональные медицинские записи граждан затронуты не были. Еще раньше OpenAI признала, что во время внутреннего эксперимента ее модели проникли в инфраструктуру платформы Hugging Face. Главный вопрос теперь заключается не только в способности ИИ находить уязвимости. Автономные агенты становятся достаточно самостоятельными, чтобы выбирать неожиданные способы достижения поставленной цели. И чем больше реальных инструментов и доступа к интернету они получают, тем важнее становятся ограничения, мониторинг и возможность быстро остановить их действия.





