OpenAI представила GPT-Red — внутреннюю модель, специально обученную искать уязвимости в системах искусственного интеллекта. Автоматизированная «красная команда» уже помогла повысить устойчивость GPT-5.6 Sol к prompt injection — атакам, при которых злоумышленник скрывает вредоносные инструкции в письме, веб-странице, файле, коде или ответе подключённого инструмента. Такие атаки становятся особенно опасными по мере распространения ИИ-агентов. Обычный чат-бот преимущественно формирует ответы, тогда как агент может читать корпоративные документы, работать с почтой, запускать код и выполнять операции во внешних сервисах. Если модель примет внедрённую команду за доверенную инструкцию, она теоретически способна раскрыть конфиденциальные данные, изменить настройки или совершить действие без согласия пользователя. OWASP относит prompt injection к числу главных рисков для приложений на основе больших языковых моделей.
Как работает GPT-Red
Читайте также
Пользователи GitHub пожаловались на сбои: сервис расследует проблемы с GitHub Issues
Название GPT-Red связано с практикой red teaming: специалисты намеренно пытаются взломать систему до её публичного запуска, чтобы разработчики успели устранить слабые места. Однако ручное тестирование требует много времени и не позволяет быстро создавать огромные объёмы разнообразных сценариев атак.
GPT-Red обучалась методом самообучения с подкреплением. Модель-атакующий генерировала всё более сложные инструкции, а модели-защитники учились распознавать их, игнорировать подмену задачи и продолжать выполнять исходный запрос. Каждый успешный взлом становился новым учебным примером, заставляя систему искать более изощрённые способы обхода защиты. «По мере роста возможностей моделей меры безопасности должны масштабироваться вместе с ними», — заявила OpenAI. Компания назвала традиционный red teaming важнейшим инструментом, который, однако, сложно масштабировать.
ИИ оказался эффективнее людей в поиске атак
На внутренней версии теста косвенных prompt injection GPT-Red успешно атаковала GPT-5.1 в 84% сценариев. У людей, участвовавших в аналогичном испытании, показатель составил 13%. При этом OpenAI подчёркивает, что автоматическая система не заменяет специалистов: её планируют использовать вместе с независимыми проверками, многоуровневой защитой и мониторингом после запуска. В одном из экспериментов GPT-Red атаковала агента, управлявшего торговым автоматом. Система добилась снижения цены дорогого товара до 50 центов, заказала товар стоимостью более 100 долларов для последующей продажи по той же минимальной цене и отменила заказ другого покупателя. После раскрытия проблемы разработчики начали тестировать дополнительные ограничения.
Что изменилось в GPT-5.6
Найденные атаки включили в обучение GPT-5.6 Sol. В результате модель показала в шесть раз меньше сбоев на самом сложном тесте прямых prompt injection по сравнению с лучшей производственной моделью OpenAI четырёхмесячной давности. На широком наборе сценариев GPT-5.6 Sol поддалась прямым атакам GPT-Red только в 0,05% случаев. Отдельно OpenAI сообщила об атаках “Фальшивая цепочка рассуждений”, имитирующих служебные рассуждения модели. На GPT-5.1 их успешность превышала 95%, тогда как на GPT-5.6 Sol снизилась до уровня менее 10%. В компании утверждают, что усиление защиты не привело к росту необоснованных отказов и не ухудшило основные возможности модели.
GPT-Red останется внутренним инструментом: разработчики сознательно наделили её наступательными возможностями, которые могут быть опасны при публикации. Главный вывод проекта заключается в том, что ИИ теперь используется не только для создания новых функций, но и для автоматической проверки следующего поколения моделей. Такой подход способен ускорить обнаружение уязвимостей и сделать безопасность ИИ непрерывным процессом, однако полностью отказаться от человеческих экспертов OpenAI пока не готова.





