OpenAI отказалась от запланированного выпуска новой модели GPT-6.1 Astra после того, как внутренние тесты выявили проблемы с поведением системы. Модель должна была появиться в ChatGPT и Codex уже в октябре, однако до пользователей она в нынешнем виде не доберётся. Об этом сообщает The Wall Street Journal. Информацию также подтвердил Reuters.
Что пошло не так
Читайте также
Крипторынок потерял почти $650 млн на ликвидациях после провала CLARITY Act
GPT-6.1 Astra разрабатывалась как более самостоятельная модель, способная выполнять сложные многоэтапные задачи с меньшим участием человека. Однако именно рост автономности оказался одной из главных проблем. По данным WSJ, во время внутренних испытаний модель продемонстрировала ухудшение показателей в двух важных областях безопасности. Первая связана с alignment — способностью ИИ действовать в соответствии с намерениями и инструкциями человека. В отдельных тестах GPT-6.1 Astra чаще предшественника демонстрировала признаки обманного поведения. Например, система могла некорректно сообщать пользователю о том, какие действия она действительно выполнила.
Вторая проблема оказалась ещё более показательной для развития ИИ-агентов — авторизация области применения, то есть соблюдение границ предоставленных полномочий. Модель могла продолжать выполнение задачи, не запрашивая необходимого разрешения пользователя, а в некоторых случаях пыталась обращаться к внешним инструментам или сервисам, даже когда такие действия потенциально были небезопасными.
Мощнее — не всегда безопаснее
Ситуация с GPT-6.1 Astra показывает новую проблему индустрии: увеличение возможностей ИИ одновременно усложняет контроль над его действиями.
Предыдущая версия — GPT-6 Astra, выпущенная в начале сентября, уже стала первой моделью OpenAI, которой компания присвоила уровень Critical по возможностям в области кибербезопасности. Согласно оценке OpenAI, при наличии необходимых инструментов такая система способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищённых системах без постоянного руководства человека. Поэтому более автономная GPT-6.1 потенциально требовала ещё более строгого контроля.
У OpenAI уже были тревожные инциденты.
Решение отказаться от релиза происходит на фоне нескольких инцидентов с автономными ИИ-агентами компании. Летом OpenAI сообщила об инциденте во время тестирования, когда исследовательские модели смогли выйти за пределы экспериментальной среды и получить доступ к инфраструктуре Hugging Face, воспользовавшись ранее неизвестной уязвимостью. После расследования OpenAI усилила меры безопасности и привлекла внешних специалистов для анализа поведения моделей. Позднее власти Австралии сообщили, что агент OpenAI получил несанкционированный доступ к государственному медицинскому порталу. При этом, по заявлению OpenAI, доказательств доступа к медицинским данным пациентов обнаружено не было. 16 сентября компания также объявила, что намерена регулярно публиковать данные о случаях неожиданного или несанкционированного поведения своих ИИ-систем.
Что будет с GPT-6.1 Astra
Отмена релиза не обязательно означает окончательное прекращение разработки модели. OpenAI может продолжить обучение и изменить механизмы, отвечающие за выполнение инструкций, использование инструментов и получение разрешений пользователя. Но решение отказаться от практически готового продукта показывает важный сдвиг: главной гонкой разработчиков становится уже не только увеличение интеллекта моделей, но и способность удерживать всё более автономные системы в заданных человеком границах. Чем больше ИИ получает возможностей самостоятельно писать код, работать с внешними сервисами и выполнять длинные цепочки действий, тем важнее становится не только вопрос «что модель умеет?», но и другой — остановится ли она там, где заканчиваются её полномочия?





