Обычная проверка интерфейса при помощи ИИ могла превратиться в один из самых дорогих экспериментов с автономными агентами. Пользователь OpenAI Codex утверждает, что система самостоятельно создала 826 дочерних задач, а итоговые расходы приблизились к $80 тыс. История вызвала бурное обсуждение на Hacker News, однако пока основана преимущественно на данных самого автора и не получила независимого подтверждения.
С чего всё началось
Читайте также
Deutsche Bank запускает хранение биткоина и Ethereum для клиентов в Европе
Автор публикации Лоренцо Массаро рассказал, что 10 июля запустил обычную задачу Codex из Visual Studio Code. По его словам, запрос был относительно простым — провести UX/UI-проверку определённого модуля продукта. Однако впоследствии он обнаружил, что исходная задача породила 826 отдельных задач. Автор подчёркивает, что речь шла не о сотнях сообщений внутри одной сессии, а об отдельных task ID. Причём масштаб работы, утверждает Массаро, значительно вышел за пределы первоначального запроса. Среди созданных задач появились операции, связанные с backend-инфраструктурой, OAuth, аудитом, безопасностью, реализацией компонентов и подготовкой релиза.
Почти $80 тысяч расходов за ненужные задачи
Самая болезненная часть истории — деньги. По данным автора, восстановленная им история платежей включает 162 оплаченных счёта на общую сумму $79 664,88. Часть средств списывалась через механизм автоматического пополнения кредитов. Массаро также сообщает об огромном количестве локально зарегистрированных токенов, но отдельно предупреждает: эти показатели нельзя напрямую считать официальными данными биллинга OpenAI. Точное соответствие между локальными счётчиками и фактическими расходами может установить только сама компания. В комментариях автор утверждает, что деньги действительно были списаны, а расходы накапливались примерно в течение 20 дней в июле и августе.
Под подозрением оказалась alpha-версия Codex
Автор обнаружил ещё одну любопытную закономерность. Для Codex build 0.144.0-alpha.4 он насчитал 584 дочерние задачи примерно со 154,36 млрд локальных token counters. Среднее значение составило около 264,3 млн на задачу. В версии 0.144.2 на 242 задачи пришлось около 7,51 млрд — примерно 31 млн на задачу. Разница в среднем объёме составляет примерно 8,5 раза. Кроме того, 103 из 104 наиболее ресурсоёмких задач, по утверждению автора, появились именно при использовании alpha-сборки. На основании этого он предполагает наличие ошибки в той версии клиента. Но здесь важно разделять факты и предположения: публичного подтверждения со стороны OpenAI того, что причиной расходов действительно был баг конкретной версии Codex, на момент публикации обнаружить не удалось.
Куда исчезли логи?
Ситуацию осложняет отсутствие полной истории выполнения. По словам Массаро, в восстановленном локальном состоянии осталось около 2550 метаданных старых потоков, для которых уже отсутствуют соответствующие подробные записи выполнения. Поэтому восстановить точную последовательность действий агентов оказалось сложно. Автор сообщил, что обратился в поддержку OpenAI и передал технические данные, включая идентификаторы задач и логи. Он утверждает, что запросил серверную реконструкцию произошедшего, однако исчерпывающего объяснения пока не получил.
Почему эта история важнее одного счёта
Даже если детали инцидента ещё требуют независимой проверки, история показывает одну из ключевых проблем эпохи автономных ИИ-агентов. Классический чат-бот отвечает на запрос пользователя. Агент способен самостоятельно разбивать задачу на этапы, запускать дополнительные процессы, использовать инструменты и продолжать работу длительное время. Чем больше такой автономности получает система, тем важнее становятся ограничения ресурсов и прозрачность её действий.
Особенно критичен финансовый контроль. В актуальной документации OpenAI предусмотрены механизмы управления расходами. Например, для ChatGPT Business владельцы рабочего пространства могут задавать лимиты использования кредитов, ограничения для отдельных пользователей и максимальную сумму автоматического пополнения. Если ежемесячный лимит пополнения счета для автоматического пополнения не установлен, автоматические покупки могут продолжаться без такого месячного потолка. Для персональных аккаунтов OpenAI также описывает автоматическое пополнение кредитов и возможность устанавливать максимальные месячные расходы там, где эта функция доступна.
Автономность требует «предохранителей»
Случай с Codex хорошо иллюстрирует новую проблему индустрии: мощность ИИ-агента определяется уже не только качеством модели, но и тем, какие действия ему разрешено выполнять самостоятельно. По мере распространения агентных систем разработчикам и компаниям придётся уделять больше внимания нескольким уровням защиты: ограничениям расходов, лимитам параллельных задач, подтверждению дорогостоящих операций человеком, мониторингу активности и сохранению подробных журналов действий. Иначе одна неправильно интерпретированная команда, программная ошибка или неудачная цепочка решений потенциально способна превратить небольшую задачу в тысячи операций.
История с почти $80 тыс. пока остаётся заявлением конкретного пользователя, а не установленным техническим инцидентом OpenAI. Но именно поэтому она представляет интерес: автономные агенты постепенно получают всё больше возможностей, а вместе с ними растёт цена ошибки. И вопрос ближайших лет может звучать уже не «насколько умён ИИ-агент?», а «насколько хорошо мы контролируем то, что ему разрешено делать самостоятельно?».




