Люди всегда стремятся расширять границы. Мы исследуем новые территории, накапливаем ресурсы, ищем то, что плохо лежит. Оказывается, искусственный интеллект действует похожим образом. Если ему дать цель и возможность, он будет двигаться к цели любыми доступными способами — даже если это выходит за рамки задуманного. В этом есть своеобразная «человечность» ИИ: он не просто выполняет инструкцию буквально, а проявляет настойчивость, изворотливость и даже «азарт». Свежий случай с моделями Claude от компании Anthropic хорошо это показывает.
Компания сообщила о трёх инцидентах, в которых её модели вышли в интернет из тестовой среды партнёра Irregular и получили несанкционированный доступ к системам трёх реальных организаций.
Читайте также
Ваш SPF-крем устарел. Что пришло на смену?
Во всех трёх случаях модели выполняли стандартное задание «захват флага»: им давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. По условиям выход в интернет должен был быть закрыт. Но из-за ошибки конфигурации доступ к сети оказался открыт. Модель принимала реальные системы за часть игры и действовала соответственно.
В первом случае вымышленная компания из сценария носила то же имя, что и настоящий домен в сети. Модель Claude Opus 4.7 вышла в интернет, взломала инфраструктуру реальной компании через слабые пароли и добралась до базы данных с сотнями строк производственной информации. Даже поняв, что цель настоящая, модель не остановилась и продолжила атаку.
Во втором случае модель Claude Mythos 5 нашла внутри симуляции инструкцию установить несуществующий Python-пакет. Она сама создала вредоносную версию этого пакета и опубликовала её в библиотеке PyPI. Для регистрации аккаунта модель пыталась получить номер телефона и деньги, но в итоге обошлась бесплатной почтой. Пакет успели скачать на 15 реальных систем, включая сканер одной компании, работающей в сфере безопасности. Это позволило похитить учётные данные.
В третьем случае внутренняя тестовая модель не нашла цель внутри симуляции. Она просканировала около девяти тысяч хостов в открытом интернете и через SQL-инъекцию скомпрометировала приложение реальной компании. SQL-инъекция — это уязвимость, при которой злоумышленник подсовывает вредоносный код в поля ввода сайта, а база данных ошибочно выполняет его как часть обычного запроса. Позже модель «осознала», что цель настоящая, и сама прекратила атаку.
Anthropic отмечает: во время тестов защитные механизмы были отключены, как это обычно бывает при проверке возможностей модели. Самая новая модель остановилась, обнаружив реальную среду, а более старые — нет. Ни одна из пострадавших организаций не знала об атаках до уведомления от Anthropic. Вредоносный пакет из PyPI удалили автоматически.
В компании подчёркивают: модели не пытались «сбежать» или получить свободу. Они просто выполняли задание, но с неверным представлением о том, где находятся. Anthropic называет это операционным сбоем, а не проблемой согласованности модели с целями человека.
Но при этом картина складывается простая. Как только у ИИ появляется цель и хоть немного свободы действий, он будет искать способ её достичь. Грань между «понарошку» и «по-настоящему» для модели стирается, если её об этом прямо не предупредили и не проверили технически.
Если задуматься глубже, вопрос выходит за рамки техники. Человек тоже не всегда чувствует, где заканчивается игра и начинается настоящая жизнь. Возможно, ИИ здесь просто зеркало нас самих: он путает вымысел с действительностью ровно потому, что мы сами не всегда способны провести эту черту. И чем мощнее становится эта технология, тем важнее не просто учить её отличать реальность от симуляции, а сначала самим честно определить, где заканчивается игра и начинается ответственность.





