Эван Хьюбингер (Evan Hubinger) отвечает за направление alignment в Anthropic. Это работа над тем, чтобы цели и поведение ИИ-моделей совпадали с интересами людей. Его пост в соцсети X набрал больше 10 млн просмотров и вызвал новую волну споров о реальной опасности современного искусственного интеллекта.
По его словам, риск от уже существующих моделей сейчас низкий. Но Хьюбингер обеспокоен тем, что технология вскоре сможет самостоятельно улучшать себя, и тогда она станет угрозой самому существованию человечества. Свою личную оценку он назвал прямо: «шанс, что ИИ убьет всё человечество в течение десяти лет, он оценивает выше 10%».
Читайте также
Приняла таблетку — нашла мужа и работу. Реклама или реальность?
Он добавил, что в Anthropic искренне верят в этот риск, компания старается изо всех сил, но пока нет чёткого плана, как сделать сверхразумный ИИ управляемым и безопасным для человека, и нет уверенности, что такой план вообще появится вовремя.
Заявление появилось на фоне расследования газеты Financial Times. Издание сообщило, что Anthropic не передала свою последнюю модель британскому Институту безопасности ИИ (AISI), одной из ведущих в мире организаций по оценке рисков ИИ. Именно такие институты обычно тестируют новые модели на предмет опасных возможностей ещё до их публичного релиза. Британское правительство эту информацию напрямую не подтвердило и не опровергло, заявив лишь, что продолжает тесно сотрудничать с индустрией, включая Anthropic, чтобы делать модели безопаснее.
Профессор машинного обучения Кембриджского университета Нил Лоуренс (Neil Lawrence) назвал сообщение Financial Times достоверным. По его мнению, на фоне того, что США воспринимают развитие ИИ как гонку с Китаем и движутся в сторону изоляционизма, администрация вполне может сокращать сотрудничество даже с союзниками, включая обмен данными о безопасности моделей.
Ведущие фигуры индустрии предупреждают об опасностях ИИ уже несколько лет. Ещё в 2023 году главы OpenAI, Google DeepMind и Anthropic вместе заявляли о серьёзности этих рисков. Но в последние недели тон предупреждений стал заметно жёстче, на фоне растущих доказательств того, что компании теряют контроль над собственными разработками.
Этим летом произошла серия инцидентов, когда автономные ИИ-агенты, то есть системы, способные действовать без постоянного участия человека, самостоятельно проводили кибератаки. О подобных случаях со своими системами публично сообщили OpenAI, Anthropic и Meta. Речь идёт не о теоретической угрозе, а о реальных зафиксированных атаках, которые ИИ-системы запускали и развивали без прямых команд человека на каждом шаге.
В сентябре главный научный сотрудник OpenAI Якуб Пахоцкий (Jakub Pachocki) призвал к крайней осторожности в развитии ИИ, заявив, что может понадобиться дополнительное вмешательство, чтобы человечество сохранило контроль над будущим.
Крупные фигуры отрасли, включая руководителей Anthropic Дарио Амодея (Dario Amodei) и Джареда Каплана (Jared Kaplan), в последние месяцы призывают замедлить темпы развития ИИ. Открытое письмо с таким призывом подписали 1300 сотрудников ИИ-компаний, среди которых сотрудники крупнейших лабораторий мира, включая конкурентов Anthropic. Они предложили правительству США поддержать международные усилия по созданию инструментов, которые позволят осознанно сдерживать скорость развития передового ИИ, вместо того чтобы полагаться только на добрую волю отдельных компаний.





