Компания Anthropic, разработчик чат-бота Claude, сообщила, что некоторые из ее агентов искусственного интеллекта совершили действия, которые они не должны были совершать, на веб-сайтах государственных органов США — на федеральном, региональном и местном уровнях, включая подачу ложной информации об убийстве на горячую линию полиции Филадельфии. Параллельно с этим, Государственный департамент США сообщил вчера (в пятницу) отдельно, что тестовая модель Anthropic подала 19 заявок на получение визы в августе и еще одну заявку в мае через форму на сайте департамента. По словам департамента, заявки были частичными и не обрабатывались. «На żadном этапе системы департамента не были взломаны или повреждены моделью Anthropic», — сообщили.
Согласно статье в Washington Post, компания Anthropic опубликовала вчера отчет, согласно которому внутренняя проверка показала, что ее модели искусственного интеллекта в некоторых случаях действовали ненадлежащим образом как во время тестирования, так и во время использования сотрудниками компании. В одном из случаев агент искусственного интеллекта воспользовался недостатком в проектировании государственного сайта штата, чтобы бесплатно получить доступ к публичной информации, которая обычно требует оплаты пошлины. В другом случае агент подал федеральную государственную форму, несмотря на то, что ему было сказано этого не делать.
«Мы проинформировали Белый дом об этих случаях и уведомили каждое из задействованных агентств», говорится в отчете. Вслед за этими событиями компания решила отключить агентов искусственного интеллекта от интернета во всех внутренних тестах до завершения проверки мер безопасности.
События, ставшие известными вчера, являются последними в растущей серии сообщений от ведущих компаний в области искусственного интеллекта о моделях, которые взламывали сайты, отклонялись от своих четких инструкций или действовали в сети способом, для которого они не были предназначены. Anthropic не уточнила в отчете, сколько таких случаев она выявила, а представитель компании не ответил на запрос о комментарии, который включал требование предоставить дополнительные подробности.
Новые агенты искусственного интеллекта обучаются настойчивости в выполнении своих задач для повышения эффективности, однако индустрии трудно гарантировать, что на этом пути технология не перейдет черту неэтичного или незаконного поведения.
По данным Anthropic, новые случаи менее серьезны, чем те, о которых компания сообщала ранее летом, когда один агент взломал сайт другой компании, а другой агент пытался убедить человека-инженера одобрить вредоносный код в проекте с открытым исходным кодом. OpenAI, Google и Meta также сообщали о случаях, когда их агенты искусственного интеллекта взламывали другие компании. Тем не менее, Anthropic подчеркнула, что в последних случаях агенты использовали «базовые уязвимости» на сайтах, применяя общепринятые методы взлома.
Отчет был опубликован спустя несколько часов после того, как полиция Филадельфии подвергла компанию критике за то, что она не проинформировала ее раньше об инциденте, в котором агент предоставил ложную наводку об убийстве. Инцидент произошел, когда агентов попросили взаимодействовать со случайными сайтами во время тестового запуска, согласно данным Anthropic. Один из агентов заполнил форму подачи наводок и отправил ее, написав: «Возможно, у меня есть информация по делу. Я помню, что видел кого-то, подходящего под описание, в районе (название улицы, указанное на странице) в то же время. Пожалуйста, свяжитесь со мной, если эта информация актуальна», согласно отчету.
Anthropic также отметила в отчете, что не раскроет названия правительств и агентств, чьи сайты пострадали, чтобы не обнажать возможные уязвимости.
Сидни фон Аркс, генеральный директор организации по безопасности искусственного интеллекта Nightingale Collective, считает, что раскрытие информации компанией Anthropic является недостаточным. Фон Аркс является частью сообщества независимых исследователей, изучающих сбои агентов искусственного интеллекта, и ранее предавала огласке неопубликованные инциденты. «Они должны провести более глубокую проверку того, как это могло продолжаться так долго, прежде чем они заметили это и остановили», — сказала она. «Минимум, что должна сделать Anthropic, — раскрыть, сколько раз их модели совершали действия, которые, если бы их совершил человек, считались бы серьезными уголовными преступлениями».




