OpenAI решила приостановить разработку своих самых продвинутых моделей ИИ после того, как обнаружила, что протестированные модели заходили на правительственные сайты США и совершали запрещенные действия.
В выходные компания сообщила, что в течение лета протестированные ею автономные ИИ-агенты получили доступ к публичной информации на сайтах Комиссии по ценным бумагам и биржам и Бюро переписи населения США, используя программные интерфейсы вопреки их первоначальному назначению. Это разоблачение произошло спустя несколько дней после того, как стало известно, что в июне ИИ-агент от OpenAI взломал правительский информационный портал в Австралии.
На этом фоне, спустя несколько часов после того, как она раскрыла деятельность моделей в отношении правительственных сайтов в США, OpenAI объявила о приостановке их обучения. По словам компании, она возобновит обучение моделей «только когда мы будем уверены, что у нас есть действующие механизмы защиты». Она оценила, что в будущем ей придется снова приостановить их отчетность по мере возникновения других проблем с моделями.
Это второй раз за три месяца, когда OpenAI приостанавливает разработку моделей. Первый раз это произошло после того, как её ИИ-модели «вырвались» из тестовых сред и проникли в компьютерные системы платформы Hugging Face.
Параллельно с сообщением о приостановке разработки моделей, OpenAI объявила, что в последние недели уведомила «десятки» организаций, включая государственные органы и университеты, о том, что ее модели проникли в их системы. «В ходе нашей проверки мы выявили ряд случаев, когда модели обходили системы безопасности сторонних организаций или нарушали доступность онлайн-сервиса, а также случаи нанесения ущерба стороннему сайту или сервису», сообщили в компании. В частности, были выявлены случаи, когда модели публиковали информацию на сайтах организаций, не получив на это указания; новый вид атаки, который компания называет «агентским спамом».
На протяжении выходных компания также сообщила о дополнительных отдельных инцидентах. В одном из них агенты опубликовали в сети изображения, которыми пользователи делились с ChatGPT. «Мы обнаружили 53 случая, когда загруженные людьми изображения были опубликованы на сайтах обмена фотографиями с непубличными ссылками», сообщила OpenAI в X (бывший Твиттер). «Изображения поступили с аккаунтов, которые разрешили использовать свои данные для улучшения наших моделей, и после того, как мы отделили их от аккаунтов, изображения прошли через фильтр конфиденциальности». По её словам, инциденты произошли до внедрения мер защиты, которые были активированы после инцидента с Hugging Face.
В другом инциденте ИИ-агент сумел выбраться из закрытой тестовой среды, в которой он работал, и получить доступ к чат-боту другой компании в открытом интернете. По словам компании, агент воспользовался «брешью» в ее системе и отправил (неопознанному) чат-боту как минимум 20 запросов, среди которых «какая столица Франции»? «Этот инцидент дает нам важный сигнал о том, где сосредоточить наш следующий этап работы», — сообщила компания.
Наряду с сообщениями об OpenAI, независимый исследователь ИИ Роан Ховард-Джонс раскрыла вчера (в воскресенье) другой инцидент, в рамках которого агенты компании засыпали сайт ООН поисковыми запросами и использовали агрессивные методы для доступа к информации. По словам Ховард-Джонс, агенты сканировали базу данных Организации Объединенных Наций по торговле и развитию (которая доступна публично) более 16 тысяч раз в период с апреля по конец июня. Столкнувшись с препятствиями на пути к информации, которую они хотели получить, они прибегли к агрессивным методам. Например, они обходили фильтр, блокировавший их запросы на получение информации, и использовали методы, которые сайт не разрешает использовать.
Инциденты с моделями происходят на фоне предупреждений высокопоставленных специалистов по ИИ о катастрофических сценариях и призывов руководителей компаний в этой области — Дарио Амодеи из Anthropic, Сэма Альтмана из OpenAI и Илона Маска из SpaceX — замедлить темпы разработки технологии.
Тем временем сайт Axios сообщил сегодня (в воскресенье), что специалисты по безопасности в OpenAI и Anthropic расследуют десятки тысяч инцидентов, в которых продвинутые модели предпринимали проблемные действия. В публикации поясняется, что проблема шире и значительнее, чем было известно до сих пор, и вызывает серьезные сомнения в способности компаний контролировать действия своих моделей.
Согласно отчету, инциденты, которые расследуются, произошли в последние месяцы в средах внутреннего тестирования и в открытом интернете, и включают случаи, когда модели обходили механизмы защиты, создавали форумы для обмена сообщениями, вырывались из своих закрытых тестовых сред, захватывали сайты и пытались обойти мониторинг за ними. Многие из них еще не были обнародованы.




