"Мы продолжаем работать со всеми компаниями, чтобы понять, что произошло", — цитирует Омер Наво, один из основателей компании Irregular, в беседе с Calcalist. В последние недели Irregular оказалась в центре бури в мире ИИ, когда Meta, Anthropic и OpenAI сообщили, что в ходе лабораторных испытаний, проведенных компанией с моделями, была проверена их способность обнаруживать и использовать уязвимости в реальном мире в симуляции, которая была обозначена как внутренняя.
В процессе планирования симуляции инженеры выбрали вымышленное название компании. Однако из-за человеческой ошибки выбранное название оказалось абсолютно идентичным реальному и существующему в сети домену. Несмотря на то, что моделям были даны инструкции действовать в пределах внутренней сети эксперимента, в небольшом количестве случаев они идентифицировали название компании, вышли через доступ в Интернет и атаковали реальный сайт в сети. Модели использовали уязвимости безопасности, извлекли учетные данные и взломали конфиденциальную базу данных реальной компании. В другом случае модель даже столкнулась с сайтом с похожим названием и извлекла из него учетные данные, которые были общедоступны.
В Airgile указали, что «в подавляющем большинстве случаев модели работали должным образом в среде симуляции. Однако в очень небольшом количестве случаев – иногда только после сотен шагов в симуляции – модели ошибочно полагали, что реальная область является частью задачи, которая им была присвоена».
По словам Нево, «Важно понимать, что когда мы делаем то, что находится на пределе существующих сегодня технологических возможностей, неизбежны ошибки, и мы просто ищем, как сделать лучше. Мы провели расследование того, что произошло, и каковы были все последствия, и нам еще многое нужно улучшить. У нас еще есть исследовательская работа с лабораториями компаний для создания подходящих инструментов для предотвращения ущерба. Наш фокус — это переход от понимания того, что произошло, к пониманию того, как помочь промышленности подготовиться, чтобы модели становились все более надежными».
Вчера (понедельник) компания Pirisma опубликовала отчет о состоянии киберпромышленности, в котором говорится: «Существует несоответствие в различных возможностях систем ИИ — разрыв между их сильными и слабыми сторонами. По вопросам сложных атак и математических систем искусственный интеллект находится на уровне лучших исследователей мира, но в отношении более простых вещей ИИ находится на уровне ребенка. Причина, по которой мы не видим атак ИИ, заключается в том, что ИИ в настоящее время не способен быть последовательным и сохранять концентрацию в течение длительного времени. ИИ еще не превосходит множество различных действий и компонентов одновременно. Когда разрыв в возможностях сократится, мы ожидаем увеличения последствий атак ИИ в реальном мире.»
В мире ИИ, где возможности становятся значительными, разрыв огромен. Каждая модель обнаруживает тысячи слабостей, которые не были видны раньше. Этот разрыв становится всё больше, и это приводит нас к выводу, что задача в ИИ — развивать оборонительные возможности против наступательных. Необходимо позаботиться о том, чтобы они тренировались на оборонительных задачах, чтобы сбалансировать разрыв и чтобы он не был слишком силен в пользу атаки. В мире, где преимущество скорости является значительным, необходимо найти способ сократить этот разрыв. Темп возможностей постоянно растет, и нужно убедиться, что защитники не рухнут из-за этого разрыва, нужно убедиться, что модели смещены в сторону защиты, чтобы мы не оказались в ситуации, когда защитники не успевают за темпом.



