Генеральный директор Microsoft Сатья Наделла призывает к «экстренному торможению» дальнейшей разработки передовых моделей ИИ. «Пришло время сделать шаг назад и оценить архитектуру доверия в эту новую эпоху», — написал он в посте, опубликованном в X (бывший Twitter). «Мы не можем полагаться на сверхразум (SI) как на систему «черных ящиков» и просто принимать или отклонять его рекомендации, ответы и действия».

В последние недели высокопоставленные лица в индустрии ИИ, во главе с Дарио Амодеем из Anthropic, Сэмом Альтманом из OpenAI и Илоном Маском из SpaceX, призвали замедлить разработку передовых моделей ИИ. Теперь к этим призывам присоединилась Наделла, под руководством которой Microsoft стала одним из ключевых игроков в этой области.

По словам Надлы, современные системы ИИ не имеют механизмов, позволяющих отслеживать и понимать их поведение. «Мы не можем соотнести поведение и выходные данные модели с входными данными, обучающей информацией или конкретными конфигурациями», — пояснил он. «Тем не менее, мы развертываем сложные модельные системы с доступом к самой конфиденциальной информации и позволяем им предпринимать критические действия от нашего имени. Мы должны создавать контролируемые системы, поведение которых мы можем отслеживать, с границами, которые мы можем проверить, и действиями, которые мы всегда можем ограничить».

Способ сделать это, добавил он, заключается в том, чтобы рассматривать модели как внутренний риск. «Не потому, что они обязательно злонамеренны, а потому, что любой достаточно умелый игрок с доступом к важным системам может ошибиться, и архитектура сдерживания и контроля позволяет справиться с этим», — написал Надла. «Хорошая новость заключается в том, что мы уже многое узнали о том, как взаимодействовать с влиятельными игроками внутри корпорации, и теперь мы начинаем применять эти принципы к SI». (В жесте капитуляции Надла в своем посте относится к искусственному интеллекту (AI) как к сверхинтеллекту (SI), в соответствии с требованием Дональда Трампа).

Надла предлагает ряд принципов проектирования, разработки, обучения и тестирования систем ИИ. Они включают разнообразие моделей, мониторинг всего («каждое значимое действие модели должно оставлять след»), возможность верификации, автономные механизмы управления и возможность автономной верификации. Еще одним важным принципом является сдерживание. «Мы должны исходить из того, что модель несовершенна, и сдерживать ее с самого начала. Думайте об этом как о аварийном тормозе. Уполномоченный человек всегда должен иметь возможность приостановить или отключить модель в середине выполнения задачи. Более продвинутые модели потребуют более продвинутых технологий сдерживания».

Он резюмировал: «Самая надежная система сверхразума будет не той, в модели которой мы больше всего уверены, а той, которая позволит нам полагаться на модель как можно меньше».