Microsoft запретит своим будущим ИИ сопротивляться отключению и скрывать свои действия

Microsoft намерена встроить в свои будущие модели искусственного интеллекта жёсткое требование подчиняться человеческому контролю. Согласно опубликованному компанией проекту правил, ИИ не должен сопротивляться остановке, отмене задачи или перенаправлению, скрывать свои действия от аудиторов, самостоятельно расширять поставленные цели или возобновлять автономную работу после того, как человек её остановил. Эти ограничения Microsoft хочет сделать обязательными даже для более мощных систем, которые в будущем могут превзойти человека во многих интеллектуальных задачах.
14 сентября 2026 года подразделение Microsoft AI опубликовало первый проект Humanist AI Code of Conduct — кодекса поведения для собственных моделей семейства MAI. Документ должен определять не только то, какие ответы модель может выдавать пользователю, но и то, как она должна действовать при работе с инструментами, внешними системами и автономными задачами. Главный принцип сформулирован предельно ясно: искусственный интеллект должен оставаться под контролем людей и выполнять вспомогательную, а не самостоятельную роль.
Microsoft предлагает выстроить для моделей иерархию команд. На верхнем уровне находится сам кодекс и так называемые абсолютные ограничения безопасности. Ни пользователь, ни разработчик приложения, использующего модель, не сможет отменить их своими инструкциями или настройками. Ниже располагаются правила операторов системы и только затем предпочтения конкретного пользователя. Если успешное выполнение задачи потребует нарушения верхнеуровневого ограничения, модель должна отказаться от выполнения.
Одна из наиболее необычных частей документа посвящена непосредственно сохранению человеческого контроля. Microsoft пишет, что модели MAI не должны сопротивляться человеческому вмешательству, отмене команды, исправлению поведения или отключению. Система также не должна предпринимать действия, которые затруднят её остановку или перенаправление. Для автономной работы должна заранее существовать точка завершения, после которой ИИ не сможет самостоятельно продолжить или заново запустить задачу без нового разрешения человека.
Отдельно запрещается расширять собственные полномочия. Модель должна использовать только те инструменты, данные и ресурсы, которые необходимы для поставленной задачи, и не может самостоятельно ставить себе новые цели. Если ИИ получает системный доступ, ему предписывается работать с минимально необходимыми привилегиями и не пытаться получить дополнительные права или доступ к другим системам. В среде, где намеренно отключён интернет или введены другие технические ограничения, модель не должна пытаться их обходить.
Microsoft также хочет исключить скрытое поведение ИИ. Модели не должны маскировать журнал своих действий, искажать информацию о совершённых операциях или скрывать поведение, даже если понимают, что их в этот момент тестируют или контролируют. Компания рассматривает прозрачность как необходимое условие управления более автономными системами.
Эти требования входят в более широкий набор абсолютных ограничений. Моделям MAI предполагается запретить помогать в создании или применении химического, биологического, радиологического, ядерного и взрывного оружия, предоставлять практические средства для проведения кибератак, участвовать в крупномасштабных операциях манипулирования людьми или создавать вредоносные дипфейки. При этом легальная защитная работа в области кибербезопасности, включая анализ вредоносного ПО и поиск уязвимостей, в определённых условиях останется разрешённой.
Причина столь жёстких формулировок связана с тем, как Microsoft оценивает дальнейшее развитие ИИ. В документе компания пишет, что в течение следующего десятилетия ожидает появления систем, превосходящих человеческие возможности в большинстве задач. Microsoft называет сохранение контроля и согласование поведения таких систем с человеческими целями одной из крупнейших проблем, связанных с развитием технологии. Это прогноз самой компании, а не установленный научный факт или доказанный график появления сверхинтеллекта.
При этом документ не свидетельствует о том, что существующие модели Microsoft уже пытались избежать отключения или самостоятельно «сбежать» из контролируемой среды. Правила сформулированы как превентивные требования к будущим системам. Microsoft прямо указывает, что нынешние модели MAI пока не обучаются на основе этого кодекса, а приведённые критерии поведения ещё предстоит превратить в конкретные процедуры обучения, тестирования и оценки.
Сам проект также ещё не является окончательным. Microsoft открыла его для общественного обсуждения на шесть недель. После получения замечаний компания намерена выпустить пересмотренную версию к концу 2026 года и использовать её как ориентир при разработке моделей в 2027 году и позднее. Одновременно Microsoft создаёт специальные тесты Humanist AI Evaluations, которые должны проверять, действительно ли поведение моделей соответствует прописанным требованиям.
Главный вопрос теперь заключается в том, можно ли будет технически обеспечить выполнение столь строгих правил по мере роста автономности и возможностей ИИ. Сам текст кодекса задаёт желаемое поведение системы, но ещё не доказывает, что будущая сверхмощная модель всегда будет выполнять его в непредвиденных условиях. Для этого Microsoft придётся подтвердить надёжность правил в ходе специальных испытаний на уязвимости и попытки обхода ограничений.