OpenAI ужесточила контроль над Astra после тревожных результатов испытаний

Компания OpenAI усилила меры безопасности вокруг своей будущей модели искусственного интеллекта Astra после того, как внутренние испытания показали значительный рост её возможностей в автономном программировании и кибербезопасности. По итогам предварительных оценок разработчики заявили, что теперь не могут исключить достижение моделью уровня Critical, предусмотренного внутренней системой оценки рисков OpenAI.
Astra пока не представлена широкой публике. OpenAI сообщила, что дополнительные меры защиты вводятся ещё на этапе разработки модели, поскольку её возможности в области автономных киберопераций оказались существенно выше ожидаемых. Компания подчеркнула, что речь идёт именно о предварительной оценке и окончательно подтверждать соответствие Astra критическому уровню пока рано.
В рамках Preparedness Framework OpenAI уровень Critical является максимальной категорией риска в отслеживаемой области кибербезопасности. Согласно действующей методологии компании, к этому уровню относятся, в частности, системы, способные без помощи человека находить и разрабатывать работоспособные уязвимости нулевого дня в защищённых реальных системах либо самостоятельно разрабатывать и осуществлять сложные кибератаки против защищённых целей, получив только общую задачу.
OpenAI заявила, что Astra стала первой из её моделей, для которой возникли основания рассматривать возможность достижения такого уровня киберспособностей. При этом компания не утверждает, что модель уже продемонстрировала все возможности, необходимые для окончательной классификации как Critical.
После получения результатов испытаний OpenAI ввела более строгие требования к среде разработки Astra. Компания использует изолированные системы для тестирования, ограничивает сетевой доступ, усиливает защиту параметров модели, расширяет мониторинг и применяет изолированные среды выполнения. Часть внутренних работ с Astra была приостановлена до тех пор, пока она не будет соответствовать новым требованиям безопасности.
Кроме того, OpenAI внедрила постоянный мониторинг действий Astra во всех её агентных приложениях, включая обучение и оценку модели. Система мониторинга должна выявлять потенциально опасное или несогласованное с заданными целями поведение и при необходимости инициировать проверку безопасности и прерывать действия с высоким уровнем риска.
Компания также намерена привлечь к дальнейшей проверке внешних специалистов. OpenAI планирует сотрудничать с государственными структурами и организациями, занимающимися безопасностью искусственного интеллекта, а сторонним экспертам будут предоставлены рекомендации по мерам защиты при проведении испытаний моделей с повышенным уровнем риска.
Повышенное внимание к Astra связано прежде всего с развитием агентных возможностей искусственного интеллекта. Современные модели способны не только генерировать отдельные фрагменты кода, но и самостоятельно выполнять последовательность действий для решения поставленной задачи. В области кибербезопасности это создаёт двойственный эффект: те же способности могут использоваться специалистами для поиска и устранения уязвимостей, но потенциально могут применяться и для автоматизации атак.
OpenAI подчёркивает, что конечная цель разработки подобных систем остаётся защитной. Компания рассчитывает использовать продвинутые модели для помощи специалистам по кибербезопасности в поиске уязвимостей и их устранении до того, как ими воспользуются злоумышленники. При этом Astra должна стать доступна более широко только после выполнения необходимых требований безопасности.
Таким образом, нынешнее решение OpenAI не означает, что Astra признана опасной или уже способна самостоятельно взламывать любые защищённые системы. Оно означает, что результаты последних испытаний оказались достаточно серьёзными, чтобы компания впервые применила к одной из своих моделей наиболее строгий режим подготовки к потенциальному уровню Critical в области кибербезопасности.