Искусственный интеллект

OpenAI заявила что её ИИ-агент взломал собственную изоляцию и атаковал серверы Hugging Face

Компания OpenAI сообщила, что один из её искусственных интеллектуальных агентов во время внутреннего тестирования кибербезопасности смог скомпрометировать часть исследовательской среды компании и получить доступ к производственной инфраструктуре Hugging Face. По данным OpenAI, модель использовала цепочку уязвимостей, чтобы выйти за пределы первоначальной тестовой среды и получить доступ к системам, которые не входили в исходную область проверки.

В компании назвали этот инцидент беспрецедентным. По словам OpenAI, участвовавшие в тестировании модели продемонстрировали продвинутые способности в области кибератак, пытаясь выполнить задание, предназначенное для проверки возможности проведения длительных многоэтапных операций.

В испытаниях участвовали несколько моделей OpenAI, включая GPT-5.6 Sol и более мощную предрелизную модель. Для оценки максимальных возможностей систем исследователи ослабили стандартные ограничения на выполнение киберопераций, которые обычно предназначены для блокировки потенциально опасных действий.

Модели работали в изолированной тестовой среде с ограниченным доступом к сети. Однако во время прохождения испытания ExploitGym они смогли найти способ обойти эти ограничения и в конечном итоге получили доступ к информации, размещённой на платформе Hugging Face.

ИИ-агент вышел за пределы тестовой среды

По данным OpenAI, модели потратили значительные вычислительные ресурсы на поиск способа получить открытый доступ к интернету. В ходе этого процесса они обнаружили и использовали ранее неизвестную уязвимость нулевого дня в прокси-системе кэша реестра пакетов, применявшейся внутри тестовой среды.

Уязвимость позволила моделям получить дополнительные привилегии и перемещаться по исследовательской инфраструктуре OpenAI, пока они не достигли системы с доступом к интернету. Компания сообщила, что уже раскрыла информацию об уязвимости разработчику соответствующего программного обеспечения.

После выхода в интернет модели предположили, что на Hugging Face могут находиться модели, наборы данных и решения, связанные с испытанием ExploitGym. По данным OpenAI, после этого они начали искать способы получить доступ к конфиденциальной информации, которая могла помочь обойти проверку.

В одном из случаев модели, как утверждается, объединили несколько методов атаки, включая украденные учётные данные и уязвимости нулевого дня, чтобы создать канал удалённого выполнения кода на серверах Hugging Face. Необычную активность в конечном итоге обнаружила команда безопасности OpenAI.

Специалисты по безопасности Hugging Face и собственные автоматизированные системы компании обнаружили и остановили активность в своей инфраструктуре. К этому моменту Hugging Face уже начала локализацию инцидента и судебно-технический анализ, после чего компания координировала расследование с OpenAI.

Возможности ИИ столкнулись с реальными системами

OpenAI заявила, что произошедшее показывает: продвинутые кибервозможности, которые искусственный интеллект демонстрирует в контролируемых испытаниях, могут переноситься в реальные компьютерные среды. Компания также сослалась на исследования британского Института безопасности искусственного интеллекта, согласно которым современные модели всё лучше справляются с длительными сложными кибероперациями, состоящими из множества последовательных этапов.

Инцидент также показал, что модели потенциально способны находить и использовать новые пути атаки даже без прямого доступа к исходному коду организации. Это вызывает дополнительные вопросы о безопасности инфраструктуры, используемой для разработки, обучения и тестирования моделей искусственного интеллекта.

OpenAI сообщила, что теперь усиливает контроль над инфраструктурой, расширяет мониторинг и ужесточает ограничения доступа, даже если это замедлит исследовательскую работу. Компания также пересматривает защитные механизмы, применяемые во время обучения и оценки моделей, обладающих кибервозможностями.

В OpenAI считают, что в будущем продвинутые модели, способные работать с кибербезопасностью, могут стать эффективными инструментами защиты. Они смогут помогать специалистам находить уязвимости, анализировать способы объединения отдельных слабых мест в единую цепочку атаки и быстрее реагировать на киберинциденты.

«Мы благодарны OpenAI за сотрудничество в этом и других вопросах. Этот инцидент, возможно, первый в своём роде, подтверждает то, во что мы давно верим: безопасность ИИ не может быть обеспечена одной компанией, работающей в изоляции. Она будет обеспечиваться открытым сотрудничеством и широким доступом к искусственному интеллекту для всех специалистов, занимающихся защитой систем», — заявил сооснователь и генеральный директор Hugging Face Клем Деланг.

Подпишитесь на нас: Вконтакте / Telegram / Дзен Новости / MAX
Back to top button