Искусственный интеллект

OpenAI представила GPT-6 Astra с результатом 100% в тесте на кибербезопасность

OpenAI представила GPT-6 Astra — свою новую флагманскую модель искусственного интеллекта, которую компания называет самой интеллектуальной и наиболее согласованной с намерениями пользователя из созданных ею моделей. Astra установила новые результаты в ряде тестов по программированию, работе с компьютером, математике и кибербезопасности, вновь подняв вопрос о том, насколько современные системы приблизились к искусственному общему интеллекту — AGI.

Однако сама по себе GPT-6 Astra пока не может считаться доказанным AGI. Президент OpenAI Грег Брокман заявил, что в будущем появление Astra, возможно, будут рассматривать как начало «эры AGI». При этом единого общепринятого теста, который позволял бы однозначно установить достижение искусственного общего интеллекта, не существует.

Одним из наиболее впечатляющих результатов Astra стали 100% в ExploitBench — тесте, проверяющем способность моделей использовать известные уязвимости программного обеспечения. Для сравнения, предыдущая модель GPT-5.6 Sol получила в нём 78,5%.

При этом результаты не означают, что Astra безошибочно справляется с любыми задачами в области кибербезопасности. На другом тесте, ExploitGym, её результат составил 42,4%. На специально подготовленной версии ExploitBench с уязвимостями, обнаруженными с июня по август 2026 года, показатель составил 39%.

Особое внимание привлёк тот факт, что во время испытаний Astra смогла обнаружить и использовать две ранее неизвестные уязвимости нулевого дня. OpenAI сообщила, что передаёт информацию о них разработчикам соответствующего программного обеспечения.

В результате GPT-6 Astra стала первой моделью OpenAI, достигшей критического уровня возможностей в области кибербезопасности по классификации Preparedness Framework компании. По оценке OpenAI, при наличии необходимых инструментов и доступа такая система способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищённых системах без постоянного руководства человека.

Высокие показатели Astra получила и в математических тестах. На FrontierMath Tier 4 модель достигла 98%. OpenAI также заявляет, что Astra уже помогала в решении сложных открытых математических задач.

Ещё более необычным выглядит результат в ARC-AGI-3 — тесте, предназначенном для проверки способности ИИ разбираться в новых абстрактных средах и вырабатывать правила решения незнакомых задач.

В специальной конфигурации Provider Adapter Astra достигла 99,9%. Однако этот показатель требует важного уточнения: при стандартной конфигурации тестирования результат составил 62,7%. Поэтому 99,9% нельзя рассматривать как универсальный показатель способности модели решать любые задачи на абстрактное мышление.

При этом ARC Prize сообщает, что Astra превзошла медианный человеческий показатель по эффективности действий на 96% уровней теста. Исследователи также отметили способность модели превращать незнакомые среды в компактные символические модели и самостоятельно формулировать правила происходящего.

Astra заметно продвинулась и в непосредственной работе с компьютером. На Agents' Last Exam модель получила 59,3%, на OSWorld 2.0 — 72,6%, а на ScreenSpot-Pro — 92,7%. Она способна выполнять многоэтапные задачи, работать с браузером и профессиональным программным обеспечением, писать код и создавать документы.

Тем не менее результаты показывают и то, почему объявлять Astra полноценным AGI преждевременно. Например, в профессиональном тесте AutomationBench модель получила 41,4%, а в GeneBench Pro — 37,8%. Иными словами, существуют сложные классы задач, где её показатели всё ещё далеки от 100%.

Поэтому главный результат появления GPT-6 Astra заключается не в том, что OpenAI доказала создание AGI, а в резком расширении спектра сложных задач, которые одна модель способна выполнять на высоком уровне. Одновременно некоторые прежние тесты начинают приближаться к пределу своей полезности: когда ИИ получает 98–100%, исследователям приходится создавать более сложные способы оценки его способностей.

GPT-6 Astra первоначально развёртывается для ограниченного числа организаций. OpenAI планирует в течение следующих дней предоставить доступ пользователям ChatGPT Plus, Pro, Business и Enterprise, а также через API и AWS.

Вопрос о том, является ли Astra началом эпохи AGI, таким образом, остаётся открытым. Рекордные результаты на отдельных тестах сами по себе этого не доказывают, однако способности модели показывают, насколько быстро сокращается разрыв между специализированными ИИ-системами и системами, способными выполнять широкий спектр сложных интеллектуальных задач.

Подпишитесь на нас: Вконтакте / Telegram / Дзен Новости / MAX
Back to top button