Искусственный интеллект

Компания Anthropic представила Claude Opus 5 с лучшими результатами в программировании

Компания Anthropic представила Claude Opus 5 — новую флагманскую модель искусственного интеллекта, которая, по заявлению разработчиков, демонстрирует передовые результаты в программировании и задачах, связанных с интеллектуальной работой, при той же стоимости использования, что и её предшественник.

Модель уже доступна на всех платформах Anthropic по цене 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Также пользователи могут выбрать ускоренный режим, работающий примерно в 2,5 раза быстрее стандартного, однако его использование обходится в два раза дороже.

Anthropic разработала Opus 5 для выполнения сложных задач программной инженерии, автоматизации бизнес-процессов, научных исследований и взаимодействия с компьютером. Компания позиционирует модель как инструмент для ежедневного использования, а не систему, которую следует применять только для самых сложных задач.

В тесте Frontier-Bench v0.1, предназначенном для оценки возможностей в программной инженерии, Opus 5, согласно данным Anthropic, превзошла другие проверенные модели и более чем в два раза улучшила результат по сравнению с Opus 4.8 при меньшей стоимости выполнения одной задачи.

В тесте CursorBench 3.2 при максимальном уровне усилий новая модель отстала менее чем на 0,5% от максимального результата Claude Fable 5, но при этом стоимость выполнения одной задачи оказалась в два раза ниже.

Новая модель показала рост результатов не только в программировании

Преимущества Claude Opus 5, по данным Anthropic, распространяются и на другие области. В тесте ARC-AGI 3, оценивающем способность искусственного интеллекта решать новые и ранее неизвестные задачи, модель показала результат в три раза выше, чем ближайшая система-конкурент.

В тесте Zapier AutomationBench, который проверяет способность моделей выполнять бизнес-задачи от начала до конца, Opus 5 достигла примерно в 1,5 раза более высокой доли успешных решений по сравнению со следующей лучшей моделью при одинаковой стоимости одной задачи.

Модель также превзошла другие системы в тесте OSWorld 2.0, предназначенном для оценки возможностей взаимодействия с компьютером. По данным Anthropic, Opus 5 показала результат выше лучшего результата Fable 5 при стоимости выполнения задачи чуть более чем в три раза ниже.

Anthropic также сообщила об улучшении возможностей модели в научных исследованиях, особенно в области наук о жизни. Во внутреннем тесте по органической химии, включавшем определение молекулярных структур на основе данных спектроскопии, Opus 5 набрала на 10,2 процентного пункта больше, чем Opus 4.8.

На задачах, связанных с влиянием изменений последовательности белков на их функции, улучшение составило 7,7 процентного пункта.

Claude Opus 5 научилась проверять собственную работу

Компания заявляет, что новая модель стала лучше проверять собственные результаты и предпринимать повторные попытки, если первоначальный подход оказывается неудачным.

В одном из тестов Opus 5 получила изображение детали механизма, но не имела прямого способа просмотреть его и должна была воссоздать деталь в виде трёхмерной модели FreeCAD.

Вместо того чтобы остановиться на невозможности напрямую изучить изображение, модель, согласно Anthropic, самостоятельно создала компьютерное зрение для извлечения геометрии из исходных пикселей изображения, а затем использовала полученные данные для восстановления детали.

Anthropic заявила, что Opus 5 неоднократно успешно справлялась с этой задачей, тогда как конкурирующие модели не смогли добиться успеха после пяти попыток в аналогичных условиях.

Anthropic усилила защиту новой модели

Одновременно с ростом возможностей Claude Opus 5 Anthropic представила дополнительные меры безопасности. Компания заявляет, что новая модель стала наиболее соответствующей требованиям безопасности среди всех её систем на основе автоматизированного поведенческого тестирования и демонстрирует более низкую склонность к обманному поведению по сравнению с недавними моделями.

При этом Opus 5 уступает модели Mythos 5 в возможностях наступательной кибербезопасности. В тестировании Anthropic OSS-Fuzz обе системы показали сопоставимые результаты при обнаружении уязвимостей в программном обеспечении, однако Opus 5 значительно хуже справлялась с разработкой эксплойтов.

Anthropic также ввела более строгие ограничения для некоторых видов кибербезопасных задач, включая поиск уязвимостей на основе анализа бинарных файлов, тестирование на проникновение и создание эксплойтов. Запросы, которые системы безопасности сочтут потенциально опасными, могут автоматически перенаправляться на модель Opus 4.8.

Вместе с запуском Claude Opus 5 Anthropic представила бета-функции для разработчиков. Они позволяют менять доступные инструменты прямо во время диалога без сброса кэша промптов, а также автоматически перенаправлять отмеченные системой безопасности запросы API на другую модель.

Claude Opus 5 стала моделью по умолчанию для пользователей Claude Max и наиболее мощной моделью, доступной подписчикам Claude Pro.

Подпишитесь на нас: Вконтакте / Telegram / Дзен Новости / MAX
Back to top button