Компания Anthropic представила Claude Opus 5 с лучшими результатами в программировании

Компания Anthropic представила Claude Opus 5 — новую флагманскую модель искусственного интеллекта, которая, по заявлению разработчиков, демонстрирует передовые результаты в программировании и задачах, связанных с интеллектуальной работой, при той же стоимости использования, что и её предшественник.
Модель уже доступна на всех платформах Anthropic по цене 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Также пользователи могут выбрать ускоренный режим, работающий примерно в 2,5 раза быстрее стандартного, однако его использование обходится в два раза дороже.
Anthropic разработала Opus 5 для выполнения сложных задач программной инженерии, автоматизации бизнес-процессов, научных исследований и взаимодействия с компьютером. Компания позиционирует модель как инструмент для ежедневного использования, а не систему, которую следует применять только для самых сложных задач.
В тесте Frontier-Bench v0.1, предназначенном для оценки возможностей в программной инженерии, Opus 5, согласно данным Anthropic, превзошла другие проверенные модели и более чем в два раза улучшила результат по сравнению с Opus 4.8 при меньшей стоимости выполнения одной задачи.
В тесте CursorBench 3.2 при максимальном уровне усилий новая модель отстала менее чем на 0,5% от максимального результата Claude Fable 5, но при этом стоимость выполнения одной задачи оказалась в два раза ниже.
Новая модель показала рост результатов не только в программировании
Преимущества Claude Opus 5, по данным Anthropic, распространяются и на другие области. В тесте ARC-AGI 3, оценивающем способность искусственного интеллекта решать новые и ранее неизвестные задачи, модель показала результат в три раза выше, чем ближайшая система-конкурент.
В тесте Zapier AutomationBench, который проверяет способность моделей выполнять бизнес-задачи от начала до конца, Opus 5 достигла примерно в 1,5 раза более высокой доли успешных решений по сравнению со следующей лучшей моделью при одинаковой стоимости одной задачи.
Модель также превзошла другие системы в тесте OSWorld 2.0, предназначенном для оценки возможностей взаимодействия с компьютером. По данным Anthropic, Opus 5 показала результат выше лучшего результата Fable 5 при стоимости выполнения задачи чуть более чем в три раза ниже.
Anthropic также сообщила об улучшении возможностей модели в научных исследованиях, особенно в области наук о жизни. Во внутреннем тесте по органической химии, включавшем определение молекулярных структур на основе данных спектроскопии, Opus 5 набрала на 10,2 процентного пункта больше, чем Opus 4.8.
На задачах, связанных с влиянием изменений последовательности белков на их функции, улучшение составило 7,7 процентного пункта.
Claude Opus 5 научилась проверять собственную работу
Компания заявляет, что новая модель стала лучше проверять собственные результаты и предпринимать повторные попытки, если первоначальный подход оказывается неудачным.
В одном из тестов Opus 5 получила изображение детали механизма, но не имела прямого способа просмотреть его и должна была воссоздать деталь в виде трёхмерной модели FreeCAD.
Вместо того чтобы остановиться на невозможности напрямую изучить изображение, модель, согласно Anthropic, самостоятельно создала компьютерное зрение для извлечения геометрии из исходных пикселей изображения, а затем использовала полученные данные для восстановления детали.
Anthropic заявила, что Opus 5 неоднократно успешно справлялась с этой задачей, тогда как конкурирующие модели не смогли добиться успеха после пяти попыток в аналогичных условиях.
Anthropic усилила защиту новой модели
Одновременно с ростом возможностей Claude Opus 5 Anthropic представила дополнительные меры безопасности. Компания заявляет, что новая модель стала наиболее соответствующей требованиям безопасности среди всех её систем на основе автоматизированного поведенческого тестирования и демонстрирует более низкую склонность к обманному поведению по сравнению с недавними моделями.
При этом Opus 5 уступает модели Mythos 5 в возможностях наступательной кибербезопасности. В тестировании Anthropic OSS-Fuzz обе системы показали сопоставимые результаты при обнаружении уязвимостей в программном обеспечении, однако Opus 5 значительно хуже справлялась с разработкой эксплойтов.
Anthropic также ввела более строгие ограничения для некоторых видов кибербезопасных задач, включая поиск уязвимостей на основе анализа бинарных файлов, тестирование на проникновение и создание эксплойтов. Запросы, которые системы безопасности сочтут потенциально опасными, могут автоматически перенаправляться на модель Opus 4.8.
Вместе с запуском Claude Opus 5 Anthropic представила бета-функции для разработчиков. Они позволяют менять доступные инструменты прямо во время диалога без сброса кэша промптов, а также автоматически перенаправлять отмеченные системой безопасности запросы API на другую модель.
Claude Opus 5 стала моделью по умолчанию для пользователей Claude Max и наиболее мощной моделью, доступной подписчикам Claude Pro.