Искусственный интеллект

Первый чип OpenAI оказался до 1,9 раза эффективнее систем Nvidia

OpenAI представила первые результаты испытаний своего собственного специализированного процессора для ИИ-инференса Jalapeño. Компания утверждает, что новый чип способен выполнять значительно больше вычислений на каждый ватт потребляемой энергии и одновременно сокращать время ответа моделей по сравнению с ведущими коммерческими системами Nvidia.

Jalapeño стал первым разработанным OpenAI специализированным процессором для выполнения уже обученных моделей. Он не предназначен для их обучения: его основная задача — максимально эффективно обрабатывать пользовательские запросы и генерировать ответы.

OpenAI протестировала чип на трёх крупных открытых моделях: GPT-OSS 120B, DeepSeek R1 с 670 миллиардами параметров и Kimi K2.5 1T с одним триллионом параметров.

По данным компании, во всех трёх тестах Jalapeño обеспечил в 1,5–1,9 раза больше вычислительной производительности на ватт при максимальной пропускной способности. Одновременно сквозная задержка обработки запроса оказалась в 1,7–3,6 раза ниже, чем у систем сравнения. Для наиболее интерактивных сценариев преимущество по производительности достигало 2,1–4,1 раза.

Основная идея Jalapeño заключается в устранении одного из ключевых компромиссов современных ИИ-ускорителей — между высокой пропускной способностью и низкой задержкой.

Во время работы большой языковой модели происходят два принципиально разных процесса. На первом этапе, при обработке входного запроса, система анализирует весь поступивший контекст, что требует значительных вычислительных ресурсов. Затем начинается пошаговая генерация ответа, когда модель создаёт новые токены один за другим, а производительность во многом определяется скоростью доступа к памяти.

OpenAI утверждает, что Jalapeño был изначально спроектирован для эффективной работы с обоими режимами. Архитектура старается удерживать состояние модели, включая KV-кэш, ближе к вычислительным блокам, которым эти данные необходимы, а сеть встроена непосредственно в архитектуру системы для сокращения перемещений данных между чипами.

Это особенно важно для ИИ-агентов, которые могут выполнять десятки или сотни последовательных шагов. Даже небольшая задержка на каждом этапе в таком случае постепенно превращается в заметную потерю времени.

Номинальное энергопотребление Jalapeño составляет 700 Вт, однако во время проведённых испытаний измеренное устойчивое энергопотребление не превышало 550 Вт. Для сравнения использовался публичный бенчмарк InferenceX, разработанный SemiAnalysis.

На модели GPT-OSS 120B Jalapeño показал примерно 1,9-кратное преимущество по пропускной способности на киловатт и сократил сквозную задержку примерно в 1,7 раза по сравнению с системой Nvidia GB200.

При работе с DeepSeek R1 670B преимущество по производительности на киловатт составило около 1,7 раза, а задержка оказалась ниже примерно в 3,6 раза.

На крупнейшей из протестированных моделей — Kimi K2.5 1T — Jalapeño обеспечил примерно в 1,5 раза более высокую производительность на ватт и примерно в 3,4 раза меньшую сквозную задержку.

Интересно, что собственные модели OpenAI участвовали и в создании самого процессора. Компания использовала ИИ для ускорения проектирования, проверки и оптимизации аппаратной части. От первоначального проектирования до отправки проекта чипа в производство команда прошла путь всего за девять месяцев.

Кроме того, с помощью Codex и GPT-Astra инженеры смогли за два месяца оптимизировать для Jalapeño три модели с открытыми весами, которые первоначально вообще не входили в план разработки процессора.

Для отдельных блоков GPT-OSS, связанных с механизмом внимания и архитектурой Mixture-of-Experts (MoE), реализации, сгенерированные с помощью ИИ, оказались в 1,5–1,8 раза быстрее существующих версий, разработанных инженерами. В OpenAI отдельно подчёркивают, что этот результат относится только к отдельным вычислительным блокам, а не к модели целиком.

Jalapeño был разработан OpenAI совместно с Broadcom и является первым поколением более крупной линейки собственных ИИ-ускорителей. Второе поколение уже находится на продвинутой стадии разработки, а третье начинает формироваться.

Развёртывание Jalapeño в вычислительной инфраструктуре OpenAI планируется начать до конца 2026 года. При этом компания не собирается полностью отказываться от оборудования Nvidia и других поставщиков: собственный чип должен дополнить существующую инфраструктуру и использоваться прежде всего там, где специализированная архитектура даст максимальный выигрыш по скорости, задержке и энергопотреблению.

Подпишитесь на нас: Вконтакте / Telegram / Дзен Новости / MAX
Back to top button