Чип OpenAI Jalapeño оказывается острее, чем Blackwell от Nvidia в бенчмарках, но полную остроту мы ощутим только к 2027 году
Кастомный чип OpenAI превосходит Nvidia в бенчмарках, но полностью он будет развёрнут только к 2027 году — так что придержите коней, или, может быть, просто свои токены.
На конференции Hot Chips во вторник OpenAI наконец-то приоткрыла завесу над своим кастомным инференс-чипом Jalapeño, и — сюрприз, сюрприз — он довольно хорош в том, что делает. Протестированный на бенчмарке InferenceX от SemiAnalysis, Jalapeño выдал больше токенов на пользователя и больше пропускной способности на киловатт, чем современные инференс-процессоры. Это модный способ сказать, что он выдаёт больше ИИ на ватт, что является той эффективностью, которая заставляет и бухгалтеров, и экологов танцевать от радости.
«Суть в том, что результаты показывают очень, очень значительное улучшение производительности по сравнению с современным уровнем», — сказал Ричард Хо, глава аппаратного обеспечения OpenAI, на пресс-конференции. «Jalapeño может обслуживать больше ИИ-работы на единицу мощности, а также быстрее возвращать ответы. Это очень эффективно для обслуживания большого количества клиентов, но также может обеспечить очень низкую задержку».
Но прежде чем вы начнёте планировать парад, вот загвоздка: это сравнение с системой Nvidia Blackwell, которая к моменту выхода Jalapeño на рынок может иметь в рукаве ещё пару трюков. Хо оценил, что Jalapeño будет развёрнут в конце 2026 года «в очень малых объёмах», а более значительное развёртывание произойдёт в 2027 году. Так что нам придётся подождать, чтобы ощутить полный вкус.
Впервые анонсированный в октябре прошлого года, Jalapeño был разработан OpenAI в тесном сотрудничестве с Broadcom, при этом собственные модели OpenAI помогали в процессе разработки. Компания планирует сделать Jalapeño многопоколенческой платформой, позволяющей разрабатывать ИИ-продукты, модели, чипы и память в унисон. Благодаря такому полностековому подходу OpenAI смогла решить конкретные фазы в процессе инференса, которые часто вызывают трения. В частности, Jalapeño спроектирован так, чтобы минимизировать задержки на этапах предварительного заполнения и коммуникации, которые, по словам OpenAI, часто являются узкими местами.
«Мы разработали Jalapeño, чтобы минимизировать перемещение данных и задержки связи», — говорится в блоге компании, представляющем результаты. «Это означает, что состояние модели, включая KV-кэш, используемый при генерации ответа, может быть явно размещено и оставаться локальным, пока система активирует правильную комбинацию вычислений, памяти и сети для каждой фазы инференса». Другими словами, они сделали чип умным в том, куда он кладёт вещи, чтобы ему не приходилось бегать и искать их. Революционно, мы знаем.
The Good Times
Новости в вашей почте.
Саркастический дайджест, доставляемый по вашему расписанию. Бесплатно.
Уже подписаны, но мы так и не доходим до вашего ящика? Загляните в папку «Спам» и нажмите «Не спам» (или «Убрать из спама»), чтобы вытащить нас из чистилища нежелательной почты. Заодно поможете и всем остальным.
Если вы не откроете ни одного нашего письма в течение месяца, вас автоматически удалят из списка рассылки.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.