На конференции Hot Chips во вторник OpenAI наконец-то приоткрыла завесу над своим кастомным инференс-чипом Jalapeño, и — сюрприз, сюрприз — он довольно хорош в том, что делает. Протестированный на бенчмарке InferenceX от SemiAnalysis, Jalapeño выдал больше токенов на пользователя и больше пропускной способности на киловатт, чем современные инференс-процессоры. Это модный способ сказать, что он выдаёт больше ИИ на ватт, что является той эффективностью, которая заставляет и бухгалтеров, и экологов танцевать от радости.

«Суть в том, что результаты показывают очень, очень значительное улучшение производительности по сравнению с современным уровнем», — сказал Ричард Хо, глава аппаратного обеспечения OpenAI, на пресс-конференции. «Jalapeño может обслуживать больше ИИ-работы на единицу мощности, а также быстрее возвращать ответы. Это очень эффективно для обслуживания большого количества клиентов, но также может обеспечить очень низкую задержку».

Но прежде чем вы начнёте планировать парад, вот загвоздка: это сравнение с системой Nvidia Blackwell, которая к моменту выхода Jalapeño на рынок может иметь в рукаве ещё пару трюков. Хо оценил, что Jalapeño будет развёрнут в конце 2026 года «в очень малых объёмах», а более значительное развёртывание произойдёт в 2027 году. Так что нам придётся подождать, чтобы ощутить полный вкус.

Впервые анонсированный в октябре прошлого года, Jalapeño был разработан OpenAI в тесном сотрудничестве с Broadcom, при этом собственные модели OpenAI помогали в процессе разработки. Компания планирует сделать Jalapeño многопоколенческой платформой, позволяющей разрабатывать ИИ-продукты, модели, чипы и память в унисон. Благодаря такому полностековому подходу OpenAI смогла решить конкретные фазы в процессе инференса, которые часто вызывают трения. В частности, Jalapeño спроектирован так, чтобы минимизировать задержки на этапах предварительного заполнения и коммуникации, которые, по словам OpenAI, часто являются узкими местами.

«Мы разработали Jalapeño, чтобы минимизировать перемещение данных и задержки связи», — говорится в блоге компании, представляющем результаты. «Это означает, что состояние модели, включая KV-кэш, используемый при генерации ответа, может быть явно размещено и оставаться локальным, пока система активирует правильную комбинацию вычислений, памяти и сети для каждой фазы инференса». Другими словами, они сделали чип умным в том, куда он кладёт вещи, чтобы ему не приходилось бегать и искать их. Революционно, мы знаем.