Na konferencji Hot Chips we wtorek OpenAI w końcu uchyliło rąbka tajemnicy na temat swojego autorskiego układu wnioskowania, Jalapeño, i – niespodzianka, niespodzianka – jest całkiem dobry w tym, co robi. Przetestowany na benchmarku InferenceX od SemiAnalysis, Jalapeño dostarczał więcej tokenów na użytkownika i większą przepustowość na kilowat niż obecne procesory wnioskowania najnowszej generacji. To wymyślny sposób na powiedzenie, że serwuje więcej AI na wat, co jest rodzajem wydajności, która sprawia, że zarówno księgowi, jak i ekolodzy tańczą z radości.

„Najważniejsze jest to, że wyniki pokazują bardzo, bardzo znaczący postęp wydajności w porównaniu z najnowocześniejszymi rozwiązaniami” – powiedział Richard Ho, szef działu sprzętu w OpenAI, podczas konferencji prasowej. „Jalapeño może obsłużyć więcej pracy AI na jednostkę mocy, jednocześnie odpowiadając szybciej. Jest bardzo wydajny w obsłudze wielu klientów, ale może też działać z bardzo niskim opóźnieniem”.

Ale zanim zaczniesz planować paradę, oto haczyk: to porównanie dotyczy systemu Nvidia Blackwell – który do czasu, gdy Jalapeño faktycznie trafi na rynek, może mieć w zanadrzu kilka dodatkowych sztuczek. Ho oszacował, że Jalapeño zostanie wdrożone pod koniec 2026 roku „w bardzo małych ilościach”, a bardziej znaczące wdrożenie nastąpi w 2027 roku. Więc trochę potrwa, zanim poczujemy pełnię smaku.

Ogłoszony po raz pierwszy w październiku zeszłego roku, Jalapeño został opracowany przez OpenAI w ścisłej współpracy z Broadcom, a własne modele OpenAI wspomagały proces rozwoju. Firma planuje uczynić z Jalapeño platformę wielopokoleniową, umożliwiającą równoczesny rozwój produktów AI, modeli, układów i pamięci. Dzięki temu podejściu pełnego stosu OpenAI było w stanie rozwiązać konkretne fazy procesu wnioskowania, które często powodują tarcia podczas przetwarzania. W szczególności Jalapeño został zaprojektowany tak, aby zminimalizować opóźnienia podczas faz prefill i komunikacji w przetwarzaniu, które według OpenAI często stanowią wąskie gardła.

„Zaprojektowaliśmy Jalapeño, aby zminimalizować przesyłanie danych i opóźnienia komunikacyjne” – napisała firma w poście na blogu prezentującym wyniki. „Oznacza to, że stan modelu, w tym pamięć podręczna KV używana podczas generowania odpowiedzi, może być jawnie umieszczony i utrzymywany lokalnie, podczas gdy system aktywuje odpowiednią kombinację mocy obliczeniowej, pamięci i sieci dla każdej fazy wnioskowania”. Innymi słowy, sprawili, że układ jest mądry w kwestii tego, gdzie umieszcza rzeczy, więc nie musi biegać w poszukiwaniu ich. Rewolucyjne, wiemy.