मंगलवार को Hot Chips सम्मेलन में, OpenAI ने आखिरकार अपनी कस्टम इंफ़रेंस चिप, जलापेनो, पर से पर्दा उठाया - और हैरानी की बात, यह अपने काम में काफी अच्छी है। SemiAnalysis के InferenceX बेंचमार्क पर परीक्षण में, जलापेनो ने वर्तमान सर्वश्रेष्ठ इंफ़रेंस प्रोसेसरों की तुलना में प्रति उपयोगकर्ता अधिक टोकन और प्रति किलोवाट अधिक थ्रूपुट दिया। यह कहने का एक फैंसी तरीका है कि यह प्रति वाट अधिक AI परोसता है, जो उस तरह की दक्षता है जो एकाउंटेंट और पर्यावरणविदों दोनों को थोड़ा खुशी का नृत्य करने पर मजबूर कर देती है।

"मूल बात यह है कि परिणाम वर्तमान सर्वश्रेष्ठ की तुलना में एक बहुत, बहुत महत्वपूर्ण प्रदर्शन उन्नति दिखाते हैं," OpenAI के हार्डवेयर प्रमुख रिचर्ड हो ने एक प्रेस कॉल में कहा। "जलापेनो प्रति यूनिट बिजली अधिक AI काम परोस सकता है, साथ ही प्रतिक्रियाएं भी तेजी से लौटाता है। बहुत सारे ग्राहकों को सेवा देना बहुत कुशल है, लेकिन यह बहुत कम विलंबता वाला भी हो सकता है।"

लेकिन इससे पहले कि आप परेड की योजना बनाना शुरू करें, यहाँ एक झटका है: वह तुलना Nvidia Blackwell सिस्टम के खिलाफ है - जो, जब तक जलापेनो वास्तव में बाजार में आएगा, उसके पास कुछ और तरकीबें हो सकती हैं। हो ने अनुमान लगाया कि जलापेनो 2026 के अंत में "बहुत कम मात्रा में" तैनात किया जाएगा, और 2027 में अधिक महत्वपूर्ण तैनाती होगी। तो, पूर्ण स्वाद चखने से पहले हमें कुछ समय और लगेगा।

पिछले अक्टूबर में पहली बार घोषित, जलापेनो को OpenAI ने Broadcom के साथ घनिष्ठ सहयोग से विकसित किया था, और विकास प्रक्रिया में OpenAI के अपने मॉडलों ने सहायता की। कंपनी जलापेनो को एक बहु-पीढ़ी मंच बनाने की योजना बना रही है, जिससे AI उत्पाद, मॉडल, चिप्स और मेमोरी सभी एक साथ विकसित हो सकें। इस फुल-स्टैक दृष्टिकोण के कारण, OpenAI इंफ़रेंस प्रक्रिया के विशिष्ट चरणों को संबोधित करने में सक्षम था जो अक्सर इंफ़रेंस प्रोसेसिंग के दौरान घर्षण पैदा करते हैं। विशेष रूप से, जलापेनो को प्रोसेसिंग के प्रीफिल और संचार चरणों के दौरान देरी को कम करने के लिए डिज़ाइन किया गया है, जिन्हें OpenAI अक्सर बाधाओं के रूप में कार्य करने वाला बताता है।

"हमने जलापेनो को डेटा मूवमेंट और संचार देरी को कम करने के लिए डिज़ाइन किया है," कंपनी ने परिणाम प्रस्तुत करते हुए एक ब्लॉग पोस्ट में कहा। "इसका मतलब है कि मॉडल स्टेट, जिसमें प्रतिक्रिया उत्पन्न करते समय उपयोग किया जाने वाला KV कैश शामिल है, को स्पष्ट रूप से रखा जा सकता है और स्थानीय रखा जा सकता है जबकि सिस्टम प्रत्येक इंफ़रेंस चरण के लिए कंप्यूट, मेमोरी और नेटवर्किंग का सही संयोजन सक्रिय करता है।" दूसरे शब्दों में, उन्होंने चिप को इस बारे में स्मार्ट बना दिया है कि वह चीजों को कहाँ रखती है, ताकि उसे उन्हें खोजने के लिए इधर-उधर भागना न पड़े। क्रांतिकारी, हम जानते हैं।