तेज़ AI इंफ़रेंस की दौड़ जारी है, और मई में अपनी IPO शुरुआत में Cerebras और उसके विशेष-उद्देश्य वाले चिप्स का बाज़ार ने गर्मजोशी से स्वागत किया। लेकिन फ्रांसीसी स्टार्टअप Kog शर्त लगा रहा है कि पारंपरिक GPU से बहुत अधिक शक्ति निचोड़ी जा सकती है।
स्टार्टअप ने मई में Hacker News के पहले पन्ने पर एक तकनीकी पूर्वावलोकन के साथ जगह बनाई, जिसका उद्देश्य यह साबित करना था कि "उद्यमों के पास पहले से मौजूद मानक डेटासेंटर GPU पर अत्यंत तेज़ सिंगल-रिक्वेस्ट डिकोडिंग संभव है" - जैसे कि AMD MI300X और NVIDIA H200 GPU, जिनका उपयोग उसने अपने डेमो में किया।
कुछ लोग यह सुनकर निराश हुए कि यह हमारे लैपटॉप के GPU तक विस्तारित नहीं है, लेकिन दूसरों ने संभावना देखी। इंफ़रेंस गति और लागत अब एक महत्वपूर्ण बाधा बन गई है, Kog का वादा मौजूदा हार्डवेयर पर सॉफ्टवेयर अनुकूलन के साथ नई क्षमताओं को अनलॉक करने का था, जिसने केवल दर्शकों को ही आकर्षित नहीं किया। "हमारे पास 200 ठोस व्यावसायिक लीड थे," CEO गेल डेलाल्यू ने TechCrunch को बताया।
प्रारंभिक प्रतिक्रिया के आधार पर, एकल संस्थापक को उम्मीद है कि सॉफ्टवेयर इंजीनियरिंग पहला उपयोग मामला होगा। अनुभवी Claude Code उपयोगकर्ता अच्छी तरह जानते हैं कि उन्हें कभी-कभी परिणाम पाने के लिए घंटों इंतज़ार करना पड़ता है। Anthropic खुद समझता है कि गति पैसे के लायक है, और Claude के फास्ट मोड के लिए कई गुना कीमत वसूलता है।
Kog उन ग्राहकों को लक्षित करने की उम्मीद कर रहा है जो इन देरी से विमुख हो जाते हैं, आमतौर पर क्योंकि वे पेशेवर कार्यों के लिए AI वर्कफ़्लो पर निर्भर हैं। लेकिन स्टार्टअप के पास डिज़ाइन पार्टनर भी हैं जो उपयोगकर्ताओं को एक प्रॉम्प्ट के साथ गेम और ऐप बनाने देते हैं, और जिनके लिए Kog इंफ़रेंस इंजन (KIE) की बदौलत तेज़ परिणाम का मतलब अधिक राजस्व होगा, डेलाल्यू ने कहा।
कंपनी को एहसास है कि यह बाज़ार अभी परिपक्व नहीं है। मांग का अवलोकन करते हुए, Kog ने सीखा कि उसके संभावित ग्राहक छोटे मॉडलों को फाइन-ट्यून करने के लिए तैयार नहीं हैं। "और इसीलिए लॉन्च के बाद से, हमने बड़े मॉडलों के विकास में तेजी लाने पर पूरी तरह ध्यान केंद्रित किया है ताकि हमने जो मांग देखी है उसे पूरा कर सकें।"
यह Kog को "30x तेज़ LLM इंफ़रेंस" के अपने वादे को पूरा करने के लिए एक बड़ी छलांग लगाने के लिए छोड़ता है। इसके डेमो ने एक प्रभावशाली 3,000 प्रति-अनुरोध टोकन प्रति सेकंड (TPS) दिखाया - लेकिन केवल लगभग 2 बिलियन पैरामीटर वाले एक विशेष-उद्देश्य वाले छोटे मॉडल के साथ, जो अब ओपन-सोर्स Laneformer 2B है।
संदेह करने वालों का खंडन करते हुए, डेलाल्यू आश्वस्त हैं कि यही दृष्टिकोण LLM के साथ भी उतना ही अच्छा काम कर सकता है, जिनका आकार इंफ़रेंस चिप्स के लिए चुनौती हो सकता है। "GPU का भविष्य उज्ज्वल है," उन्होंने कहा। Kog के CEO के लिए, यह विचार कि वे डिकोडिंग के लिए उपयुक्त नहीं हैं, एक गलत धारणा बन गई है; नए GPU में अधिक से अधिक मेमोरी बैंडविड्थ है जो अनलॉक होने की प्रतीक्षा कर रही है।
Kog अकेला नहीं है जो सोचता है कि सॉफ्टवेयर अनुकूलन GPU को बॉक्स पर जो कहा गया है उससे अधिक करने में मदद कर सकता है। फ्रांस की ही ZML ने हार्डवेयर-अज्ञेय सॉफ्टवेयर जारी किया है जो प्रतिस्पर्धी चिप्स पर तेज़ इंफ़रेंस का समर्थन करने के लिए Nvidia के CUDA को बायपास करता है। लेकिन डेलाल्यू ने कहा कि Kog स्टैनफोर्ड विश्वविद्यालय की प्रयोगशाला Hazy Research के समान है, जिसमें GPU त्वरण पर और भी गहरा ध्यान है।
डेलाल्यू खुद शोधकर्ता नहीं हैं, और उनका पहला स्टार्टअप, TechCrunch50 2009 का पूर्व छात्र Stribe, उनके नए स्टार्टअप से कोई लेना-देना नहीं है - उनके पूर्व सह-संस्थापक बने VC कामेल ज़ेरौल के अलावा, जिनकी फर्म Varsity VC ने Kog के सीड राउंड का सह-नेतृत्व किया। लेकिन स्टार्टअप का गहरा स्तर का ध्यान उनकी अद्वितीय पृष्ठभूमि से उपजा है।
फ्रांस के इकोले पॉलीटेक्निक में ठोस-अवस्था भौतिकी का अध्ययन करने के बाद, उन्होंने आक्रामक साइबर सुरक्षा में काम किया - जिसे व्हाइट हैट हैकिंग के रूप में भी जाना जाता है। डेलाल्यू के अनुसार, इसने उस मानसिकता को आकार दिया जिसे वह अब अपनी टीम में प्रोत्साहित कर रहे हैं। विज्ञान की ओर, "भौतिकी के नियमों और GPU के नियमों को समझने की यह मानसिकता है ताकि उनका अधिकतम लाभ उठाया जा सके।"
जहां तक हैकिंग का सवाल है, DEF CON की CTF प्रतियोगिता के चार बार के फाइनलिस्ट ने कहा कि इसने उन्हें "बहुत निचले स्तर पर चीजों को रिवर्स-इंजीनियर करना सिखाया - असेंबली भाषा और बाइनरी कोड तक - यह समझने के लिए कि यह कैसे काम करता है, और इसे एक ऐसे लक्ष्य को प्राप्त करने के लिए उपयोग करने की कोशिश करें जिसके लिए इसे आवश्यक रूप से डिज़ाइन नहीं किया गया था।"
इस दृष्टिकोण का नकारात्मक पहलू यह है कि यह बहुत व्यावहारिक और समय लेने वाला है। "हर नए GPU के लिए, हम विवरणों में वास्तव में गहराई से जाने के लिए कई सप्ताह या महीने समर्पित करेंगे,"