स्टार्टअप्स की होड़: ट्रांसफॉर्मर्स को बदलने की कोशिश, जिसने LLM को संभव (और बेहद महंगा) बनाया
चार स्टार्टअप ट्रांसफॉर्मर - हर बड़े LLM के पीछे की तकनीक - को स्पार्स अटेंशन, पावर रिटेंशन, वर्म-ब्रेन-प्रेरित नेटवर्क और डिफ्यूजन से बदलने की कोशिश कर रहे हैं। क्यों नहीं?
2017 की गर्मियों में, Google के शोधकर्ताओं ने 'Attention Is All You Need' नामक एक पेपर जारी किया, जिसमें ट्रांसफॉर्मर पेश किया गया - एक न्यूरल नेटवर्क जो लंबे टेक्स्ट को पढ़ने में शानदार साबित हुआ। नौ साल बाद, ट्रांसफॉर्मर हर बड़े लैंग्वेज मॉडल (LLM) के इंजन हैं। AI स्टार्टअप Subquadratic के CEO Justin Dangel कहते हैं, "पूरा AI उद्योग ट्रांसफॉर्मर्स पर बना है," और इसे कंप्यूटर विज्ञान के इतिहास की सबसे महत्वपूर्ण खोजों में से एक बताते हैं। लेकिन सबसे बड़े हिट भी समय के साथ पुराने पड़ जाते हैं।
ट्रांसफॉर्मर्स अब अपनी उम्र दिखा रहे हैं। हालिया LLM प्रगति - जैसे कि रीज़निंग मॉडल जो खुद को नोट्स लिखते हैं और विशाल इनपुट संभालते हैं - मूल तकनीक के साफ विस्तार नहीं हैं; वे मूलभूत कमजोरियों पर लगाए गए पैच हैं। इसलिए वैज्ञानिकों और इंजीनियरों का एक बढ़ता समूह पूछ रहा है: आगे क्या? LLM कहीं नहीं जा रहे हैं, लेकिन उनके निर्माण का तरीका दांव पर है। MIT Technology Review ने इस भावी पीढ़ी को 'LLMs+' नाम दिया है, और स्टार्टअप्स की एक लहर इन सीमाओं को आगे बढ़ाने के लिए दौड़ रही है। कुछ असफल होंगे, लेकिन उनके पास खेलने के लिए सब कुछ है और आज के अग्रणी खिलाड़ियों की तुलना में खोने के लिए बहुत कम।
पहले, समस्या। ट्रांसफॉर्मर घने ध्यान (dense attention) पर निर्भर करते हैं, जो हर शब्द (या टोकन) की तुलना हर दूसरे शब्द से गुणा के माध्यम से करता है। यह अर्थ को शानदार ढंग से पकड़ता है, लेकिन कंप्यूटेशन भयानक रूप से बढ़ता है: 10,000 शब्दों के दस्तावेज़ के लिए 50 मिलियन गुणा की आवश्यकता हो सकती है। यही कारण है कि LLM इतनी अधिक बिजली खाते हैं। OpenAI के अध्यक्ष Greg Brockman का कहना है कि कंपनी इस साल कंप्यूटिंग पर $50 बिलियन खर्च करेगी, और अंतर्राष्ट्रीय ऊर्जा एजेंसी का अनुमान है कि 2030 तक डेटा सेंटर की बिजली खपत दोगुनी हो जाएगी। ट्रांसफॉर्मर बड़े कॉन्टेक्स्ट विंडो (लाइब्रेरी, कोडबेस, या एजेंट आउटपुट) के साथ भी संघर्ष करते हैं, और रीज़निंग मॉडल अधिक डेटा जोड़ते हैं। जैसे-जैसे LLM बढ़ते हैं, ट्रांसफॉर्मर बाधा बन जाते हैं।
यहाँ चार बेतुके विचार हैं इसे ठीक करने के लिए।
**विचार 1: स्पार्स अटेंशन, Subquadratic शैली**
मियामी स्थित Subquadratic का दावा है कि उसने स्पार्स अटेंशन (केवल कुछ शब्द युग्मों की गणना) को बिना अर्थ खोए हल कर लिया है। इसका मॉडल SubQ, कथित तौर पर खोज और कोडिंग कार्यों में शीर्ष LLM से मुकाबला करता है। संशयवादी अभी भी हैं, लेकिन हजारों लोगों ने वेटलिस्ट में शामिल हो गए हैं। कंपनी का कहना है कि वह तुरंत पता लगा लेती है कि कौन से शब्द महत्वपूर्ण हैं, और जल्द ही व्यापक रिलीज़ की योजना है।
**विचार 2: Manifest AI से पावर रिटेंशन**
सैन फ्रांसिस्को की Manifest AI ने अटेंशन को छोड़कर 'पावर रिटेंशन' अपनाया है, जो केवल सबसे प्रासंगिक जानकारी संग्रहीत करता है और कॉन्टेक्स्ट विंडो का रोलिंग सारांश प्रदान करता है, नए डेटा आने पर कम प्रासंगिक बिट्स को हटा देता है। यह अवधारणा एक दशक पुरानी है, लेकिन Manifest का दावा है कि यह अब ट्रांसफॉर्मर्स के साथ प्रतिस्पर्धी है। इसने ओपन-सोर्स कोडिंग LLM StarCoder को PowerCoder में बदल दिया और Brumby जारी किया, जो कथित तौर पर Alibaba के Qwen से मुकाबला करता है। सह-संस्थापक Carles Gelada घंटों के वीडियो विश्लेषण से लेकर एजेंटों तक जो हफ्तों तक कार्य पर बने रहते हैं, अनुप्रयोग देखते हैं।
**विचार 3: Liquid AI से लिक्विड न्यूरल नेटवर्क**
MIT स्पिनऑफ Liquid AI ट्रांसफॉर्मर्स को लिक्विड न्यूरल नेटवर्क (कीड़े के दिमाग से प्रेरित) के साथ जोड़कर 'लिक्विड फाउंडेशन मॉडल' (LFM) बनाता है। ये काफी छोटे और अधिक ऊर्जा-कुशल हैं, $50 Raspberry Pi पर चलते हैं। CEO Ramin Hasani के अनुसार, ये $10 मिलियन से कम वार्षिक राजस्व वाले संगठनों के लिए मुफ्त हैं, और लगभग 34 मिलियन डाउनलोड हो चुके हैं। ये मॉडल चार गुना बड़े प्रतिद्वंद्वियों से मुकाबला करते हैं, जिनमें Qwen और Google के Gemma के संस्करण शामिल हैं। रहस्य: एक AI जो मॉडल डिज़ाइन करता है, 20% ट्रांसफॉर्मर और 80% लिक्विड नेटवर्क का हाइब्रिड चुनता है। Hasani आश्चर्य करते हैं कि दिमाग 20 वाट पर चलता है: "हम और अधिक नवाचार कर सकते हैं।"
**विचार 4: Inception से डिफ्यूजन**
पालो ऑल्टो स्थित Inception, डिफ्यूजन (छवि और वीडियो मॉडल के पीछे की तकनीक) का उपयोग करके पूरे वाक्य एक साथ उत्पन्न करता है। डिफ्यूजन LLM, जैसे Mercury 2, GPT-4 प्रदर्शन से मेल खाने का दावा करते हैं लेकिन 10 गुना तेज़। सह-संस्थापक Stefano Ermon, एक स्टैनफोर्ड शोधकर्ता, ने टेक्स्ट के साथ डिफ्यूजन को काम करने का गणित निकाला।
The Good Times
आपके इनबॉक्स में समाचार।
व्यंग्यात्मक समाचार सारांश, आपके समयसारणी के अनुसार। निःशुल्क।
पहले से सदस्य हैं पर हम आपके इनबॉक्स में कभी नहीं आते? अपना स्पैम फ़ोल्डर देखें और 'स्पैम नहीं' (या 'स्पैम से हटाएँ') दबाएँ ताकि हम जंक-मेल के नरक से बाहर आ सकें। साथ ही आप सबकी मदद भी करेंगे।
अगर आप एक महीने तक हमारा कोई भी ईमेल नहीं खोलते, तो आपको मेलिंग सूची से अपने आप हटा दिया जाएगा।
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.