2017 की गर्मियों में, Google के शोधकर्ताओं ने 'Attention Is All You Need' नामक एक पेपर जारी किया, जिसमें ट्रांसफॉर्मर पेश किया गया - एक न्यूरल नेटवर्क जो लंबे टेक्स्ट को पढ़ने में शानदार साबित हुआ। नौ साल बाद, ट्रांसफॉर्मर हर बड़े लैंग्वेज मॉडल (LLM) के इंजन हैं। AI स्टार्टअप Subquadratic के CEO Justin Dangel कहते हैं, "पूरा AI उद्योग ट्रांसफॉर्मर्स पर बना है," और इसे कंप्यूटर विज्ञान के इतिहास की सबसे महत्वपूर्ण खोजों में से एक बताते हैं। लेकिन सबसे बड़े हिट भी समय के साथ पुराने पड़ जाते हैं।

ट्रांसफॉर्मर्स अब अपनी उम्र दिखा रहे हैं। हालिया LLM प्रगति - जैसे कि रीज़निंग मॉडल जो खुद को नोट्स लिखते हैं और विशाल इनपुट संभालते हैं - मूल तकनीक के साफ विस्तार नहीं हैं; वे मूलभूत कमजोरियों पर लगाए गए पैच हैं। इसलिए वैज्ञानिकों और इंजीनियरों का एक बढ़ता समूह पूछ रहा है: आगे क्या? LLM कहीं नहीं जा रहे हैं, लेकिन उनके निर्माण का तरीका दांव पर है। MIT Technology Review ने इस भावी पीढ़ी को 'LLMs+' नाम दिया है, और स्टार्टअप्स की एक लहर इन सीमाओं को आगे बढ़ाने के लिए दौड़ रही है। कुछ असफल होंगे, लेकिन उनके पास खेलने के लिए सब कुछ है और आज के अग्रणी खिलाड़ियों की तुलना में खोने के लिए बहुत कम।

पहले, समस्या। ट्रांसफॉर्मर घने ध्यान (dense attention) पर निर्भर करते हैं, जो हर शब्द (या टोकन) की तुलना हर दूसरे शब्द से गुणा के माध्यम से करता है। यह अर्थ को शानदार ढंग से पकड़ता है, लेकिन कंप्यूटेशन भयानक रूप से बढ़ता है: 10,000 शब्दों के दस्तावेज़ के लिए 50 मिलियन गुणा की आवश्यकता हो सकती है। यही कारण है कि LLM इतनी अधिक बिजली खाते हैं। OpenAI के अध्यक्ष Greg Brockman का कहना है कि कंपनी इस साल कंप्यूटिंग पर $50 बिलियन खर्च करेगी, और अंतर्राष्ट्रीय ऊर्जा एजेंसी का अनुमान है कि 2030 तक डेटा सेंटर की बिजली खपत दोगुनी हो जाएगी। ट्रांसफॉर्मर बड़े कॉन्टेक्स्ट विंडो (लाइब्रेरी, कोडबेस, या एजेंट आउटपुट) के साथ भी संघर्ष करते हैं, और रीज़निंग मॉडल अधिक डेटा जोड़ते हैं। जैसे-जैसे LLM बढ़ते हैं, ट्रांसफॉर्मर बाधा बन जाते हैं।

यहाँ चार बेतुके विचार हैं इसे ठीक करने के लिए।

**विचार 1: स्पार्स अटेंशन, Subquadratic शैली**

मियामी स्थित Subquadratic का दावा है कि उसने स्पार्स अटेंशन (केवल कुछ शब्द युग्मों की गणना) को बिना अर्थ खोए हल कर लिया है। इसका मॉडल SubQ, कथित तौर पर खोज और कोडिंग कार्यों में शीर्ष LLM से मुकाबला करता है। संशयवादी अभी भी हैं, लेकिन हजारों लोगों ने वेटलिस्ट में शामिल हो गए हैं। कंपनी का कहना है कि वह तुरंत पता लगा लेती है कि कौन से शब्द महत्वपूर्ण हैं, और जल्द ही व्यापक रिलीज़ की योजना है।

**विचार 2: Manifest AI से पावर रिटेंशन**

सैन फ्रांसिस्को की Manifest AI ने अटेंशन को छोड़कर 'पावर रिटेंशन' अपनाया है, जो केवल सबसे प्रासंगिक जानकारी संग्रहीत करता है और कॉन्टेक्स्ट विंडो का रोलिंग सारांश प्रदान करता है, नए डेटा आने पर कम प्रासंगिक बिट्स को हटा देता है। यह अवधारणा एक दशक पुरानी है, लेकिन Manifest का दावा है कि यह अब ट्रांसफॉर्मर्स के साथ प्रतिस्पर्धी है। इसने ओपन-सोर्स कोडिंग LLM StarCoder को PowerCoder में बदल दिया और Brumby जारी किया, जो कथित तौर पर Alibaba के Qwen से मुकाबला करता है। सह-संस्थापक Carles Gelada घंटों के वीडियो विश्लेषण से लेकर एजेंटों तक जो हफ्तों तक कार्य पर बने रहते हैं, अनुप्रयोग देखते हैं।

**विचार 3: Liquid AI से लिक्विड न्यूरल नेटवर्क**

MIT स्पिनऑफ Liquid AI ट्रांसफॉर्मर्स को लिक्विड न्यूरल नेटवर्क (कीड़े के दिमाग से प्रेरित) के साथ जोड़कर 'लिक्विड फाउंडेशन मॉडल' (LFM) बनाता है। ये काफी छोटे और अधिक ऊर्जा-कुशल हैं, $50 Raspberry Pi पर चलते हैं। CEO Ramin Hasani के अनुसार, ये $10 मिलियन से कम वार्षिक राजस्व वाले संगठनों के लिए मुफ्त हैं, और लगभग 34 मिलियन डाउनलोड हो चुके हैं। ये मॉडल चार गुना बड़े प्रतिद्वंद्वियों से मुकाबला करते हैं, जिनमें Qwen और Google के Gemma के संस्करण शामिल हैं। रहस्य: एक AI जो मॉडल डिज़ाइन करता है, 20% ट्रांसफॉर्मर और 80% लिक्विड नेटवर्क का हाइब्रिड चुनता है। Hasani आश्चर्य करते हैं कि दिमाग 20 वाट पर चलता है: "हम और अधिक नवाचार कर सकते हैं।"

**विचार 4: Inception से डिफ्यूजन**

पालो ऑल्टो स्थित Inception, डिफ्यूजन (छवि और वीडियो मॉडल के पीछे की तकनीक) का उपयोग करके पूरे वाक्य एक साथ उत्पन्न करता है। डिफ्यूजन LLM, जैसे Mercury 2, GPT-4 प्रदर्शन से मेल खाने का दावा करते हैं लेकिन 10 गुना तेज़। सह-संस्थापक Stefano Ermon, एक स्टैनफोर्ड शोधकर्ता, ने टेक्स्ट के साथ डिफ्यूजन को काम करने का गणित निकाला।