În vara anului 2017, cercetătorii Google au publicat o lucrare numită "Attention Is All You Need", introducând transformatorul - o rețea neuronală care s-a dovedit spectaculos de bună la procesarea unor secvențe lungi de text. Nouă ani mai târziu, transformatoarele sunt motorul din interiorul fiecărui model de limbaj mare (LLM). "Întreaga industrie AI este construită pe transformatoare", spune Justin Dangel, CEO al startup-ului AI Subquadratic, numindu-le una dintre cele mai importante inovații din istoria informaticii. Dar chiar și cele mai mari hituri încep să obosească după un timp.
Transformatoarele își arată vârsta. Progresele recente în LLM - cum ar fi modelele de raționament care își scriu notițe și gestionează intrări masive - nu sunt extensii îngrijite ale tehnologiei de bază; sunt plasturi cu bandă adezivă peste defecte fundamentale. Așa că un grup tot mai mare de oameni de știință și ingineri se întreabă: ce urmează? LLM-urile nu dispar, dar modul în care sunt construite este în joc. MIT Technology Review a numit această generație viitoare "LLM+", iar un val de startup-uri se îndreaptă spre ea, sperând să împingă limitele acestei tehnologii în plin avânt. Unele vor eșua, dar au totul de câștigat și mult mai puțin de pierdut decât liderii actuali.
În primul rând, problema. Transformatoarele se bazează pe atenție densă, care compară fiecare cuvânt (sau token) cu fiecare alt cuvânt prin înmulțire. Captează sensul strălucit, dar calculul scalează oribil: un document de 10.000 de cuvinte ar putea necesita 50 de milioane de înmulțiri. De aceea LLM-urile consumă atât de multă energie. Președintele OpenAI, Greg Brockman, spune că compania va cheltui 50 de miliarde de dolari pe calcul anul acesta, iar Agenția Internațională pentru Energie prezice că consumul de electricitate al centrelor de date se va dubla până în 2030. Transformatoarele se luptă și cu ferestre de context mari - ținând evidența unei biblioteci, a unui cod sau a ieșirilor agentului - iar modelele de raționament adaugă mai multe date de gestionat. Pe măsură ce LLM-urile cresc, transformatoarele devin un blocaj.
Iată patru idei sălbatice pentru a rezolva problema.
**Ideea 1: Atenție rară, stil Subquadratic**
Subquadratic, cu sediul în Miami, susține că a spart atenția rară - calculând doar unele perechi de cuvinte, nu toate - fără a pierde sensul. Modelul său, SubQ, rivalizează, se presupune, cu cele mai bune LLM-uri la sarcini de căutare și codare. Scepticii rămân, dar mii s-au înscris pe lista de așteptare. Compania spune că își dă seama din mers ce cuvinte contează și plănuiește o lansare largă în curând.
**Ideea 2: Reținerea puterii de la Manifest AI**
Manifest AI din San Francisco renunță la atenție în favoarea "reținerii puterii", care stochează doar informațiile cele mai relevante și oferă un rezumat continuu al ferestrei de context, eliminând biții mai puțin relevanți pe măsură ce sosesc date noi. Conceptul este vechi de un deceniu, dar Manifest susține că este în sfârșit competitiv cu transformatoarele. A transformat LLM-ul open-source de codare StarCoder în PowerCoder și a lansat Brumby, despre care spune că rivalizează cu Qwen de la Alibaba. Cofondatorul Carles Gelada vede aplicații de la analiza videoclipurilor de ore întregi până la agenți care rămân pe sarcină săptămâni întregi.
**Ideea 3: Rețele neuronale lichide de la Liquid AI**
Spin-off-ul MIT, Liquid AI, împerechează transformatoarele cu rețele neuronale lichide - inspirate de creierul viermilor - pentru a crea "modele de fundație lichide" (LFM). Acestea sunt mult mai mici și mai eficiente energetic, rulând pe un Raspberry Pi de 50 de dolari. Sunt gratuite pentru organizațiile cu venituri anuale sub 10 milioane de dolari și au acumulat aproape 34 de milioane de descărcări, spune CEO-ul Ramin Hasani. Modelele se potrivesc cu rivali de patru ori mai mari, inclusiv versiuni ale Qwen și Gemma de la Google. Secretul: o AI care proiectează modelele, optând pentru un hibrid de 20% transformatoare și 80% rețele lichide. Hasani se minunează că creierul funcționează cu 20 de wați: "Putem fi mult mai inovatori."
**Ideea 4: Difuzie de la Inception**
Inception, cu sediul în Palo Alto, generează propoziții întregi deodată folosind difuzia - tehnologia din spatele modelelor de imagini și video. LLM-urile cu difuzie, precum Mercury 2, susțin că se potrivesc cu performanța GPT-4, dar de 10 ori mai rapid. Cofondatorul Stefano Ermon, cercetător la Stanford, a descoperit matematica pentru a face difuzia să funcționeze cu text.