Startups racen om Transformers te vervangen, de tech die LLMs mogelijk maakte (en verschrikkelijk duur)
Vier startups proberen de transformer - de tech achter elke grote LLM - te vervangen met sparse attention, power retention, worm-brein-geïnspireerde netwerken en diffusie. Want waarom ook niet?
In de zomer van 2017 publiceerden Google-onderzoekers een paper genaamd "Attention Is All You Need", waarin de transformer werd geïntroduceerd - een neuraal netwerk dat buitengewoon goed bleek in het verwerken van lange tekstsequenties. Negen jaar later zijn transformers de motor in elk groot taalmodel (LLM). "De hele AI-industrie is gebouwd op transformers", zegt Justin Dangel, CEO van AI-startup Subquadratic, die ze een van de belangrijkste innovaties in de geschiedenis van de computerwetenschap noemt. Maar zelfs de grootste hits gaan na een tijdje vervelen.
Transformers beginnen hun leeftijd te tonen. Recente LLM-vorderingen - zoals redenerende modellen die aantekeningen voor zichzelf maken en enorme inputs verwerken - zijn geen nette uitbreidingen van de kerntechnologie; het zijn duct-tape-patches over fundamentele gebreken. Dus een groeiende groep wetenschappers en ingenieurs vraagt zich af: wat is de volgende stap? LLMs gaan nergens heen, maar hoe ze worden gebouwd staat ter discussie. MIT Technology Review heeft deze toekomstige generatie "LLMs+" gedoopt, en een golf van startups stormt naar voren, hopend de grenzen van deze bloeiende tech te verleggen. Sommigen zullen falen, maar ze hebben alles te winnen en veel minder te verliezen dan de huidige koplopers.
Eerst het probleem. Transformers vertrouwen op dichte aandacht, die elk woord (of token) met elk ander woord vergelijkt via vermenigvuldiging. Het vangt betekenis briljant, maar de rekenkracht schaalt verschrikkelijk: een document van 10.000 woorden kan 50 miljoen vermenigvuldigingen vereisen. Daarom slurpen LLMs zoveel stroom. Greg Brockman, president van OpenAI, zegt dat het bedrijf dit jaar $50 miljard aan rekenkracht zal uitgeven, en het Internationaal Energieagentschap voorspelt dat het elektriciteitsverbruik van datacenters tegen 2030 zal verdubbelen. Transformers worstelen ook met grote contextvensters - het bijhouden van een bibliotheek, een codebase of agent-outputs - en redenerende modellen voegen meer data toe om te jongleren. Naarmate LLMs groeien, worden transformers een bottleneck.
Hier zijn vier wilde ideeën om het te verhelpen.
**Idee 1: Sparse Attention, Subquadratic-stijl**
Het in Miami gevestigde Subquadratic beweert sparse attention te hebben gekraakt - het berekenen van slechts enkele woordparen in plaats van alle - zonder betekenisverlies. Hun model, SubQ, zou volgens hen rivaliseren met top-LLMs op zoek- en codeertaken. Sceptici blijven, maar duizenden hebben zich op de wachtlijst geplaatst. Het bedrijf zegt dat het ter plekke uitzoekt welke woorden belangrijk zijn, en plant binnenkort een brede release.
**Idee 2: Power Retention van Manifest AI**
Het in San Francisco gevestigde Manifest AI laat aandacht vallen voor "power retention", dat alleen de meest relevante informatie opslaat en een doorlopende samenvatting van het contextvenster biedt, waarbij minder relevante stukken worden gedropt naarmate nieuwe data binnenkomen. Het concept is tien jaar oud, maar Manifest beweert dat het nu eindelijk concurrerend is met transformers. Het veranderde de open-source codeer-LLM StarCoder in PowerCoder en bracht Brumby uit, dat volgens hen rivaliseert met Alibaba's Qwen. Medeoprichter Carles Gelada ziet toepassingen van het analyseren van urenlange video's tot agents die wekenlang op taak blijven.
**Idee 3: Liquid Neural Networks van Liquid AI**
MIT-spin-off Liquid AI combineert transformers met liquid neural networks - geïnspireerd op wormhersenen - om "liquid foundation models" (LFMs) te creëren. Deze zijn veel kleiner en energiezuiniger, en draaien op een Raspberry Pi van $50. Ze zijn gratis voor organisaties met minder dan $10 miljoen jaaromzet, en hebben bijna 34 miljoen downloads opgeleverd, zegt CEO Ramin Hasani. De modellen evenaren rivalen die vier keer zo groot zijn, waaronder versies van Qwen en Google's Gemma. Het geheime sausje: een AI die de modellen ontwerpt, en uitkomt op een hybride van 20% transformers en 80% liquid networks. Hasani verwondert zich erover dat het brein op 20 watt draait: "We kunnen veel innovatiever zijn."
**Idee 4: Diffusie van Inception**
Inception, gevestigd in Palo Alto, genereert hele zinnen tegelijk met behulp van diffusie - de tech achter beeld- en videomodellen. Diffusie-LLMs, zoals Mercury 2, beweren GPT-4-prestaties te evenaren maar 10 keer sneller te zijn. Medeoprichter Stefano Ermon, een Stanford-onderzoeker, bedacht de wiskunde om diffusie met tekst te laten werken in
The Good Times
Nieuws in je inbox.
Een sardonische samenvatting, bezorgd op jouw schema. Gratis. Meld je af wanneer je wilt.
Al geabonneerd maar zie je ons nooit? Kijk in je spammap en klik op 'Geen spam' (of 'Verwijderen uit spam') om ons uit het ongewenste-mailvagevuur te bevrijden. Je helpt er iedereen mee.
Open je een maand lang geen van onze e-mails, dan word je automatisch van de lijst verwijderd.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.