2017 yazında Google araştırmacıları, transformeri tanıtan 'Attention Is All You Need' adlı bir makale yayınladılar - uzun metin dizilerini işlemede olağanüstü başarılı olduğu ortaya çıkan bir sinir ağı. Dokuz yıl sonra transformatörler, her büyük dil modelinin (LLM) içindeki motor durumunda. 'Tüm yapay zeka endüstrisi transformatörler üzerine inşa edildi' diyor AI start-up'ı Subquadratic'in CEO'su Justin Dangel ve bunları bilgisayar bilimi tarihindeki en önemli yeniliklerden biri olarak nitelendiriyor. Ama en büyük hitler bile bir süre sonra yorulmaya başlar.

Transformatörler yaşlanıyor. Son LLM gelişmeleri - kendilerine notlar alan ve büyük girdileri işleyen akıl yürütme modelleri gibi - çekirdek teknolojinin düzgün uzantıları değil; temel kusurların üzerine bantla yapıştırılmış yamalar. Bu yüzden büyüyen bir bilim insanı ve mühendis grubu şunu soruyor: sırada ne var? LLM'ler hiçbir yere gitmiyor, ancak nasıl inşa edildikleri tartışmaya açık. MIT Technology Review bu gelecek nesli 'LLM+' olarak adlandırdı ve bir start-up dalgası bu patlama yaşayan teknolojinin sınırlarını zorlamak umuduyla içeri giriyor. Bazıları başarısız olacak, ancak oynayacakları her şey var ve bugünün öncülerinden çok daha az kaybedecekleri var.

Önce sorun. Transformatörler, her kelimeyi (veya tokeni) diğer her kelimeyle çarpma yoluyla karşılaştıran yoğun dikkate dayanır. Anlamı zekice yakalar, ancak hesaplama ölçeği berbat: 10.000 kelimelik bir belge 50 milyon çarpma gerektirebilir. Bu yüzden LLM'ler bu kadar çok güç tüketiyor. OpenAI başkanı Greg Brockman, şirketin bu yıl bilgi işleme 50 milyar dolar harcayacağını söylüyor ve Uluslararası Enerji Ajansı, veri merkezi elektrik kullanımının 2030'a kadar ikiye katlanacağını tahmin ediyor. Transformatörler ayrıca büyük bağlam pencereleriyle - bir kütüphaneyi, kod tabanını veya ajan çıktılarını takip etmek - ve akıl yürütme modelleri eklenecek daha fazla veri ekliyor. LLM'ler büyüdükçe transformatörler bir darboğaz haline geliyor.

İşte bunu düzeltmek için dört çılgın fikir.

**Fikir 1: Subquadratic Tarzı Seyrek Dikkat**

Miami merkezli Subquadratic, anlamı kaybetmeden tüm kelime çiftlerini değil yalnızca bazılarını hesaplayan seyrek dikkati çözdüğünü iddia ediyor. Modeli SubQ, arama ve kodlama görevlerinde en iyi LLM'lerle rekabet ettiği iddia ediliyor. Şüpheciler var, ancak binlerce kişi bekleme listesine katıldı. Şirket, hangi kelimelerin önemli olduğunu anında belirlediğini söylüyor ve yakında geniş bir sürüm planlıyor.

**Fikir 2: Manifest AI'dan Güç Tutma**

San Francisco merkezli Manifest AI, dikkat yerine 'güç tutma'yı kullanıyor; bu, yalnızca en alakalı bilgileri saklıyor ve bağlam penceresinin kayan bir özetini sağlıyor, yeni veriler geldikçe daha az alakalı bitleri düşürüyor. Konsept on yıllık, ancak Manifest sonunda transformatörlerle rekabetçi olduğunu iddia ediyor. Açık kaynak kodlu LLM StarCoder'ı PowerCoder'a dönüştürdü ve Alibaba'nın Qwen'iyle rekabet ettiğini söylediği Brumby'yi yayınladı. Kurucu ortak Carles Gelada, saatlerce süren videoları analiz etmekten haftalarca görevde kalan ajanlara kadar uygulamalar görüyor.

**Fikir 3: Liquid AI'dan Sıvı Sinir Ağları**

MIT'den çıkan Liquid AI, 'sıvı temel modelleri' (LFM'ler) oluşturmak için transformatörleri solucan beyinlerinden ilham alan sıvı sinir ağlarıyla birleştiriyor. Bunlar çok daha küçük ve enerji açısından daha verimli; 50 dolarlık bir Raspberry Pi'de çalışıyor. Yıllık geliri 10 milyon doların altında olan kuruluşlar için ücretsizler ve CEO Ramin Hasani'ye göre yaklaşık 34 milyon indirme topladılar. Modeller, Qwen ve Google'ın Gemma'sının sürümleri de dahil olmak üzere dört kat daha büyük rakiplerle eşleşiyor. Sırrı: modelleri tasarlayan, %20 transformatör ve %80 sıvı ağ hibritine karar veren bir yapay zeka. Hasani, beynin 20 watt ile çalıştığını hayretle karşılıyor: 'Çok daha yenilikçi olabiliriz.'

**Fikir 4: Inception'dan Difüzyon**

Palo Alto merkezli Inception, görüntü ve video modellerinin arkasındaki teknoloji olan difüzyonu kullanarak aynı anda tüm cümleleri üretiyor. Mercury 2 gibi Difüzyon LLM'leri, GPT-4 performansıyla eşleştiğini ancak 10 kat daha hızlı olduğunu iddia ediyor. Stanford araştırmacısı kurucu ortak Stefano Ermon, difüzyonun metinle çalışmasını sağlayan matematiği çözdü.