Cursa pentru inferență AI mai rapidă este în plină desfășurare, iar piețele au primit cu căldură debutul la bursă al Cerebras și al cipurilor sale special construite în mai. Dar startup-ul francez Kog pariază că există mult mai multă putere de stoars din GPU-urile convenționale.
Startup-ul a ajuns pe prima pagină a Hacker News în mai cu o previzualizare tehnică menită să demonstreze că „decodarea extrem de rapidă a cererilor unice este posibilă pe GPU-urile standard din centrele de date pe care întreprinderile le dețin deja” - cum ar fi AMD MI300X și NVIDIA H200 pe care le-a folosit pentru demonstrație.
Unii au fost dezamăgiți să audă că acest lucru nu se extinde la GPU-urile din laptopurile noastre, dar alții au văzut potențialul. Cu viteza și costurile de inferență devenind un blocaj critic, promisiunea lui Kog de a debloca noi capacități pe hardware-ul existent prin optimizare software a atras mai mult decât privitori. „Am avut 200 de lead-uri de afaceri tangibile”, a declarat CEO-ul Gaël Delalleau pentru TechCrunch.
Pe baza feedback-ului timpuriu, fondatorul solo se așteaptă ca ingineria software să fie primul caz de utilizare. Utilizatorii veterani ai Claude Code știu bine că uneori trebuie să aștepte ore pentru rezultate. Anthropic însuși înțelege că viteza valorează bani și percepe un multiplu de preț pentru Modul Rapid al lui Claude.
Kog speră să vizeze clienții descurajați de aceste întârzieri, de obicei pentru că se bazează pe fluxuri de lucru AI pentru sarcini profesionale. Dar startup-ul are și parteneri de design care le permit utilizatorilor să genereze jocuri și aplicații cu un prompt, și pentru care un rezultat mai rapid datorită Kog Inference Engine (KIE) ar însemna mai multe venituri, a spus Delalleau.
Compania își dă seama că această piață nu este încă matură. În timp ce observa cererea, Kog a aflat că potențialii săi clienți nu sunt pregătiți să regleze fin modelele mici. „Și de aceea, de la lansare, ne-am concentrat complet pe accelerarea dezvoltării modelelor mai mari pentru a răspunde cererii pe care am văzut-o.”
Acest lucru îl lasă pe Kog cu un salt uriaș de făcut pentru a-și îndeplini promisiunea de „inferență LLM de 30 de ori mai rapidă”. Demonstrația sa a arătat un impresionant 3.000 de token-uri pe secundă (TPS) per cerere - dar cu un model mic special construit, cu doar aproximativ 2 miliarde de parametri, Laneformer 2B, acum open-source.
Contrazicând scepticii, Delalleau este încrezător că aceeași abordare poate funcționa la fel de bine cu LLM-urile, a căror dimensiune poate fi o provocare pentru cipurile de inferență. „GPU-urile au un viitor strălucit”, a spus el. Pentru CEO-ul Kog, ideea că nu sunt potrivite pentru decodare a devenit o concepție greșită; GPU-urile mai noi au din ce în ce mai multă lățime de bandă de memorie care doar așteaptă să fie deblocată.
Kog nu este singurul care crede că optimizarea software poate ajuta GPU-urile să facă mai mult decât scrie pe cutie. ZML, tot din Franța, a lansat software independent de hardware care ocolește CUDA de la Nvidia pentru a suporta inferență rapidă pe cipuri concurente. Dar Delalleau a spus că Kog este mai asemănător cu laboratorul Hazy Research de la Universitatea Stanford, cu un focus și mai profund pe accelerarea GPU.
Delalleau însuși nu este cercetător, iar primul său startup, Stribe, absolvent TechCrunch50 2009, nu are nimic de-a face cu noul său startup - în afară de fostul său cofondator devenit VC, Kamel Zeroual, a cărui firmă Varsity VC a co-condus runda seed a lui Kog. Dar focusul profund al startup-ului provine din experiența sa unică.
După ce a studiat fizica solidelor la École Polytechnique din Franța, a lucrat în securitate cibernetică ofensivă - cunoscută și sub numele de hacking white hat. Potrivit lui Delalleau, acest lucru i-a modelat mentalitatea pe care acum o încurajează în echipa sa. Pe partea științifică, „există această mentalitate de a înțelege legile fizicii și legile GPU-ului pentru a le folosi la maximum”.
Cât despre hacking, finalistul de patru ori la turneul CTF al DEF CON a spus că l-a învățat „să reverse-engineerez lucrurile la un nivel foarte scăzut - până la limbaj de asamblare și cod binar - pentru a înțelege cum funcționează și să încerc să-l folosesc pentru a atinge un scop pentru care nu a fost neapărat proiectat”.
Dezavantajul acestei abordări este că este foarte practică și consumatoare de timp. „Pentru fiecare GPU nou, vom dedica câteva săptămâni sau chiar luni pentru a ne scufunda în detalii și a