De race om snellere AI-inferentie is losgebarsten, en de markten gaven Cerebras en zijn speciaal gebouwde chips een warm welkom bij zijn beursdebuut in mei. Maar de Franse startup Kog wedt dat er veel meer kracht te halen valt uit conventionele GPU's.

De startup haalde in mei de voorpagina van Hacker News met een tech-preview die moest bewijzen dat "extreem snelle single-request decoding mogelijk is op de standaard datacenter-GPU's die bedrijven al bezitten" - zoals de AMD MI300X en NVIDIA H200 GPU's die het voor zijn demo gebruikte.

Sommigen waren teleurgesteld dat dit niet gold voor de GPU's in onze laptops, maar anderen zagen het potentieel. Nu inferentiesnelheid en -kosten een kritieke bottleneck zijn, trok Kog's belofte om nieuwe mogelijkheden op bestaande hardware te ontsluiten met software-optimalisatie meer dan alleen toeschouwers. "We hadden 200 concrete zakelijke leads," vertelde CEO Gaël Delalleau aan TechCrunch.

Op basis van vroege feedback verwacht de solo-oprichter dat software-engineering het eerste gebruiksscenario zal zijn. Doorgewinterde Claude Code-gebruikers weten maar al te goed dat ze soms uren moeten wachten op resultaten. Anthropic zelf begrijpt dat snelheid geld waard is en rekent een prijsvermenigvuldiger voor Claude's Fast Mode.

Kog hoopt klanten aan te spreken die door die vertragingen worden afgeschrikt, meestal omdat ze voor professionele taken afhankelijk zijn van AI-workflows. Maar de startup heeft ook designpartners die gebruikers in staat stellen games en apps te genereren met een prompt, en voor wie een sneller resultaat dankzij de Kog Inference Engine (KIE) meer omzet zou betekenen, aldus Delalleau.

Het bedrijf beseft dat deze markt nog niet helemaal volwassen is. Terwijl het de vraag observeerde, leerde Kog dat zijn potentiële klanten niet bereid zijn om kleine modellen fijn te tunen. "En daarom zijn we sinds de lancering volledig gefocust op het versnellen van de ontwikkeling van grotere modellen om aan de vraag die we zien te voldoen."

Dit laat Kog met een enorme sprong om zijn belofte van "30x snellere LLM-inferentie" waar te maken. Zijn demo liet een indrukwekkende 3.000 tokens per seconde (TPS) per verzoek zien - maar met een speciaal gebouwd klein model met slechts zo'n 2 miljard parameters, het nu open-sourced Laneformer 2B.

In tegenstelling tot sceptici is Delalleau ervan overtuigd dat dezelfde aanpak net zo goed kan werken met LLM's, waarvan de grootte een uitdaging kan zijn voor inferentiechips. "GPU's hebben een mooie toekomst," zei hij. Voor Kog's CEO is het idee dat ze niet geschikt zijn voor decoding een misvatting geworden; nieuwere GPU's hebben steeds meer geheugenbandbreedte die erom smeekt om ontsloten te worden.

Kog is niet de enige die denkt dat software-optimalisatie GPU's meer kan laten doen dan op het doosje staat. ZML, ook uit Frankrijk, bracht hardware-agnostische software uit die Nvidia's CUDA omzeilt om snelle inferentie op concurrerende chips te ondersteunen. Maar Delalleau zei dat Kog meer verwant is aan het Hazy Research-lab van Stanford University, met een nog diepere focus op GPU-versnelling.

Delalleau zelf is geen onderzoeker, en zijn eerste startup, TechCrunch50 2009-alumnus Stribe, heeft niets te maken met zijn nieuwe - behalve zijn voormalige mede-oprichter die nu VC is, Kamel Zeroual, wiens bedrijf Varsity VC Kog's seed-ronde mede-leidde. Maar de diepgaande focus van de startup komt voort uit zijn unieke achtergrond.

Na het bestuderen van vastestoffysica aan de École Polytechnique in Frankrijk, ging hij aan de slag in offensieve cyberbeveiliging - ook wel white hat hacking genoemd. Volgens Delalleau heeft dit de mentaliteit gevormd die hij nu zijn team aanmoedigt om aan te nemen. Aan de wetenschappelijke kant is er "de mentaliteit om de wetten van de natuurkunde en de wetten van de GPU te begrijpen om er het maximale uit te halen."

Wat hacken betreft, zei de viervoudig finalist van DEF CON's CTF-toernooi dat het hem leerde "om dingen op een zeer laag niveau te reverse-engineeren - tot op assembly-taal en binaire code - om te begrijpen hoe het werkt, en om te proberen het te gebruiken om een doel te bereiken waarvoor het niet per se ontworpen was."

Het nadeel van deze aanpak is dat het zeer hands-on en tijdrovend is. "Voor elke nieuwe GPU zullen we enkele weken of zelfs maanden besteden om echt in de details te duiken en"