Kapplöpningen om snabbare AI-inferens är igång, och marknaderna gav Cerebras och dess specialbyggda chips ett varmt välkomnande vid börsdebuten i maj. Men den franska startupen Kog satsar på att det finns mycket mer kraft att pressa ur konventionella GPU:er.
Startupen hamnade på förstasidan av Hacker News i maj med en teknikförhandsvisning som syftade till att bevisa att "extremt snabb avkodning av enskilda förfrågningar är möjlig på de standarddatacenter-GPU:er som företag redan äger" – såsom AMD MI300X och NVIDIA H200 GPU:er som användes i demon.
Vissa blev besvikna över att detta inte gällde GPU:erna i våra bärbara datorer, men andra såg potentialen. Med inferenshastighet och kostnader nu som en kritisk flaskhals, lockade Kogs löfte om att låsa upp nya förmågor på befintlig hårdvara med programvaruoptimering fler än bara åskådare. "Vi hade 200 konkreta affärsleads", säger vd:n Gaël Delalleau till TechCrunch.
Baserat på tidig feedback förväntar sig grundaren att programvaruutveckling blir det första användningsområdet. Erfarna Claude Code-användare är väl medvetna om att de ibland måste vänta i timmar på resultat. Anthropic själv förstår att hastighet är värd pengar och tar ett högre pris för Claudes snabbläge.
Kog hoppas kunna nå kunder som avskräcks av dessa förseningar, vanligtvis för att de förlitar sig på AI-arbetsflöden för professionella uppgifter. Men startupen har också designpartners som låter användare generera spel och appar med en prompt, och för vilka ett snabbare resultat tack vare Kog Inference Engine (KIE) skulle innebära mer intäkter, säger Delalleau.
Företaget inser att marknaden ännu inte är helt mogen. Medan de observerade efterfrågan lärde sig Kog att dess potentiella kunder inte är beredda att finjustera små modeller. "Och det är därför vi sedan lanseringen helt fokuserat på att påskynda utvecklingen av större modeller för att möta den efterfrågan vi sett."
Detta lämnar Kog med ett stort steg att ta för att infria sitt löfte om "30x snabbare LLM-inferens". Demon visade imponerande 3 000 tokens per sekund (TPS) per förfrågan – men med en specialbyggd liten modell med endast cirka 2 miljarder parametrar, den nu öppna Laneformer 2B.
I motsats till skeptiker är Delalleau övertygad om att samma tillvägagångssätt kan fungera lika bra med LLM:er, vars storlek kan vara en utmaning för inferenschip. "GPU:er har en ljus framtid", säger han. För Kogs vd har idén att de inte är väl lämpade för avkodning blivit en missuppfattning; nyare GPU:er har mer och mer minnesbandbredd som bara ber om att låsas upp.
Kog är inte ensam om att tro att programvaruoptimering kan hjälpa GPU:er att göra mer än vad som står på lådan. ZML, också från Frankrike, släppte hårdvaruagnostisk programvara som kringgår Nvidias CUDA för att stödja snabb inferens på konkurrerande chips. Men Delalleau säger att Kog mer liknar Stanfords laboratorium Hazy Research, med ett ännu djupare fokus på GPU-acceleration.
Delalleau själv är inte forskare, och hans första startup, TechCrunch50 2009-alumnen Stribe, har inget med hans nya att göra – förutom hans tidigare medgrundare som blev VC, Kamel Zeroual, vars firma Varsity VC var med och ledde Kogs seed-runda. Men startupens djupgående fokus härrör från hans unika bakgrund.
Efter att ha studerat fasta tillståndets fysik vid Frankrikes École Polytechnique, gick han vidare till att arbeta med offensiv cybersäkerhet – även känt som white hat-hacking. Enligt Delalleau formade detta det tänkesätt som han nu uppmuntrar sitt team att anta. På vetenskapssidan, "det finns detta tänkesätt att förstå fysikens lagar, och GPU:ns lagar för att få ut det mesta av dem."
Vad gäller hackande, sa fyrafinalisten i DEF CON:s CTF-turnering att det lärde honom "att reverse-engineeringa saker på en mycket låg nivå – ända ner till assemblerspråk och binärkod – för att förstå hur det fungerar, och att försöka använda det för att uppnå ett mål som det inte nödvändigtvis var designat för."
Nackdelen med detta tillvägagångssätt är att det är mycket praktiskt och tidskrävande. "För varje ny GPU kommer vi att ägna flera veckor eller till och med månader åt att verkligen gräva i detaljerna och