Wyścig o szybszą inferencję AI trwa, a rynki ciepło przyjęły Cerebras i jego specjalnie zaprojektowane chipy podczas debiutu giełdowego w maju. Ale francuski startup Kog stawia na to, że z konwencjonalnych procesorów graficznych można wycisnąć znacznie więcej mocy.

Startup trafił na pierwszą stronę Hacker News w maju z zapowiedzią techniczną, mającą na celu udowodnienie, że „niezwykle szybkie dekodowanie pojedynczych żądań jest możliwe na standardowych procesorach graficznych w centrach danych, które przedsiębiorstwa już posiadają” – takich jak AMD MI300X i NVIDIA H200, których użyto w demonstracji.

Niektórzy byli rozczarowani, że nie dotyczy to procesorów graficznych w naszych laptopach, ale inni dostrzegli potencjał. Ponieważ szybkość i koszty inferencji stały się krytycznym wąskim gardłem, obietnica Kog dotycząca odblokowania nowych możliwości na istniejącym sprzęcie dzięki optymalizacji oprogramowania przyciągnęła więcej niż tylko gapiów. „Mieliśmy 200 konkretnych leadów biznesowych” – powiedział TechCrunch CEO Gaël Delalleau.

Na podstawie wczesnych opinii, samotny założyciel spodziewa się, że inżynieria oprogramowania będzie pierwszym przypadkiem użycia. Doświadczeni użytkownicy Claude Code doskonale wiedzą, że czasami muszą czekać godzinami na wyniki. Sam Anthropic rozumie, że szybkość jest warta pieniędzy i pobiera wyższą cenę za tryb szybki Claude.

Kog ma nadzieję dotrzeć do klientów zniechęconych tymi opóźnieniami, zwykle dlatego, że polegają na przepływach pracy AI w zadaniach zawodowych. Ale startup ma również partnerów projektowych, którzy pozwalają użytkownikom generować gry i aplikacje za pomocą podpowiedzi, a dla których szybszy wynik dzięki Kog Inference Engine (KIE) oznaczałby większe przychody – powiedział Delalleau.

Firma zdaje sobie sprawę, że ten rynek nie jest jeszcze w pełni dojrzały. Obserwując popyt, Kog dowiedział się, że potencjalni klienci nie są gotowi do dostrajania małych modeli. „I dlatego od czasu premiery w pełni skupiliśmy się na przyspieszaniu rozwoju większych modeli, aby sprostać obserwowanemu popytowi”.

To pozostawia Kogowi ogromny skok do wykonania, aby spełnić obietnicę „30x szybszej inferencji dużych modeli językowych”. Jego demo pokazało imponujące 3000 tokenów na sekundę (TPS) na żądanie – ale z celowo zbudowanym małym modelem o zaledwie około 2 miliardach parametrów, obecnie open-source'owym Laneformer 2B.

Zaprzeczając sceptykom, Delalleau jest pewny, że to samo podejście może działać równie dobrze w przypadku dużych modeli językowych, których rozmiar może być wyzwaniem dla chipów inferencyjnych. „GPU mają świetlaną przyszłość” – powiedział. Dla CEO Kog, przekonanie, że nie nadają się one do dekodowania, stało się błędnym przekonaniem; nowsze GPU mają coraz więcej przepustowości pamięci, która tylko czeka na odblokowanie.

Kog nie jest jedynym, który uważa, że optymalizacja oprogramowania może pomóc GPU zrobić więcej, niż mówi specyfikacja. ZML, również z Francji, wypuściło oprogramowanie niezależne od sprzętu, które omija CUDA Nvidii, aby wspierać szybką inferencję na konkurencyjnych chipach. Ale Delalleau powiedział, że Kog jest bardziej podobny do laboratorium Hazy Research ze Stanford, z jeszcze głębszym skupieniem na akceleracji GPU.

Sam Delalleau nie jest naukowcem, a jego pierwszy startup, Stribe z TechCrunch50 2009, nie ma nic wspólnego z nowym – poza jego byłym współzałożycielem, który został VC, Kam elem Zeroual, którego firma Varsity VC współprowadziła rundę seedową Kog. Ale głębokie skupienie startupu wynika z jego unikalnego doświadczenia.

Po studiach z fizyki ciała stałego na francuskiej École Polytechnique, pracował w cyberbezpieczeństwie ofensywnym – znanym również jako white hat hacking. Według Delalleau, ukształtowało to sposób myślenia, który teraz zachęca swój zespół do przyjęcia. Po stronie naukowej „istnieje sposób myślenia polegający na zrozumieniu praw fizyki i praw GPU, aby w pełni je wykorzystać”.

Jeśli chodzi o hacking, czterokrotny finalista turnieju CTF DEF CON powiedział, że nauczyło go to „reverse-engineeringu na bardzo niskim poziomie – aż do języka asemblera i kodu binarnego – aby zrozumieć, jak to działa, i spróbować użyć tego do osiągnięcia celu, do którego niekoniecznie było zaprojektowane”.

Minusem tego podejścia jest to, że jest bardzo praktyczne i czasochłonne. „Dla każdego nowego GPU poświęcimy kilka tygodni, a nawet miesięcy, aby naprawdę zagłębić się w szczegóły i