더 빠른 AI 추론을 위한 경쟁이 한창이며, 시장은 5월 기업공개(IPO) 데뷔에서 Cerebras와 그 특수 제작 칩을 따뜻하게 환영했다. 그러나 프랑스 스타트업 Kog는 기존 GPU에서 더 많은 성능을 짜낼 수 있다고 베팅하고 있다.

이 스타트업은 5월 Hacker News 첫 페이지에 기술 미리보기로 등장했는데, 이는 "기업이 이미 보유한 표준 데이터센터 GPU에서 매우 빠른 단일 요청 디코딩이 가능하다"는 것을 증명하는 데 목적을 두었다. 데모에 사용된 AMD MI300X 및 NVIDIA H200 GPU와 같은 것들이다.

일부는 이것이 우리 노트북의 GPU에는 적용되지 않는다는 소식에 실망했지만, 다른 이들은 잠재력을 보았다. 추론 속도와 비용이 중요한 병목이 된 지금, Kog가 기존 하드웨어에서 소프트웨어 최적화로 새로운 기능을 잠금 해제하겠다는 약속은 구경꾼 이상을 끌어모았다. CEO Gaël Delalleau는 TechCrunch에 "실질적인 비즈니스 리드가 200개나 있었다"고 말했다.

초기 피드백에 따르면, 단독 창업자는 소프트웨어 엔지니어링이 첫 번째 사용 사례가 될 것으로 기대한다. 베테랑 Claude Code 사용자들은 결과를 얻기 위해 때때로 몇 시간을 기다려야 한다는 것을 잘 알고 있다. Anthropic 자체도 속도가 돈이라는 것을 이해하고 있으며, Claude의 Fast Mode에 대해 가격 배수를 부과한다.

Kog는 이러한 지연에 실망한 고객을 대상으로 하기를 희망하며, 보통 전문 작업을 위해 AI 워크플로우에 의존하는 사람들이다. 그러나 이 스타트업은 또한 사용자가 프롬프트로 게임과 앱을 생성할 수 있게 해주는 디자인 파트너를 보유하고 있으며, Kog Inference Engine(KIE) 덕분에 더 빠른 결과가 더 많은 수익을 의미할 것이라고 Delalleau는 말했다.

회사는 이 시장이 아직 성숙하지 않다는 것을 알고 있다. 수요를 관찰하는 동안 Kog는 잠재 고객이 소형 모델을 미세 조정할 준비가 되어 있지 않다는 것을 배웠다. "그래서 출시 이후로 우리가 본 수요를 충족시키기 위해 대형 모델 개발을 가속화하는 데 완전히 집중해 왔다."

이것은 Kog가 "30배 빠른 LLM 추론"이라는 약속을 이행하기 위해 큰 도약을 해야 한다는 것을 남긴다. 데모에서는 요청당 초당 3,000토큰(TPS)이라는 인상적인 성능을 보여주었지만, 약 20억 파라미터의 특수 제작 소형 모델(현재 오픈 소스화된 Laneformer 2B)을 사용했다.

회의론자들과 반대로, Delalleau는 동일한 접근 방식이 LLM에서도 잘 작동할 수 있다고 확신하며, LLM의 크기는 추론 칩에 도전이 될 수 있다. "GPU는 밝은 미래가 있다"고 그는 말했다. Kog CEO에게 GPU가 디코딩에 적합하지 않다는 생각은 잘못된 개념이 되었다. 최신 GPU는 점점 더 많은 메모리 대역폭을 갖추고 있으며, 이는 잠금 해제되기를 기다리고 있다.

소프트웨어 최적화가 GPU가 상자에 적힌 것보다 더 많은 일을 할 수 있게 도울 수 있다고 생각하는 것은 Kog만이 아니다. 프랑스의 ZML도 Nvidia의 CUDA를 우회하여 경쟁 칩에서 빠른 추론을 지원하는 하드웨어에 구애받지 않는 소프트웨어를 출시했다. 그러나 Delalleau는 Kog가 스탠포드 대학의 Hazy Research 연구소와 더 유사하며, GPU 가속화에 더 깊은 수준으로 초점을 맞추고 있다고 말했다.

Delalleau 자신은 연구원이 아니며, 그의 첫 스타트업인 TechCrunch50 2009 졸업생 Stribe는 그의 새 스타트업과 아무 관련이 없다. 전 공동 창업자이자 VC가 된 Kamel Zeroual이 그의 회사 Varsity VC가 Kog의 시드 라운드를 공동 주도했다는 점을 제외하고. 그러나 스타트업의 깊은 수준의 초점은 그의 독특한 배경에서 비롯된다.

프랑스의 École Polytechnique에서 고체 물리학을 공부한 후, 그는 공격적 사이버 보안(일명 화이트햇 해킹) 분야에서 일했다. Delalleau에 따르면, 이것이 그가 팀이 채택하도록 장려하는 사고방식을 형성했다. 과학 측면에서 "물리 법칙과 GPU의 법칙을 이해하여 최대한 활용하려는 사고방식이 있다."

해킹에 관해서는, DEF CON의 CTF 토너먼트에서 4회 결선 진출자인 그는 "어셈블리 언어와 바이너리 코드 수준까지 매우 낮은 수준에서 리버스 엔지니어링하여 그것이 어떻게 작동하는지 이해하고, 원래 설계되지 않은 목표를 달성하기 위해 그것을 사용하려고 시도하는 것"을 배웠다고 말했다.

이 접근 방식의 단점은 매우 실습적이고 시간이 많이 걸린다는 것이다. "새 GPU마다 몇 주 또는 몇 달을 할애하여 세부 사항을 파고들 것이다."