Гонка за более быстрым ИИ-инференсом продолжается, и рынки тепло встретили Cerebras и её специализированные чипы во время IPO в мае. Но французский стартап Kog ставит на то, что из обычных GPU можно выжать гораздо больше мощности.
Стартап попал на первую страницу Hacker News в мае с техническим превью, целью которого было доказать, что «чрезвычайно быстрая однозапросная декодировка возможна на стандартных дата-центровых GPU, которые уже есть у предприятий» — таких как AMD MI300X и NVIDIA H200, использованных в демонстрации.
Некоторые были разочарованы, узнав, что это не распространяется на GPU в наших ноутбуках, но другие увидели потенциал. Поскольку скорость и стоимость инференса сейчас являются критическим узким местом, обещание Kog разблокировать новые возможности на существующем оборудовании с помощью оптимизации программного обеспечения привлекло не только зевак. «У нас было 200 реальных бизнес-лидов», — сказал TechCrunch генеральный директор Гаэль Делалло.
Основываясь на ранних отзывах, основатель-одиночка ожидает, что первым вариантом использования будет разработка программного обеспечения. Опытные пользователи Claude Code хорошо знают, что иногда им приходится ждать часами, чтобы получить результаты. Сама Anthropic понимает, что скорость стоит денег, и взимает надбавку за быстрый режим Claude.
Kog надеется привлечь клиентов, которых отпугивают эти задержки, обычно потому, что они полагаются на ИИ-рабочие процессы для профессиональных задач. Но у стартапа также есть партнёры по дизайну, которые позволяют пользователям генерировать игры и приложения по запросу, и для которых более быстрый результат благодаря Kog Inference Engine (KIE) означал бы больше дохода, сказал Делалло.
Компания осознаёт, что этот рынок ещё не совсем зрелый. Наблюдая за спросом, Kog узнал, что его потенциальные клиенты не готовы дорабатывать маленькие модели. «И именно поэтому с момента запуска мы полностью сосредоточены на ускорении разработки более крупных моделей, чтобы удовлетворить спрос, который мы видим».
Это оставляет Kog огромный скачок, чтобы выполнить своё обещание «30-кратного ускорения инференса LLM». Его демонстрация показала впечатляющие 3000 токенов в секунду на запрос (TPS) — но с использованием специально созданной маленькой модели с всего лишь около 2 миллиардами параметров, ныне открытой Laneformer 2B.
Вопреки скептикам, Делалло уверен, что тот же подход может работать и с LLM, чей размер может быть проблемой для чипов инференса. «У GPU светлое будущее», — сказал он. Для генерального директора Kog идея о том, что они плохо подходят для декодирования, стала заблуждением; новые GPU имеют всё больше и больше пропускной способности памяти, которая только и ждёт, чтобы её разблокировали.
Kog не одинок в мысли, что оптимизация программного обеспечения может помочь GPU делать больше, чем написано на коробке. ZML, также из Франции, выпустил аппаратно-независимое программное обеспечение, которое обходит CUDA от Nvidia для поддержки быстрого инференса на конкурирующих чипах. Но Делалло сказал, что Kog больше похож на лабораторию Hazy Research из Стэнфорда, с ещё более глубоким уровнем фокуса на ускорении GPU.
Сам Делалло не исследователь, и его первый стартап, участник TechCrunch50 2009 года Stribe, не имеет ничего общего с его новым — кроме его бывшего сооснователя, ставшего венчурным инвестором Камеля Зеруаля, чья фирма Varsity VC была со-ведущим в посевном раунде Kog. Но глубокий уровень фокуса стартапа проистекает из его уникального прошлого.
Изучив физику твёрдого тела в парижской Политехнической школе, он перешёл к работе в наступательной кибербезопасности — также известной как белое хакерство. По словам Делалло, это сформировало мышление, которое он сейчас прививает своей команде. С научной стороны, «есть этот образ мышления — понимать законы физики и законы GPU, чтобы извлечь из них максимум».
Что касается хакерства, четырёхкратный финалист CTF-турнира DEF CON сказал, что это научило его «делать реверс-инжиниринг на очень низком уровне — вплоть до языка ассемблера и бинарного кода — чтобы понять, как это работает, и попытаться использовать это для достижения цели, для которой оно не обязательно было предназначено».
Обратная сторона такого подхода в том, что он очень практический и трудоёмкий. «Для каждого нового GPU мы будем тратить несколько недель или даже месяцев, чтобы действительно вникнуть в детали и