Startup Francesa Promete Inferência de IA 30x Mais Rápida, Por Que Comprar Novas GPUs Quando Você Pode Hackear as Que Já Tem?
A Kog afirma que pode tornar suas GPUs existentes 30x mais rápidas em inferência de IA, porque por que comprar hardware novo quando você pode fazer engenharia reversa do antigo?
A corrida por inferência de IA mais rápida está em andamento, e os mercados deram as boas-vindas à Cerebras e seus chips de propósito específico em sua estreia na IPO em maio. Mas a startup francesa Kog está apostando que há muito mais poder a ser extraído das GPUs convencionais.
A startup chegou à primeira página do Hacker News em maio com uma prévia técnica destinada a provar que "decodificação de solicitação única extremamente rápida é possível nas GPUs de datacenter padrão que as empresas já possuem" - como as AMD MI300X e NVIDIA H200 que usou em sua demonstração.
Alguns ficaram desapontados ao saber que isso não se estendia às GPUs de nossos laptops, mas outros viram o potencial. Com a velocidade e os custos de inferência agora sendo um gargalo crítico, a promessa da Kog de desbloquear novas capacidades em hardware existente com otimização de software atraiu mais do que curiosos. "Tivemos 200 leads de negócios tangíveis", disse o CEO Gaël Delalleau ao TechCrunch.
Com base no feedback inicial, o fundador solo espera que a engenharia de software seja o primeiro caso de uso. Veteranos do Claude Code sabem bem que às vezes têm que esperar horas para obter resultados. A própria Anthropic entende que velocidade vale dinheiro e cobra um múltiplo de preço pelo Modo Rápido do Claude.
A Kog espera atingir clientes desencorajados por esses atrasos, geralmente porque dependem de fluxos de trabalho de IA para tarefas profissionais. Mas a startup também tem parceiros de design que permitem que os usuários gerem jogos e aplicativos com um prompt, e para quem um resultado mais rápido graças ao Kog Inference Engine (KIE) significaria mais receita, disse Delalleau.
A empresa percebe que esse mercado ainda não está maduro. Ao observar a demanda, a Kog aprendeu que seus clientes em potencial não estão preparados para ajustar modelos pequenos. "E é por isso que desde o lançamento, estamos totalmente focados em acelerar o desenvolvimento de modelos maiores para atender à demanda que vimos."
Isso deixa a Kog com um salto enorme para cumprir sua promessa de "inferência de LLM 30x mais rápida". Sua demonstração mostrou impressionantes 3.000 tokens por segundo (TPS) por solicitação - mas com um modelo pequeno de propósito específico com apenas cerca de 2 bilhões de parâmetros, o agora open-source Laneformer 2B.
Contrariando os céticos, Delalleau está confiante de que a mesma abordagem pode funcionar igualmente bem com LLMs, cujo tamanho pode ser um desafio para chips de inferência. "As GPUs têm um futuro brilhante", disse ele. Para o CEO da Kog, a ideia de que elas não são adequadas para decodificação tornou-se um equívoco; GPUs mais novas têm cada vez mais largura de banda de memória que só pede para ser desbloqueada.
A Kog não está sozinha em pensar que a otimização de software pode ajudar as GPUs a fazer mais do que diz na caixa. A ZML, também da França, lançou software agnóstico de hardware que contorna a CUDA da Nvidia para suportar inferência rápida em chips concorrentes. Mas Delalleau disse que a Kog é mais parecida com o laboratório Hazy Research da Universidade de Stanford, com um foco ainda mais profundo em aceleração de GPU.
Delalleau não é pesquisador, e sua primeira startup, Stribe, ex-aluna do TechCrunch50 2009, não tem nada a ver com a nova - exceto por seu ex-cofundador que virou VC Kamel Zeroual, cuja firma Varsity VC co-liderou a rodada seed da Kog. Mas o foco profundo da startup vem de sua formação única.
Tendo estudado física do estado sólido na École Polytechnique da França, ele passou a trabalhar em segurança cibernética ofensiva - também conhecida como hacking de chapéu branco. Segundo Delalleau, isso moldou a mentalidade que ele agora incentiva sua equipe a adotar. No lado da ciência, "há essa mentalidade de entender as leis da física e as leis da GPU para aproveitá-las ao máximo".
Quanto ao hacking, o quatro vezes finalista do torneio CTF da DEF CON disse que isso o ensinou "a fazer engenharia reversa em um nível muito baixo - até linguagem assembly e código binário - para entender como funciona, e tentar usá-lo para alcançar um objetivo para o qual não foi necessariamente projetado".
O lado negativo dessa abordagem é que ela é muito prática e demorada. "Para cada nova GPU, dedicaremos várias semanas ou até meses para realmente nos aprofundarmos nos detalhes e"
The Good Times
Notícias na sua caixa.
Um resumo sardônico, entregue conforme sua agenda. Grátis. Cancele quando quiser.
Já está inscrito mas nunca chegamos à sua caixa de entrada? Veja a pasta de spam e clique em 'Não é spam' (ou 'Remover do spam') para nos tirar do purgatório do lixo eletrônico. De quebra, ajuda todo mundo.
Se você não abrir nenhum dos nossos e-mails por um mês, será removido automaticamente da lista.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.