AI推理速度的竞赛正在如火如荼地进行,市场在5月对Cerebras及其专用芯片的IPO首秀给予了热烈欢迎。但法国初创公司Kog却押注,传统GPU中还有更多性能可以挖掘。

这家初创公司在5月登上了Hacker News的头版,发布了一项技术预览,旨在证明“在标准数据中心GPU上实现极快的单请求解码是可能的”——例如其演示中使用的AMD MI300X和NVIDIA H200 GPU。

有些人失望地发现这并不适用于我们笔记本电脑中的GPU,但其他人看到了潜力。随着推理速度和成本成为关键瓶颈,Kog承诺通过软件优化解锁现有硬件的新能力,吸引了不仅仅是旁观者。“我们有200个切实的商业线索,”首席执行官Gaël Delalleau告诉TechCrunch。

基于早期反馈,这位独立创始人预计软件工程将是第一个用例。资深Claude Code用户深知,有时他们需要等待数小时才能获得结果。Anthropic自己也明白速度的价值,并为Claude的快速模式收取额外费用。

Kog希望瞄准那些因延迟而望而却步的客户,这些客户通常依赖AI工作流处理专业任务。但这家初创公司也有设计合作伙伴,允许用户通过提示生成游戏和应用,而Kog推理引擎(KIE)带来的更快结果意味着更多收入,Delalleau说。

该公司意识到这个市场尚未完全成熟。在观察需求的同时,Kog了解到其潜在客户并不准备微调小型模型。“这就是为什么自发布以来,我们一直专注于加速大型模型的开发,以满足我们看到的需求。”

这使得Kog要实现“30倍更快的LLM推理”的承诺还有巨大飞跃。其演示显示了令人印象深刻的每秒3000个请求令牌(TPS)——但使用的是仅有约20亿参数的小型专用模型,即现已开源的Laneformer 2B。

与怀疑者相反,Delalleau确信同样的方法同样适用于LLM,尽管其规模可能对推理芯片构成挑战。“GPU前景光明,”他说。对于Kog的首席执行官来说,认为GPU不适合解码的想法已成为一种误解;新一代GPU拥有越来越多的内存带宽,只待解锁。

并非只有Kog认为软件优化可以帮助GPU发挥超出其规格的性能。同样来自法国的ZML发布了与硬件无关的软件,绕过Nvidia的CUDA,支持跨竞争芯片的快速推理。但Delalleau表示,Kog更类似于斯坦福大学的Hazy Research实验室,专注于更深入的GPU加速。

Delalleau本人并非研究员,他的第一家初创公司Stribe(TechCrunch50 2009校友)与他的新公司无关——除了他的前联合创始人转为风投资本家的Kamel Zeroual,其公司Varsity VC共同领投了Kog的种子轮。但这家初创公司的深层专注源于他独特的背景。

他在法国巴黎综合理工学院学习固态物理学,之后从事进攻性网络安全工作——也称为白帽黑客。据Delalleau说,这塑造了他现在鼓励团队采用的心态。在科学方面,“有一种理解物理定律和GPU定律的心态,以便充分利用它们。”

至于黑客技术,这位DEF CON CTF锦标赛的四次决赛选手说,这教会了他“在非常低的层面上逆向工程——深入到汇编语言和二进制代码——以理解其工作原理,并尝试用它来实现一个并非为其设计的目标。”

这种方法的缺点是它非常动手且耗时。“对于每一款新GPU,我们都会投入数周甚至数月的时间,深入挖掘细节并……