Kog深挖GPU潜力,以软件优化实现更快推理
法国初创公司Kog致力于通过软件优化在现有数据中心GPU上实现极速推理,其技术预览展示了每秒3000 token的解码速度,并计划在9月前将大型模型推理速度提升10倍,以吸引企业客户并推动融资。
更快的人工智能推理竞赛正在进行,Cerebras及其专用芯片在5月首次公开募股时受到市场热烈欢迎。但法国初创公司Kog押注,传统GPU仍有大量性能可挖掘。
该公司于5月登上Hacker News头版,发布技术预览,旨在证明“在企业已拥有的标准数据中心GPU上,可以实现极快的单请求解码”——其演示使用了AMD MI300X和NVIDIA H200 GPU。
有人失望地发现这并不适用于笔记本电脑中的GPU,但其他人看到了潜力。随着推理速度和成本成为关键瓶颈,Kog承诺通过软件优化在现有硬件上解锁新能力,吸引了众多关注者。“我们有200个切实的商业线索,”首席执行官Gaël Delalleau告诉TechCrunch。
基于早期反馈,这位独立创始人预计软件工程将是首个用例。资深Claude Code用户深知,有时需等待数小时才能获得结果。Anthropic自身也明白速度的价值,对Claude的快速模式收取更高费用。
Kog希望吸引那些因延迟而却步的客户,这些客户通常依赖AI工作流处理专业任务。
Delalleau表示,公司还有设计合作伙伴,允许用户通过提示词生成游戏和应用,对他们而言,Kog推理引擎(KIE)带来的更快结果意味着更多收入。公司意识到这一市场尚未成熟。在观察需求时,Kog发现潜在客户不愿微调小型模型。
“因此自发布以来,我们一直专注于加速大型模型的开发,以满足我们看到的需求。”这使得Kog在兑现“30倍更快LLM推理”的承诺上面临巨大跨越。
其演示显示了令人印象深刻的每秒3000 token(TPS)——但使用的是仅约20亿参数的专用小模型,即现已开源的Laneformer 2B。与怀疑者相反,Delalleau确信同样的方法也适用于LLM,尽管其规模对推理芯片构成挑战。
“GPU前景光明,”他说。对Kog CEO而言,认为GPU不适合解码已成为误解;新一代GPU拥有越来越多的内存带宽,亟待解锁。Kog并非唯一认为软件优化能让GPU超越标称性能的公司。
同样来自法国的ZML发布了与硬件无关的软件,绕过Nvidia的CUDA,支持跨竞争芯片的快速推理。
但Delalleau表示,Kog更类似于斯坦福大学的Hazy Research实验室,但更深入地聚焦GPU加速。
Delalleau本人并非研究员,他的第一家初创公司Stribe(TechCrunch50 2009校友)与现在这家无关——除了他的前联合创始人、现风险投资人Kamel Zeroual,其公司Varsity VC共同领投了Kog的种子轮。
但这家初创公司的深度聚焦源于他独特的背景。他在法国巴黎综合理工学院学习固态物理,之后从事攻击性网络安全(即白帽黑客)工作。据Delalleau称,这塑造了他现在鼓励团队采用的心态。在科学方面,“有一种理解物理定律和GPU定律的心态,以便充分利用它们。
”至于黑客技术,这位四次进入DEF CON CTF锦标赛决赛的选手表示,这教会了他“在极低层次上逆向工程——直至汇编语言和二进制代码——以理解其工作原理,并尝试用它实现并非其设计初衷的目标。”这种方法的缺点是极其耗时且需要亲力亲为。
“对于每款新GPU,我们会投入数周甚至数月,深入细节并对该硬件进行GPU工程研究。”团队仅11人,这限制了Kog能支持的芯片数量,至少在可预见的未来如此。
长远来看,Kog希望将其方法融入基于智能体的流水线,从而支持更多芯片和模型。随着欧洲在这两方面寻求自建能力,这可能为这家初创公司带来主权顺风,该公司已获得Scaleway支持,并得到法国Bpifrance和French Tech 2030计划资助。
不过,目前Kog需要向世界证明其方法适用于LLM。这也是获得更多资金的关键。“一旦我们以10倍速度实现首个主要模型(我认为将在9月),我们将能开始展示客户吸引力,并由此进行A轮融资,”Delalleau说。