Megakernels已死又重生:Cursor开源MoK引发推理工程之争
本期AI新闻聚焦推理工程领域关于Megakernels的激烈辩论,并报道Cursor开源其NVL72 MoE训练Megakernel,以及Qwen、NVIDIA、Mistral等多家公司发布新模型,展示推理效率与模型发布的快速演进。
[AINews] Megakernels已死又重生平静的一天让我们得以聚焦Cursor的发布和一场工程辩论昨天我们的推理工程大师班播客中,一部分内容涉及关于Megakernels的激烈讨论:megakernels已死为什么megakernels有用?
你花两个月时间编写一个内核,以节省启动开销和内核间重叠不佳的时间。
你有PDL,但后来人们说它并不完美,你仍然可以从落后的CTA中获得一些边际收益,因此——等等,抱歉,我忘了,Rubin解决了这个问题(内核二需要10个CTA,内核一有7个完成、3个落后,内核二启动其7个CTA)。
只要时间线足够长,一切都会趋于平衡。没有严肃的推理提供商会生产使用67k行代码的手工融合前向传播内核,而那些这样做的团队纯粹是出于研究目的。已死。完整讨论,供有兴趣者收听:Ali:融合内核救不了你。
比如在张量并行中,矩阵的一半在一个GPU上,另一半在另一个GPU上,如果下一步需要整个矩阵来执行非线性操作,例如,如果我在做注意力,我需要softmax,或者我需要做指数运算,我需要整行。
所以我需要知道GPU 2的部分结果和GPU 1的部分结果,才能在下一阶段执行softmax。
因此,即使我有融合内核,我也必须让它们相互通信,因为每个内核内部都有非线性。另外,对于megakernels,老实说,我非常看空。这是一个好的研究方向,直觉上、理论上似乎都不错。启动开销很大——只需一个内核——是的,只需不断融合并移动数据。
把所有东西都融合在一起。但内核复杂性本身使得编写一个高度优化的megakernel非常困难。非常困难。
不点名任何公司,但即使是那些从事融合megakernel的公司,或者我与之交谈过的人,他们通常最终不会在生产中运行这些内核,因为TensorRT-LLM和模块化内核启动更快,因为你可以优化每个单独的组件,并让它们相互并行化。
NVIDIA的一位技术主管在Twitter上发帖说:“我们正在揭开Rubin的面纱,这是规格。”第三条推文显示,不过不要太技术化,我还需要多读一些,但该GPU的设计方式扼杀了megakernels。
所以似乎整个研究领域不会继续了。他引用了(节目的朋友!
)Kyle Kranen宣布依赖触发器——这是先前证明内核融合合理性的管道阻塞的一部分:正如节目中所说,仍有一些物理限制尚未解决,但NVIDIA更新Rubin设计以更好地适应内核领域正在进行的可怕事情,这完全合理。
Ben Spector的megakernel合著者之一Stuart Sul现在领导着发布Mixture of Kittens(参考Ben的令人愉悦的ThunderKittens,也是Dan Fu团队的一部分)的团队,以及Cursor今天的开源megakernel:
头条结果引人注目——每秒总token数增加41%。在规模上,这意味着节省数十亿美元。2026年8月3日至2026年8月4日的AI新闻。我们检查了12个subreddits、544个Twitter账号,没有进一步的Discords。
AINews的网站允许您搜索所有过往期刊。提醒您,AINews现在是Latent Space的一部分。您可以选择加入/退出电子邮件频率!
AI Twitter回顾前沿模型发布:Qwen 3.8-Max、Alpamayo 2 Super、Pokee-Isaac、Maple-Preview和ShieldstralQwen的发布节奏继续跨模态推进:@Alibaba_Qwen推出了Qwen3.8-Max,
称其“更好更便宜”,并迅速通过Hermes Agent、Nous Research和ClinePass将其推入智能体生态系统。在视觉方面,@skalskip92强调了Qwen3.
8-Max的框条件检测行为,对于难以描述的概念,单个框报告60% mAP,多个框报告80% mAP;Qwen的图像栈也有所提升,@arena和@Alibaba_Qwen指出Qwen-Image-3.0-Pro在Text-to-Image Arena中达到第5名。
NVIDIA和Mistral都倾向于可部署的专门化:@JensenHuang推出了Alpamayo 2 Super,用于AV推理,并采用商业用途的开放发布条款,而@MistralAI推出了Shieldstral,一个3B开放权重安全模型,专为设备端审核/分类设计。
@vllm_project提供了第0天服务支持,并强调了一步前向安全评分、多模态输入、12种语言和32k上下文。
长上下文和高效权重实验加速:@Pokee_AI发布了Pokee-Isaac 28B,声称拥有10M token上下文,在10M时RULER为93.3%,并且从RTX 4090开始可单GPU部署;
该模型据说在vLLM和SGLang中也有第0天支持。与此同时,@deepgrove_ai推出了Maple-Preview,一个开源20B-A1B三元权重推理模型,据说在Mac Mini M4上以200+ tok/s运行,并在其权重级别中优于其他模型。
这两个发布都指向一个日益增长的分化:不仅是更大的前沿模型,还有对上下文架构和低位/三元效率的积极探索。
推理经济学、路由和内核/服务基础设施定价压力现在正在改变产品设计:@thsottiaux对Luna的永久重新定价立即引发了关于常驻辅助工作负载的讨论;@theo将Luna描述为便宜到几乎可以在每个提示词上启动以生成元数据/状态。
与此同时,几篇帖子强调了DeepSeek-V4-Flash在价格上的主导地位:@kimmonismus、@AndrewCurran_、@ollama和@EpochAIResearch都强化了开放(权重)或准开放服务经济现在具有足够竞争力以塑造技术栈选择的观点,
特别是对于高容量智能体工作流。路由正在成为一流的系统问题:@tomas_hk推出了Not Diamond Code,一个用于长时程编码智能体的路由器,每一步选择模型和推理努力,声称在不损失质量的情况下降低20-65%的成本。
类似主题出现在@cognition中,Devin Fusion在FrontierCode 1.1上智能度提高4%,成本降低27%,得益于框架/模型改进;
@togethercompute报告称,在DeepSWE上,具有测试套件验证的Kimi优先级联以更低成本优于单独的Sol。基础设施层变得更有深度:@cursor_ai开源了MoK,其NVL72 MoE训练megakernel,这是当天训练系统中最具体的性能声明。
@ArtificialAnlys添加了新的端点准确性指数,基准测试无服务器端点相对于自托管参考部署保留了多少准确性;一个实际要点是,输出token限制和工具调用格式差异会显著降低端点质量。
在服务方面,@kimmonismus强调Celeris-1在Artificial Analysis速度排名中位居榜首,约2,086 tok/s,同时在商用GPU上保持75.9%的MMLU-Pro范围,@vllm_project提醒工程师,
原生Transformers模型现在可以无需自定义集成即可加载到vLLM中。
智能体框架、自我改进循环和生产智能体工具框架内的训练正在变得正常而非新颖:@liquidai将LFM2.5-2.6B描述为通过真实智能体框架进行后训练——SFT、专家专业化、多领域on-policy蒸馏,以及使用Pi、
Hermes Agent和OpenClaw的智能体RL,每次rollout都有沙箱和结果奖励。随后,@maximelabonne、@nicodotdev、@OsaurusAI等人将该模型定位为本地/后台工作流的真正可用的小型智能体模型。
框架设计越来越被视为主要的效率杠杆