AI 见闻
精选· 重要性 4/5

Modal CTO:AI基础设施必须从开发者体验转向智能体体验

Latent Space (Swyx)··约 8 分钟阅读
中文导读

Modal 完成 3.55 亿美元 C 轮融资,其 CTO 阐述为何传统云基础设施不适合 AI 工作负载,以及平台如何从开发者体验转向智能体体验。

我们一直在运行一个 Agent Cloud 系列,调查所有顶级的推理/算力/云提供商,从 Databricks 到 Daytona 再到 Railway,甚至更早的 E2B。

但我们很高兴以 Modal 作为该系列的结尾——Modal 刚刚完成了 3.55 亿美元的巨额 C 轮融资。云是为开发者构建的,但智能体正在改变这一切。旧的基础设施栈是为人类设计的:他们能阅读文档、通过 YAML 进行推理、理解仪表盘,并在出问题时找出需要什么。

虽然这对开发者来说很痛苦,但它是有效的,因为人类可以在头脑中填补缺失的上下文。然而,智能体没有这种奢侈。在这个智能体的新时代,一切都必须更加紧密。智能体需要一个地方来编写代码、运行代码、检查输出、更改环境、调试失败并重试。

快速迭代和反馈循环,并附带所有必要的上下文,对于智能体的正常运行至关重要。此外,沙箱清晰地体现了这一转变——智能体可以轻松地启动隔离环境。

这种可编程的基础设施甚至延伸到了研究领域:两年前,我们是最早报道 Modal 的媒体之一,当时 CEO Erik Bernhardsson 和 Alessio 为我们设计了有史以来最喜欢的 Latent Space 缩略图:那时,Modal 还只是一家很小的公司,

A 轮融资仅 1700 万美元。

如今,刚刚完成 3.55 亿美元 C 轮融资的 Modal,是实时构建智能体云未来的最清晰范例之一:一个超越传统 Web 应用假设、转向 AI 实际创造的工作负载的云平台——例如弹性推理、沙箱、GPU 突发、后训练、后台智能体,以及智能体自身可以操作的基础设施。

在本期节目中,Modal CTO Akshat Bubna 与 swyx 和 Vibhu 一起探讨:为什么 AI 应用不符合传统的云假设,为什么 Kubernetes 从未为突发性、计算密集型工作负载而设计,以及为什么 Modal 现在正从开发者体验转向智能体体验。

我们深入探讨了 Modal 的 AI 基础设施栈:无服务器函数、基于装饰器的基础设施、自定义模型的弹性推理、GPU 快照、DeFlash、推测解码、自动端点、沙箱、持久存储、网络容器、私有 IPv6、RDMA、多节点训练,以及 Modal 跨越 17 个云提供商的容量池。

Akshat 还解释了为什么 RL 部署可能需要 10 万个沙箱,为什么生产级智能体需要硬性护栏,为什么可观测性可能比阅读代码更重要,以及为什么 AI 让基础设施再次变得令人兴奋。

我们讨论了:为什么 Kubernetes 不是为突发性 AI 工作负载而构建的Modal 如何在成为 AI 云之前,

从一个更好的运行时起步为什么 Modal 在 ChatGPT 之前就添加了 GPU从开发者体验到智能体体验的转变为什么当智能体编写代码时可观测性很重要针对音频、

视频、机器人和计算生物学的自定义模型的弹性推理GPU 快照、冷启动,以及为什么推理工作负载如此突发为什么 RL 部署可能需要 10 万个沙箱DeFlash、推测解码和前沿级推理性能自动端点以及让优化推理更易于部署Modal 在 vLLM、

SGLang 和裸 GPU 租赁之外还提供了什么Modal 的 17 云容量池和超级云战略网络沙箱、

边车、私有 IPv6 和 RDMA用于后训练和研究工作负载的无服务器多节点训练自动研究、模型引导的扫描和智能体启动 GPU 实验算力策略、容量规划和批处理层级为什么生产级智能体需要专门的沙箱和硬性护栏Modal 对托管智能体、CI、Gitpod/Ona、Python、

TypeScript 和 Modal Bench 的看法Akshat BubnaModal网站:https://modal.com

时间戳00:00:00 介绍00:00:39 Modal 的起源以及为什么 Kubernetes 不够用00:04:32 开发者体验 → 智能体体验00:06:21 Modal 的 AI 云原语00:09:14 沙箱、智能体循环和原始认知00:12:12 弹性推理、

GPU 快照和 10 万个沙箱00:

15:24 DeFlash、推测解码和自动端点00:19:59 超越裸 GPU 的生产级推理00:22:00 后台智能体、Ramp Inspect 和智能体生命周期00:24:08 Modal 的 17 云超级云战略00:26:40 网络沙箱、

私有 IPv6 和 RDMA00:

32:48 多节点训练、后训练和自动研究00:37:36 算力策略、容量规划和批处理层级00:40:55 开放模型、实时 AI 和生产级智能体基础设施00:43:06 硬性护栏、托管智能体和专用沙箱00:46:06 为什么 AI 让基础设施再次令人兴奋00:48:

30 模型 API、差异化产品和智能体视频00:51:50 CI、编码智能体基础设施、SDK 和 Modal Bench00:57:28 结束语

文字记录

介绍:Modal、C 轮融资和艺术派对Swyx [00:00:00]: 我们和 Modal 的 CTO Akshat 以及 Vibhu 一起在这里。恭喜你们完成 C 轮融资。Akshat [00:00:10]: 谢谢。

Swyx [00:00:11]: 你们昨天的派对太棒了。Akshat [00:00:15]: 是的。Swyx [00:00:15]: 从照片和周边来看。Akshat [00:00:17]: 我们有很多艺术装置,很有趣,看到我们的产品放在基座上,旁边是罗丹的作品。

Swyx [00:00:25]: 非常好。非常好。当你们开始时,它并不是一家 GPU 推理公司。也许你们心里有数。带我们回到最初的故事。

Modal 的起源:超越 Kubernetes 的新运行时

Akshat [00:00:39]: 我第一次见到 CEO Eric 是通过一位投资人。当时 Eric 已经在考虑构建一个新的运行时,他思考为什么工作流编排产品如此难用。那是因为你必须在 Kubernetes 上运行它们。

Kubernetes 很难管理。它不是为突发性和自定义镜像而构建的。Swyx [00:01:03]: 是的。Akshat [00:01:03]: 它的开发者体验很糟糕。Swyx [00:01:05]: 我插一句。

Akshat [00:01:06]: 好。Swyx [00:01:07]: 对于新听众,我们两年前采访过 Eric,那里有更多关于 Spotify 等背景的故事。

Swyx [00:01:14]: 我是在 Data Council 上认识 Eric 的,因为他做了关于你们无服务器容器栈的演讲,那是我第一次觉得“好吧,我需要认真对待 Modal”的时刻。Akshat [00:01:26]: 是的。

Swyx [00:01:26]: 但当时仍然很不清楚,比如,我的数据管道真的需要这些吗?Akshat [00:01:33]: 是的。最初我们在想,如果我们构建一个更好的运行时,它本身就是一个非常有用的原语。

有很多问题可以通过无服务器函数解决,比如你可以做 ETL 工作、任务队列、所有这类突发性处理——事实证明每家公司都有这种需求。但我们也把它看作一个原语,我们可以在其上构建一整套高度垂直化的产品。

所以数据工程可能是第一个,但我们也在考虑推理。当时更多的是经典推理,比如计算机视觉和运行 XGBoost 之类的东西。但我们在 ChatGPT 发布前一年就在产品中加入了 GPU。

从无服务器容器到 GPU 工作负载

Swyx [00:02:19]: 不错。Akshat [00:02:19]: 我们只是没想到它会变得这么重要。Swyx [00:02:22]: 是的,就像加个 A100。Vibhu [00:02:23]: 有没有什么早期的关键问题真正促使你们构建它?

Akshat [00:02:28]: 有。主要是,现有的工具没有一个是为出色的开发者体验而构建的,而且我们看到的很多工作负载都非常……我希望有一个更好的词,但就是计算密集型。

它们需要更多的资源,所以你需要频繁地上下波动,而 Kubernetes 是为缓慢扩展和 Web 服务器用例设计的。而且还有更多的专业化需求。

原文出处
Why AI Infrastructure must evolve for Agent Experience — Akshat Bubna, Modal CTO

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读