← 顶级AI播客总结
Latent Space

Modal 的野心:把 AI 基础设施做成"自供给"的云

The AI Infra Stack: DeFlash, Auto Endpoints, RDMA, and Sandboxes — Akshat Bubna, Modal CTO
节目时长 59 分钟 阅读约 24 分钟
▶ 在 YouTube 收看原片
Modal 的野心:把 AI 基础设施做成"自供给"的云 插画

Modal CTO Akshat Bubna 拆解 DeFlash 投机解码、Auto Endpoints、RDMA 网络与 Sandbox,讲清一朵为 AI 而生的云如何在 17 家云商之上重造原语。

核心要点

  • 自供给运行时:Modal 把硬件、扩缩容配置写进代码 decorator,让 Agent 改几行就能看到运行时实时生效,而不必读上百个 Kubernetes YAML 文件,SDK 团队已从"开发者体验"转向"Agent 体验"。
  • 弹性推理是根基:Modal 最早在自定义模型推理上找到 PMF,服务 Suno(音频)、Runway(视频)、机器人与计算生物公司,核心专长是跨区域的极致自动扩缩容与 GPU 快照冷启动。
  • DeFlash 加速 2-4 倍:优化 kernel 只带来几个百分点提升,而提高 draft 模型的 accept length 是乘性加速,DeFlash 这一块级投机解码器已全部开源,用它能达到专有推理商同等性能且质量不降。
  • 17 家云之上的超级云:Modal 不自建数据中心,在 17 家 NeoCloud 上构建统一容量池,并自建可靠性层,GPU 掉线时用户负载不受影响,靠资本轻、软件强来快速迭代。
  • RDMA 撑起 serverless 训练:加个 decorator 就能拿到带 RDMA 网络的 GPU 集群(3 TB/s 内部带宽),i6pn IPv6 覆盖网络本为分布式训练的密钥交换而建,却被用户挖出用于其它场景。
  • Auto Endpoints 降门槛:从 UI 或 CLI 一键创建内置 DeFlash 优化的推理端点,代码全透明可 eject,后续还会让 draft 模型随数据分布自动演化,无需与人对接。
  • 推理拐点:AI 负载的 GPU:CPU 比从约 8:1 逼近 1:1,Agent 频繁在 GPU 与 CPU 间来回调用,逼得一切必须 collocate,这是 Modal 平台的天然优势。
Modal 的野心:把 AI 基础设施做成
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

一、从"更好的运行时"到 AI 云:起源与自供给哲学

Akshat 通过投资人认识了 CEO Erik,当时 Erik 已在思考一种新型运行时。出发点是一个具体痛点:workflow 编排产品为什么这么难用?因为它们都跑在 Kubernetes 上——而 Kubernetes 难管理、不为突发性设计、对自定义镜像支持差、开发者体验糟糕。swyx 补充,两年前采访 Erik 时讲过更多来自 Spotify 的背景,而他自己第一次"认真对待模型"正是看了 Erik 在 Data Council 上关于 serverless 容器栈的演讲。

Modal 早期的判断是:一个更好的运行时本身就是极有用的原语。serverless function 能解决 ETL、job queue、各种突发处理,而"每家公司都有这类需求"。更重要的是,这是一个能在其上构建一整套产品的原语。他们在 ChatGPT 出现前一年就给产品加了 GPU,"只是没想到会这么大",当时想的还是计算机视觉、跑 XGBoost 这类经典推理。

Akshat 反复强调驱动这一切的是两个趋势:一是负载"compute heavy"——需要大量资源、要频繁上下突发扩缩容,而 Kubernetes 是为慢速扩缩容和 Web server 场景设计的;二是环境的高度专业化——有时要加速器、有时要不同镜像。self-provisioning infrastructure(自供给基础设施)这个词,swyx 说是他在 Temporal 时写的一篇文章里造的,Modal "偷"来放上了 landing page。核心洞见是:一切都能放进与代码同处的 decorator,这样就能像操作其它代码一样操作基础设施,更具表达力和动态性。

面对"这是个 DSL、闭源、会被锁定"的质疑,Akshat 回应:Modal 从没真正遭遇这种反弹,因为你可以带任何已有代码进来,DSL 只是描述"用什么硬件、如何扩缩容"的配置层,代码始终归你所有——即便如今做推理也如此。

二、DX 到 AX:Agent 体验成为新身份

Modal 已把 SDK 团队的思考对象从"开发者体验(DX)"改成"Agent 体验(AX)"。Akshat 认为二者收益高度一致:为什么要让一个 Agent 读上百个 Kubernetes 文件、写没有类型的 YAML,而不是改几行 decorator,就得到一个能实时看到变更生效的自供给运行时?他们从客户处观察到,Agent 用 Modal 明显比操作其它底座更快。

主持人抛出"负面命题":如今没人看代码了,DX 还有意义吗?Akshat 的回应是——observability 反而更重要了。Modal 把大量能力推到 CLI 让 Agent 自行排查,但仍需人去解读、做判断。你可以把代码当黑盒,只看它跑出来的可观测行为,然后 prompt 一个改动。因此"仪表盘做得多好"这件事,现在比看代码本身更关键。

收尾时 swyx 追问:DX 和 AX 到底有没有本质不同?Akshat 的立场是二者"cosine similarity 0.9"。唯一的主要转变是他们建了 modal bench 基准来发现 Agent 的短板,然后据此给产品补表面积——如果 Agent 老去够某个不存在的功能("幻觉出自己的功能"),那可能就是产品反馈,该做成 CLI 给它。他们把过去只在 UI 里的 logs 和 metrics 也搬到了 CLI,让 Agent 能以那种形式访问。

三、Sandbox 与推理:产品的两条主线

Sandbox 的故事很有前瞻性。2023 年初 swyx 做 smol developer 时用的正是 Modal function 跑任务,还因 HackerNews 爆火给 Modal 带来流量高峰、出现在了董事会分析里。Akshat 说这几乎是"protocognition"——如果当年画出技术树,就该预见到今天。同期 Modal 在和一批需要 sandboxing 的客户交流,于是 2023 年 5 月——"在任何人知道这会成为一个品类之前"——建了 Sandbox,第一个 demo 就是把 smol developer 放进循环让 Agent 自我迭代。但当时模型没有为此后训练,"10 次迭代后就发散,产不出有意义的东西"。Sandbox 沉寂了近两年,直到去年才真正爆发。

推理这条线是 Modal 最大的用例。Akshat 明确:他们最早在"自定义模型推理"上找到 PMF,刻意避开了 LLM 空间,服务 Suno(音频)、Runway(视频)、机器人、计算生物等自训模型的公司——Modal 是"部署这些模型的最佳黑盒"。关键发现是这些公司流量高度不可预测:产品发布日流量暴增,而且他们在不同区域部署多个模型,各区域扩缩容周期彼此错峰,使自动扩缩容问题更难。Modal 的专长正在于此,并为此把 GPU 快照做进产品——快照 torch 编译后的模型状态,让下次冷启动快得多。

Akshat 区分了不同负载的突发性:推理需要突发;RL rollout"极其突发",有时要 10 万个 Sandbox;训练前的编码等批处理任务也会突然要上千 GPU。他认为 Agent 本身其实不那么突发,Sandbox 也是——除非在做 RL。

四、DeFlash 与投机解码:为什么 accept length 是关键

Modal 近来深入 LLM 推理层,因为意识到自己在跨区域自动扩缩容上的优势别处没有,而唯一的缺口是过去只做黑盒、不碰模型层。他们判断靠优秀的人能达到前沿级模型性能,并大量开源工作,其中就有 DeFlash——一个块级(block-based)投机解码器(speculator),全部开源,用它能拿到与专有推理商同等的性能。

Akshat 应主持人要求讲清了投机解码:用一个更小的 draft 模型提前预测若干 token,再让大模型一次性验证这些 token。之所以更快,是因为逐 token 生成受内存带宽限制,而批量验证 draft 模型的输出能更充分利用计算、因而更快。只要 draft 模型产出的、能被接受的 token 够多(这个量叫 accept length),加速就能是原模型速度的数倍。他强调的核心论点是:人们总谈"我们把 kernel 做快了",但 kernel 优化只带来几个百分点提升,而提高 accept length 是乘性下降,能在几乎不损性能的情况下带来 2 到 4 倍加速。

主持人问是否更贵(多跑一个模型)、质量是否下降。Akshat 澄清:质量不降——因为永远不会接受一个"更差"的 token,接受的 token 只会"更好或相同"。DeFlash 的进步在于不是一次预测一个 token,而是预测一个块。下一步是帮客户训练 speculator 和自定义模型——这类工作传统上极度依赖 FDE(forward deployed engineer)手把手支持。

五、Auto Endpoints 与"vs DIY"的真实差异

Auto Endpoints 是让人"不碰代码"的入口:有些人只想要一个能用、且自带 Modal 全部性能与扩缩容的端点。于是可从 UI 或 CLI 创建端点,内置 DeFlash 等所有优化,且完全透明——给你代码,可自己跑、可 eject 进完整 Modal 体验做微调和 fine-tune,不是黑盒。更进一步(文章里预告的下一步):让你的 draft 模型随数据分布演化,同样无需与人对接。

主持人替听众追问最实在的问题:如果我自己拿同一个开源模型(如 GLM 5.2 FP8)、用现成推理引擎(vLLM、SGLang)、买同等算力,Modal 到底提供了什么 delta?Akshat 的回答分几层:其一,Modal 走开源路线,把贡献 upstream 回 SGLang,和 SGLang 团队紧密合作,好处是自家团队有深厚专长,遇到别处没有的问题能帮你率先拿到性能。其二,也是实践中更要紧的——Modal 的端点"弹性远超他人",有真正的 scale-to-zero、真正的突发能力,这比"找到 GPU、跑模型代码"重要得多。其三,生产级推理本身就是难题,即便抛开自动扩缩容,控制尾延迟(tail latency)、保证每个请求至少送达一次,都有大量创新空间。swyx 也附和:所谓"自己搭很简单"其实说易做难,组合太多、trade-off 并不显性。

这条产品线让 Modal 越来越像一朵完整的云,"侵入别人的地盘"。被问"什么不做",Akshat 说会跟随用户、给一个各部分协同良好的平台,目前聚焦模型生命周期(数据准备→训练→推理)和 Agent 生命周期(Sandbox→持久存储等)。他明确不与 Render 之流竞争 always-on 大规模 Web server。Ramp 的 inspect 是成功的后台 Agent 案例,靠快照和快速扩缩容做到高响应性。

六、超级云与网络:17 家云、i6pn 与 RDMA

Akshat 提出"推理拐点(inference inflection)":AI 负载的 GPU:CPU 比过去约 8:1,如今逼近 1:1,因为 Agent 大量被 CPU 密集型任务阻塞或调用,限制因素在 GPU 与 CPU 间来回摆动,逼得一切都要 collocate。swyx 说这正是他从今年 GTC Jensen 主题演讲中提炼的判断。

Modal 的应对是构建了一个横跨 17 家云商的容量池,很擅长在全球各种云容量上运行——且不自建数据中心,只跑在众多 NeoCloud 上。Akshat 解释这是刻意选择:差异化在软件层,资本轻让他们跑得更快;既然那么多人在建数据中心,与他们合作、聚焦自身特长即可。因为 NeoCloud 可靠性参差,Modal 投入大量精力自建可靠性层——GPU"掉出总线"或出故障时用户负载不受影响,这也让他们能用上比普通用户能用的多得多的容量。

网络是重头戏。collocation 的需求来自 data locality 或延迟——用户要 GPU/CPU 固定在 EU 或 US,或让 Sandbox 紧挨数据。Sandbox 现支持 sidecar(一个 Sandbox 其实是一个 pod,可跑多容器),实现类 docker compose;也支持对出站网络的精细控制,如为 RL 日志跑中间人代理、控制 egress、注入凭证。更前沿的是跨多节点的 Sandbox 互通。

Modal 有个未曾公开谈过的 i6pn——用 IPv6 地址的覆盖网络(overlay network),同一 workspace 内的容器可用私有 IPv6 互相寻址,外人无法访问。它最初是为分布式训练产品建的:加个 decorator 就能拿到带 RDMA 网络的 GPU 集群,跑"真正 serverless"的分布式训练,而 RDMA 需要这个覆盖网络。但用户挖出它用于文档里根本没写的其它用途。Akshat 澄清:覆盖网络其实是 TCP 覆盖网络,用于 RDMA 前的密钥交换,而用户发现并用上了其中的 TCP 部分。

swyx 讲了个"顿悟时刻":他为 World's Fair 评审 2200 份投稿,操作系统名家 John Ousterhout 投的竟是关于 imprint 上 RDMA 的演讲。Akshat 说这合理——云、KV cache 的搬运、权重从训练 GPU 到推理 GPU 的迁移,本质都是"把内存搬来搬去、做调度"的系统问题。i6pn 类似 VPN、和 WireGuard 同域,区别在于不加密(用 eBPF 程序在 Linux 内核里放行/拒绝 TCP 连接,过去要用 sidecar)。对分布式训练的怀疑,Akshat 回应:Modal 不做大规模预训练,multinode 训练面向中小规模后训练(如后训练中等规模 Qwen 模型以提升推理质量),内部网络达 3 TB/s,是所需标准;RDMA(Melanox/InfiniBand)绕过 TCP 网络栈,节点间传输快得多。

七、Auto Research、容量经济学与 Agent 栈的未来

multinode 训练的另一用例是:即便有大集群,研究员仍在做小规模实验,弹性极重要——这是 auto research 的当前限制因素。Akshat 对 auto research 的观察很务实:目前还是"科学展览"阶段,真正在做的人不多;它做的不是架构层,而是"由模型直觉引导的超参数扫描",比普通 sweeper 高效得多。Modal 内部有个叫 auto inference 的仓库,把自家 FDE 工作自动化——Agent 自动跑一批不同配置,甚至跑 Nvidia 内部 profiler、改配置、把 GPU 从 H200 换到 B200,效果很好。他顺带指出 Modal 的 FDE 极其技术化,本质是"应用推理/训练研究员",与销售型 FDE 不同,售前另有 solutions architect。

关于 LLM 生成 Modal 代码:Cloud 4 之前不行,如今能开箱 one-shot。他们在考虑发布 modal bench 覆盖 LLM 尚不能做的更难的事——典型短板是没有正确指引时,Agent 不擅长用 observability(如何看日志、更新正确的东西、对此推理)。他们现在有了 modal skill,建 modal bench 正是为了发现这类问题并在 tuning skill 中修复。

容量与经济学是隐性护城河。Modal 有个叫 compute strategy 的团队(Akshat 打趣说"外行叫 FP&A",但更复杂):如何在 1 年与 3 年预留之间配比、如何预测自身容量、如何在 GPU 类型和区域高度可替换的前提下建模、对供应链演化持观点并据此下注——他称之为 tokenomics。swyx 类比航空公司对燃油的对冲,Southwest 曾靠一次成功的燃油押注长期成本领先。基于对全栈和调度的掌控,Modal 正在做 batch tier:不在意延迟的客户能拿到便宜得多的价格、24 小时内出结果。有趣的是这类批处理的需求主要不来自 LLM,而来自计算生物等跑大批量、不在意何时返回的非 LLM 公司。

面向未来的 Agent 栈,Akshat 谈到权限层的新问题。当前的新层级是 Claude Code 式的"危险跳过权限/按命令 allow-list",乃至"LLM 中介的权限(trust me bro)"。Akshat 对在 Sandbox 层用 LLM 中介权限持怀疑——需要硬边界,否则有人能 exfiltrate 数据;可用硬护栏搭配软护栏。swyx 抛出"LLM OS 内核就是个 LLM"的非共识设想,Akshat 承认这让人不适但那正是"信仰 LLM"的样子,不过他坚持关键场景仍需硬护栏。

八、生态观察:Replicate 复盘、竞品与语言之争

主持人请 Akshat 点评生态。对已倒下的竞品 Replicate,他的复盘是:Modal 刻意避开"为模型提供 API",因为模型 API 生意有一部分服务于"业余爱好者市场",粘性低得多;Modal 一直想服务那些在构建产品、需要超越单纯 API 的灵活性的公司。他们所有示例都不是"给你 API token 就用",而是可任意修改的起点代码——判定一个东西从"API 包装"变成"产品"的实质,除了代码量,还有一层选择效应:想深入到那个层级的公司往往在构建更差异化的东西。他举例 Ramp 早期训练自己的 tokenizer 并在 llama 里替换,以及某公司因完全自定义的模型架构必须在代码层调整、故用 Modal 跑全部推理。

其它点评:Ethan(xAI Grok 团队)预测下一层视频生成是"能用工具、写代码的模型/Agent 去编排视频模型"(如从 6 秒拼出 6 分钟),Akshat 说 Modal 已见到用 GPU Sandbox 做视频操作的 Agent,Luma agent 是一个雏形。GitPod(已更名 Ona,团队加入 OpenAI)技术很强,Modal 看好 CI 市场——Agent 越多、跑的 CI 越多,而 CI 有大量浪费在准备依赖/artifact 上,用内存快照与恢复原语能更高效地跑 CI;本质是另一种按需算力。runtime sandbox 最终胜过 buildtime sandbox,因其在镜像配置、存储挂载上有不同的配置面。

语言之争上,Akshat 说 Python 是首个 SDK 语言(数据与 ML 的语言),现已有 Go 和 TypeScript SDK,运行时用 Rust、完全不绑定 Python。推理训练仍以 Python 为主,而 Agent 相关的人更多用 TypeScript SDK(因为不真正做 ML)。他不认为短期需超越这两者。swyx 打趣"世界上最后两种语言",又补一句"英语和 prompting"。Akshat 提到常有人(如 OpenAI 董事长 Bret Taylor)想为 LLM 造新语言,但至今没有出现——Python 和 TypeScript 数据多却本身作为语言并不完美。Modal 是否会做气隙(air-gapped)本地版?答案是否定的,Modal 仅云端。他还强调 Modal 的目标不只服务 LLM 市场,药物发现、计算生物(如 Chai Discovery 那个世界)、投入实际部署的机器人,都会有大事发生。

金句

为什么要让一个 Agent 读上百个 Kubernetes 文件、写没有类型的 YAML,而它本可以改几行 decorator,就得到一个能实时看到变更生效的自供给运行时。 —— Akshat Bubna 0:00
我们在 2023 年 5 月就建了 Sandbox,在任何人知道这会成为一个品类之前。第一个 demo 就是把 smol developer 放进循环,让 Agent 自我迭代。 —— Akshat Bubna 10:05
人们总谈把 kernel 做快了,但 kernel 优化只带来几个百分点,而提高 accept length 是乘性下降——几乎不损性能就有 2 到 4 倍加速。 —— Akshat Bubna 18:34
我们不自建数据中心,只跑在很多 NeoCloud 上。我们的差异化在软件层,资本轻、专注软件让我们跑得非常快。 —— Akshat Bubna 25:29
也许我们才是恐龙。也许 AIOS、LLM OS 才是真的——内核就是一个该死的 LLM。 —— swyx 44:44
提供模型 API 有一部分终究服务于业余爱好者市场,粘性低得多;我们一直想为那些在构建产品、需要超越单纯 API 灵活性的公司而建。 —— Akshat Bubna 49:21

提到的书·产品·人物

适合谁听

关心 AI 推理经济学、Agent 基础设施与云底层原语的工程师、创始人与投资人。

← 返回全部观看原片 ↗