核心要点
- 自供给运行时:Modal 把硬件、扩缩容配置写进代码 decorator,让 Agent 改几行就能看到运行时实时生效,而不必读上百个 Kubernetes YAML 文件,SDK 团队已从"开发者体验"转向"Agent 体验"。
- 弹性推理是根基:Modal 最早在自定义模型推理上找到 PMF,服务 Suno(音频)、Runway(视频)、机器人与计算生物公司,核心专长是跨区域的极致自动扩缩容与 GPU 快照冷启动。
- DeFlash 加速 2-4 倍:优化 kernel 只带来几个百分点提升,而提高 draft 模型的 accept length 是乘性加速,DeFlash 这一块级投机解码器已全部开源,用它能达到专有推理商同等性能且质量不降。
- 17 家云之上的超级云:Modal 不自建数据中心,在 17 家 NeoCloud 上构建统一容量池,并自建可靠性层,GPU 掉线时用户负载不受影响,靠资本轻、软件强来快速迭代。
- RDMA 撑起 serverless 训练:加个 decorator 就能拿到带 RDMA 网络的 GPU 集群(3 TB/s 内部带宽),i6pn IPv6 覆盖网络本为分布式训练的密钥交换而建,却被用户挖出用于其它场景。
- Auto Endpoints 降门槛:从 UI 或 CLI 一键创建内置 DeFlash 优化的推理端点,代码全透明可 eject,后续还会让 draft 模型随数据分布自动演化,无需与人对接。
- 推理拐点:AI 负载的 GPU:CPU 比从约 8:1 逼近 1:1,Agent 频繁在 GPU 与 CPU 间来回调用,逼得一切必须 collocate,这是 Modal 平台的天然优势。
章节时间轴
- 0:00 开场与 Agent 体验 — Modal 把 SDK 团队从 DX 转向 AX,自供给运行时让 Agent 改 decorator 即见效。
- 1:31 起源故事 — Erik 从"workflow 编排为何难用"出发,因 Kubernetes 不适合突发负载与自定义镜像而重造运行时。
- 3:06 早期定位 — Modal 在 ChatGPT 前一年就加了 GPU,最初瞄准 ETL、job queue 等突发算力,未料推理会爆发。
- 4:38 自供给基础设施与 DSL 争议 — 把配置放进 decorator 与代码同处,代码归用户所有,回应"被锁定"质疑。
- 8:33 与初创共建 — 与 Cognition、Decagon、Ramp 等一起创新,Payton 直接嵌入 Cognition 办公。
- 9:19 Sandbox 起源 — 2023 年 5 月建 Sandbox,smol developer 放进循环自我迭代;沉寂两年后去年才爆发。
- 13:13 弹性推理与自动扩缩容 — 服务自定义模型公司,流量不可预测且跨区域错峰,GPU 快照加速冷启动。
- 15:32 RL 与突发负载 — RL rollout 极其突发,有时需 10 万个 Sandbox;关注 continual learning 等新形态。
- 17:03 DeFlash 与投机解码 — 深入 LLM 推理层,开源块级投机解码器,讲清 accept length 的乘性加速。
- 20:06 Auto Endpoints — 一键创建内置优化的透明端点,可 eject 深度定制;对比 DIY 推理的真实差异。
- 24:44 推理拐点与 17 家云 — GPU:CPU 比逼近 1:1,Modal 不自建数据中心,在 NeoCloud 之上做可靠性层。
- 27:00 网络原语 — collocation、data locality、Sandbox sidecar、出站网络控制、i6pn 覆盖网络与 RDMA。
- 33:10 分布式训练 — 3 TB/s RDMA 支撑中小规模后训练与研究员的小规模弹性实验。
- 35:29 Auto Research 与内部工具 — auto inference 自动化 FDE 工作,Agent 自建基础设施调参换 GPU。
- 39:20 容量策略与 tokenomics — compute strategy 团队做算力规划,类比航空公司燃油对冲,推批处理低价层。
- 42:26 未来与 Agent 栈 — 区域路由、权限层、LLM 中介权限的怀疑、managed agent 生态。
- 49:21 超越 LLM 与竞品复盘 — 药物发现、机器人;Replicate 复盘、GitPod/Ona、Python vs TypeScript、DX vs AX 收尾。
详细内容
一、从"更好的运行时"到 AI 云:起源与自供给哲学
Akshat 通过投资人认识了 CEO Erik,当时 Erik 已在思考一种新型运行时。出发点是一个具体痛点:workflow 编排产品为什么这么难用?因为它们都跑在 Kubernetes 上——而 Kubernetes 难管理、不为突发性设计、对自定义镜像支持差、开发者体验糟糕。swyx 补充,两年前采访 Erik 时讲过更多来自 Spotify 的背景,而他自己第一次"认真对待模型"正是看了 Erik 在 Data Council 上关于 serverless 容器栈的演讲。
Modal 早期的判断是:一个更好的运行时本身就是极有用的原语。serverless function 能解决 ETL、job queue、各种突发处理,而"每家公司都有这类需求"。更重要的是,这是一个能在其上构建一整套产品的原语。他们在 ChatGPT 出现前一年就给产品加了 GPU,"只是没想到会这么大",当时想的还是计算机视觉、跑 XGBoost 这类经典推理。
Akshat 反复强调驱动这一切的是两个趋势:一是负载"compute heavy"——需要大量资源、要频繁上下突发扩缩容,而 Kubernetes 是为慢速扩缩容和 Web server 场景设计的;二是环境的高度专业化——有时要加速器、有时要不同镜像。self-provisioning infrastructure(自供给基础设施)这个词,swyx 说是他在 Temporal 时写的一篇文章里造的,Modal "偷"来放上了 landing page。核心洞见是:一切都能放进与代码同处的 decorator,这样就能像操作其它代码一样操作基础设施,更具表达力和动态性。
面对"这是个 DSL、闭源、会被锁定"的质疑,Akshat 回应:Modal 从没真正遭遇这种反弹,因为你可以带任何已有代码进来,DSL 只是描述"用什么硬件、如何扩缩容"的配置层,代码始终归你所有——即便如今做推理也如此。
二、DX 到 AX:Agent 体验成为新身份
Modal 已把 SDK 团队的思考对象从"开发者体验(DX)"改成"Agent 体验(AX)"。Akshat 认为二者收益高度一致:为什么要让一个 Agent 读上百个 Kubernetes 文件、写没有类型的 YAML,而不是改几行 decorator,就得到一个能实时看到变更生效的自供给运行时?他们从客户处观察到,Agent 用 Modal 明显比操作其它底座更快。
主持人抛出"负面命题":如今没人看代码了,DX 还有意义吗?Akshat 的回应是——observability 反而更重要了。Modal 把大量能力推到 CLI 让 Agent 自行排查,但仍需人去解读、做判断。你可以把代码当黑盒,只看它跑出来的可观测行为,然后 prompt 一个改动。因此"仪表盘做得多好"这件事,现在比看代码本身更关键。
收尾时 swyx 追问:DX 和 AX 到底有没有本质不同?Akshat 的立场是二者"cosine similarity 0.9"。唯一的主要转变是他们建了 modal bench 基准来发现 Agent 的短板,然后据此给产品补表面积——如果 Agent 老去够某个不存在的功能("幻觉出自己的功能"),那可能就是产品反馈,该做成 CLI 给它。他们把过去只在 UI 里的 logs 和 metrics 也搬到了 CLI,让 Agent 能以那种形式访问。
三、Sandbox 与推理:产品的两条主线
Sandbox 的故事很有前瞻性。2023 年初 swyx 做 smol developer 时用的正是 Modal function 跑任务,还因 HackerNews 爆火给 Modal 带来流量高峰、出现在了董事会分析里。Akshat 说这几乎是"protocognition"——如果当年画出技术树,就该预见到今天。同期 Modal 在和一批需要 sandboxing 的客户交流,于是 2023 年 5 月——"在任何人知道这会成为一个品类之前"——建了 Sandbox,第一个 demo 就是把 smol developer 放进循环让 Agent 自我迭代。但当时模型没有为此后训练,"10 次迭代后就发散,产不出有意义的东西"。Sandbox 沉寂了近两年,直到去年才真正爆发。
推理这条线是 Modal 最大的用例。Akshat 明确:他们最早在"自定义模型推理"上找到 PMF,刻意避开了 LLM 空间,服务 Suno(音频)、Runway(视频)、机器人、计算生物等自训模型的公司——Modal 是"部署这些模型的最佳黑盒"。关键发现是这些公司流量高度不可预测:产品发布日流量暴增,而且他们在不同区域部署多个模型,各区域扩缩容周期彼此错峰,使自动扩缩容问题更难。Modal 的专长正在于此,并为此把 GPU 快照做进产品——快照 torch 编译后的模型状态,让下次冷启动快得多。
Akshat 区分了不同负载的突发性:推理需要突发;RL rollout"极其突发",有时要 10 万个 Sandbox;训练前的编码等批处理任务也会突然要上千 GPU。他认为 Agent 本身其实不那么突发,Sandbox 也是——除非在做 RL。
四、DeFlash 与投机解码:为什么 accept length 是关键
Modal 近来深入 LLM 推理层,因为意识到自己在跨区域自动扩缩容上的优势别处没有,而唯一的缺口是过去只做黑盒、不碰模型层。他们判断靠优秀的人能达到前沿级模型性能,并大量开源工作,其中就有 DeFlash——一个块级(block-based)投机解码器(speculator),全部开源,用它能拿到与专有推理商同等的性能。
Akshat 应主持人要求讲清了投机解码:用一个更小的 draft 模型提前预测若干 token,再让大模型一次性验证这些 token。之所以更快,是因为逐 token 生成受内存带宽限制,而批量验证 draft 模型的输出能更充分利用计算、因而更快。只要 draft 模型产出的、能被接受的 token 够多(这个量叫 accept length),加速就能是原模型速度的数倍。他强调的核心论点是:人们总谈"我们把 kernel 做快了",但 kernel 优化只带来几个百分点提升,而提高 accept length 是乘性下降,能在几乎不损性能的情况下带来 2 到 4 倍加速。
主持人问是否更贵(多跑一个模型)、质量是否下降。Akshat 澄清:质量不降——因为永远不会接受一个"更差"的 token,接受的 token 只会"更好或相同"。DeFlash 的进步在于不是一次预测一个 token,而是预测一个块。下一步是帮客户训练 speculator 和自定义模型——这类工作传统上极度依赖 FDE(forward deployed engineer)手把手支持。
五、Auto Endpoints 与"vs DIY"的真实差异
Auto Endpoints 是让人"不碰代码"的入口:有些人只想要一个能用、且自带 Modal 全部性能与扩缩容的端点。于是可从 UI 或 CLI 创建端点,内置 DeFlash 等所有优化,且完全透明——给你代码,可自己跑、可 eject 进完整 Modal 体验做微调和 fine-tune,不是黑盒。更进一步(文章里预告的下一步):让你的 draft 模型随数据分布演化,同样无需与人对接。
主持人替听众追问最实在的问题:如果我自己拿同一个开源模型(如 GLM 5.2 FP8)、用现成推理引擎(vLLM、SGLang)、买同等算力,Modal 到底提供了什么 delta?Akshat 的回答分几层:其一,Modal 走开源路线,把贡献 upstream 回 SGLang,和 SGLang 团队紧密合作,好处是自家团队有深厚专长,遇到别处没有的问题能帮你率先拿到性能。其二,也是实践中更要紧的——Modal 的端点"弹性远超他人",有真正的 scale-to-zero、真正的突发能力,这比"找到 GPU、跑模型代码"重要得多。其三,生产级推理本身就是难题,即便抛开自动扩缩容,控制尾延迟(tail latency)、保证每个请求至少送达一次,都有大量创新空间。swyx 也附和:所谓"自己搭很简单"其实说易做难,组合太多、trade-off 并不显性。
这条产品线让 Modal 越来越像一朵完整的云,"侵入别人的地盘"。被问"什么不做",Akshat 说会跟随用户、给一个各部分协同良好的平台,目前聚焦模型生命周期(数据准备→训练→推理)和 Agent 生命周期(Sandbox→持久存储等)。他明确不与 Render 之流竞争 always-on 大规模 Web server。Ramp 的 inspect 是成功的后台 Agent 案例,靠快照和快速扩缩容做到高响应性。
六、超级云与网络:17 家云、i6pn 与 RDMA
Akshat 提出"推理拐点(inference inflection)":AI 负载的 GPU:CPU 比过去约 8:1,如今逼近 1:1,因为 Agent 大量被 CPU 密集型任务阻塞或调用,限制因素在 GPU 与 CPU 间来回摆动,逼得一切都要 collocate。swyx 说这正是他从今年 GTC Jensen 主题演讲中提炼的判断。
Modal 的应对是构建了一个横跨 17 家云商的容量池,很擅长在全球各种云容量上运行——且不自建数据中心,只跑在众多 NeoCloud 上。Akshat 解释这是刻意选择:差异化在软件层,资本轻让他们跑得更快;既然那么多人在建数据中心,与他们合作、聚焦自身特长即可。因为 NeoCloud 可靠性参差,Modal 投入大量精力自建可靠性层——GPU"掉出总线"或出故障时用户负载不受影响,这也让他们能用上比普通用户能用的多得多的容量。
网络是重头戏。collocation 的需求来自 data locality 或延迟——用户要 GPU/CPU 固定在 EU 或 US,或让 Sandbox 紧挨数据。Sandbox 现支持 sidecar(一个 Sandbox 其实是一个 pod,可跑多容器),实现类 docker compose;也支持对出站网络的精细控制,如为 RL 日志跑中间人代理、控制 egress、注入凭证。更前沿的是跨多节点的 Sandbox 互通。
Modal 有个未曾公开谈过的 i6pn——用 IPv6 地址的覆盖网络(overlay network),同一 workspace 内的容器可用私有 IPv6 互相寻址,外人无法访问。它最初是为分布式训练产品建的:加个 decorator 就能拿到带 RDMA 网络的 GPU 集群,跑"真正 serverless"的分布式训练,而 RDMA 需要这个覆盖网络。但用户挖出它用于文档里根本没写的其它用途。Akshat 澄清:覆盖网络其实是 TCP 覆盖网络,用于 RDMA 前的密钥交换,而用户发现并用上了其中的 TCP 部分。
swyx 讲了个"顿悟时刻":他为 World's Fair 评审 2200 份投稿,操作系统名家 John Ousterhout 投的竟是关于 imprint 上 RDMA 的演讲。Akshat 说这合理——云、KV cache 的搬运、权重从训练 GPU 到推理 GPU 的迁移,本质都是"把内存搬来搬去、做调度"的系统问题。i6pn 类似 VPN、和 WireGuard 同域,区别在于不加密(用 eBPF 程序在 Linux 内核里放行/拒绝 TCP 连接,过去要用 sidecar)。对分布式训练的怀疑,Akshat 回应:Modal 不做大规模预训练,multinode 训练面向中小规模后训练(如后训练中等规模 Qwen 模型以提升推理质量),内部网络达 3 TB/s,是所需标准;RDMA(Melanox/InfiniBand)绕过 TCP 网络栈,节点间传输快得多。
七、Auto Research、容量经济学与 Agent 栈的未来
multinode 训练的另一用例是:即便有大集群,研究员仍在做小规模实验,弹性极重要——这是 auto research 的当前限制因素。Akshat 对 auto research 的观察很务实:目前还是"科学展览"阶段,真正在做的人不多;它做的不是架构层,而是"由模型直觉引导的超参数扫描",比普通 sweeper 高效得多。Modal 内部有个叫 auto inference 的仓库,把自家 FDE 工作自动化——Agent 自动跑一批不同配置,甚至跑 Nvidia 内部 profiler、改配置、把 GPU 从 H200 换到 B200,效果很好。他顺带指出 Modal 的 FDE 极其技术化,本质是"应用推理/训练研究员",与销售型 FDE 不同,售前另有 solutions architect。
关于 LLM 生成 Modal 代码:Cloud 4 之前不行,如今能开箱 one-shot。他们在考虑发布 modal bench 覆盖 LLM 尚不能做的更难的事——典型短板是没有正确指引时,Agent 不擅长用 observability(如何看日志、更新正确的东西、对此推理)。他们现在有了 modal skill,建 modal bench 正是为了发现这类问题并在 tuning skill 中修复。
容量与经济学是隐性护城河。Modal 有个叫 compute strategy 的团队(Akshat 打趣说"外行叫 FP&A",但更复杂):如何在 1 年与 3 年预留之间配比、如何预测自身容量、如何在 GPU 类型和区域高度可替换的前提下建模、对供应链演化持观点并据此下注——他称之为 tokenomics。swyx 类比航空公司对燃油的对冲,Southwest 曾靠一次成功的燃油押注长期成本领先。基于对全栈和调度的掌控,Modal 正在做 batch tier:不在意延迟的客户能拿到便宜得多的价格、24 小时内出结果。有趣的是这类批处理的需求主要不来自 LLM,而来自计算生物等跑大批量、不在意何时返回的非 LLM 公司。
面向未来的 Agent 栈,Akshat 谈到权限层的新问题。当前的新层级是 Claude Code 式的"危险跳过权限/按命令 allow-list",乃至"LLM 中介的权限(trust me bro)"。Akshat 对在 Sandbox 层用 LLM 中介权限持怀疑——需要硬边界,否则有人能 exfiltrate 数据;可用硬护栏搭配软护栏。swyx 抛出"LLM OS 内核就是个 LLM"的非共识设想,Akshat 承认这让人不适但那正是"信仰 LLM"的样子,不过他坚持关键场景仍需硬护栏。
八、生态观察:Replicate 复盘、竞品与语言之争
主持人请 Akshat 点评生态。对已倒下的竞品 Replicate,他的复盘是:Modal 刻意避开"为模型提供 API",因为模型 API 生意有一部分服务于"业余爱好者市场",粘性低得多;Modal 一直想服务那些在构建产品、需要超越单纯 API 的灵活性的公司。他们所有示例都不是"给你 API token 就用",而是可任意修改的起点代码——判定一个东西从"API 包装"变成"产品"的实质,除了代码量,还有一层选择效应:想深入到那个层级的公司往往在构建更差异化的东西。他举例 Ramp 早期训练自己的 tokenizer 并在 llama 里替换,以及某公司因完全自定义的模型架构必须在代码层调整、故用 Modal 跑全部推理。
其它点评:Ethan(xAI Grok 团队)预测下一层视频生成是"能用工具、写代码的模型/Agent 去编排视频模型"(如从 6 秒拼出 6 分钟),Akshat 说 Modal 已见到用 GPU Sandbox 做视频操作的 Agent,Luma agent 是一个雏形。GitPod(已更名 Ona,团队加入 OpenAI)技术很强,Modal 看好 CI 市场——Agent 越多、跑的 CI 越多,而 CI 有大量浪费在准备依赖/artifact 上,用内存快照与恢复原语能更高效地跑 CI;本质是另一种按需算力。runtime sandbox 最终胜过 buildtime sandbox,因其在镜像配置、存储挂载上有不同的配置面。
语言之争上,Akshat 说 Python 是首个 SDK 语言(数据与 ML 的语言),现已有 Go 和 TypeScript SDK,运行时用 Rust、完全不绑定 Python。推理训练仍以 Python 为主,而 Agent 相关的人更多用 TypeScript SDK(因为不真正做 ML)。他不认为短期需超越这两者。swyx 打趣"世界上最后两种语言",又补一句"英语和 prompting"。Akshat 提到常有人(如 OpenAI 董事长 Bret Taylor)想为 LLM 造新语言,但至今没有出现——Python 和 TypeScript 数据多却本身作为语言并不完美。Modal 是否会做气隙(air-gapped)本地版?答案是否定的,Modal 仅云端。他还强调 Modal 的目标不只服务 LLM 市场,药物发现、计算生物(如 Chai Discovery 那个世界)、投入实际部署的机器人,都会有大事发生。
金句
为什么要让一个 Agent 读上百个 Kubernetes 文件、写没有类型的 YAML,而它本可以改几行 decorator,就得到一个能实时看到变更生效的自供给运行时。 —— Akshat Bubna 0:00
我们在 2023 年 5 月就建了 Sandbox,在任何人知道这会成为一个品类之前。第一个 demo 就是把 smol developer 放进循环,让 Agent 自我迭代。 —— Akshat Bubna 10:05
人们总谈把 kernel 做快了,但 kernel 优化只带来几个百分点,而提高 accept length 是乘性下降——几乎不损性能就有 2 到 4 倍加速。 —— Akshat Bubna 18:34
我们不自建数据中心,只跑在很多 NeoCloud 上。我们的差异化在软件层,资本轻、专注软件让我们跑得非常快。 —— Akshat Bubna 25:29
也许我们才是恐龙。也许 AIOS、LLM OS 才是真的——内核就是一个该死的 LLM。 —— swyx 44:44
提供模型 API 有一部分终究服务于业余爱好者市场,粘性低得多;我们一直想为那些在构建产品、需要超越单纯 API 灵活性的公司而建。 —— Akshat Bubna 49:21
提到的书·产品·人物
- Akshat Bubna(人物):本期嘉宾,Modal 联合创始人兼 CTO。
- Erik(人物):Modal CEO,两年前曾上 Latent Space,从 Spotify 与 workflow 编排痛点出发构想新运行时。
- swyx / Vibhu(Vivu)(人物):本期两位主持人。
- Modal(公司/产品):为 AI 应用从零构建原语的云平台,覆盖推理、训练、批处理与 Sandbox。
- DeFlash(DeFlash/Dlash)(产品):Modal 开源的块级投机解码器(speculator),带来 2-4 倍推理加速。
- Auto Endpoints(产品):Modal 从 UI/CLI 一键创建、内置优化且透明可 eject 的推理端点。
- i6pn(产品):Modal 基于 IPv6 的私有覆盖网络,为分布式训练 RDMA 密钥交换而建。
- RDMA / Melanox / InfiniBand(技术):绕过 TCP 栈的高速节点间内存传输,Modal 内部带宽 3 TB/s。
- GPU 快照(GPU snapshotting)(技术):快照 torch 编译后模型状态以加速冷启动。
- Kubernetes(产品):Modal 起源要绕开的对象,被指不适合突发负载与自定义镜像。
- smol developer(产品):swyx 的项目,早期用 Modal function,被放进循环成为最早的自迭代 Agent demo。
- Suno / Runway(公司):Modal 的音频、视频自定义模型推理客户。
- Cognition / Decagon / Ramp(公司):与 Modal 共建创新的客户;Payton 嵌入 Cognition,Ramp 的 inspect 是成功后台 Agent 案例,Rahul 为 Ramp 新 CTO。
- Cursor Composer(产品):每几小时对模型做一次 RL 的例子。
- Engram(公司):近期宣布做 continual learning / 训练的公司。
- SGLang / vLLM(产品):开源推理引擎,Modal 与 SGLang 团队紧密合作并 upstream 贡献。
- GLM 5.2 FP8(产品):主持人举例的自部署开源模型。
- Qwen(产品):后训练中等规模模型以提升推理质量的例子。
- John Ousterhout(人物):知名操作系统教授,向 World's Fair 投了 RDMA 演讲。
- WireGuard(产品):与 i6pn 同域的加密 VPN,用于对比(i6pn 不加密)。
- eBPF(技术):在 Linux 内核中放行/拒绝 TCP 连接,替代旧的 sidecar 方案。
- NVIDIA H200 / B200 / GTC / Jensen 主题演讲(产品/人物/事件):auto inference 会自动切换 GPU 型号;swyx 从 GTC 提炼"推理拐点"。
- Replicate(公司):已倒下的竞品,被复盘为过度服务低粘性的业余爱好者市场。
- GitPod / Ona(公司):更名 Ona 后团队加入 OpenAI,技术强,Modal 看好其所在 CI/CD 市场。
- OpenPipe / Vercel / Databricks Omni(产品/公司):被提及的 meta-harness / 伪 Agent 云。
- Ethan(xAI Grok 团队)(人物):预测视频生成下一层是编排视频模型的 Agent。
- Luma agent(产品):视频生产方向的一个雏形。
- Astro / Modular(被 Qualcomm 收购)/ Bret Taylor(公司/人物):Python 工具生态与"为 LLM 造新语言"话题中提及。
- Chai Discovery(公司):计算生物/药物发现领域的客户代表。
- Chatterbox / Whisper(产品):Modal 网站上展示的音频模型定制案例。
适合谁听
关心 AI 推理经济学、Agent 基础设施与云底层原语的工程师、创始人与投资人。