← 顶级AI播客总结
No Priors

扩散模型要赢的不是训练,是推理:Stefano Ermon 的反共识押注

Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon
节目时长 38 分钟 阅读约 23 分钟
▶ 在 YouTube 收看原片

扩散之父离开斯坦福创业,用并行生成把 LLM 推理速度拉到定制芯片水平,只靠 GPU。

核心要点

  • 推理是新瓶颈:autoregressive 推理必须一个 token 一个 token 串行生成,第 10 个 token 要等前 9 个完成,这种负载极度 memory-bound,时间都花在搬运权重上,几乎不做算术运算,与 GPU 特性严重错配。
  • 2024 年平价论文:Ermon 团队首次在 GPT-2 规模(十亿参数以下)用 Transformer 架构训出的扩散语言模型,达到与 autoregressive 模型相同的 perplexity,但文本生成速度快 10 倍,这成了他创办 Inception 的直接依据。
  • Mercury 打平小模型:Inception 的 Mercury 系列在 benchmark 上与 Claude Haiku、Gemini Flash、OpenAI mini/nano 等速度优化档模型持平,但显著更快,目前已在生产环境为真实客户提供服务。
  • 软件替代定制芯片:语音 agent 公司 Open Call 原本把 LLM 跑在 Cerebras 定制芯片上换速度,改用 Mercury 后在普通 Nvidia GPU 上拿到同等速度,同时获得更好的供给可得性、更低成本和更高质量。
  • 20~30% 工作负载:Ermon 按 OpenRouter 的任务分类做过估算,研究、对话、编程、日志处理等场景中约有 20%~30% 对延迟高度敏感,这是延迟敏感型模型的保守可寻址下限。
  • 可控性是隐藏优势:autoregressive 必须生成完整对象才能用 reward function 打分,扩散是由粗到细生成,从早期就能判断方向并用外部奖励或约束实时引导,学术文献中有大量证据支持扩散更易控制。
  • 护城河是工程栈:光有模型不够——vLLM、SGLang 跑不了扩散 LLM,Inception 自建了 serving engine、kernel 以及 SFT/RLHF/RL 全套后训练栈,这些加上真实客户反馈和自建 evals 构成比论文更难复制的 IP。

章节时间轴

详细内容

一、从冷门方向到扩散范式:一条十年的研究线

Ermon 2014 年以助理教授身份入职斯坦福,方向就是生成模型。他回忆当时这个领域"并不特别热"——模型效果不好,还在 MNIST 上做小生成模型,"能生成那种颗粒感很重的数字图像就算大成功"。论文也难发,你必须把训练生成模型包装成"一种从无标注数据中学特征、进而帮助监督学习做得更好"的手段,因为当时大家只关心监督学习。

主持人问他当时除了好奇心之外,有没有对模型能做什么抱有个人期待。Ermon 说他一直相信建生成模型是理解数据结构的正确方式,但他当时想的不是今天这种 LLM 能力,而是 world model 视角:他做图像出身,思考的是"如果我站起来走出门会发生什么,我能在脑子里想象出来",这种对世界的建模能力对决策和 model predictive control 很重要,而它需要生成能力。他还以为这个问题足够难,"够我忙一整个职业生涯"——结果当然错得离谱,事情发展得比他预期快太多。

技术路线上他经历了完整的一轮换代:先是 autoregressive 图像模型,慢且模糊;然后 VAE;然后 GAN 接管。但他对 GAN 的状态很不满——"能工作,但训练极不稳定,结果非常难复现"。于是他和博士生开始找一个"和 GAN 一样好但更有原则"的方案,这就是 2019 年的 score-based 生成模型,后来演化成现代扩散模型。

核心洞察非常朴素:训一个神经网络去给图像去噪。如果你能去噪,说明你对图像结构的理解已经足够支撑一套基于去噪器的生成流程。由此产生了范式差异——不是从左到右一个像素一个像素地生成,而是从纯噪声出发逐步精修,直到得到干净图像。Ermon 指出,今天图像、视频、音乐乃至相当一部分蛋白质生成的最佳模型,都建立在扩散之上。

二、离散化难题与 2024 年的平价结果

把扩散做通图像之后,Ermon 自然地开始想:怎么让它在文本和代码上工作?他要的是"超越 autoregressive、更并行、自带纠错能力"的东西。

主持人在这里提了一个很实在的质疑:扩散在图像、视频上的成功有目共睹,甚至有人为它造硬件;但这不直观地意味着它能迁移到别的领域,也不显然构成对当前 full-transformer 路线 AGI 实验室的有力竞争。

Ermon 承认技术上确实需要"新科学"。他解释了离散化的本质困难:扩散学的是去噪,这对连续数据很自然——两个像素颜色之间可以插值,插出来的值仍然有意义;但两个词之间未必存在中间态,一切都是离散的。把这套思想扩展到离散空间需要大量 R&D。

突破出现在 2024 年。团队发表论文,首次证明在 GPT-2 规模(不到十亿参数,Ermon 自己承认"还相当学术")上,用同样的数据、依然是 Transformer 架构、但按扩散方式训练,可以匹配 autoregressive 模型的质量——相同参数量下达到相同的 perplexity,对数据的拟合程度一致。而因为扩散同时输出多个 token,生成速度快了 10 倍。Ermon 说他非常想知道 scale up 之后会怎样,于是创办 Inception,目标就是把这套技术推到商业规模。

三、核心论证:推理时代的"RNN → Transformer 时刻"

这是全期最完整的一条论证链,值得逐层还原。

Ermon 先描述当下的格局:存在两大范式,autoregressive(预测下一个 token 或下一个像素,从左到右逐个生成)和 diffusion(由粗到细、迭代去噪)。连续模态里扩散占绝对优势;离散模态——文本和代码——所有大实验室都押在同一个架构上。而当行业走向统一的多模态模型时,最终架构到底是 autoregressive 还是 diffusion,"陪审团还没回来",没人知道。

Inception 押扩散的理由是:最终决定胜负的是 inference time scaling,而扩散在推理时有根本性优势。Ermon 的类比是 2017 年的范式切换:当时人们从 RNN 换到 Transformer,原因是 RNN 必须串行处理 token,训练太慢;Transformer 让你能并行处理大量 token,这才是能 scale 的架构,也是 LLM 一切成功的基础。

现在把镜头从训练移到推理。autoregressive 模型在推理时依然是串行的——你没生成完前面的,就生成不了第 10 个 token。Ermon 的判断是:这种负载"和 GPU 根本不匹配,是极端 memory-bound 的",你大部分时间花在跨内存层级搬运权重,实际做的算术运算极少。这是 autoregressive 的根本问题。

那么推理端对应的"Transformer"是什么?答案就是扩散模型。扩散在推理时的负载本身就是并行处理大量 token,因此推理负载与训练负载高度相似,能很好地映射到 matmul,也就是 GPU 最擅长的事。

Ermon 进一步把这个优势接到三条产业链路上:其一,经济学由 intelligence per watt、intelligence per dollar 主导;其二,reasoning 模型的进步很大程度上来自 scaling test-time compute,在这条轴上 scale 得更好就直接受益;其三,RL 后训练的瓶颈在于生成 rollouts——让模型探索、给轨迹打分、再改进模型,推理同样是关键瓶颈,因此推理端 scale 得更好,RL 后训练自动也更好。他的结论直白:押扩散是因为它本质更并行,而苦涩教训(the bitter lesson)告诉我们,更并行的方案最终会赢。

四、噪声、压缩与 perplexity:代码数据能扩散吗

主持人提了一个结构性的追问,也是本期最有质量的交锋。她的观点是:扩散在图像、视频、语音上的结构性红利,来自被复现的对象在现实世界里存在一致结构——什么是真正可能的、最可能的。但 AI 迄今最有价值的一些领域,输入数据(比如代码)非常杂乱,甚至可以争辩说其中很大一部分并不具备你要找的那种"正确的真实结构"。

Ermon 的回答从更底层切入:训练任何生成模型——无论 autoregressive 还是 diffusion——本质上都是在建立一套压缩方案来识别数据中的结构。压缩得越好,说明你识别出的结构和模式越多。这正是"仅仅通过预测下一个词就能学到数据结构"这件事的神奇之处,而两种方法在这一点上是同构的。

于是 2024 年那篇论文的意义被重新表述:他们用的度量是 perplexity,而 perplexity 正是"你识别出了多少结构"的记号。在 GPT-2 规模上扩散模型识别出的结构量与 autoregressive 完全相同。

主持人仍然追问:实证结果在那里,但直觉上代码不像物理那样有 grounding,噪声很多——听起来你认为这是个可管理的问题?Ermon 说噪声哪里都有,但"数字不会说谎":只要你能把 perplexity 压下去,就说明你确实构建出了那个压缩率的压缩方案,那结构就必然存在,且模型已经把它挖出来了。剩下的问题变成 inductive bias 之争——Transformer 是不是识别这些模式的更好方式?next-token prediction 是不是正确的建模框架,还是去噪更好?他坦承这是"纯经验问题,目前我们甚至还没有理解它的工具"。

五、速度在哪里变现:语音 agent 与 Cerebras 的替换

主持人把话题拉到商业侧,先给了一段自己的判断:在一个根本上被算力和供给约束的环境里,效率研究过去在很多工业研究机构里是二阶考量,主要精力给了纯能力 scaling;但如果你相信我们能用掉手上全部的电力、而且用掉它有经济理由,那么对效率的关注会急剧上升。她说现在很多人认为 AI 公司最重要的决策之一,就是手上的每一瓦电该怎么在训练和最有价值的用例之间分配。她随即问:2026 年 9 月的当下,速度在哪里已经赢了?

Ermon 的回答分两层。第一层是普适的:在质量相同的前提下,人永远选更快的方案。前沿实验室推出的快速版模型正在被验证——人们愿意多付钱买更快的模型。他的比喻是宽带:"一旦你用过快的模型,就回不去了。"

第二层是具体客户。他公开点名了语音领域的 Open Call,一家做 voice agent 的公司。这条流水线是 ASR → LLM(做 tool call、决定下一句说什么,为了最高质量通常必须是 reasoning LLM)→ TTS,延迟至关重要。他们此前把 LLM 跑在 Cerebras 上,也就是靠定制芯片换速度;换成 Inception 的扩散 LLM 之后,在普通 Nvidia GPU 上就拿到了"相当于 autoregressive 模型跑在定制硬件上"的速度。Ermon 强调这带来三重好处:可得性更好(GPU 虽稀缺,但比定制芯片多得多)、成本更低、质量更高。

主持人顺势问到硬件格局,指出确实有用例愿意为大 SRAM 的昂贵芯片买单——编程等场景就是。Ermon 认可硬件是加速的一条路,主持人补了一句"但如果能用现有硬件,软件可能是更好的路";Ermon 表示两者是互补的,而且"软件带来的增益和硬件带来的增益是乘性的"。主持人则补充说,也许某天会有人造出更贴合扩散模型的硬件。

六、David 打 Goliath:创业公司的护城河在哪

主持人提出了一个业内普遍的疑虑:今天很难投资新架构,因为架构或方法上的任何进展都会被有资源 scale 算力的大玩家直接吸收。她直接问 Ermon 怎么以 David 的身份竞争。

Ermon 承认这个问题非常有效,也是他们的心头事。他的答案分三层递进。

第一层是 IP 和商业秘密——公司早期的护城河就是他和研究员们建模型、把模型做得更好的那些想法本身。

第二层是 serving 层的工程资产。这也是他们为什么不做纯研究、而是做产品、有真实客户的原因之一。他明确说:扩散 LLM 跑不了 vLLM 或 SGLang,他们必须自建 serving engine。而且"就算你训出了扩散 LLM,如果没有 serving engine、没有 vLLM 的等价物,你依然卡在那里、用不起来"。逼自己从第一天就端到端部署,让团队积累了大量关于如何服务这类模型的知识,这些本身就是 IP。此外还包括他们自建的 SFT、RLHF、RL 全套后训练栈。

第三层是客户数据与 evals 的飞轮。和真实客户合作能拿到模型反馈,知道什么有效什么无效,有时能从客户处收集数据,并基于客户实际遇到的问题构建 evals——这些东西"要复制会难一些"。

护城河的代价他也讲得很清楚:正因为选择不开源,社区贡献的机会更少,采用门槛更高,on-prem 部署也更难。他把这明确称作"两种选择各有利弊"。新架构的通用困境同样存在:整个生态不成熟,serving engine、kernel 都得自己造;开源的扩散模型有一些,但"都不太好",这让客户尝试新东西的意愿更低,因为他们不习惯。

七、对齐、可控性,以及扩散可能打开的新接口

主持人指出,一些做 AI 产品的公司认为在语音流水线中间放一个 LLM 的好处,是他们比较懂怎么做对齐和可控性,而这在扩散模型上想必不一样。

Ermon 的回答分成"现在"和"未来"两段,很值得区分。

现在:他们把一切都做成向后兼容的——API 不变,仍然 OpenAI 兼容,text in、text out。而他们训出来的模型恰好擅长遵循指令、擅长输出 JSON 等结构化格式,能处理这些需求。对 Open Call 来说,Mercury "足够好,事实上比他们之前用的模型更好",所以他们能继续给客户提供同等水平的服务。主持人总结说:接口一样、栈不用换,就很简单。

未来则是 Ermon 认为"非常有意思"的一点:扩散模型通常比 autoregressive 更容易控制。原因在生成机制里——autoregressive 必须等整个对象生成完,才知道它是否满足约束、是否对齐、是否符合你在意的目标函数;比如你在生成一个分子、你关心溶解度,那你得等拿到完整分子才能用 reward function 打分。而扩散是由粗到细的生成,从很早期你就知道"这是不是我要的东西",并可以按外部 reward function 或一组约束把生成过程往某个方向引导。他指出学术文献里有大量证据支持扩散更易控制,而且存在一些 autoregressive 根本做不到的引导方式。这意味着一种 autoregressive 甚至提供不了的新接口,而 Inception 一直在思考:围绕这些新能力,正确的产品体验应该是什么样。

主持人追问:除了性能之外,你设想 Inception 的模型在规模上会有今天模型没有的能力吗?Ermon 坦率地说不知道,"这是涌现的"。当前的楔子是速度——这是最初的押注,因为它最容易测试、最容易度量、显然有价值。但随着他们对如何训练这类模型理解加深,"我们不知道会发现什么"。

他举了一个已有线索:学术文献里有相当多证据表明扩散模型比 autoregressive 更数据高效。直觉是训练扩散时你是通过去噪来学习——拿一张图像加噪、再学着去噪——这实际上等于在做数据增广,同一张图像被多种噪声视角增强。如果这个性质在大规模上成立,那么在数据成为瓶颈的任务上,扩散会变得更有意思。

八、两年后的份额、团队组织,与学术界还剩什么

主持人问:如果往后看两年(她自己吐槽说五年在 AI 里太长了),扩散和传统模型的负载会怎么分?

Ermon 先给出限定:扩散目前还没到前沿智能水平,而很多工作负载确实需要前沿智能。但他做过估算——OpenRouter 有一套很好的用例分类法,把 research、conversational、coding、software engineering、log processing 等任务切得很清楚。按他的估计,其中大约 20%~30% 是延迟高度重要的。他把这当作保守下限:这部分至少可以由"在给定延迟预算内提供最高质量"的模型来覆盖。

关于团队:Inception 成立约两年,约 50 人,大量时间仍花在 R&D 上——怎么训这类模型、怎么加速推理都还不明朗。Ermon 对比说,autoregressive 模型的推理其实没什么可做的,一次一个 token 就是全部;而扩散模型在推理时有大量用算力换质量的选项,比如图像和视频扩散里成熟的蒸馏、各种精巧的微分方程求解技巧,都能让采样极快。加上数据配比、evals、RL 后训练基础设施,工作量很大。他们的策略是尽可能复用现成的东西——底座仍是 Transformer,所以架构方面的既有成果不用扔掉,attention 照用,公开数据集、evals、benchmark 也照用,把精力集中在最能做出差异的地方;现在这个差异点是速度,"未来谁知道呢,也许扩散语言模型会比 autoregressive 显著更聪明"。

组织形式上:一个产品团队负责平台、和客户一起把模型用好,本质上是服务当前最佳版本的模型;另一个团队负责构建下一代模型,包含训练、RL 和推理,偏研究。他说 50 人对一家全栈研究-服务-产品公司不算多,但每个人都很强、很拼,而且他们有 agent 让效率大幅提升,"事实上瓶颈往往是算力而不是人"。模型规模、FLOPs 这些他表示属于商业机密,不能透露,但强调他们在持续推进前沿。

关于招人,他的定位很清楚:这仍是一个相对小的领域,有大量东西待发明。选择来 Inception 而不是去别的实验室的人,要的是所有权和发明新东西的机会——一片更接近处女地、更开放、更少既定答案的空间。

主持人还问了递归自我改进:这件事在研究圈既让人兴奋又让人绝望,而 Ermon 走的是一条很不一样的路线,他怎么看?Ermon 说"我们还没到那一步",也许是他们拿不到别人手里那些模型。他们当然大量使用模型,包括前沿实验室的模型,这极大加速了迭代速度和开发流程。但至少眼下——"六个月或一年后会怎样我不知道"——人的创造力仍然极其重要,提出正确想法、剪枝搜索空间、识别更有希望的方向,这些对他们非常关键。

最后一个问题关于学术界:很多人会说在这个需要巨量算力的时代,学术 AI 研究处境艰难,而 Ermon 自己也确实因此开了公司。他在 2024 年结果出来之前,是怎么建立起对研究方向的信心的?

Ermon 的回答是一组累积的结果,而不是单点。早期的扩散工作,在学术界能训的模型规模上就已经能打败 GAN 且训练稳定得多,后来整条线接管了领域,Stable Diffusion、Midjourney 都源自他实验室发展出的想法。但他强调这不是唯一一例:他作为共同指导参与了 Flash Attention,同样出自学术界、后来在工业界产生巨大影响;DPO 最初只是他组里一个 rotation 项目,如今被用来对齐 LLM 和扩散模型——它完全在学术界诞生,靠的是一个巧妙洞见,即问题中某种有趣的数学结构,使得后训练和对齐可以有一种截然不同且更高效的做法。

他的结论是:这些"宝石"到处都是,寻找解决重要问题的更好方式的机会很多。学术界的好处恰恰在于它允许你下这些反共识的注。资源当然是挑战,"永远不够,有更多算力我们会更高效",但你能接触到出色的学生,所有人都在试图做出新东西,没有人害怕下注——这正是学术界一直如此有影响力的原因。

金句

如果你能给图像去噪,你对图像结构的理解就已经足够,足以基于这些去噪器构建一整套生成流程。 —— Stefano Ermon 3:10
autoregressive 模型在推理时仍然是串行的:你没生成完前面所有 token,就生成不了第 10 个。这种负载和 GPU 根本不匹配,它是极端 memory-bound 的。 —— Stefano Ermon 8:32
我们押注扩散语言模型,因为它本质上更并行,而苦涩教训告诉我们:更并行的那个方案,最终会赢。 —— Stefano Ermon 10:50
一旦你用过快的模型就回不去了,这就像宽带一样。 —— Stefano Ermon 17:01
就算你训出了扩散 LLM,如果没有 serving engine、没有 vLLM 的等价物,你依然是卡住的,根本用不起来。 —— Stefano Ermon 20:49
学术界的好处之一,就是它允许你下这些反共识的注。 —— Stefano Ermon 36:57

提到的书·产品·人物

适合谁听

关心 AI 推理成本与延迟、在评估架构路线或算力/硬件投资的从业者、研究者与投资人。

← 返回全部观看原片 ↗