← 顶级AI播客总结
Latent Space

Transformer 撑不起物理世界:Anima Anandkumar 的 5 万亿上下文豪赌

Transformers Can't Think In Physics — Anima Anandkumar & Benedikt Jenik, Accelerated Understanding
节目时长 27 分钟 阅读约 14 分钟
▶ 在 YouTube 收看原片

Accelerated Understanding 出鞘:用 neural operator 训练物理界的「GPT 时刻」,训练上下文一万亿、推理五万亿。

核心要点

  • 一个模型吃多种物理:同尺寸模型同时学多个物理领域,效果优于把同样参数量全给单一物理的专用模型——这说明收益来自跨领域共享学习,不只是「模型变大了」,与语言模型的涌现同源 7:41
  • 5 万亿上下文:空间三维不压缩、时间不做自回归,四个维度独立增长相乘后轻松进入万亿量级;他们训练做到万亿上下文(输入输出皆是),推理做到 5 万亿,且不用视频模型的像素平均和 patch 技巧 6:09
  • Transformer 出局:二次复杂度在 5 万亿上下文下无论投多少算力都不可行,而且没必要——物理世界有结构,不是任意的 all-to-all 关联;neural operator 提供分辨率无关性,可按任务动态给不同上下文 10:46
  • 物理定律当奖励:数值仿真器负责造数据,PDE 本身还能当训练信号检验模型;相比语言自我改进只能靠稀疏的人类点赞点踩,物理反馈是稠密的,因此可以推到超越训练数据质量的位置 17:43
  • 课程式训练:语言训练是下载整个互联网、乱序、真假混杂,而他们能用仿真器自建课程——从简单方程、低分辨率开始按顺序学,更接近人类学习方式 16:57
  • 分片基建重写:单个数据样本装不下一个加速器甚至整个节点,FSDP 那套「在 GPU 内重组一层」的标准做法直接失效,整套 sharding 策略必须重新发明;5 万亿那次推理输出就有 22 TB 6:54
  • 半导体与能源先行:首批商业化押在 semi 和 energy——芯片设计今天只把物理当一次性合规检查(PDK 过了就停),没人去吃掉剩下的物理裕度,而这正是他们要打开的性能空间 20:48

章节时间轴

详细内容

一、赌注:物理世界的「统一模型时刻」

Benedikt 的叙述起点是语言领域的历史。在 AI 革命之前,人们为每个任务训练一个模型:拼写检查一个、翻译一个、自动补全一个。OpenAI 的做法是把所有东西塞进一个模型,结果这个统一模型在几乎所有维度上超过了专用模型。

Accelerated Understanding 的问题因此非常直接:物理仿真和物理理解能不能做同样的事? Anima 把它表述为「语言里我们见到的那种普适性和规模效应,物理世界的对应物是什么」——这就是公司押的注。

主持人立刻提出了最尖锐的质疑:语言再多样也还是语言,但天气仿真、心脏导管和核聚变反应堆之间,物理本身就很不一样,凭什么会有迁移?

二、为什么物理之间真的能迁移

Anima 的回答分两层。

第一层是坦承困难:物理世界不存在「现成的互联网」,真实数据根本不够;更麻烦的是,科学发现按定义就是做出训练数据里没有的东西。所以纯数据驱动的路走不通,必须把物理定律本身加进来。

第二层是给出共享结构的证据。表面上,导管里的流体和火箭里的流体是不同场景,但它们服从同一套流体动力学原理,差别只是雷诺数等参数刻画的不同区域。再往上抽象一层:即使不同系统由不同的偏微分方程(PDE)描述,这些方程之间仍然共享大量隐含特征——随时间的演化、某种形式的能量守恒、物体恒存性、因果性。跨领域(能源、半导体、航空航天)看起来天差地别,但底层原理是重叠的,而神经网络恰恰擅长捕捉这类共享特征。

这个论点后来被实验直接支持:同样参数量的模型,喂多个物理领域比只喂一个领域效果更好;如果把专用模型也放大到同等尺寸,仍然更差。Anima 强调这个对比的意义——收益不是「模型更大所以更好」,而是「加入更多物理领域帮助它在每一个领域上都学得更好」,这与语言模型里观察到的涌现学习是同一种现象。

三、不走捷径的代价:四个维度同时膨胀

Benedikt 讲架构时反复用一个词:不抄近路(don't cut corners)。

语言模型的 token 只在一个维度上增长,前沿模型能塞进一百万个。他们的数据不同:空间保持真实的三维、不像视频模型那样压缩;时间维度也不做自回归。自回归意味着一步步预测,误差会累积,而且会丢掉连续性、丢掉「输入中的什么导致了输出」这一信息——而后者对于做设计恰恰是最关键的。所以他们直接建模完整 rollout。

结果就是四个维度各自独立增长,乘起来立刻进入十亿甚至万亿级上下文。他们做到了:训练时输入输出都达到万亿上下文,推理达到 5 万亿。Benedikt 特意指出,他们没有用视频模型那套效率技巧——不做像素平均、不做 patch——却仍然撑住了这个量级。

算术其实很朴素:每个空间维度 1000 分辨率、时间上精确解析 1000 步,乘出来就是一万亿。而 5 万亿那次跑,仅输出就是 22 TB,而这些东西你希望它待在加速器显存里,否则速度无法接受。

代价落在基建上。像 FSDP 这类标准技术的前提是「分片存储、训练时在单个 GPU 内重新组装一层」——但他们的层大到无法在 GPU 内重组,单个数据样本大到装不下一个加速器、甚至装不下一个完整节点。整套 sharding 基础设施和策略都得重新发明。Benedikt 的总结是:LLM 训练正在越来越多地撞上的那些问题(既需要现代技巧又需要老派 HPC 方法),他们从第一天起就必须面对。同时另一端也在跑通——小模型配小上下文、甚至中等模型配小上下文,可以塞进一台 MacBook 或 Mac Studio。

四、架构:neural operator 而非 Transformer

架构细节属于专有信息,但 Anima 讲清了骨架:neural operator 构成基础,因为它带来分辨率无关性(resolution invariance)。

这一点的实际价值在于弹性。5 万亿上下文是为最难的物理准备的,但不是每次运行都需要那么高的分辨率——尤其在设计探索的早期阶段,你并不需要每一个细节,也不该烧掉那么多算力。分辨率无关意味着同一个模型可以按需要给出不同的上下文长度。

Anima 顺势划出与其他「世界模型」的分界线:视频模型、视觉模型在训练和推理时都假定固定分辨率。对游戏和娱乐来说这没问题,物理稍微含糊一点无所谓;但工程设计和科学发现用不了这种取巧。

对 Transformer 的判决则更硬:注意力的二次复杂度在 5 万亿上下文面前,无论投入世界上多少算力都不可行;而且它也没有必要——物理世界有结构,并不是完全任意的 all-to-all 关联。所以架构必须为物理世界重新设计。她把这个过程类比成语言前沿实验室的演化路径:大量系统性实验、从早期架构演进到 mixture of experts 等等,他们也在走同一条演化曲线,同时做架构与硬件的协同设计,把通信、带宽等要求一起考虑进去。

主持人追问了 Fourier neural operator 那类几何归纳偏置——比如在球面上运算——在面对多种几何时如何迁移。Anima 没有展开专有细节,但给出的原则是:模型不被外部规定死在某一类几何或某一类 PDE 上。

五、数据与自我改进:把物理定律变成稠密奖励

数据这一节是全场信息量最高的部分之一。

Benedikt 先点出行业里反复出现的失败模式:某家公司拿到一小块很漂亮的数据,做出闪亮的 demo,但客户真正关心的场景是 out-of-sample,于是什么也部署不了。这类窄替代模型(narrow surrogate)的天花板正是他们想跳出去的。

他们的解法建立在一个数学事实上:当你正确地解出一个 PDE,你就是在正确地做物理。 因此只要采样域足够宽,保证目标任务落在分布之内,sim-to-real gap 就能在很大程度上被绕开。于是数值仿真器可以按需生成任意多训练数据。

在此之上是课程工程(curriculum engineering)。语言训练是把整个互联网下载下来、打乱、真假混杂地喂进去;而人类学习显然是有顺序的。他们可以从简单方程、低分辨率的简单数据开始,按难度排布训练顺序。

但如果只做到这一步,模型的质量上限就是训练分布的平均质量——机器学习的老宿命。突破口是自我改进:PDE 不仅能用来生成数据,还能反过来当作训练信号,检验模型在方程本身上做得如何。Benedikt 特别强调它与语言的差别:语言的自我改进依赖人类反馈或其他奖励信号,而这些信号极其稀疏,只告诉你「行/不行」;物理定律有很多条,反馈是稠密的,而且这些定律的排布本身又可以设计成课程。这让模型可以被推到超越训练数据质量的位置——他们的实验已经看到了这一点。

多尺度问题的处理逻辑与此一脉相承。物理表征的难点在于要同时表示大尺度和小尺度上发生的事,跨越数个数量级。当然可以全部用最高分辨率算,但极其昂贵。更好的做法是:先用低分辨率、甚至更便宜的粗化解算器收集更多数据——它们忽略细尺度效应,是「错的」,但足以给出整体平均效应作为起点——再用考虑细尺度特征的专用解算器做微调。Anima 指出,neural operator 的优势在于允许在模型内部混合不同尺度,而不是像很多物理机器学习混合方法那样由外部规定,因而数据效率和学习效果都更好。

六、落地:半导体的「被浪费的裕度」与能源

商业化按两个坐标切:物理领域,以及这些领域能服务的行业。当下最明显需要突破、又正好在他们射程内的,是 semi(半导体)和 energy(能源)。

芯片设计的例子讲得最具体。今天的流程基本是:先在数字域完成设计,把数字部分冻结,然后送去做一次性的物理检查——PDK 规定必须满足某些特征,否则 TSMC 不给你造。检查通过就结束了。Benedikt 的观察是:「我们今天并没有利用那些裕度去换取额外性能。」 如果能够真正问「物理允许我做到什么」,就有机会把包络再往外推一点,甚至通过重新排布把它推得更远。半导体的生产制程本身也充满同类物理挑战。

能源侧分两类问题。一类是设计:我要一个具备某些能力的物理对象——这是他们的强项(此前节目聊过核能)。另一类是反演:我有对世界的观测,它告诉我世界是什么样——比如地热,你想知道地下哪里够热、且有合适的水可供循环;又比如关键矿产在哪里,而那是所有电子设备的原料。Benedikt 的判断是,一旦模型达到足够的普适性,大量的门会同时打开,因为彼此不同的东西其实没那么多。

主持人追问这种迁移是否已经在真实商业场景中出现。回答是肯定的:他们做过对照——先确认某个仿真器配置正确、能单独训练出模型,再把它加进通用模型。观察到的性能特征对比是「broad all the way」,广谱模型全面胜出。

七、下一步与 Time 100

Anima 说公司在同时扩模型和扩团队,出 stealth 之后 inbound 大量涌入,她还在逐一回复。她把当下定位为「模型规模化旅程的开始」:要去啃科学发现和发明中最难的物理现象,同时又必须对商业侧诚实,沿途为客户解锁真实价值——这个组合正是他们兴奋的原因。

关于 Time 100 AI,她说自己既激动又意外,去年还拿过 Time 的 Impact Award(在迪拜领奖,见到很多领域内的重量级人物)。她认为 Time 做这件事是好的:把对 AI 持不同视角的人聚到一起。

金句

我们不想抄任何近路。所以我们说:让一切都保持它在真实世界中的样子。 —— Benedikt Jenik 5:23
科学发现的本质是做出新东西,所以按定义它不可能存在于训练数据里。 —— Anima Anandkumar 3:04
同样大小的模型,装进多个物理领域,比把全部参数都给单一物理要好。 —— Anima Anandkumar 7:41
那种二次复杂度是不可行的,而且也没必要——物理世界比完全任意的 all-to-all 关联更有结构。 —— Anima Anandkumar 10:46
语言的自我改进只能靠稀疏信号,只告诉你赞或者踩;而我们的物理反馈是稠密的。 —— Benedikt Jenik 17:43
今天我们并没有利用那些物理裕度去换取额外的性能。 —— Benedikt Jenik 20:48

提到的书·产品·人物

适合谁听

关心 AI for Science、世界模型架构之争,或想知道芯片设计与能源勘探下一波效率来自哪里的人。

← 返回全部观看原片 ↗