← 顶级AI播客总结
Latent Space

物理世界撞碎 Transformer:Anima Anandkumar 的神经算子革命

🔬 Why Transformers Hit a Wall the Moment Physics Shows Up — Anima Anandkumar, Caltech
节目时长 84 分钟 阅读约 30 分钟
▶ 在 YouTube 收看原片

天气预报快一万倍、聚变模拟快一百万倍——Caltech 教授解释为什么物理世界需要另一套架构。

核心要点

  • Transformer 算力墙:物理仿真的工业级分辨率是每个维度上千网格点,3D 加时间就是 1000⁴,等于上千亿到万亿级 context 长度,"别想给这种规模上 Transformer,全世界的算力都不够,而且还得全部同址部署" 29:20
  • 五万样本 vs 语言:他们的天气模型只有约 5 万个全球高分辨率气象场样本,物理数据永远不可能像语言那样充沛,所以必须把归纳偏置和物理约束显式加进架构,而不是靠数据堆量 27:48
  • 快一万倍:FourCastNet 用神经算子训练后精度接近传统数值天气模式,但快数万倍——原本需要大型超算的任务,一块消费级 GPU 就能跑,这个结果彻底改变了业界认知 34:00
  • 地球是个球:其他架构假设世界是矩形,长时间 rollout 会迅速崩掉;FourCastNet 3 引入球面几何后能稳定推演数月,Allen AI Institute 基于该神经算子架构做出了目前唯一可用的 AI 气候模拟器 37:06
  • 聚变快百万倍:与英国原子能机构(UK Atomic Energy Authority)合作,用几千个样本就能建等离子体数字孪生、预测 disruption,比传统 MHD 仿真快一百万倍,下一步是把控制和仿真一起设计 64:05
  • 自然界很仁慈:极端事件本以为是 AI 弱项,实际预测得很好——因为飓风这类极端现象有非常具体的物理特征,"物理世界可能更宽容,因为它本身有大量结构",传统数值方法只追求正确性,反而挖不出这种隐结构 43:16
  • AI 不等于语言模型:监管框架常把 AI 直接等同于语言模型,但 AI for Science 完全不同,一刀切会出问题;在她看来语言模型和 agent "本质上还是外层包装",直到 AI 真正理解物理世界为止 80:10

章节时间轴

详细内容

一、两条腿走路:把物理建对,把命题证对

Anima 把自己的研究纲领概括为一句话:AI 和科学如何结合。她指出,很多人把"用语言模型做科学"理解成假设生成——这没错,你可以让模型产出大量想法,但"想法本身不够",真正的瓶颈在于测试和验证这些想法在真实世界里成立 3:50。因此她的近期重心是:如何构建对物理世界有保证(guarantees)的 AI。

这个目标分成两条腿。第一条是建模物理世界并保持物理正确,这就是神经算子的位置。第二条是符号层面的验证:如果声称一个定理成立,就得真的去验证它,而 Lean 作为形式化语言正好承担这个角色 4:35。TorchLean 站在两者交汇处——她强调,需要验证的不只是数学命题,还包括神经网络自身声称能交付的性质。比如你要把一个神经网络放进控制回路(无人机、核反应堆),你就想知道它是否鲁棒 5:21。

主持人追问"到底能证什么,是输入输出的界吗"。Anima 的回答是:TorchLean 是一个整体框架,让你能用类似 PyTorch 的抽象在 Lean 里写神经网络,从而完全形式化,然后在这个框架下实现 certified robustness 的算法,比如 CROWN——不同的松弛技术会给出不同紧度的界 6:53。最自然的一类保证就是敏感度分析:输入被扰动一定幅度时,输出最多变化多少 7:39。这类界不只用于把网络训练好,也用于控制系统关心的安全、鲁棒、稳定性 8:27。另一类界是有限精度带来的影响:网络实际是在有限精度下训练的,能否把这部分误差也界定住 9:15。

主持人 R.J. 问到规模问题:对 Transformer 这种大网络证这些界现实吗?Anima 很直接地承认框架和可扩展性是两件事,Lean 目前仍有不少短板——它是 CPU 的,搬到 GPU 上有大量细节要处理,"要在很大规模上做得高效,还有很多工作要做",而这一点对整个 Lean 生态都成立 10:00。

二、PINN 的天花板:从零求解方程是没希望的

主持人以研究生数值分析课为类比:给定微分方程和离散化误差,你能界定解的性质;但物理启发的神经网络(PINN)历史上有点"西部荒野"的味道——有时能用,有时不能,人们也说不清什么时候能用 10:46。

Anima 的解释非常具体。PINN 的做法是把偏微分方程写下来,然后期待优化成功、得到答案。"如果优化完全不是问题,这就是万能的,我们都开心了,但事实不是这样" 11:32。优化通常极其困难,尤其是时变问题——不只是稳态,还带时间维,而时间分量在很多情况下是湍流的。以流体动力学为例,跑得足够久就会变成混沌,极小尺度的效应也会起作用;在这类情形下,想要在所有时刻求解偏微分方程"基本上是没希望的,这不是一个我们能把握的优化景观" 12:19。

结论是:从零开始用神经网络求解这些方程做不到,PINN 不是处处能用 13:06。这正是神经算子的出发点——不能只靠物理约束产出答案,而要把大量已有数据用上。她以天气为例:我们不只有解方程得到的合成数据,还有观测得到的真实数据,为什么不用 13:52。

主持人要求更多直觉:PINN 是把物理约束烘进网络,加一点数据为什么就不一样?Anima 的对比是:PINN 在经典意义上每个方程实例都从头解一次;而神经算子有一个训练阶段,教它对不同的方程实例给出解,测试时像普通监督学习一样直接问答案,同时仍可用物理约束做引导 14:39。关键差别在于"因为有数据,你不会卡在优化景观里——训练时你就知道答案是什么,所以测试时也更有机会给出对的答案" 15:25。

三、神经算子:把世界当作无限分辨率的连续函数

Anima 把神经算子定位为神经网络的推广。标准神经网络的输入输出是固定尺寸:语言里是固定词表,视觉和视频里是固定分辨率,事后无法更改 16:12。但物理数据本质上是多尺度的,你不该预先决定分辨率——气象数据可能只有粗分辨率,而真实现象发生在更细的尺度上;你也许之后想补入更高分辨率的数据,或者在更细尺度上施加物理约束 16:58。

因此神经算子把输入输出建模成连续函数,可以无限精细地离散化,推理时你可以给任意分辨率的输入、要任意分辨率的输出,不再受训练分辨率限制——"神经算子让我们能随意放大缩小" 17:45。这个映射发生在函数空间之间,这正是"算子"这个名字的来源 19:17。

主持人立刻指出了一个尖锐问题:这样定义的函数是欠约束的,能拟合同样数据的函数有无数个,很容易过拟合,怎么正则化?Anima 承认,在比训练分辨率更高的地方做预测(她称为 zero-shot super resolution)确实有猜测成分,模型在做的是平滑外推 17:45。但如果你给模型额外信息——偏微分方程约束、守恒律——并且在比数据更细的分辨率上施加它们,模型就有了指引,于是"physics-informed neural operator"可以在比训练数据更高的保真度和分辨率上工作 18:30。

关于约束如何实施,主持人问是加进 loss function 吗。Anima 明确回答:是,"因为这是可行的;做成硬约束不可行",而软约束就需要在物理损失和数据损失之间做权衡 48:41。她还提到一个正在研究的有趣方向:不同物理的"课程"(curriculum)——某些物理很难作为损失加进去,另一些容易,所以还要思考该加什么、按什么顺序加 48:41。

四、为什么是傅里叶:非局域现象与准线性复杂度

Fourier Neural Operator(FNO)是他们早期的架构之一,Anima 说它成功的原因是在效率和表达力之间取得了不错的折中 20:03。傅里叶空间的价值在于能高效捕捉非局域现象,而自然界的很多现象——流体动力学、材料变形、量子化学——都是非局域的。她给了一个数学上的说明:微分方程里的导数是局部的,但它的逆运算本质上是积分,是非局域的,所以解本身就是非局域的 20:49。

但她特别强调,这不意味着把世界完全表示在傅里叶基里——那是经典数值方法的线性表示做法。他们在傅里叶层之间加入非线性(就像 Transformer 和其他网络那样),还加残差连接,把在其他网络里被证明有效的架构要素带过来 21:37。

复杂度对比是这段最硬的论证:如果用 Transformer 处理很高分辨率,二次复杂度加全连接会变得不可承受;而傅里叶变换是准线性复杂度,同时仍保留全局连接,能建模非局域现象——"所以这是个不错的中间地带" 21:37。主持人用天气打比方:芝加哥发生的事可能影响旧金山。Anima 补充了时空两个维度:短期是可预测的天气,长期就是气候;你没法精确说芝加哥今天导致旧金山一个月后发生什么(那是蝴蝶效应),但可以给出平均意义上的判断,比如某个区域有热浪,整体温度会高于平均 23:10。

R.J. 从信号处理角度追问:线性变换里存在最大频率,超过就表示不了;加了非线性之后,频率截断的选择会怎么变?Anima 认为这正是表达力的作用所在:如果只做傅里叶变换去表示信号,就需要非常细的离散化,这也是经典仿真昂贵的原因;而深度学习的核心是学特征,所以不能强制只待在傅里叶域,必须给非线性去找表示信号的最佳基 24:43。她的描述是:模型先把二三维的信号非线性地"抬升"到高得多的通道维度——那里已经有一个隐空间——再在傅里叶变换之间做进一步非线性变换;于是即便频率模数有限,加上非线性也能较好地刻画信号 26:15。(她顺口说了句"帮它找到合适的 latent space——无意冒犯节目名",主持人接了句"这是电台节目" 25:29。)

五、经典数学不是包袱,但物理数据永远不够多

主持人问她一个"代际"问题:她的职业起点在神经网络起飞之前,那时人们认真思考基函数、函数展开、正交多项式;社区后来转向"管它呢,全丢进去"。她显然还相信一些经典原则,那么严格的数学技术真能改进对真实世界的建模吗 27:02?

Anima 说这是个取舍,并自我调侃:二十多年前她的本科毕业论文就是分数阶傅里叶变换,"光靠这些当然做不了计算机视觉",但她当时就好奇这些技术能走多远 27:48。她完全同意不能把自己困在"石器时代的技术"里,特征学习、灵活性、表达力、可优化性对深度学习都极其重要。

但转折点是数据:涉及物理世界和物理数据时,数据永远不会像语言模型那样充沛。她给出了具体数字——他们的天气模型大约有 5 万个样本,是相当高分辨率的全球气象场,但这跟语言完全不是一个量级;在其他领域甚至更少,因为仿真太贵,真实数据可能根本不存在 27:48。所以必须更多地思考归纳偏置、加入物理约束,不能只依赖数据,架构设计的分量因此上升 28:33。

第二个转折点是计算复杂度,这是全场最有冲击力的一段。语言只有一维,即便如此上下文长度到百万级就已经很吃力;而物理世界是 2D、3D 甚至 4D(3D + 时间),如果每个维度只有几百个网格点——而工业级规模是每个维度约一千个网格点——那就是上千亿到万亿级的 context 长度,"所以别想给这种规模上任何 Transformer,全世界的算力都不够,而且首先它们全都得同址部署才可能做到" 29:20。

R.J. 反驳说我们已经有视觉和视频语言模型,它们也在学映射。Anima 的回应是分辨率才是关键:物理世界要的是 1000×1000×1000×1000,那已经是几千亿量级,而图像视频根本没做到那个分辨率 30:07。R.J. 继续从 codebook / 压缩角度辩护自回归方法的成功 30:52。Anima 的反驳很清晰:视觉和视频模型的自回归技术主要是为了"看起来好",不是为了精确仿真;而在精确仿真里高分辨率和细节至关重要,你至少得把那个分辨率的数据吃进去、在上面推理——这才是真正的瓶颈,因为你不能把细节全扔掉退回到每维 100 或 50 个网格点,那样根本没有足够细节去正确刻画流体、等离子体、材料变形 30:5231:39。

六、FourCastNet:从被劝退到成为气象机构的标配

选题动机很朴素:他们在找有趣的例子,天气数据是开源的——ECMWF(欧洲全球气象机构)的 ERA5——"数据在那儿,我们就想,行,那就试试" 32:28。但当时(2021 年)很多气象科学家劝阻他们:传统天气预报是几十年精心构建的自下而上物理建模,AI 不可能打得过 33:14。

结果出乎所有人预料。他们用神经算子有效捕捉了这些现象,模型不仅准确度接近传统天气模式,而且快数万倍:原本需要大型超算的运算现在只需要一块消费级 GPU,模型很小、跑得很快、还准 34:00。她认为这件事改变了所有人的想法——之后 DeepMind、华为等一年后陆续发布自己的模型,而他们是第一个真正开源天气模型 FourCastNet、并且采用宽松许可的团队,这让公司、气象机构都能在其之上构建 34:00。她特别强调一个社会意义:全球南方的小型气象机构现在能获得过去只有大机构才有的预报保真度,这是天气建模的民主化 34:46。

主持人追问"关键洞见到底是什么"。Anima 分成两步说明。第一步是最初的工作:传统方法每次都要重新求解偏微分方程,而 AI 从数据中学模式,可以同样准确但快得多 35:33。第二步是准确度的迭代,这里涉及一个观念转变:传统上短期天气(未来两周可预测窗口)和长期(次季节直到气候)用的是完全不同的模型系统,"但对我来说只有一个地球"——如果说这是基础模型,它就该同时做短期和长期 36:20。

FourCastNet 3 做到了这一点,关键是纳入了地球的球面几何。她的解释是:其他架构在短期天气上精度不错,但跑到数月乃至一年就会迅速爆掉,因为它们假设世界是矩形,而世界不是 37:06。把几何信息纳入神经算子后,同一个模型能忠实地跑长期,进而变成气候模型——Allen AI Institute 已经基于他们的神经算子架构构建了气候模型,"那是唯一能作为 AI emulator 工作的",因为气候要求你假设世界是球体、且反复 rollout 时保持这一信息 37:52。她把只看几个指标的窄替代模型(narrow surrogate)和要做一系列任务的基础模型明确区分开:前者很多架构都能胜任,后者才需要几何 37:52。

七、训练细节、集合预报与极端天气的意外之喜

数据方面,训练用的是全球气象场,而非局部区域。模型接受当前天气(风、湿度等),以自回归方式预测下一个 6 小时,然后一步步 rollout 39:24。这里出现了本期最反直觉的细节之一:训练目标只是预测未来 6 小时,再加"一点点"多步微调用于自回归 rollout;他们并没有针对气候尺度训练,因为太贵;"我们只是希望它神奇地能用"——而它确实能推演数月 59:2860:14。主持人直言"这非常令人惊讶,我以为训练尺度是几周或几个月" 60:14。

数据本身是 reanalysis data,即历史气象数据经过再分析:原始卫星数据与物理求解器给出的结果被同化在一起,由气象机构发布 50:13。R.J. 把这个流程复述为"取低分辨率的全球观测数据,再用经典物理方法做短时仿真填补细节",Anima 确认,并指出一个副作用:数据本身已经用物理仿真加工过,所以他们的模型隐式地就是 physics-informed 的——这可能是它在极端天气上表现好的一个原因 50:59。分辨率方面,可用数据是 0.25 度,大概相当于 700 × 数千的网格 61:47。球面上使用球谐(spherical harmonics)基,主持人评论这比 FFT 处理起来要难,Anima 回应说傅里叶的框架正好能很好地纳入这些几何 57:55。

关于集合预报,Anima 给了一个非常具体的操作图景:飓风在加勒比海形成时,你并不真的知道测量值,所以给初始条件加不同水平的噪声,看可能的飓风路径如何演变,从而得到不同区域登陆的概率,这才能做风险评估 53:20。传统天气模式跑这些 ensemble 极贵,而 AI 天气模型快数万倍意味着可以跑非常大的 ensemble,这对风险评估是很大的改进 54:07。目前公开展示的是"几十个"成员量级,但可以做得更大;主持人猜"预测越长需要越多成员",Anima 纠正说不一定,关键在于校准 ensemble、确保 spread 正确 56:23。

这里有一段主持人反复澄清的技术细节,值得记录:物理约束是加在每个 ensemble 成员上,而不是加在平均上。Anima 说"要确保你看的是每个 ensemble 成员并且它遵守物理",因为对平均做粗粒化会丢掉分辨率;每个成员独立满足约束,ensemble 本身则不需要 57:0957:55。她也坦承长时间 rollout 仍是开放问题:你不想把细节完全抹平(否则不准确),但保留细节又可能物理上无效,"这是我们正在积极研究的" 41:4357:09。

公众认知的转折点是 ECMWF 上线。她说 ECMWF 把 AI 天气模型向公众开放(她记得是 2023 年秋,"两年多前")是很大一步,因为大家能亲眼看到这些模型在做什么。她举 Hurricane Lee 为例:FourCastNet 比标准天气预报模式提前数天正确预测了登陆——这对人命和经济成本都意义重大,气象科学家因此有了信心 51:4652:33。

极端事件的表现是她眼中真正的惊喜。她说本以为罕见事件是 AI 的弱项,但从最早的尝试起,可视化某些飓风和风暴就发现效果很好 42:29。她给出的解释上升为一条一般性洞见:物理世界可能更宽容,因为像飓风这样的极端事件有非常具体的物理签名——"极端,但是以一种非常特定的方式极端",所以也许不需要那么多样本,因为物理世界本身有大量结构 43:16。她拿聚变佐证:等离子体只有几千个样本,却能准确预测 disruption 这类事件,且比传统仿真快一百万倍 43:16。她把这归功于自然界"有大量隐空间结构",而传统数值方法更关注在任何情形下都正确求解,反而挖不出这种结构;AI 从数据中学习,能揭示这些问题实际有多可解 44:03。

主持人 Brandon 从计算生物学给出一个平行类比:AlphaFold 是该领域最激动人心的进展(他提到此前和 Boltz 团队的一期节目讨论过其中的细节和保留意见),而蛋白结构之所以成为生物学中少数大胜利,正是因为它被物理强约束;由微分方程刻画得好的问题,更有整合这类技术的空间 44:48。

八、从聚变到光刻:逆向设计与"物理基础模型"

聚变:他们与英国原子能机构(UK Atomic Energy Authority)合作建 tokamak 的等离子体演化模型,求解磁流体动力学(MHD)方程,比传统仿真快一百万倍,本质上是造了等离子体的数字孪生 64:05。R.J. 解释了 disruption 的物理危害:整个等离子体在某个时刻收拢成一束细小的射流打向包容容器,可能损坏反应堆,因此必须提前关机,可持续聚变也就无从谈起 64:51。下一步是同时设计控制与仿真,理想目标是在事件发生时调整磁场把它稳住 65:36。她还提到他们同时在做 stellarator 等其他路线,并给出一个有意思的元论点:作为 AI 研究者可以不预先押注赢家——物理世界里你必须砍掉风险高的方案、只做最可能成功的那个,而 AI 让你能在数字世界里承担风险、并行探索多条路径 66:21。

其他领域:碳封存——把二氧化碳注入地下,建模它如何扩张、储层压力如何积累、数十年间如何迁移,比传统仿真快得多 70:58。空气动力学——汽车、飞机等任意几何形状,做法是把车(或任何形状)变换到一个甜甜圈,在甜甜圈上建模,再变换回去;这是"隐空间"最漂亮的例子之一,让一个模型泛化到大量不同几何 71:45(主持人调侃"你怎么没变成咖啡杯,那才是经典笑话")。逆向设计——逆向光刻(inverse lithography)的掩模设计、量子点里的栅极设计、非线性光子学 75:34。她指出这类问题的共性是:有一个正向模型在仿真物理,但你真正想要的是逆向设计的最优解,而"人类通常不擅长这个"——我们不擅长看着高度非线性的现象说出"也许这一组栅极组合能把电子拉到一起",她的合作者手工做这件事很吃力,而 AI 能给出高效设计,并且因为仿真就在优化回路里,这些设计是可信的 76:20。她总结说,这些例子表明价值不只在仿真,而在真正新颖的设计和发现 77:06。

物理基础模型:主持人把这条线归纳为一个愿景——训练一个能建模多种物理现象的基础模型,再针对具体几何做微调或提示。Anima 确认这就是未来:"我们有语言的基础模型,也许有视觉的,但没有物理的" 72:31。目前看到的都是窄替代模型,而理想的是覆盖广泛现象、并且能处理多物理耦合(real world 里各种物理是耦合在一起的),既能做仿真也能做设计 73:18。她还指出另一个有趣方向是逆问题:不只是仿真,而是直接问最优设计是什么——从"人先设计、再仿真或进风洞验证"的旧范式,变成"AI 给出优化设计、但有物理作为护栏" 73:1874:03。

关于泛化的边界她说得很克制:完全没见过的物理无法迁移,"如果你说的是超越标准模型,那根本没有数据,做不到" 74:03。但如果模型分别学过热传播和材料拉伸,现在出现了热导致拉伸的耦合现象,就有希望用少得多的样本微调——从零开始学耦合仍然太难(高度非线性),但少样本是可行的,他们的多篇论文都有这类证据,本质上是搭建一个"课程",把模块化的物理拼起来 74:4875:34。

九、职业弧线、联合国与"AI 不只是语言模型"

主持人观察到她的职业轨迹:早期大量时间在机器学习的理论基础和数学上,六到八年前开始大量转向应用和多样化问题 67:08。Anima 的自述是"我和 AI 一起成长":神经网络因为数据不足等原因跑不通的年代,你只能建理论基础,希望它把你带到算法能work的地方;那时的张量方法就是这个思路——深度学习之前人们仍想要结构,有隐狄利克雷分配(LDA)这样的概率模型做主题建模,求解很难,而张量方法给出了可并行、可大规模、又有良好理论基础的实用方案 67:53。

然后深度学习起飞,实践上有效,但理论理解不多,"对我来说理论不该是约束,而应该是使能",于是她转向让方法在实践中大规模跑通,去了 AWS 和 NVIDIA,"真正把手弄脏" 68:39。而现在她看到一个完整的圆:纯数据驱动的方法出现饱和,一条路是让它们更省硬件更省能耗,另一条路就是像物理世界这类数据不够、需要硬外推的领域——"发现按定义就是外推,我们永远不会有关于一个新发现的数据",所以必须在架构设计、算法设计、损失函数上重新有原则地思考,把深度学习里可用的都拿来,但做得更有原则 69:2470:11。

关于新加入的联合国科学顾问委员会,她说在地缘政治复杂的时期,让科学家在场很重要,她希望提供无偏的科学证据:如何确保 AI 的好处触达所有人、如何民主化 AI 的可及性、如何控制非预期和有害影响;同时她对天气气候建模在联合国体系内的应用(包括用天气服务农业和粮食)也很兴奋,因为联合国在全球各地有专门机构和一线人员 77:5178:37。

主持人指出她比 AI 圈很多人更乐观、更愿意解决具体问题而不是空谈,问她能带来什么独特视角 79:22。她的回答直指监管:作为科学家她努力保持无偏,而只谈危害时常常会漏掉 AI 大量的有益面,尤其是 AI for Science——"很多监管框架把 AI 等同于语言模型";语言模型确实能操纵人、确实有需要控制的危害,但 AI for Science 是不同的东西,一刀切正是很多问题的来源 80:10。

最后两问的答案很干脆。若能魔法般解除本领域一个瓶颈,她的答案是"更多算力"——她自嘲这是个偷懒答案,也顺口感谢了 NVIDIA 等推动算力增长(主持人笑称"再一次",她说"不作评论"),但她强调重点是让研究者拿到更多算力,她知道国家实验室在建更多超算,"没有算力我们就无法实验、无法创新" 80:5881:45。行动号召是:去玩 neural operator 的开源库——它已被广泛采用,属于 PyTorch 生态,有大量文档、多种架构、示例和 recipe 77:5181:45。以及那句贯穿全场的判断:AI for Science 不只是语言模型和 agent,那些"某种意义上仍然是外层包装",直到我们有真正理解物理世界的 AI——不只把它当符号,而是能仿真、能设计、能基于它做控制——之前,都有很大一块拼图是缺的 82:30。

金句

你可以有很多想法,但想法是不够的——瓶颈在于去测试、去验证它们在真实世界里成立。 —— Anima Anandkumar 3:50
每个维度上千个网格点,3D 加时间,我们说的是上千亿到万亿级的 context 长度——所以别想给这种规模上 Transformer,全世界的算力都不够。 —— Anima Anandkumar 29:20
它不只准确度接近传统天气模式,还快数万倍。原本要靠大型超算跑的东西,现在一块消费级 GPU 就够了。 —— Anima Anandkumar 34:00
对我来说只有一个地球。如果它是基础模型,它就该同时做得了极短期和极长期。 —— Anima Anandkumar 36:20
物理世界可能更宽容,因为飓风这类极端事件有非常具体的物理签名——极端,但是以一种非常特定的方式极端。 —— Anima Anandkumar 43:16
对我来说理论不该是一种约束,它应该是一种使能。 —— Anima Anandkumar 68:39
AI for Science 不只是语言模型和 agent。那些某种意义上还是外层包装——在我们拥有真正理解物理世界的 AI 之前,缺的是很大一块。 —— Anima Anandkumar 82:30

提到的书·产品·人物

适合谁听

想知道"为什么科学与工程领域不能直接照搬 Transformer"的 AI 工程师、以及关心 AI 在天气气候、聚变、材料与芯片设计中如何真正落地的研究者。

← 返回全部观看原片 ↗