← 顶级AI播客总结
Latent Space

降两个飞行高度层,就能修掉 1% 的全球变暖

🔬 1% of Global Warming Is Fixable by Changing Altitude — John Platt, Google Fellow
节目时长 121 分钟 阅读约 38 分钟
▶ 在 YouTube 收看原片

Google Fellow John Platt 拆解 ERA、凝结尾迹与聚变:AI 是科学的电动工具,也会锯掉你的手指。

核心要点

  • 可打分任务:ERA 的核心抽象是把科学问题改写成"我想要一段代码,让某个分数最大化"。统计建模只是其中一个子集,渐近展开、遥感超分辨、流行病预测都能被塞进这个框架。
  • 1% 的全球变暖:持久性凝结尾迹约占全部人为变暖的 1%。它白天反射阳光降温,但 24 小时都在吸收并回辐射地球约 10 微米的黑体红外,净效应是像毯子一样锁住热量。
  • 两个飞行高度层:尾迹只在"冰过饱和"区域形成,这类区域呈煎饼状、只有几百米厚。让飞机下降两个高度层绕开,多烧一点油,就能大幅削减航空的气候影响。
  • 10000 比 1:在坏区域里,飞机每排出 1 克水、冰或煤烟,会从大气中"钓"出约 10 公斤的水凝结成冰——Platt 用做冰糖(rock candy)过饱和糖水来类比这种放大效应。
  • 电动工具会锯手指:Platt 说 AI 让过拟合风险陡增,"你现在必须更小心、更严谨,才不会骗到自己",必须有真正藏起来不看的 hold-out 集合。
  • Gemini 2.0 根本不行:同样的想法在 2.0 上"不可能跑通",2.5 开始能跑,如今已经"惊人"。Platt 对科学家的提醒是:别拿一年前的体验下结论,那已经是一个纪元以前了。
  • 天气被攻克,气候没有:15 天内的天气预报已因 2018 世代的 ML 出现阶跃式进步(连热带气旋路径都能提前很多天算准),但气候是非平稳的低数据问题,AI 至今没能革命它。

章节时间轴

详细内容

一、ERA:把科学翻译成"可打分任务"

Google Research 做 AI for science 已经十多年。Platt 说,十年前的做法是"经典机器学习"——为每一个具体科学问题手工造一个卷积网络之类的专用模型。大约两年前,团队被通用 LLM 的能力吸引,开始寻找一个更普适的抽象,最后撞上了"可打分任务"(scorable task)这个映射:大量科学问题都可以改写成"我想要一段代码,它让某个分数尽可能高"。

Platt 强调这个框架比机器学习宽得多。机器学习只是其中一个特例(分数就是数据集上的拟合优度)。ERA 论文的第一作者 Michael Brenner 擅长用它"一晚上敲掉一篇论文":比如应用数学里的渐近展开——你想知道某个常微分方程在参数 epsilon 趋于 0 时的行为,就让系统提出候选的渐近解,然后在 epsilon = 1e-4 这样的取值上检验拟合,同时让 Gemini 做数学推理去解这个问题。

另一个被反复提到的例子是遥感。卫星观测永远在重访频率、空间分辨率、光谱分辨率三者间取舍:你想要每 5 分钟一帧、10 厘米像素、高光谱,物理上做不到。ERA 的做法是把两颗卫星拼起来:OCO-2 / OCO-3(后者挂在国际空间站上)能提供高精度、高分辨率但只有窄条带的 CO2 测量;GOES 气象卫星每 5 分钟拍一次全图、有红外波段但像素巨大且本来就不是为测 CO2 设计的。于是让系统从后者估计前者,再把天气、长期反照率等数据铲进去——本质是一种"有先验知识的超分辨"。

用户侧的入口是对话。因为"怎么把问题映射成可打分任务"本身往往不显然,团队专门写了一个 agent 陪你聊,帮你把问题定义清楚,并在底下产出一个带打分函数的 Python notebook,然后开始变异它。

二、引擎盖下:蒙特卡洛树搜索,但变异器是 Gemini

用 2026 年的术语说,ERA 是一个跑蒙特卡洛树搜索的专用 harness(团队实际是 2024–2025 年做的)。它维护成百上千个候选 notebook,每个候选可能有子节点,因此候选池是树状的。选哪个分支去扩展,用的是强化学习里很标准的 UCB(upper confidence bound)——一个乐观算法:估计每个候选变异后的 95 分位结果(大致是"当前表现 + 2 sigma"),选上界最高的那个。所以它不总是贪心地挑当前最好的 notebook,有时会去搞第五好的那个。团队还试过把两个候选的想法"揉"在一起生成第三个。

并行度是个权衡。默认是 10 片叶子同时生长。主持人追问为什么不开一千个,Platt 解释:如果一次跑 10 个搜索,1 号看不到 2–10 号在干什么;开一千个就是在烧算力而没有交叉学习。一小批跑完之后,历史(它当时在想什么、代码结果如何)会回到共享上下文里——当然要剪枝以免炸掉 context。主持人打趣说"你们是在硬逼 Gemini 的长上下文能力",Platt 承认:"确实,而且你得做好上下文管理。"

初始种子怎么来?Platt 说这才是神奇之处:你只要给它问题的文字描述,Gemini 就能写出第一版代码;你甚至可以扔给它五篇别人解过这个问题的论文,它会去读,然后动笔。第一版可能有 bug、返回负无穷,但它会继续变异改进。你也可以给启动代码,但不是必须的。

Platt 特别点出这个设计为什么现在才奏效:进化式编程从七十年代就有,大家都爱搞"变异 LISP 代码",但它一直没起飞,因为代码空间里的随机变异基本毫无价值——就像 DNA 一样,大多数突变是有害的。ERA 的不同之处在于内循环本身是个知道世界怎么运转的 AI,它"知道有意思的梯度往哪个方向走"。

三、评分函数、reward hacking 与 Goodhart 定律

主持人 RJ 提出一个尖锐的观察:在真实 ML 项目里,人从来不是只盯一个指标,还会看训练曲线、翻具体样本;而且定义那个分数往往才是最难的部分,他不确定自己会信任 agent 来做这一步。

Platt 同意,而且说这里必须非常小心:常见情形是你(或 agent,或你们一起)定了一个评分函数,然后迭代过程找到了作弊路径或漏洞——"不不我不是那个意思"——于是你得在外面再套一个循环反复纠偏,或者在指令里明确禁止某些做法。你不会在第一天就拿到正确的评分函数。

但他认为这恰恰是好事。在"老日子里,也就是 2024 年",研究生大量时间耗在写科学软件上,写代码太费劲,所以你只敢试几个相关的方案就收手去写论文了。ERA 则是不知疲倦的,于是使用者的时间全被推到了正确的层级——"什么叫一个好的 cost function",这几乎就是科学问题的本质。人不再泡在"我得 import 这个 CSV、我得让这个数据库跑起来"的泥浆里,而是在近乎哲学地思考自己的科学问题。顺带一提,agent 还会主动建议你 join 哪些数据集。

被追问有没有搞笑的 reward hacking 故事时,Platt 老实说自己一时想不起来。主持人接了一句很妙的类比:机器学习像猴爪之前的古老精灵故事——小心你许的愿,因为你一定会得到它。Platt 说确实有这种"精灵感",但另一面是 Gemini 有世界知识,尤其你给它指几篇论文之后,它做的事多半是"理智的"。

真正的反例来自人类。ERA 项目的起源其实叫 auto-Kaggle(很多人不知道 Kaggle 属于 Google),所以它天然长成了打榜的形状。而 Kaggle 里过拟合泛滥:Platt 团队自己办过一个凝结尾迹的 Kaggle 竞赛,结果有人打败了他们——因为选手发现标注里有半个像素的偏移(原点到底在像素中心还是左下角),在制造旋转过的人造数据时没处理这个偏移,选手就抓住这点榨出了额外分数。Platt 由此引到 Goodhart 定律:"任何变成目标的指标,都不再是好指标。"他说这就是整个 AI 领域不断耗尽一个又一个榜单的原因:Goodhart 定律对你造的每一个 leaderboard 都单独生效。

战绩方面:ERA 在 Kaggle 的 playground 类竞赛里表现非常好;最让团队自豪的是 CDC 组织的那个"预测下周全美各州及属地的新冠与流感病例数"的竞赛,ERA 成绩极佳(主持人调侃说,Google 二十年前发明了 Google Flu,现在算是绕回来了)。但在另一些竞赛里就没那么突出——Platt 坦承这些比赛的名次常常是"你愿意投入多少 TLC、愿不愿意把最后 0.001 榨出来"的度量,而没人在旁边替 ERA 抠那最后的零点零零一。

四、预测模型 vs 描述模型:AI 能发现新物理吗

主持人抛出多重假设检验的担忧:现在 ERA 每跑一个算法就是一个新假设,状态空间指数爆炸,过拟合风险应该更高才对(他说自己已经把 ERA 的开源版本接到 Claude 上跑起来了,还不知道效果)。

Platt 把问题拆成两半,先讲一个他认为在 LLM 时代正被刻意模糊的区分:预测模型 vs 描述模型。预测模型就是给定输入输出、把某个数据集上的错误率压到最低的统计模型。描述模型才是科学真正想要的——它内部捕捉了物理或对现实的某种描述,因此可以外推。"牛顿确实想过苹果和引力,但引力根本不是关于苹果的。如果他只是个 17 世纪的机器学习模型,他会说'苹果会掉',至于行星?我没有行星的数据,谁知道呢。"

被追问"外推能力是来自显式引入的先验,还是模型自己学到的物理",Platt 说这个界限本来就模糊:物理学家也是靠直觉、或者说靠一堆已知事实,来确保自己造的模型与已知一致。而当前的 ERA 用的是 LLM 直觉——你指给它已有论文,它就会造出比较靠谱的模型,你也可以通过"记得把这个纳入进来"来注入偏置。

主持人举了几个具体的形式化先验:PDE 里的 neural operator、physics-informed neural network,分子系统里的等变性(equivariance)。Platt 说他没看到 ERA 真的去做等变建模("如果你了解 Clebsch-Gordan 系数,你知道那会变得多毛躁"),但它非常擅长复现论文里的方法。他讲了一个例子:有位 MIT 教授写过一个"给定固定屋顶面积、用镜子/支架/太阳能板设计一个立体装置以最大化全天太阳能捕获"的代码;Michael Brenner 试的时候,Platt 相信他根本没装那个模拟器——因为 ERA 内部有编码 agent,直接把论文里的代码重造了出来。

结论是:如果你不告诉它 Clebsch-Gordan 这类东西的存在,它不会从零发明一套全新的物理模型;但你只要告诉它关于世界的已知约束,它就能演化出好东西。主持人半开玩笑:"所以未来一两年人类还有位置。"Platt 认真回答说人类不会消失——他们有 co-scientist 做假设生成,他自己用它做地球化学问题时还学到了一种自己不知道存在于岩浆中的离子——但那不能替代人类的创造力、哲学与严谨。

聊到指数曲线时,Platt 表态自己是"锯齿前沿"(jagged frontier)的信徒:编码能力、知识汇集与关联发现上有巨大尖峰,对科学家是天大的好事;但严谨、哲学与创造力上仍然落后。"有人说一切都会被抹平,但我仍然看到非常强的锯齿。"

回到多重假设检验,Platt 的答案分两层。第一层:ERA 找的是预测模型还是描述模型?判断它是不是描述性的,这个责任仍然在科学家身上——目前这套东西还不能发现全新的物理,它是帮你发现新科学的"电动工具"。第二层,关于纯粹的过拟合,他给了本期最锋利的那句话:它可以把你的手指锯掉。你现在必须更加小心、更加严谨,才不会骗到自己——你必须有真正藏起来从不去看的 hold-out 集合。

主持人评价说这可能是新时代最重要的技能之一,大家都在谈 taste,而这是 taste 的另一面:rigor。Platt 认为两者都需要,但不一定要是同一批人——软件工程里也一样,有人被拉向创造性的一极(想新科学、新产品),有人被拉向严谨的一极(保证不崩、能扩展、不出错),未来这两类人都是锚。

五、凝结尾迹:1% 的全球变暖,和一个卡了两年的反事实问题

先澄清:contrails(凝结尾迹),不是 chemtrails(阴谋论)。Platt 说不过你也该讨厌 contrails,只是理由不同。

物理机制。 尾迹是飞机后面那道白色的云。有些拉一道就散了,不起作用;有些会持续很久,在天上留下持久性尾迹织成的"华夫饼"。它们同时有两个相反效应:作为薄白云它们反射阳光(降温),但这只在白天发生;而所有物体都发黑体辐射,地球在约 300 K 下主要辐射在约 10 微米的远红外,在这个波段尾迹的反照率极低、几乎是黑的,它吸收外逸红外再向两个方向重新辐射,等于把热量像毯子一样盖住——而且这是 24 小时不停的。净效应是变暖。

量级。 在欧洲这类航班密集区,尾迹卷云可能覆盖天空的百分之几,局地强迫约 1 瓦/平方米;作为参照,全部人为变暖在全球平均下约 3 瓦/平方米。全球估计约 1% 的人为全球变暖来自尾迹。

成因与干预。 尾迹产生于大气中的冰过饱和区,Platt 的类比是做冰糖:糖水过饱和时,任何一点糖粒都会让糖全部结晶出来。这些区域呈煎饼状、只有几百米厚。飞机穿过时,尾气里的水汽会成滴再冻结,而在这种坏区域里,每排出 1 克水、冰或煤烟,就会从大气里抽出约 10 公斤的水——约 10000 比 1 的放大比。所以解法是:找出这些看不见的区域,让飞机从下方绕过,通常只需要下降两个飞行高度层,油耗代价很小。

为什么需要 AI。 团队建了一套从卫星图像检测尾迹的持续监测系统,又因为气象模式不足以精确定位冰过饱和区,训练了自定义的卷积网络/UNet 来预测它们会在哪里出现,再把地图交给飞行计划软件去躲。主持人问为什么可预测,Platt 解释这些区域非常持久——可能持续数天,一般认为是暖湿空气在对流层顶边界(平流层底部)被注入后长期滞留再缓慢消散;"它们就是大气里你不想飞进去的坏点"。

ERA 真正解开的那个结。 你还得知道某条尾迹到底造成了多少变暖——因为躲避是有燃油成本的,你想优先躲最大的那些。但这是个反事实问题:尾迹发生了,红外辐射也测到了,可"如果它没出现会怎样"你无法访问那个宇宙。团队在外逸长波辐射那一侧的反事实模型做得还行,但在反射阳光那一侧卡了整整两年——他们甚至用注入人造尾迹的合成数据集做了测试代码,自己的模型连自家测试都过不了。ERA 找到了一个模型,"搜遍了各种混杂变量",最终解开了这个问题。Platt 特意说明,ERA 给的不是一坨庞大代码,而是一个非常简单、只是用了他们没试过的那组混杂变量的模型,事后看非常清楚。相关工作已在 EGU 讲过,论文还没投出去。

顺带一提 CO2:我们其实不知道碳进出生物圈的通量。海洋吸收一部分(主要走无机化学,也有浮游植物),陆地吸收很大一部分,但误差棒不小;而 2100 年的误差棒极大——仅"被吸收多少"这一项的不确定性就有 300 ppm,而当前大气浓度才 440–450 ppm 左右。"可能糟糕得惊人,也可能只是不太好。"

六、天气、气候与那个"低数据"的诅咒

Platt 先做了一个区分:人们常把天气和气候混为一谈,因为底层是同一套物理,但一个完整的地球系统模型(气候模型)远比大气模型复杂——你得算陆地的水通量、CO2 通量、冰的行为。

天气(约 15 天以内)已经出现了阶跃式进步,而且 Platt 强调这不是新的 LLM 带来的,而是 2018 世代的机器学习加上大量数据与算力,其中很多出自 Google。一个很漂亮的突破是热带气旋路径预测:牙买加被飓风重创的那次,很多经典模式没预测出来,尤其是强度增强部分——因为那完全由海表温度驱动,飓风本质上是把海洋的热转成巨大大气运动的热机。

气候则困难得多,因为它是非平稳的:你不是要预测 2070 年西雅图某天下不下雨,你要的是统计量,而底层物理本身在变——植物的行为在变,冰的行为在变。Platt 给了一个非常清爽的表述:天气是"你在吸引子上的哪个位置",气候是"吸引子本身的统计性质";而麻烦在于我们正在改变这个吸引子,它在移动,甚至可能出现所谓的临界点(吸引子形状突变)。这带来一个恶性的诊断难题:当模拟跑飞了,你分不清是模型不好还是真实的物理不稳定性。

更根本的是数据。主持人指出:不仅没有未来数据,过去数据也很少——冰芯之类只能间接测量,一百年前没人拿着仪器站在那儿。Platt 说如果是年度数据,某个地点运气好也就 50 个数据点。所以关于描述模型与多重假设检验的那整段讨论,在气候领域是极端严重的:"我们没有 30 年后的数据,也不想等 30 或 50 年才知道自己是对的还是过拟合了。"

现状的替代方案是过程模型:把可怕复杂的气候问题还原成一千个部件,然后找到写过第 763 号部件论文的专家,他给某组数据拟了一条三次曲线。Platt 举了一个与尾迹直接相关的例子:云中冰的行为至今成谜。尾迹怎么消散?冰晶累积变大后掉落,但下落速度取决于晶体形状——未知;尾迹内部湿气与外界混合多少——只有近似。而冰的微观物理对气候模型的行为有很强影响。"这事很棘手,还没解决。"

他的希望是:未来版本的 ERA 不只能拟合数据,还能读论文,而且能读的论文比任何人都多。"如果我们能把所有人仔细评估过的知识整合起来,再去拟合数据,那会美妙至极。今天我们还没有。"主持人说这听起来很像生物学,Platt 立刻附和——生物系统里到处是例外和 hack。

在这个基础上双方讨论了"什么时候数据驱动模型够用"。Platt 的判据是数据丰富度:在数据丰富、问题"封闭"的领域(天气、或者因为有 PDB 而数据充足的蛋白质),统计模型就很好用——AlphaFold 就是例子,而且他们把它跑遍 PDB 并公开发布,"这真的非常酷"。但在气候这种开放、非平稳、必须大幅外推的问题上就必须谨慎得多。生物学里也有反例:Arc Institute 的 Virtual Cell Challenge 结果很有趣——简单基线表现非常好,可能存在过拟合。Platt 的老建议是"永远先拟一个线性回归"。主持人补充了另一个角度:像生物或气候这类问题,除非答案是可还原、每个零件都能单独理解的形状,否则我们不会信它——如果一个巨大黑箱说"细胞就是这么工作的",我没法检验,我为什么要信?

七、干预、能源拼图与聚变

Platt 的团队最关心的是干预,以及干预的相对成本。凝结尾迹之所以迷人,除了便宜,还因为它是局地的:与 CO2 不同,一个国家治理自己上空的尾迹,虽然有全球效应,但主要改善自己头顶的气候——所以各国都愿意干。

主持人半开玩笑地问:那寒冷国家会不会反过来故意制造尾迹取暖?Platt 说这里有个不对称性:变暖是全天候、全球性的,降温只在太阳角度合适时发生。绝大多数夜间尾迹几乎纯粹是变暖,团队在两个标准差的置信度上很确定;而"我确定它在降温、所以我想要更多"的情形只出现在极地夏季,而南极上空基本没有航班。所以他们干脆不推荐去飞那些航线。

关于经济学,主持人指出可再生能源和电池已经在市场上无争议地胜出了。Platt 补充了一个关键限定:那是对非移动场景而言。飞机没有解法——电池飞机很小、航程极短;他和主持人一致认为物理上难以想象,除非有类似核电池的东西,但那既不知道怎么做,做出来人们也会因风险而恐惧。

于是引出他常讲的"糟糕饼图 / 悲伤饼图":气候变化没有银弹,温室气体来自经济的方方面面,必须一项项修。理想路径是"把一切都电气化",但那样电力需求会增长约 5 倍,而用可再生加电池去覆盖最后那 10–20% 会越来越贵——你需要天文数字的电池。所以仍然需要某种基载电源。此外水泥和钢铁很难电气化(炼钢本质是还原反应,你在加碳还原铁矿)。

聚变是他最兴奋的候选。主持人说老笑话是"聚变永远还有 30 年",Platt 的判断是:有明确概率在本十年结束前出现商业相关的聚变,"三年,不是三十年"。他也给了一套判断真伪进展的框架——劳森判据:密度、温度、约束时间(能量衰减到 1/e 所需时间的倒数)三者的乘积必须超过某个常数。"正因为它是三个数的乘积,聚变才这么难:每条路线都有自己的阿喀琉斯之踵,某一个数特别小,于是他们拼命去抬那个数。"因此看到"约束时间稳定 X 分钟"这类耸动新闻时要谨慎——那只是三个数里的一个。

具体技术细节上:Google DeepMind 在做托卡马克的控制系统以避免破裂(disruption)——托卡马克里全部能量会汇聚成一束打进真空室,"然后你就非常伤心";主持人提到 ITER 花 300 亿美元后一旦破裂可能变成 300 亿美元的砖头。Platt 自己在 LLM 之前和聚变公司 TAE 合作过,做实验推荐系统,对方非常怀疑(他认为这种怀疑是应该的)——他在控制室里听过"砰"的一声,然后设备停机两周去补真空室。TAE 用的不是托卡马克而是场反位形(FRC):一个自包含的橄榄球状等离子体,内外磁场方向相反,由 separatrix 分隔;在 MHD 代码里理论上不稳定,但现实并非如此,所以实践中稳定(Helion 也用 FRC)。FRC 的不稳定性很简单,比如 Z 不稳定性只是来回晃,用一个 PID 控制器把"橄榄球"稳在反应器中心就行。

这一段里还散落着两个彩蛋:有家创业公司提出往聚变反应堆里注入汞,靠中子通量把汞嬗变成黄金再卖掉(Platt 觉得很聪明,但不一定成);以及作为物理学家他真正想从聚变堆里要的是氦-3(用来做稀释制冷机),并顺势吐槽美国战略氦储备——当年是为了飞艇舰队而储备,虽然荒唐但保留了几十年,"后来我们把它全放掉了,飘到空气里去了"。

八、FireSat、气候韧性与"治病还是治症状"

Platt 的观点是:气候变化像一种严重疾病——你是治症状(适应)还是攻击病因(干预)?"如果病得够重,答案是两者都要。"因此 Google 有一块很大的气候韧性投入。

最有代表性的是 FireSat。核心洞察是:如果足够早发现,扑灭一场屋子大小的野火非常容易;一旦长到一英亩就难得多。火在中波红外(同样回到黑体辐射,那是火焰的温度)非常显眼,所以团队设计了一种传感器,配上大约 50 到 80 颗低轨卫星的星座,就能在全球任何地方发现约 5 米见方的火点,且随星座规模不同,重访间隔可压到 15 到 20 分钟(要压到 15 分钟大概需要 80 颗)。这样就有了干预窗口——你也可以判断这把火烧掉一些燃料反而安全,从而选择不干预。

落地情况:合作方是现已独立的非营利组织 Earth Fire Alliance,卫星由 Muon Space 制造,目前已发射一颗原型星。技术细节上,传感器原生分辨率约 50×50 米,靠多光谱信息做超分辨才达到 5×5 米;因为是中波红外,必须制冷,所以卫星没法做得特别小(但也远不如地球同步轨道那些"巨兽"大)。

此外 Google 还在做:从现有卫星和数据源推断火场边界,并通过 Android 手机和搜索推送给用户;与美国林务局合作更新火蔓延模型——因为现行模型是 1970 年代 Rothermel 提出的过程模型,团队做了一个神经网络代理模型让它能极快地跑。

Platt 给的动机数字是:世界卫生组织估计全球每年有约 30 万人因野火烟雾超额死亡。主持人补充了几年前烟云横扫美国北部和加拿大导致大量呼吸道问题的记忆,以及洛杉矶大火——Platt 在洛杉矶住过 11 年,他也在内华达山脉有一间小屋,"以前夏天是很舒服的,现在是冬天、春天、夏天、烟季"。

九、给年轻科学家:领域深度、20% 时间,与"不要对生产力过拟合"

Platt 认为过去 12 到 18 个月发生了相变。以前他的工作模式是为一个个具体问题造专用模型——"如果你认为这就是你的工作,那其实挺有趣的,解决一个再解决下一个"。但现在有了通用 AI,整个 AI for science 社区还在摸索,"因为它们能用这件事本身太新了,我们集体还不确定最好的做法是什么,也许根本没有唯一最好的做法,也许是一条工具链"。

他给年轻人的建议来自自己 21 岁的儿子——同时深扎 RNA 领域、又在大量用 vibe coding 和各种工具。Platt 认为这就是对的答案:领域专长不会消失(它关联到 taste,而 taste 怎么在不做粗活的情况下获得是个开放问题),但同时要把所有工具都玩一遍,"不是说我们这些聪明的老人知道会发生什么——不,我们也在实验"。他还提醒:物理实验室工作仍是瓶颈且不会消失,实验是 ground truth,"lab in the loop"讲了很久但仍非常开放,据他所知没有人有一个什么都能做的通用实验室。

主持人提了一个很好的问题:过去人们是靠死磕一个简单问题、在探索中长出能力的,而现在那个问题一秒就被解决了,怎么办?Platt 的比喻是爬山:你当然可以开车上山,但偶尔徒步上山是可以的,甚至是有趣的。他接着说自己"要开始像老头子说话了"——不是六个月前的老日子,而是八九十年代:现在有开源包、有 sklearn,而当年他得自己写数值库、自己写机器学习,"boosting 我大概用四种语言重写过四遍,所以我是真的懂 boosting"。他把这称作练肌肉:像运动员一样,有全力冲刺的时候,也有训练的时候,人得训练。

这也是他在自己组里坚决保护 20% 时间的原因:"你想学什么、想试什么都可以,你甚至不用告诉我——事实上你最好别告诉我。"他说创造力的汁液就在那儿,他不想把人的时间占满到连玩、学、试疯狂点子的余地都没有。他承认这条建议在"全世界都想把一切最优化榨干"的文化里是逆流而上的,"但你过度优化时确实会失去一些东西——你对生产力过拟合了"。

关于什么技能是持久的,Platt 的清单是:真正关于世界的基础领域(生物、物理科学)、数学,以及严谨与检查的能力。后者被主持人类比成"我们都变成中层管理者了"——Platt 回应说你不能当"空心西装"(empty suit),因为 LLM 会犯和人类不一样的怪错误,你不能完全信任它们,必须严格去戳去验;"不过你对自己写的软件也该这样,别信任你自己,这是我学到的一件事"。他引了费曼那句话:你绝对不能欺骗自己,而你恰恰是最容易被自己欺骗的人。

十、彩蛋:费曼的课、NeurIPS 的起源、小行星与奥斯卡

Platt 1982 年上过费曼的"计算物理"课,那门课是费曼与 Hopfield、Carver Mead 合开的。课程由 DARPA 资助,按规定学生每周去一次能吃一顿烤牛肋排(他说"所以我每周都去")。结构是周二请嘉宾讲,周四费曼站起来解释那些为什么都是错的。他还描述了所谓费曼效应:他太有魅力,讲的时候你觉得"是的我懂了",走出教室才发现"不,我没懂"。嘉宾包括 Danny Hillis(Connection Machine 时期),大家在争论计算能否可逆、每次操作的最小热耗能否为零——回到朗道尔极限那套问题。"我觉得那现在不算什么大问题了。"

关于 1982 年的算力水平,他的回答是"四舍五入等于零":他当时是 Carver Mead 的系统管理员,实验室有一台 VAX 11/750,大概 1 MIPS;整个研究组共用一块 80 MB 硬盘,体积像一台洗碗机。"当时真的很激动人心。"

NeurIPS 的起源也在这段:八十年代初 Hopfield 网络引发巨大兴奋,Snowbird 有一个名义上私密的工作坊,但所有人都想混进去,于是干脆办了 NeurIPS——而 Snowbird 那个工作坊又源自 1985 年的圣巴巴拉工作坊,后者又源自 Caltech 本地的 "hopfests"。Platt 顺势点了一个漂亮的闭环:当年大家兴奋的是联想记忆,而如果你往下挖,Transformer 本质就是联想记忆——所以才有那篇 "Hopfield Networks is All You Need"。他说这个领域确实革命了计算机科学,只是当年的希望与梦想远远超出了能力,因为我们实际上算力为零。

他对"为什么是神经网络赢了"的解释是:它们是唯一受算力限制的方法,而且骑在 BLAS 上——GPU 优化的正是 BLAS,于是算法与硬件共同演化。"我相当确定大脑不是靠矩阵乘法工作的。"如果当年人们在意的是别的计算形态,今天的架构可能完全不同。他也确认了时间线:Hinton 组在 2010 年前后用 GPU 做深度学习,但在 2007–2008 年 GPU 并不比 CPU 快多少;GPU 反超 CPU 的时点与 ImageNet、语音识别的突破重合,这不是巧合。(主持人补了一段 NVIDIA 的轶闻:他的研究生同学 Bryan Catanzaro 曾在公司全力押注游戏时,用一次约 15 分钟的对话说服了 Jensen 转向 CUDA 与深度学习;Platt 说他认识 Dave Kirk 和 Bill Dally,但不清楚细节。)

小行星:那是 Caltech 的一门行星科学课,老师是 Gene 和 Carolyn Shoemaker。四十年前的流程是去 Palomar 用一台快速望远镜(现在那台已经是访客中心的展品)拍一张底片,隔几分钟再拍同一片天区,回 Caltech 用立体镜看有没有东西"浮起来",再用测量显微镜相对已知恒星定位,把数据寄给 Minor Planet Center 的 Brian Marsden;如果你的观测恰好是让软件能把各次"出现"串成一条完整轨道的那一次,你就获得发现权和命名权。今天智利的 Vera Rubin 天文台和 Simonyi 巡天望远镜把这一切自动化了——"六周发现了 11000 颗小行星"。他找到两颗(在那门课上很不寻常);本来想把一颗以父亲命名却犹豫了,Carolyn 把自己的一颗让给了他,于是那颗以他母亲命名——而正是那颗被业余天文爱好者通过掩星观测发现带有一颗卫星:主体约 4 公里,卫星约 1 公里,"算是个挺大的双小行星"。

奥斯卡:1986 年他在 Schlumberger(一家石油勘探公司,但有个 AI 实验室)做实习生做计算机图形学研究。当时"用物理模拟器来做电脑动画"还是革命性的,他写了一个基于弹性理论的模拟器,做出布料和可拉伸的东西。这项工作的后代成了 Pixar 等公司使用的物理模拟器的基础,20 年后(2006)拿到学院技术成就奖。"所以我半开玩笑地对实习生说:如果你实习做得足够好,你会得奖的。"他解释 20 年的滞后其实很典型——颁奖时他们要确认这项技术确实被广泛使用了。

量子计算:Platt 说自己"按十年为单位平均",看到的就是稳定的进展。目前处在 NISQ 时代(术语由 John Preskill 提出,他觉得这个词不太好但只能用)。他是 Google 量子回声(quantum echoes)算法论文的众多共同作者之一,其思路正是费曼式的:用量子计算机在循环里调参,把一个参数化的物理模型(哈密顿量)拟合到观测数据上,例如解码 NMR 参数——这是有实用价值的方向,但能否大到做出突破仍待定。他说 Google 量子团队正沿着 Neven 几年前定下的路线图执行得极好,时间尺度是"几年到若干年",不是 30 年,也不是明天。关键的未决问题是超导路线会不会是赢家:他仍看好超导,因为可扩展;但物理量子比特与逻辑量子比特的比例仍偏高,这部分源于把量子比特铺在二维芯片上的二维连通性限制,而中性原子理论上任意互连——"但实践中我们不知道,至少我不知道它的限制在哪"。他也提醒 NISQ 时代这些本质上是模拟计算机,非常"娇气",所以别指望某个硬件天才想法一出现就立刻相变。

最后的"如果能用魔法消除一个瓶颈",Platt 的愿望是:一个"万能实验室",你给它发一个 JSON blob,它就能做任何实验。"那大概等于要先解决 AI-complete 的机器人问题吧。但如果做到了,那会非常惊人——因为现在像 ERA 这样的东西全是计算性的,总得有人去采集数据。"

金句

它就是一把电动工具,我不该这么说,但它能把你的手指锯掉。你必须非常非常小心,必须极其严谨。事实上,现在你要更小心、更严谨,才不会骗到自己。 —— John Platt 32:20
在那个坏区域里,你每排出一克水、冰或煤烟,就会有大约十公斤的水被抽出来。这是一万比一的巨大放大比。 —— John Platt 45:22
在老日子里——我是说 2024 年——研究生要花大量时间写科学软件……这东西在底下是不知疲倦的,所以用它的人现在几乎把全部时间都花在了正确的层级上,花在了科学创造力上。 —— John Platt 16:11
我们没有 30 年之后的数据,我们也不想等 30 年或 50 年才发现自己当初是对的、还是过拟合了。 —— John Platt 55:22
费曼怎么说的来着?你绝对不能欺骗自己——而你恰恰是最容易被自己欺骗的那个人。 —— John Platt 与主持人 97:03
如果能许一个魔法愿望,我希望有人造出那个"万能实验室":你给它发一个 JSON blob,它就能做任何实验。 —— John Platt [119:59]

提到的书·产品·人物

适合谁听

想知道 AI 究竟在科学里真正做成了什么(以及在哪儿仍然做不到)的研究者、工程师与气候/能源方向的从业者。

← 返回全部观看原片 ↗