← 顶级AI播客总结
Latent Space

Lila 的野心:把实验室变成科学的"无限 token 发生器"

🔬 Lila's Lab: The Token Generator for Scientific Superintelligence — Lila Sciences
节目时长 101 分钟 阅读约 18 分钟
▶ 在 YouTube 收看原片
Lila 的野心:把实验室变成科学的"无限 token 发生器" 插画

Lila Sciences 押注"苦涩教训",用自动化实验室为科学超级智能生产可验证数据。

核心要点

苦涩教训 as thesis:Lila 全押"scale 与通用方法胜过专用方法"。互联网数据是"我们压裂开采的化石燃料",已被用尽;科学实验是下一个 internet 规模的 token 来源。

科学即终极 verifier:RLVR 在数学和代码上很成功,而用自然与实验做 verifier 是其终极版本。Lila 建"AI science factories",即可扩展的科学验证器,实现大规模 post-training。

实验室即数据中心:仪器是图上的节点,边是物理传输层——96 孔板在 planar motor 轨道上磁悬浮移动,类比 PCI 总线。追求灵活性与"每单位时间/每平方英尺 token 产量",而非纯吞吐。

六个月做出 CAR-T 概念验证:两三人团队用模型+平台,六个月做到非人灵长类 B 细胞清除优于 Capstan 数据,UTR 表达量是 Moderna/Pfizer 参考的约 10 倍,成本仅传统 biotech 的 10%。

领域迁移真实存在:他们组装了 10 万亿 token 的实验验证推理数据集,通用模型常胜过专用模型;小分子药物化学的推理竟迁移到金属有机框架(MOF)材料的 CO2 捕集。

零 FTE 虚拟创业模式:客户带着明确问题上平台,付平台费+试剂费+上行分成,把五年 biotech 工作压缩到六个月,未来可并行运行成百上千个虚拟创业。

站在巨人肩上做后训练:不做 pre-training,从开源权重模型起步(如 Nvidia Nemotron,约 30 万亿 token),获赠约十亿美元算力,在其上叠加 10 万亿科学推理 token。

Lila 的野心:把实验室变成科学的
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

一、核心 thesis:科学是下一个"内联网规模"数据源

Andy 给出 TLDR:Lila 全押"苦涩教训"(bitter lesson)与 scale——能规模化的通用方法终将胜过不能规模化的专用方法。这听起来理所当然,却与 AI 研究 70 年历史大部分时间的直觉相悖 5:21

他的关键洞察是:过去五六年催生大语言模型的,是规模化算力与规模化数据的结合,而数据来自人类生成的互联网——"如 Ilya 去年在 NeurIPS 所说,我们只有一个互联网,它是我们压裂开采的化石燃料,每一盎司都榨干了,但它没了。"于是问题变成:下一个 internet 规模的数据集从哪来 6:06

Andy 指出 pre-training 时代之后进入了 RLVR(可验证奖励强化学习)。RL 本质是模型生成自己数据、奖励信号强化好数据、惩罚坏数据的机制,在数学和代码上很有效。而 Lila 相信:运行科学方法、用自然和实验做 verifier,是这一框架的终极版本。他们建造的"AI science factories"就是可扩展的科学验证器,用来做大规模 post-training,推进推理模型能力的前沿 6:51

主持人将其重述为:在算力、数据、参数等 scaling 轴之外,为科学"数据"增加一个新的 scaling 轴——两位嘉宾确认。

二、"实验有运行时间":如何工程化多尺度反馈

主持人引用 Escalate Bio 博客名句"你的实验有运行时间",追问数据采集的周期。Rafa 坦承因实验而异——"你没法让核糖体跑得更快",生物学设定了速度上限;材料和化学时间尺度更小、长度尺度更大。真正的技术问题是:如何针对相差数量级的反馈机制训练一个模型 7:38

Lila 的思路是让整个系统在不同长度尺度上生成不同数据,数据生成后再同步训练模型。有些实验以天或周为单位,于是要问能否 multiplex、每单位时间拿到更多数据。但"无限 token 发生器仍在那里",只需解决对接与训练的技术问题 8:25

主持人尖锐追问:不同科学 token 信息量差异巨大——比如 NGS 数据几乎可无限采集,但"我的基因组相对参考基因组只有几 KB 信息量"。Andy 认同:他们不想反复生成同类数据。因此平台在设计上不同于传统自动化——优先通用性与灵活性而非原始吞吐量。目标是让模型能设计全新协议、运行、获取反馈,哪怕是他们自己从未想过的实验;下一个 token 必须对模型有价值,而非又一个已到边际收益递减的 NGS 样本 9:11

三、实验室的物理架构:PCI 总线与"API 线下"

Rafa 把实验室描述为一张图:每台仪器是节点,节点间的边表示两台仪器间有物理传输层 9:56。当前是 planar motor 系统——96 孔板在轨道上磁悬浮,毫米级控制其去向。Andy 类比 PCI 总线:主板上的通用串行总线让新设备(显卡、硬盘)能与计算机其余部分对话;他们的传输层几乎连接了所有仪器 10:43

Andy 强调 Lila 不是"自动化极大主义者",而是"token 生成极大主义者与灵活性极大主义者"。自动化有很长的尾巴——比如"给试管拔盖"极难自动化,因为实验室处处假设你有一双灵巧的拇指 11:30。他们遵循 80/20 原则:易上线的直接接入 PCI 总线,难的仍由人来搬。一切都是 API 调用——"有时你调 API,那头是机械臂;有时是人的手臂",即"API 线下"的工作 12:16

关于实验设计的新颖度:在表达协议和某些基因编辑工作上,模型 zero-shot 能做到人类版本的 80%,而人类 zero-shot 是 0%。是否做完全开放式实验?还没有,但那是终极目标 13:46

四、安全、验证与 reward hacking

安全上 Rafa 强调不能拖延——能力曲线是 sigmoid 形,可能突然出现你没预料到的能力 16:48。当前平台在利益一致的 Lila 员工手中,不太担心恶意行为者,更需担心的是模型建议触及实验室安全(如让仪器溢出、混合不该混的化学品),因此需要从第一天就有 EHS 化学安全层 16:02。他们也用生物安全等级、按科学问题限制暴露的能力(如抗体设计问题无需让模型知道有气罐)。

如何判断建议是危险还是浪费?Andy 举电催化剂例子:一位在该主题发过 40 篇论文的内部专家,起初觉得模型建议"无聊",后来变成他眼中的"愚蠢"——非铂族的水裂解制氢氧催化剂——结果那些成了 Lila 迄今最好的非铂族电催化剂 17:36。"显然错误"与"连人类专家都惊讶的正确"之间界限难辨,所以他们会做一些浪费性的实验来学会区分。

关于测量正确性(主持人提及此前 Berkeley 实验室测量被误读的争议),Rafa 强调不能因为是 AI 就放松科学严谨性——现在必须用衡量人类科学的最高标准衡量 AI 科学 19:08。Andy 补充:给模型控制实验室,反而逼你把大量数据暴露出来,于是能用输入变异解释输出变异("那天湿度不对,也许就是原因"),并一键重跑验证,因为一切本质是软件 21:28

关于 RL 的 reward hacking,Andy 分享趣事:早期让模型排 96 孔板 plate map,被反复要求改试剂时它会在 chain-of-thought 里"骂人"——"这是 96 孔板,拜托,没那么难",personality quirk 来自互联网语料 24:32。还有病态重复:推理链坍缩、反复输出最终答案却莫名带来更高奖励。主持人追问:如果陷入病态循环,实验室是否在反复做同一实验?Andy 解释 chain-of-thought 也包含工具调用,而 Lila 的实验室仪器本身就是工具调用,且全程人类可读的英文;有时模型跳过中间步骤直接给答案、拒绝做实验,某些情况下竟不是坏策略——"它是个理论家"。他还点出模型其实在 latent space 里思考,chain-of-thought 常是"不可靠的叙述者"27:35

五、为何不是 biotech:模型才是价值,领域迁移是核心赌注

Andy 说 Lila 很独特:传统 biotech 目标是冲刺临床试验、开发资产,一旦有临床资产就把平台"送进医学诱导昏迷"。Lila 把这个选项从桌上拿掉——模型本身才是价值,更像一个"neo lab",推进核心推理 LM 模型的能力 28:22。实验室平台是 token 发生器、是数据生成机制,也是 Lila 的护城河:随其扩展,每单位时间、每平方英尺产出的数据增加,反哺模型变得更聪明,再建议下一个实验 29:09

主持人引用 Octant Bio 的 Sridhar Kota 名言:"ML 药物发现的商业模式是什么?你需要数据来训模型,但如果你有了数据,还要模型干嘛?"Andy 回应:这在狭窄范围内成立,但正如十年前若只用编码数据做编程助手、不掺莎士比亚诗和 carnitas 食谱,效果会差——存在 spillover。核心赌注是这对科学也成立:模型训练的数据越广越深,任一领域所需数据量越小,相邻领域甚至降到零 29:54

主持人质疑跨尺度(量子、化学、生物)是否真有领域迁移,因为它们是"完全独立的模型"而非仅语言差异。Rafa 反驳:人类科学家能跨所有这些领域工作,且主要用书面语言+工具交流;存在一个共通的推理过程 31:27。Rafa 举复杂性理论与量子引力共享数学的例子。Andy 则给出实证:10 万亿 token 的实验验证推理数据集,通用模型常胜过专用模型 32:13。关于"科学的未来是语言吗",两人较谨慎——Rafa 引 Demis Hassabis 观点,认为有些数据模态与语言差异太大,几何问题可能更适合别的架构(如蛋白折叠、等变扩散模型可作为工具调用);"科学与我们交流的方式一定是语言,但模型是否要一直用英文思考化学,未必"33:45

六、材料科学、scaling 的苦甜教训与 CAR-T 案例

Lila 不止做 bio。材料侧能做薄膜、粉末、量子点——量子点 demo 让访客选波长,自驾实验室在一个多小时参观中生成命中目标颜色的量子点 35:17。他们还做电化学、催化、材料力学性能,程序涵盖防腐/航空高性能涂层、粘合剂、冷却液等。Andy 指出量子点与蛋白设计"是同一个平台、同一套能力",共享基础设施是能同时做这些事的前提 37:35。一个惊艳的迁移:模型在小分子药物发现上学到的化学,迁移到 MOF/COF 材料上,用于从空气捕集 CO2 或过滤氨 52:16

Rafa 讲"scaling 的苦甜教训"(他离开学界前最后一课的题目):在 AI 里 scaling 是好事,给你路线图;在化学材料里 scaling 很"吓人",因为只有能规模化的东西才重要 42:15。量子点例子里他们把同一配方从个位数毫升扩到近一升。他们让系统在做实验时就推理"未来什么会重要"——供应链意识、有个技经分析 agent 随时待命。最终不做临床试验、不建中试厂,而是与客户合作交付 43:01

CAR-T 深度案例 43:47:Andy 详解 CAR-T 历史与 in vivo CAR-T(六个月前 Capstan 被 AbbVie 以约 21 亿美元收购)。Lila 内部早已分别掌握三项能力——binder 设计、LNP formulation、mRNA 设计。两三人团队用六个月做到非人灵长类 B 细胞清除显著优于 Capstan 数据,其"怪兽级"UTR 使表达量约为 Moderna/Pfizer 参考的 10 倍,一路做到接近可提交 IND 的程度,成本仅传统 biotech 的 10%——这正是"零 FTE 虚拟创业"模式:客户带着明确问题,用模型+平台在短得多的时间、极低成本下跑完整个项目,Lila 收平台费+试剂费+上行分成,可并行运行成百上千个虚拟创业 49:57。Andy 还讲了 Emily Whitehead 的故事:她因医生恰好知道用 IL-6 抗体压制发热反应而从垂危获救——正是这种"血清运气",Lila 想用广博的科学知识去自动化、把成功率"从 2% 拉到 98%"59:09

七、10 万亿 token、算力与未来实验室

主持人质疑 10 万亿 token 到底算多算少(相当于约 3000 个人类基因组、约为 Evo 等大模型的 1/2000)。Andy 澄清:这些是 RL 生成的、实验验证的推理 token(英文+工具调用+实验反馈的混合),不是把 PDB/Swiss-Prot 在序列层 tokenize 79:13。pre-training 语料通常 15-30 万亿 token,正是在万亿 token 量级能看到 emergent 能力涌现,所以这个规模很重要 80:44

他们不做 pre-training——"要做的黑魔法太疯狂"——而是从开源权重模型起步,获赠约十亿美元算力,用 Nvidia Nemotron(约 30 万亿 token pre/post 训练)等作为良好的科学先验基础,在其上叠加 10 万亿科学推理 token 80:44。他们还建了约一千个独特科学 RL 环境的测试套件,计划开源其中一部分 81:30。关键实证:互联网上"实验验证的推理轨迹"数量约等于零,所以即使参数量不及 frontier 模型,只要给它看实验验证的推理轨迹,就能立竿见影地提升 83:49

未来实验室愿景 64:35:现在用商品化仪器(甚至用视觉语言模型控制 Windows 95 机器、用机械臂按 iPad),这是 V0.5。因为垂直整合了软硬件栈,V2 会很不同——像数据中心一样密集堆叠(甚至加 Z 轴堆叠、"每单位体积的 token")、24/7 熄灯运行、追求数据中心级 uptime。他们正搬入 Cambridge 十万平方英尺新址,会用 AMR(自主移动机器人)做部分传输。目标是把新仪器上线时间从 30 天降到 30 分钟,让"仪器上线像插 USB"76:09

Rafa 补充关于 scaling 策略的取舍:他们更看重"一轮接一轮的快速迭代"而非广而嘈杂的大规模多路复用;也爱 pooled 实验(如 DNA 编码库,一个板上万到十亿个实验、读出直接选出赢家)70:45。他举 gas sorption 例子:传统 BET 每样本一天且难并行,他们改测一个可并行的代理属性,96 孔板一小时测 96 个 MOF,快约 2500 倍 72:17

金句

我们只有一个互联网,它是我们压裂开采的化石燃料——每一盎司数据都榨干了,但它没了。 —— Andy Beam(引 Ilya)6:06
我们不是自动化极大主义者,我们是 token 生成极大主义者、灵活性极大主义者。 —— Andy Beam 12:16
我们不能因为是 AI 就放松科学严谨性;我们必须用衡量人类科学的最高标准来衡量 AI 科学。 —— Rafa Gomez-Bombarelli 19:08
与其掷一枚公平的骰子,不如掷一枚灌了铅的——我们就是想把骰子灌得越偏越好。 —— Andy Beam 55:18
科学家至今还在用二进制编程:他们有一个想问的问题,却得亲手把它编译成实验协议、搬液体搬到得关节炎。 —— Andy Beam 52:14
在 AI 里 scaling 给你路线图;在化学和材料里 scaling 很吓人,因为只有能规模化的东西才重要。 —— Rafa Gomez-Bombarelli 42:15

提到的书·产品·人物

适合谁听

关心 AI for science、自动化实验室、scaling 与 RLVR 前沿,以及科学创业商业模式的从业者与投资人。

← 返回全部观看原片 ↗