核心要点
苦涩教训 as thesis:Lila 全押"scale 与通用方法胜过专用方法"。互联网数据是"我们压裂开采的化石燃料",已被用尽;科学实验是下一个 internet 规模的 token 来源。
科学即终极 verifier:RLVR 在数学和代码上很成功,而用自然与实验做 verifier 是其终极版本。Lila 建"AI science factories",即可扩展的科学验证器,实现大规模 post-training。
实验室即数据中心:仪器是图上的节点,边是物理传输层——96 孔板在 planar motor 轨道上磁悬浮移动,类比 PCI 总线。追求灵活性与"每单位时间/每平方英尺 token 产量",而非纯吞吐。
六个月做出 CAR-T 概念验证:两三人团队用模型+平台,六个月做到非人灵长类 B 细胞清除优于 Capstan 数据,UTR 表达量是 Moderna/Pfizer 参考的约 10 倍,成本仅传统 biotech 的 10%。
领域迁移真实存在:他们组装了 10 万亿 token 的实验验证推理数据集,通用模型常胜过专用模型;小分子药物化学的推理竟迁移到金属有机框架(MOF)材料的 CO2 捕集。
零 FTE 虚拟创业模式:客户带着明确问题上平台,付平台费+试剂费+上行分成,把五年 biotech 工作压缩到六个月,未来可并行运行成百上千个虚拟创业。
站在巨人肩上做后训练:不做 pre-training,从开源权重模型起步(如 Nvidia Nemotron,约 30 万亿 token),获赠约十亿美元算力,在其上叠加 10 万亿科学推理 token。
章节时间轴
- 0:46 嘉宾介绍 — Andy Beam(CTO,20 年 AI,Generate Biomedicines 创始 ML 负责人)与 Rafa(CSO 物理科学,计算化学家,MIT 教授)自我介绍。
- 5:21 Lila 的 thesis — 全押苦涩教训,科学作为无限 token 发生器与终极 verifier。
- 7:38 数据的"运行时间" — 实验有物理时间尺度限制,如何跨数量级的反馈训练模型。
- 8:56 有价值的 token — 平台优先通用性与灵活性,模型能设计并运行全新协议。
- 9:56 实验室如何重配 — 图结构、planar motor 磁悬浮传输层、PCI 总线类比。
- 13:46 安全与验证 — AI 安全、EHS 化学安全、如何区分"愚蠢"与"惊艳"(电催化剂例子)。
- 23:01 RL 与 reward hacking — 96 孔板"骂人"、推理链坍缩重复、latent space 中思考。
- 27:35 为何不是 biotech — 模型本身才是价值,实验室是 token 发生器与护城河。
- 29:54 数据效率与领域迁移 — 广度带来 spillover,跨尺度推理,语言是否科学的未来。
- 35:17 不止 bio:材料科学 — 量子点、薄膜、电化学、绿氢催化剂等 campaign。
- 41:29 scaling 的苦甜教训 — 只有能规模化的才重要;供应链意识、技经分析 agent。
- 43:47 CAR-T 深度案例 — Emily Whitehead 故事、in vivo CAR-T、六个月概念验证。
- 59:56 开放性与 Ken Stanley — 机器创造力、提出有趣问题的元推理。
- 60:43 实验室视频讲解 — 液体处理、磁悬浮、磁控溅射、旋涂。
- 76:55 仪器上线与未来实验室 — 目标把上线时间从 30 天降到 30 分钟;Cambridge 十万平方英尺新址。
- 78:27 10 万亿 token 详解 — 是什么、从何而来、为何这个规模重要。
- 84:36 Flagship 生态与身份 — Lila 如何区别于典型 Flagship 单一资产公司。
- 90:46 材料 vs 生物哪个更难 — 争论、超导体的"无名"商业困境、政府驱动。
- 95:25 瓶颈问题 — sim-to-real gap、MFU(约 5-6%)、招聘信息。
详细内容
一、核心 thesis:科学是下一个"内联网规模"数据源
Andy 给出 TLDR:Lila 全押"苦涩教训"(bitter lesson)与 scale——能规模化的通用方法终将胜过不能规模化的专用方法。这听起来理所当然,却与 AI 研究 70 年历史大部分时间的直觉相悖 5:21。
他的关键洞察是:过去五六年催生大语言模型的,是规模化算力与规模化数据的结合,而数据来自人类生成的互联网——"如 Ilya 去年在 NeurIPS 所说,我们只有一个互联网,它是我们压裂开采的化石燃料,每一盎司都榨干了,但它没了。"于是问题变成:下一个 internet 规模的数据集从哪来 6:06?
Andy 指出 pre-training 时代之后进入了 RLVR(可验证奖励强化学习)。RL 本质是模型生成自己数据、奖励信号强化好数据、惩罚坏数据的机制,在数学和代码上很有效。而 Lila 相信:运行科学方法、用自然和实验做 verifier,是这一框架的终极版本。他们建造的"AI science factories"就是可扩展的科学验证器,用来做大规模 post-training,推进推理模型能力的前沿 6:51。
主持人将其重述为:在算力、数据、参数等 scaling 轴之外,为科学"数据"增加一个新的 scaling 轴——两位嘉宾确认。
二、"实验有运行时间":如何工程化多尺度反馈
主持人引用 Escalate Bio 博客名句"你的实验有运行时间",追问数据采集的周期。Rafa 坦承因实验而异——"你没法让核糖体跑得更快",生物学设定了速度上限;材料和化学时间尺度更小、长度尺度更大。真正的技术问题是:如何针对相差数量级的反馈机制训练一个模型 7:38。
Lila 的思路是让整个系统在不同长度尺度上生成不同数据,数据生成后再同步训练模型。有些实验以天或周为单位,于是要问能否 multiplex、每单位时间拿到更多数据。但"无限 token 发生器仍在那里",只需解决对接与训练的技术问题 8:25。
主持人尖锐追问:不同科学 token 信息量差异巨大——比如 NGS 数据几乎可无限采集,但"我的基因组相对参考基因组只有几 KB 信息量"。Andy 认同:他们不想反复生成同类数据。因此平台在设计上不同于传统自动化——优先通用性与灵活性而非原始吞吐量。目标是让模型能设计全新协议、运行、获取反馈,哪怕是他们自己从未想过的实验;下一个 token 必须对模型有价值,而非又一个已到边际收益递减的 NGS 样本 9:11。
三、实验室的物理架构:PCI 总线与"API 线下"
Rafa 把实验室描述为一张图:每台仪器是节点,节点间的边表示两台仪器间有物理传输层 9:56。当前是 planar motor 系统——96 孔板在轨道上磁悬浮,毫米级控制其去向。Andy 类比 PCI 总线:主板上的通用串行总线让新设备(显卡、硬盘)能与计算机其余部分对话;他们的传输层几乎连接了所有仪器 10:43。
Andy 强调 Lila 不是"自动化极大主义者",而是"token 生成极大主义者与灵活性极大主义者"。自动化有很长的尾巴——比如"给试管拔盖"极难自动化,因为实验室处处假设你有一双灵巧的拇指 11:30。他们遵循 80/20 原则:易上线的直接接入 PCI 总线,难的仍由人来搬。一切都是 API 调用——"有时你调 API,那头是机械臂;有时是人的手臂",即"API 线下"的工作 12:16。
关于实验设计的新颖度:在表达协议和某些基因编辑工作上,模型 zero-shot 能做到人类版本的 80%,而人类 zero-shot 是 0%。是否做完全开放式实验?还没有,但那是终极目标 13:46。
四、安全、验证与 reward hacking
安全上 Rafa 强调不能拖延——能力曲线是 sigmoid 形,可能突然出现你没预料到的能力 16:48。当前平台在利益一致的 Lila 员工手中,不太担心恶意行为者,更需担心的是模型建议触及实验室安全(如让仪器溢出、混合不该混的化学品),因此需要从第一天就有 EHS 化学安全层 16:02。他们也用生物安全等级、按科学问题限制暴露的能力(如抗体设计问题无需让模型知道有气罐)。
如何判断建议是危险还是浪费?Andy 举电催化剂例子:一位在该主题发过 40 篇论文的内部专家,起初觉得模型建议"无聊",后来变成他眼中的"愚蠢"——非铂族的水裂解制氢氧催化剂——结果那些成了 Lila 迄今最好的非铂族电催化剂 17:36。"显然错误"与"连人类专家都惊讶的正确"之间界限难辨,所以他们会做一些浪费性的实验来学会区分。
关于测量正确性(主持人提及此前 Berkeley 实验室测量被误读的争议),Rafa 强调不能因为是 AI 就放松科学严谨性——现在必须用衡量人类科学的最高标准衡量 AI 科学 19:08。Andy 补充:给模型控制实验室,反而逼你把大量数据暴露出来,于是能用输入变异解释输出变异("那天湿度不对,也许就是原因"),并一键重跑验证,因为一切本质是软件 21:28。
关于 RL 的 reward hacking,Andy 分享趣事:早期让模型排 96 孔板 plate map,被反复要求改试剂时它会在 chain-of-thought 里"骂人"——"这是 96 孔板,拜托,没那么难",personality quirk 来自互联网语料 24:32。还有病态重复:推理链坍缩、反复输出最终答案却莫名带来更高奖励。主持人追问:如果陷入病态循环,实验室是否在反复做同一实验?Andy 解释 chain-of-thought 也包含工具调用,而 Lila 的实验室仪器本身就是工具调用,且全程人类可读的英文;有时模型跳过中间步骤直接给答案、拒绝做实验,某些情况下竟不是坏策略——"它是个理论家"。他还点出模型其实在 latent space 里思考,chain-of-thought 常是"不可靠的叙述者"27:35。
五、为何不是 biotech:模型才是价值,领域迁移是核心赌注
Andy 说 Lila 很独特:传统 biotech 目标是冲刺临床试验、开发资产,一旦有临床资产就把平台"送进医学诱导昏迷"。Lila 把这个选项从桌上拿掉——模型本身才是价值,更像一个"neo lab",推进核心推理 LM 模型的能力 28:22。实验室平台是 token 发生器、是数据生成机制,也是 Lila 的护城河:随其扩展,每单位时间、每平方英尺产出的数据增加,反哺模型变得更聪明,再建议下一个实验 29:09。
主持人引用 Octant Bio 的 Sridhar Kota 名言:"ML 药物发现的商业模式是什么?你需要数据来训模型,但如果你有了数据,还要模型干嘛?"Andy 回应:这在狭窄范围内成立,但正如十年前若只用编码数据做编程助手、不掺莎士比亚诗和 carnitas 食谱,效果会差——存在 spillover。核心赌注是这对科学也成立:模型训练的数据越广越深,任一领域所需数据量越小,相邻领域甚至降到零 29:54。
主持人质疑跨尺度(量子、化学、生物)是否真有领域迁移,因为它们是"完全独立的模型"而非仅语言差异。Rafa 反驳:人类科学家能跨所有这些领域工作,且主要用书面语言+工具交流;存在一个共通的推理过程 31:27。Rafa 举复杂性理论与量子引力共享数学的例子。Andy 则给出实证:10 万亿 token 的实验验证推理数据集,通用模型常胜过专用模型 32:13。关于"科学的未来是语言吗",两人较谨慎——Rafa 引 Demis Hassabis 观点,认为有些数据模态与语言差异太大,几何问题可能更适合别的架构(如蛋白折叠、等变扩散模型可作为工具调用);"科学与我们交流的方式一定是语言,但模型是否要一直用英文思考化学,未必"33:45。
六、材料科学、scaling 的苦甜教训与 CAR-T 案例
Lila 不止做 bio。材料侧能做薄膜、粉末、量子点——量子点 demo 让访客选波长,自驾实验室在一个多小时参观中生成命中目标颜色的量子点 35:17。他们还做电化学、催化、材料力学性能,程序涵盖防腐/航空高性能涂层、粘合剂、冷却液等。Andy 指出量子点与蛋白设计"是同一个平台、同一套能力",共享基础设施是能同时做这些事的前提 37:35。一个惊艳的迁移:模型在小分子药物发现上学到的化学,迁移到 MOF/COF 材料上,用于从空气捕集 CO2 或过滤氨 52:16。
Rafa 讲"scaling 的苦甜教训"(他离开学界前最后一课的题目):在 AI 里 scaling 是好事,给你路线图;在化学材料里 scaling 很"吓人",因为只有能规模化的东西才重要 42:15。量子点例子里他们把同一配方从个位数毫升扩到近一升。他们让系统在做实验时就推理"未来什么会重要"——供应链意识、有个技经分析 agent 随时待命。最终不做临床试验、不建中试厂,而是与客户合作交付 43:01。
CAR-T 深度案例 43:47:Andy 详解 CAR-T 历史与 in vivo CAR-T(六个月前 Capstan 被 AbbVie 以约 21 亿美元收购)。Lila 内部早已分别掌握三项能力——binder 设计、LNP formulation、mRNA 设计。两三人团队用六个月做到非人灵长类 B 细胞清除显著优于 Capstan 数据,其"怪兽级"UTR 使表达量约为 Moderna/Pfizer 参考的 10 倍,一路做到接近可提交 IND 的程度,成本仅传统 biotech 的 10%——这正是"零 FTE 虚拟创业"模式:客户带着明确问题,用模型+平台在短得多的时间、极低成本下跑完整个项目,Lila 收平台费+试剂费+上行分成,可并行运行成百上千个虚拟创业 49:57。Andy 还讲了 Emily Whitehead 的故事:她因医生恰好知道用 IL-6 抗体压制发热反应而从垂危获救——正是这种"血清运气",Lila 想用广博的科学知识去自动化、把成功率"从 2% 拉到 98%"59:09。
七、10 万亿 token、算力与未来实验室
主持人质疑 10 万亿 token 到底算多算少(相当于约 3000 个人类基因组、约为 Evo 等大模型的 1/2000)。Andy 澄清:这些是 RL 生成的、实验验证的推理 token(英文+工具调用+实验反馈的混合),不是把 PDB/Swiss-Prot 在序列层 tokenize 79:13。pre-training 语料通常 15-30 万亿 token,正是在万亿 token 量级能看到 emergent 能力涌现,所以这个规模很重要 80:44。
他们不做 pre-training——"要做的黑魔法太疯狂"——而是从开源权重模型起步,获赠约十亿美元算力,用 Nvidia Nemotron(约 30 万亿 token pre/post 训练)等作为良好的科学先验基础,在其上叠加 10 万亿科学推理 token 80:44。他们还建了约一千个独特科学 RL 环境的测试套件,计划开源其中一部分 81:30。关键实证:互联网上"实验验证的推理轨迹"数量约等于零,所以即使参数量不及 frontier 模型,只要给它看实验验证的推理轨迹,就能立竿见影地提升 83:49。
未来实验室愿景 64:35:现在用商品化仪器(甚至用视觉语言模型控制 Windows 95 机器、用机械臂按 iPad),这是 V0.5。因为垂直整合了软硬件栈,V2 会很不同——像数据中心一样密集堆叠(甚至加 Z 轴堆叠、"每单位体积的 token")、24/7 熄灯运行、追求数据中心级 uptime。他们正搬入 Cambridge 十万平方英尺新址,会用 AMR(自主移动机器人)做部分传输。目标是把新仪器上线时间从 30 天降到 30 分钟,让"仪器上线像插 USB"76:09。
Rafa 补充关于 scaling 策略的取舍:他们更看重"一轮接一轮的快速迭代"而非广而嘈杂的大规模多路复用;也爱 pooled 实验(如 DNA 编码库,一个板上万到十亿个实验、读出直接选出赢家)70:45。他举 gas sorption 例子:传统 BET 每样本一天且难并行,他们改测一个可并行的代理属性,96 孔板一小时测 96 个 MOF,快约 2500 倍 72:17。
金句
我们只有一个互联网,它是我们压裂开采的化石燃料——每一盎司数据都榨干了,但它没了。 —— Andy Beam(引 Ilya)6:06
我们不是自动化极大主义者,我们是 token 生成极大主义者、灵活性极大主义者。 —— Andy Beam 12:16
我们不能因为是 AI 就放松科学严谨性;我们必须用衡量人类科学的最高标准来衡量 AI 科学。 —— Rafa Gomez-Bombarelli 19:08
与其掷一枚公平的骰子,不如掷一枚灌了铅的——我们就是想把骰子灌得越偏越好。 —— Andy Beam 55:18
科学家至今还在用二进制编程:他们有一个想问的问题,却得亲手把它编译成实验协议、搬液体搬到得关节炎。 —— Andy Beam 52:14
在 AI 里 scaling 给你路线图;在化学和材料里 scaling 很吓人,因为只有能规模化的东西才重要。 —— Rafa Gomez-Bombarelli 42:15
提到的书·产品·人物
- Lila Sciences(公司,转录中亦作 Lyra/Lyla):本期主角,从 Flagship 孵化,用自动化实验室为科学超级智能生产可验证推理数据。
- Andy Beam(人物,嘉宾):Lila CTO,20 年 AI 研究者,Generate Biomedicines 创始 ML 负责人,前哈佛医学 AI。
- Rafa Gomez-Bombarelli(人物,嘉宾):Lila 首席科学官(物理科学)、联合创始人,计算化学家,MIT 材料科学教授。
- Flagship Pioneering(孵化机构):Lila 与 Generate、Moderna 的母体,据称创立约 110 家公司、约 30 次成功 IPO;CEO Jeff Builtzen。
- Generate Biomedicines(公司):Flagship 生成生物学公司,Andy 创始 ML 负责人,近期成功 IPO,有治哮喘的单抗三期试验。
- Ilya Sutskever(人物):其 NeurIPS "只有一个互联网"的论断被引为核心 thesis。
- Ken Stanley(人物,Lila 团队):开放性/机器创造力先驱,著《Why Greatness Cannot Be Planned》,在 Lila 建开放性团队。
- 《Why Greatness Cannot Be Planned》(书):Ken Stanley 论开放性与偶然性。
- Capstan(公司):in vivo CAR-T 公司,六个月前被 AbbVie 以约 21 亿美元收购,Lila 数据对标它。
- Emily Whitehead(人物):儿科白血病首批 CAR-T 治愈者之一,因医生知道用 IL-6 抗体而幸存的传奇案例。
- Nvidia Nemotron(模型):Lila 常用的开源权重基座模型,约 30 万亿 token 训练。
- Heather Kulik(人物):MIT 教授,此前 Latent Space 嘉宾,提出"材料领域没有 AlphaFold"。
- 量子点 / MOF / COF / 电催化剂(产品/材料):Lila 材料侧代表性成果,含绿氢非铂族催化剂、CO2 捕集材料。
- Octant Bio / Sridhar Kota(公司/人物):其关于 ML 药物发现商业模式的推文被引来质疑。
- Escalate Bio(公司):其"你的实验有运行时间"博客被引用。
- magnetron sputtering / spin coater / planar motor(设备):实验室视频中的关键仪器。
适合谁听
关心 AI for science、自动化实验室、scaling 与 RLVR 前沿,以及科学创业商业模式的从业者与投资人。