核心要点
- 对齐带来跃迁:Evo 2 停在预训练基座,Omni 补上 mid/post-training 与特殊 token 的问答式结构,才在 ClinVar、TraitGym 等变异效应基准上从"有竞争力"变成大部分任务的 state-of-the-art。
- 非编码区是主战场:编码区只占基因组约 1.5%~2%,但多数疾病的致病变异落在调控性的非编码区,传统生信和统计方法长期失灵,而这正是 Omni 表现最亮眼的地方。
- DNA 版思维链:团队拿 RNA aptamer 数据集,按适应度分数从低到高排成序列喂给模型,藏起最高分的那批,模型能自行把轨迹续下去并复现更高分设计,湿实验验证正在进行。
- 超越序列比对的防御:生物防御界主要靠把序列比对已知病原库,但 Microsoft 的 paraphrase 工作已证明可以保留功能、改写"拼写"来绕过检测,所以必须做功能感知的 AI 检测。
- 似然比即惊讶度:零样本打分的原理是比较野生型与突变序列的似然,用两者之比衡量模型的"惊讶程度"——进化上罕见的写法更可能致病。
- 上下文就是护城河:模型做到 200 万 token 上下文,而人类基因组约 30 亿碱基对、还长约一千倍,长上下文是公司名字的由来,也是他们坚持做 AI 研究实验室而非套开源模型的理由。
- 押注 DNA 为底座:他们认为 RNA、蛋白质、代谢组都源自 DNA,先在 DNA 上预训练再叠加模态能拿到迁移红利,目标是"通用生物智能"而非只做虚拟细胞。
章节时间轴
- 2:19 什么是基因组语言模型 — GLM 是训练在 DNA 序列而非自然语言上的大模型;团队做的是第一批不只能"读"还能"写"DNA 的生成式基因组模型。
- 3:06 HyenaDNA 与长上下文起点 — 用卷积替代注意力的 hyena operator,把上下文推到 100 万,当时是最长的语言模型上下文,用来从序列预测调控功能。
- 5:25 Evo 与生成式基因组学 — 从"读"跨到"写",单个 DNA 模型跨 RNA、蛋白质多模态协同设计,生成出全新的 CRISPR-Cas 系统。
- 8:28 第一个 AI 从头生成的基因组 — 科学家用 Evo 生成了可运作的噬菌体基因组,既是能力的里程碑,也直接催生了公司对生物风险的警觉。
- 11:31 从 Evo 到 Omni:对齐登场 — 解释为什么 Evo 打不过专才模型,以及 mid-training、post-training、特殊 token 和问答式结构如何带来提升。
- 20:04 变异效应预测与非编码区 — 讲 ClinVar、TraitGym 基准的设定,以及为什么非编码调控区的致病变异最难也最有价值。
- 24:42 Borzoi、监督与无监督之争 — 对比监督式功能基因组轨道预测模型与语言模型,解释似然比打分和 CADD 这个"厨房水槽式"集成基准。
- 33:11 把 chain-of-thought 搬到 DNA — 从 Jason Wei 的思维链讲起,用 RNA aptamer 适应度阶梯让模型自我优化,并讨论 RNA 能力为何会意外涌现。
- 46:59 稀土矿物与上下文的价值 — 与国家实验室合作设计选择性结合稀土的蛋白,用基因组邻域作为上下文,是他们相对结构模型的差异化优势。
- 53:13 长上下文与创业起源 — 从 Michael Poli 的 hyena 架构、GPU kernel 的执念,讲到六个月四处推销 Evo 被判"蠢主意",以及 Arc、NVIDIA 与 Greg Brockman 的下注。
- 63:12 机制可解释性与疾病流形 — 从 GC 含量、转录因子 motif 一路往上,目标是画出模型内部"疾病的流形"。
- 70:55 双重使命与生物防御 — 检测监测、溯源归因、反制手段三大支柱,DNA 合成公司的缺口,以及为什么防御方一直落后。
- 83:19 军备竞赛与威胁模型 — 主持人质疑"你同时在推进攻防前沿",Eric 谈门槛降低带来的量级问题、国家行为体与意外泄漏。
- 88:44 瓶颈与给听众的话 — 除了 GPU,最大的瓶颈是领域专家的悲观;寄语是不必在前沿 AI 和真正在乎的领域之间二选一。
详细内容
从长上下文到 Evo:一条误打误撞的路
Eric 的起点其实不是生物学,而是长上下文。他在 Stanford 的博士方向是长序列建模,和同实验室的 Michael Poli 一起做出了 hyena 这个用卷积替代注意力的架构。做出来之后的问题很朴素:既然模型在长序列上效率高,那世界上最长的序列是什么?答案不出意外地落到了 DNA——人类基因组三十亿碱基对。
他去看当时基因组模型在做什么,发现上下文短得离谱,一次只处理一两千个碱基对。主持人 RJ 补了一句作为参照:大多数人类转录本就有 3K 左右,一两千连表示一个蛋白质都不够。于是有了 HyenaDNA:把上下文推到 100 万,当时是语言模型里最长的,任务是从 DNA 序列预测调控功能。Eric 强调这件事的意义在于长程交互——就像自然语言里的 context rot,输入越长模型越容易退化,而 DNA 的"语法"恰恰藏在跨越很长距离的 motif 组合里。
接下来的转折点是"能不能写"。Eric 说当时所有 DNA 模型都只会读,而生成在自然语言里已经被证明是变革性的,"那这门我们还看不懂的语言 DNA 呢?"这就是 Evo 的由来。Evo 的第一个亮眼成果是 CRISPR-Cas 系统:这是一个同时包含 RNA 和蛋白质的复合系统,当时业界有蛋白质语言模型、有 RNA 模型,但没有一个系统能协同设计跨模态的东西。Evo 从 DNA 这个共同源头出发做到了,生成出自然界中不存在的新 CRISPR-Cas 系统,并且在真实世界中有功能,上了 Science 封面。
Evo 之后更震撼的事发生在去年:科学家用 Evo 从头生成了一个完整基因组——一个噬菌体(也就是病毒)。Eric 解释为什么这件事人类做不到:人类的做法本质是复制粘贴,把已知功能的小片段挪来挪去,因为我们理解那些片段的规则;但从零构建一整个基因组、在基因组尺度上"自己写",此前从未有人做到。
这件事同时带来了两种反馈。一边是兴奋,一边是担忧——如果你能操纵生命的底层结构、控制它的功能,你在向世界释放什么?Eric 说正是这波来信和评论,让他们意识到公司必须同时做设计和防御。他也承认存在合理的批评:"有人会说,它生成的东西其实很接近自然,只是在复现一点小变异。"这类质疑他认为是公允的,而他的回应是别停在"酷,这能做到"的思想实验层面,而要真正把它变成能改善疾病理解和治疗的工具。
但 Evo 有个实在的软肋:在专才模型面前打不赢,尤其在人类基因组学上。社区的反应很直接——"我有更小更专门的模型,为什么要用一个巨大的 LLM?"Eric 收到的具体批评是:人类基因组的语法太复杂、太吵、重复字符太多,这类模型搞不定。Omni 就是冲着这个质疑去的。
Omni 的答案:基因组学缺的是"对齐"
Eric 的核心论点是:生物领域的模型几乎全都停在 base model 阶段——预训练做完就发布,等于是未对齐的。在自然语言那边,预训练之后还有大量 mid-training、post-training 和 alignment 才让模型真正可用、输出成人想要的形态。基因组学里这一整段几乎是空白。
具体怎么做?Eric 说关键是输入结构:用特殊 token 告诉模型现在要做哪类任务(比如疾病预测用一个 token、设计用另一个),再以类似思维链的方式展示期望输出的序列和轨迹。他坦承讲得有点含糊是故意的,这部分是还在打磨的 secret sauce。本质上是精心切分数据集,再把问题按特定形式结构化——而预训练只是把一切塞进去做 next token prediction 或 mask infilling,模型根本没有问答结构的概念。
主持人追问模型是不是每个任务一个 head。Eric 说早期实验确实有多 head,有时多 head 更好、有时单 head 更好,团队在这点上保持灵活,但方向是走向统一,因为越统一越容易解锁泛化和涌现能力。他还提到一个被低估的实用好处:不需要每次取 embedding 再接一个 head 做回归,"想象一下 ChatGPT 每次你提问都要先针对某个领域微调一遍"——Omni 在 mid-training 阶段一次性训了很多任务,开箱即用,只要按格式 prompt 就行。
效果超出预期。Eric 说他们原本只想做个 preview,结果不仅"多任务都还行",而是在变异效应预测、疾病致病突变等每个方向上都开始推进前沿。实际需求也立刻冒出来:医院系统和非营利机构手里有大量遗传数据,知道病人有症状但找不到哪段 DNA 导致的,这些"意义未明变异"(VUS)正是他们最想用模型攻克的方向。
基准怎么读:非编码区、似然比与 CADD 这堵墙
Omni 主打的场景是变异效应。Eric 先讲清楚为什么这件事难:三十亿字母里的组合太多,临床上真正知道致病与否的只是极小一部分,于是社区从 ClinVar、TraitGym 这些数据源做出基准,问题就是"给定一个突变,它会不会致病"。DNA 模型天然适配这个设定,因为它是概率模型:改一个字母,下一个字母的预测概率就会变。模型见过海量人类 DNA,知道什么写法常见、保守,常见通常意味着更健康;罕见的写法则可能致病。这个野生型与突变的似然之比,就是 Eric 说的"惊讶因子"。
真正的分水岭在编码区和非编码区。编码区只占基因组约 1.5%~2%,传统生信和统计方法基本都围着它转;而非编码区是调控性的,控制基因何时表达、表达多少,那里的突变是否致病极难判断,偏偏多数疾病就落在那里。Eric 说这正是 Omni 发光的地方,尤其是长程的非编码区域,这对长期束手无策的遗传学家最有吸引力。
主持人特意让他解释基准表里的 Borzoi 一列。Eric 说 Borzoi 也是 DNA 模型但路数完全不同:它是监督模型,从 DNA 直接预测功能基因组轨道(如染色质可及性、基因表达),不做 next token prediction。RJ 插了一句这些轨道是无数人写论文标注出来的。Eric 借此点出关键差异——监督方法需要标注输出,而绝大多数基因组数据是没有标注的,无监督预训练因此能吃到多得多的数据。表里还有一列是 Goodfire 对 Evo 2 做的微调结果,Eric 说 Evo 2 本身在那一列是零样本、没微调的;Omni 则在微调之上再加一层:把基准的问答格式本身作为结构灌进 mid-training,这是额外提升的来源。
关于数据泄漏,RJ 的质疑很直接:这些序列很可能在无监督训练数据里出现过。Eric 说团队有生信人员系统性地梳理、去重、比对,把与基准相似的序列剔除,有专门的 QC 流程。另一个他们主动树立的高标杆是 CADD——这个方法长期是 SOTA,因为它本质是集成:把当时最好的方法(哪怕是别人的模型)和 SVM 之类的东西全扔进去。Eric 说既然对方把厨房水槽都扔进来了,"我们就不能挑一个模型说我们比它强,我们得赢过现在人类能做到的极限"。
把 chain-of-thought 搬进 DNA
主持人说看到博客里提 chain of thought 时"脑子有点炸"——DNA 里没有词句,模型拿什么"思考"?Eric 先回溯来源:思维链出自自然语言社区,他归功于 OpenAI 的 Jason Wei,突破在于让模型"展示过程"就能表现更好,哪怕步骤很简单,本质可能只是给了模型更多 token 和草稿空间,这被视为推理能力的开端,也是今天 agent 疯狂烧 token 的源头。生物领域几乎没有这类工作,蛋白质设计里刚冒了一点头。
他们做的是一个简化版。团队拿到一个大型 RNA aptamer 数据集,每条序列配一个适应度分数,分数越高越好。做法是:把最高分的那部分留出来不给模型看,只展示分数较低的序列,但按分数从低到高排成一个阶梯序列,然后让模型"照这个模式继续"。结果模型确实把轨迹续了下去,复现出了它从未见过的高分区间,生成出合理的高适应度 aptamer。Eric 强调目前只是 in silico,湿实验验证正在进行中;如果验证成功,这个范式几乎可以套到任何"序列 + 适应度分数"的生物任务上。
RJ 对这个结果表示意外,理由很专业:RNA 以缺乏良好的共进化数据著称,病毒基因组有强进化压力,但哺乳动物的 RNA 结构通常没有,主导压力是携带编码信息。他追问这个能力可能从哪来。Eric 坦率承认不确定、团队自己也很意外——模型是在 DNA 上预训练的,RNA 只在 mid-training 里以很小的量出现过,甚至只有这个数据集里的 RNA,没有外部 RNA。他倾向于 RJ 的直觉:DNA 本身携带了大量进化信息,这恰恰印证了先在基因组上预训练、再往上叠模态能拿到迁移红利的判断。RJ 补充说这和蛋白质领域的经验一致——序列本身就隐含结构。Eric 说目前不加 2D/3D 信息,但绝对计划要加。
RJ 还帮忙补了实验侧的背景:aptamer 可以理解成一个 RNA 开关,某物结合上去就会触发动作(比如切断一段序列),用 NGS 高通量读出,结合得多读数就多;这一轮筛完再突变、再迭代,据他估计探索了 10 的 11 次方量级的序列,这个实验里靶的是 HIV 相关的蛋白。关键是"筛选是由生物学本身完成的",而 Omni 做的是把同一个实验搬到计算机里。Eric 认同这个范式可以推广:比如抗微生物耐药性场景,杀灭特定菌株的效果可以打 0 到 1 的分,展示效果递增的噬菌体基因组就完全吻合这个结构。
稀土、上下文,以及公司真正的差异化
一个出人意料的应用是稀土。Eric 说他们在和一家国家实验室合作,设计能提取稀土矿物的蛋白——难点不只是能结合,而是要有选择性,只结合特定的一种稀土,所以每种矿物都有对应的结合亲和力分数,同样可以用"逐级更优"的阶梯去 prompt。
RJ 直接提出质疑:这听上去是单个蛋白的结构任务,而你们的强项应该在整生物体尺度的大规模设计,这里未必有比较优势。Eric 的回应是"上下文"。他们的假设是:某些微生物天然带有他们想要的功能蛋白,而 Omni 可以被告知"到这个基因组邻域里去找",本质是一次挖矿。他们能做而蛋白结构模型做不到的,是把目标基因上游的非编码区一起喂进去,再让模型基于这个语境产出变体——"知道你身处这个微生物中,给我看看自然界里出现过的不同写法,或者把见过的东西组合起来"。他举例说已经有人用 Evo 模型以同样手法做毒素-抗毒素系统:在目标蛋白上游做 prompt,再让模型生成一批合理的变体。
Eric 把这套思路总结成一句话:他把基因组看成"物理世界在 DNA 上的印记",你想要的那段固然重要,但它周围的东西告诉你它从哪来、为什么长成这样。RJ 接话说生物学最大的瓶颈之一可能就是缺乏语境——人类习惯用工程思维隔离单个系统,而系统生物学很难拿到有意义的定量预测力。
上下文也是公司名字的由来。RJ 算了一笔账:现在是 200 万长度上下文,而人类基因组还要长约一千倍,很多细菌基因组也远超 200 万,那怎么在有限上下文下做跨大型生物体的合成生物学?Eric 先澄清一个常见误解:Evo 2 那个 AI 生成的噬菌体基因组其实上下文很短,大约 6000 碱基对——噬菌体正因为是最短的基因组之一才被选作起点,"它们短得离谱,却极其高效"。至于长上下文本身,他说这是整个 AI 社区都在持续攻的核心问题,也是他们坚持做研究型实验室而不是拿开源模型拼装的理由。RJ 还点出他们的风格:从第一性原理出发,深入 GPU 架构去设计模型。Eric 笑说想让 Radical Numerics 的研究员分心很简单,"提长上下文和 kernel,他们立刻就'等等,有人说 kernel 了?'"。
从"蠢主意"到公司,再到机制可解释性
起源故事这段很坦诚。Eric 说 Evo 的点子他推销了六个月——在生物界这不算久——四处问人"如果我能生成 DNA,你觉得有用吗?你会拿它做什么?你愿意支持吗?"结果 Stanford 几乎每一个他聊过的科学家都觉得这是个蠢主意。反驳理由他都听全了:人类自己都不懂 DNA 的规则,怎么指望 AI 学会?你连对错都判断不了,怎么教它?DNA 太吵、重复太多、里面全是垃圾、根本没有真正的规则。他说自己就是固执地觉得"一定有用例,虽然我说不上来是什么"。
真正让他起鸡皮疙瘩的是第一个 checkpoint。有人把它扔到 ProteinGym(蛋白质基准)上,发现它和蛋白质专用模型打得有来有回——而他们从没告诉过模型什么是蛋白质。之后好消息一个接一个:RNA 上也强、DNA 上也是 SOTA,跨模态学习的迹象出来了。Arc 的人当时的态度是"行吧,花点钱买 GPU,让这几个疯孩子训一个";后来 NVIDIA 支持了 Evo 2;Greg Brockman 从 OpenAI 休了四个月长假来帮忙,Eric 说凌晨三点在 Slack 上和他一起 debug 代码,"挺离谱的"。他把这条曲线类比成自然语言的早期——人们也曾问"这玩意能干嘛,帮我写个笑话吗",没人想到会走到自动化一切。
机制可解释性是另一条他们很兴奋但自认起步偏早的线。方法上大量借自然语言社区:模型把见过的信息压缩进权重和激活,那就去探测它究竟蒸馏出了什么。他们目前主要看激活和 embedding,已经能看到 GC 含量(即 G 和 C 两种碱基在序列中的比例)、重复序列、转录因子 motif 等结构。Eric 解释转录因子是能结合 DNA、改变基因表达模式的分子,它不修改 DNA 本身却能改变 DNA 的产物,从疾病状态到衰老研究都绕不开它;而转录因子彼此又是编码基因、可以互相调控,组合空间大到不可能手工穷举,只能走数据驱动。
再往上一层,他们想做的是"疾病的流形"——在模型的输出分数和 embedding 空间里刻画疾病的结构与地貌。Eric 说仅凭 DNA 这一个"传感器"就能获得这么多洞见,那把蛋白质、RNA、表观基因组、染色质可及性、甲基化这些分子表型全部融合进来会怎样?下一代模型会显著更多模态,"我们说的是几十种"。他也顺带批评了虚拟细胞的主流做法:大家往往只盯着 RNA 和转录本就想描述整个细胞,但细胞远不止于此;要理解一个系统,就该从这个系统所有的信号和传感器学起。而公司真正的目标词是"通用生物智能"——把生物学里那些所谓不同的"语言"统一起来,因为归根结底它们都源自 DNA。主持人问自然语言算不算其中一个模态,Eric 说"还不算,但会是",而且他觉得融合语言反而相对好办(图像、视频已有大量先例),难的是生物模态之间的融合。RJ 立刻接上:那不就是做 chain of thought 最自然的方式吗。
双重使命:为什么设计方必须同时做防御
Eric 把公司的"双重使命"讲得很具体。逻辑起点是:会生成的模型天然也最会判别——擅长生成序列的模型,同样非常擅长判断一段序列是否具有致病性,所以设计能力团队本来就是最适合做防御工具的团队,这不只是原则问题,战略上也成立。他讲了一个刺激他的场景:前一晚他参加一个关于 AI 科学家的 panel,最后一个问题问最大的风险是什么,每个人都提到生物武器;但他接着想"那这些人对此做了什么",答案是基本什么都没做,看这些公司也确实没有相关投入。
他把生物防御拆成四根支柱:检测与监测(从机场拭子、鼻拭子、污水样本里判断是否存在病原体)、溯源归因(判断它是天然的、来自某国的、还是某个实验室人为改造的)、反制手段(做出抗病毒或抗微生物制剂)、以及威慑(更偏政府层面)。公司主要做前三个。他认为社区缺的不只是"判断是否致病",而是把它彻底刻画清楚:序列的哪些部分危险、哪些基因危险、它的签名指向哪里。
他点出现有防御的结构性缺陷:生物防御界主要靠序列比对,把序列对到已知病原数据库看有没有见过。问题有两个——新东西不在名单上;以及有人可以刻意做规避。这里他引了 Microsoft 的 paraphrase 工作:用蛋白质语言模型保持结构(进而保持功能)、只改"拼写",然后测试这些序列能否通过现有检测系统,答案是能绕过。RJ 补充说这正好对应屏幕上那个流形——模型内部编码的是功能,所以能识别"基因上差别不小但功能相似"的东西。Eric 还讲了最初的动机场景:DNA 合成公司像 Amazon 一样接单,你把设计发过去,他们把实体 DNA 寄给你,这套管线支撑着整个科研界;而在一个网上有几十亿、上万亿 agent 自主行动的世界里,"它们居然没有任何工具能判断自己在造的东西危不危险"——这就是他们决定先做一个危险性检测器的原因。他也公允地说,很多 DNA 合成公司确实有检测工具,但他强烈怀疑那些工具不是 AI 的、也不够稳健;RJ 接话"基本都是模式匹配"。
军备竞赛、误报、威胁模型与两个固定提问
主持人接连提了几个尖锐问题。第一个是误报:所有做生物的人都试过用 Fable,结果几乎输入什么都会被拦(Eric 说他的网站就是例子);在一天或一年产生数十亿条序列的规模下,哪怕 F1 到 0.9——而现在远没到——仍然会严重妨碍正当的合成生物学研究,这个 ROC 曲线上的平衡点非常难找。Eric 的回答是重新定义问题:与其问"如何 100% 阻止危险设计",不如问"防御侧有没有人在用前沿技术",而答案是没有。既然存在这么大的空白,把前沿技术带过去、让攻防至少回到同一量级,对他们就是容易的选择。他承认总会有漏网的,所以语言模型和聊天机器人层面的安全是一层,但东西一旦流出去,你需要的是监测、溯源、反制这整套生态——"它必须完美才有用吗?我不这么认为,门槛是能不能把针往前推一格。"
第二个是 steelman:既然你自己就在前沿,那你等于同时在推进攻与防的前沿,长期看是不是白做?Eric 的回应是要把它理解成军备竞赛而非一次性产品,类比网络安全:你做出更强的技术,对面也会跟上,来回拉扯;但目前的现实是防御方远远落后,他们要做的是把防御方拉回到势均力敌。
RJ 随即指出这个类比的关键裂缝:网络安全里,足够强的模型原则上可以堵住所有非社会工程学的漏洞,找到就打补丁、用户更新就安全了;但"我们的基因组是固定的,你没法给人打补丁",所以攻击面和防守难度高得多。不过他给了反向论证:主动发起攻击的动机也少得多,而且从能打印任意 DNA 到真造出一个成功的、还不会先杀死设计者的病毒,门槛其实很高。
他接着问 Eric 最担心什么。Eric 说自己很难代入一个想造生物武器的人的心态,也不打算穷举所有坏人剧本;他真正担心的是门槛在降低——所需专业度下降、工程速度上升,意味着总量在某个时点会指数级上涨。风险分两类:有意的一侧确实存在,历史上有国家搞过规模极大的生物战项目,公司的一位顾问就亲眼见过并参与拆除过这类设施;这在和平时期没那么可怕,战时则相当可怕。而他认为近期更可能的是无意的一侧:有人为了研究去生成和控制功能,结果东西泄漏了出去——这类东西本来就难以完全围堵。但他总体是乐观主义者,认为这项技术的收益远大于潜在危害,研究界和政策界的韧性也足以动员起来赶上;他也观察到监管侧、政治人物和智库的讨论明显在升温。
节目固定会问每位嘉宾两个问题。第一个是"如果能用行政命令消除一个瓶颈,你选什么"。Eric 要了两个答案:第一个他自己都说是敷衍,因为每个 AI 实验室都这么讲——GPU。第二个更哲学:这个领域里,专业度越高的人往往对自己的领域越悲观。他说在生物学里尤其明显,你对某个疾病领域或某种模态了解得越透,别人提个新东西你就越会条件反射地"但是这个、那个",而且他们往往是对的。他们在招人时刻意寻找的是"既是领域专家、又还是梦想家"的人——懂那个领域,但仍保有想象力和改变现状的欲望。他认为如果这个领域更能容纳这一点,就能看到多得多的阶跃式进步。
第二个问题是给听众的一句话。Eric 说很多 AI 研究者感觉自己必须二选一:要么做前沿 AI,而那似乎就等于做消费级或企业级应用、做聊天机器人;要么去做他们认为 AI 真正的潜力所在——理解生物学、改善人类健康——但那就意味着离开前沿。他想传达的是不必选:"我们可以既做真正在乎的事、既推动人类进步,又在最前沿的技术上工作,这就是我们在 Radical Numerics 想建的东西。"RJ 最后补了一句:读读他们的博客,架构、机制可解释性里有大量创新,他坚信生物学正处在 AI 的最前沿。
金句
一个擅长生成的模型,事实证明同样非常擅长判别——判断一段序列是否具有致病性。 —— Eric Nguyen 72:27
疯狂的是,我在 Stanford 聊过的科学家里,几乎每一个都觉得这是个蠢主意。 —— Eric Nguyen 58:34
我们甚至不想止步于细胞,我们想把整个生物学里所有的传感器都融合起来。 —— Eric Nguyen 40:01
我们正在降低所需专业度的门槛,也在提高工程的速度,这意味着总量在某个时点会指数级上涨。 —— Eric Nguyen 86:25
我们的基因组是固定的,你没法给一个人打补丁。 —— RJ Honicky 84:52
我想让大家带走的是:你不必二选一。 —— Eric Nguyen 91:02
提到的书·产品·人物
- Eric Nguyen(人物):本期嘉宾,Radical Numerics 的 CEO 与联合创始人,Evo、Evo 2、HyenaDNA 的核心作者。
- Radical Numerics(公司):嘉宾创办的 AI 研究实验室,同时做基因组设计模型 Omni 与生物防御工具,名字源自团队的长上下文渊源。
- Omni(产品):本期主角模型,通过 mid-training 与 post-training 对齐后,在多项变异效应基准上达到 SOTA。
- Evo / Evo 2(产品):第一代生成式基因组模型,设计出新的 CRISPR-Cas 系统并登上 Science 封面,Evo 2 由 NVIDIA 支持。
- HyenaDNA(产品):用 hyena 卷积算子替代注意力的 DNA 模型,把上下文推到 100 万。
- Borzoi(产品):基准对照中的监督式 DNA 模型,从序列直接预测功能基因组轨道。
- CADD(产品):长期占据 SOTA 的集成式变异打分方法,被团队当作必须超越的标杆。
- ClinVar / TraitGym(产品):用于评估变异是否致病的公开基准数据集。
- ProteinGym(产品):Evo 第一个 checkpoint 被拿去测试的蛋白质基准,意外表现出竞争力。
- Chris Ré(人物):Eric 在 Stanford 的博士导师。
- Michael Poli(人物):Eric 的实验室同伴,hyena 卷积架构的主要设计者。
- Jason Wei(人物):被 Eric 认为最早展示 chain-of-thought 的 OpenAI 研究者。
- Greg Brockman(人物):从 OpenAI 休假四个月帮助 Evo 2 团队,曾凌晨三点在 Slack 上一起 debug。
- Arc Institute(机构):早期支持训练第一版 Evo 的机构。
- Goodfire(公司):对 Evo 2 做微调、在基准表中单列一栏的团队,被 Eric 称为他们尊敬的同行。
- Microsoft paraphrase 研究(论文/工作):展示用蛋白质语言模型保留功能、改变序列"拼写"以绕过现有生物安全检测。
- Fable(产品):被主持人举例说明生物领域用户常被安全护栏误伤。
- Atomic AI / Mirror Omix(公司):两位主持人 Brandon 与 RJ Honicky 各自所在的公司。
适合谁听
关心 AI 如何真正进入生物学的从业者,以及想弄懂生成式基因组模型、模型对齐迁移与生物安全攻防态势的技术与政策读者。