核心要点
- 放弃 20 亿创业:Windsurf 以 20 亿美元被 DeepMind 收购,Ronak 放弃全部收购款创办 Trajectory,押注 coding 之外每个领域都将像 coding 一样被持续学习超级加速。
- AI 像静态软件:他的核心痛点是今天的 AI 像普通软件一样静态——昨天的模型明天还犯同样的错,用户给的所有修正、编辑都被浪费,缺的是 Sui 1、cursor composer、Claude Code 那种「围绕产品建模」的复利循环。
- Harvey + Nvidia 案例:Trajectory 与 Harvey、Nvidia 合作训练 Nemotron 3 Super 逼近帕累托前沿,在 issue spotting、引用核查等法律指标上全面提升,且比前沿模型大幅更便宜更快,对部署到数十万用户至关重要。
- 二元信号太噪:thumbs up/down、accept/reject 这类信号其实非常噪(没人在 cursor 里点赞),真正有用的是用户「该往这个方向走」式的修正与改写,这在任何产品里都通用。
- SDPO 是关键解锁:传统 RL 把真实世界丰富信息压成一个奖励数字太破碎;self-distillation policy optimization 给 teacher 喂特权 hint 造出更聪明 teacher,再用其 log props 引导 student,能用真实文本而非二元奖励引导模型。
- continual LoRA 切半墙钟:训练正从「研究问题」变成「生产问题」,他们与 Berkeley Sky RL 开源持续学习训练栈,用专门的训练池与采样池并发跑任务,2 个并发即可把 wall clock 切半。
- 三阶段路线:当前服务 Clay、Harvey、Rogo、Decagon 等 AI-native 公司;下一步是科技 incumbents(Airtable、Notion),再到 Fortune 500(如 Walmart),后者需要真正的持续学习——只靠观察层就能造 agent。
章节时间轴
- 0:03 开场与 Windsurf 回忆 — Ronak 回忆 Sonnet 3.5 刚出时,团队围观 agent 一次成型做出 2048 的「魔法时刻」。
- 1:35 从研究到 Sui 1 — 斯坦福背景、放弃 Gemini post-training 加入 Codium,从 autocomplete 转向捕捉 agent 用户信号、训出击败前沿的 Sui 1。
- 3:09 被收购那天 — 以为是 OpenAI,结果会议室里是 Demis 和 DeepMind 团队;周四交出工牌,周五已是 DeepMind 员工,Cognition 周一买下其余。
- 6:14 决定创业 — 看到 coding 之外每个领域都将爆发,且 AI 仍像静态软件,放弃收购款去做持续学习。
- 9:18 持续学习的流派 — 以 Harvey 法律工作流为例,区分「写进权重」与「技能/markdown」等不同路径,解释为何选前者。
- 10:49 Harvey + Nvidia 案例 — 训练 Nemotron 3 Super、捕捉专家法律工作流、全面提升指标且更便宜更快。
- 13:09 平台与上手速度 — 从首个客户 3 个月搭建,到与 Harvey 一个月内训出模型、新客户一周内启动飞轮。
- 13:56 Nemotron 与开源 — 评中美开源模型差距收窄,西方仍缺万亿参数级模型,但 Nemotron 进步显著。
- 15:29 数据策展难题 — agent 在产品里做什么 vs. 用户还做了什么,后者(修正、改写)才是宝贵信号,二元信号太噪。
- 18:33 SDPO — 拆解 RL 把丰富信息压成一个数字的破碎,self-distillation 如何用 hint 与 log props 引导。
- 22:23 产品公司 + 研究实验室 — 11 人团队来自 OpenAI、Meta SI、Amazon AGI、DeepMind、Apple、Stripe、Figma。
- 23:09 continual LoRA 开源 — 与 Sky RL/Anyscale 合作,把线性训练生命周期改成并发池,切半 wall clock。
- 27:46 Act 2 与三阶段路线 — 让客户可读可控,从 AI-native 公司到 incumbents 再到 Fortune 500。
- 30:50 不止 coding — 为何不只盯可验证的 coding 域,而要加速并改造每个垂直行业。
- 31:35 招聘与社区 — 研究世界活在 Twitter,要与客户和持续学习研究保持同频。
详细内容
从 Windsurf 到放弃 20 亿创业
Ronak 的起点是斯坦福——他在大一第一周的数学课上认识了两位联合创始人。硕士做完 AI 研究后,他放弃了去 Google 做 Gemini post-training 的「现状路径」,加入当时还叫 Codium 的团队,原因是「一切关乎团队、关乎快速行动」。他带着一个论点入场:要么 math、要么 coding 这种结构化信息会带来下一次飞跃——而 coding 在经济上更可行。
他从研究侧起步,最初训练 autocomplete 模型,随后团队意识到他们从 agent 那里拿到的用户信号(人们如何构建整个网站、整个应用)远比 accept/reject 丰富,于是着手训练自有基础模型 Sui 1,把海量用户信号 post-train 进去,「击败前沿」。这成了 Windsurf 的重大解锁,而紧接着(约 35 天后)就是 Google/Cognition 的收购。收购那天极其戏剧化:CTO Douglas 半夜发短信约去酒店会议室、不许告诉别人;所有人以为是 Sam Altman 来谈 OpenAI 收购(新闻都已泄露),结果电话里是 Demis 和一众 DeepMind/Google 高管。周四交工牌、周五入职 DeepMind,Cognition 周一买下其余部分。
创业的触发点是双重的:一是 coding 之外的 legal、healthcare、finance 都将像 coding 一样被超级加速;二是 AI 仍像任何静态软件——昨天的模型明天还犯同样的错,用户的修正全被浪费。他想把 Sui 1、cursor composer、Claude Code 那种「围绕产品和真实用户行为建模」的复利循环带给每家公司。
Harvey 案例:更便宜更快的主权智能
从客户视角看持续学习更清楚。以 Harvey 为例:法律工作流里 agent 研究文档、redline 合同,但法律「做到 80% 等于 0」,容错远低于 coding;当 agent 尝试后用户去补足剩下 20%,那就是可学习的宝贵信号。Trajectory 的高层做法是把所有数据、专家轨迹蒸馏成统一格式——他们称之为「trajectory」——它包含了创建 eval、judge、environment 等训练所需全部组件,从而构成端到端的自助优化循环(当前从模型入手)。
与 Harvey、Nvidia 合作训练 Nemotron 3 Super 逼近帕累托前沿,捕捉 Harvey 实验室数据集里的专家法律工作流(issue spotting、analysis、explanation、citation、reference、completeness coverage 等),在这些指标上全面提升,而 Nemotron 比前沿模型大幅更便宜更快——部署到数十万用户时这一点至关重要,也契合 Harvey 作为受监管行业对「主权智能」的需求。平台的可扩展性体现在落地速度:首个客户花了三个月「边飞边造飞机」,如今与 Harvey 一个月内能训出模型,新客户一周内就能启动飞轮。
谈到 Nemotron 作为基座,Ronak 称赞开源社区与中国模型(Kimi、GLM、DeepSeek 等万亿参数模型),认为自 DeepSeek V3、GRPO 之后中美差距持续收窄,西方在那种体量上仍有功课要做,但 Nemotron(12B,与 GPT-OSS 同级)进步显著,Nvidia 投入巨大,西方世界正迎来更多开源模型——这对 legal、finance、healthcare 都重要。
数据策展与 SDPO
为何过去少有人做在线/持续学习?Ronak 认为关键在数据策展。每家公司存储方式不同,系统里有两件事:一是 agent 在产品里做什么(cursor 写代码跑命令、GTM 工作流建表富集列),这是 OpenAI tool call/response 格式的易解部分;二是用户还做了什么——在 Windsurf 是 agent 写完网站后用户把按钮挪到左边、改类结构。后者才是有用信息。人们一想到在线学习就想到 accept/reject、thumbs up/down,但这些二元信号其实非常噪(你上次在 cursor 或 Claude Code 点赞是什么时候?大家都在 vibe accepting);真正有用的是「你应该往这个方向走」式的方向性修正,且这在任何产品里通用。
难点是如何把这些数据压成可训练格式。一是纯基础设施问题——他们做了 auto research pipeline,把用户行为向量变成 judge、eval、environment。二是算法本身:他们近期发布的 SDPO(scaling up self-distillation policy optimization)。RL 是当下主流 post-training 范式:agent 探索世界多次,最后拿到一个奖励数字(judge 或生产信号)来更新——但它把真实世界的丰富信息压成一个数字,太破碎。self-distillation 的妙处在于不需要更聪明的 teacher:student 可以就是最聪明的模型,但你给 teacher 喂一段特权信息/hint,造出一个略小却更聪明的 teacher,再让 student 的 log props 匹配它,于是能用真实文本而非二元奖励来引导模型。例子是「我飞纽约的机票多少钱」——agent 查错了,从生产端拿到隐藏信息后给 teacher 一个聪明 hint,再匹配。他们把它扩展到真实世界的 Apex agents(Mayor 推出的 benchmark),收敛速度远快于普通 GRPO 风格训练,并能在真实 off-policy 数据上更鲁棒。
continual LoRA:从研究问题到生产问题
第二个开源产物(与 Berkeley Sky RL、Anyscale 合作)是持续学习训练栈。传统训练像 slurm 跑作业:起一堆资源、采样、训练、跑完整生命周期再关停——线性的。但持续学习里训练没有明确的起止,你可能同时跑并发作业,传统范式开始崩解(这也和 thinking machines 等「分布式 LoRA」公司的论点相似)。Trajectory 的贡献是把这做成开源:用一个专门的训练池和一个专门的采样池,把任务并行堆叠。结果是即便扩到更多并发实验,2 个并发就能切半 wall clock;扩到 4、8 个仍能很好地并发——8 个并发的耗时约等于顺序跑 3 个作业。这其实是 OS 调度问题(starvation、preemptive scheduling),他们正扩到 16 并发、235B 级模型,且性能不退化、即插即用。
Act 2 与三阶段路线
产品当前还是栈里各自分离的组件,他们在管理训练 run。下一步「Act 2」是让客户可读可控:给对的 observability 工具和 eval 抽象层,让管理 agent 产品的 PM 能说「这里 agent 很好、那里还在失败」,改动模型与各部件后第二天醒来就有更聪明的模型。商业路线分三阶段:当前服务 Clay、Harvey、Decagon、Rogo 等 AI-native 公司;接着是 Airtable、Notion 这类科技 incumbents;再到 Fortune 500——例如观察 Walmart 用户的全部手动流程,即便现成模型今天做不到,也能据观察造出 agent + harness。战术上从模型入手,但很快会改进 harness、skills 乃至 memory 层,他认为三者协同才是完整的持续学习解。
至于是否该只盯可验证的 coding 域,Ronak 的论点是:coding 过去两年发生的事将发生在每个领域;所以从不同垂直的公司入手,让平台对领域无关。招聘上他强调要与客户和持续学习研究保持同频——「研究世界活在 Twitter」。主持人 Swyx 透露已邀请他参加 AIE 会议的 continual learning 专场,并盛赞这是「产品实验室如何发布」的新标杆。
金句
你昨天用的模型,明天还是同一个、还会犯同样的错。你给它的所有修正、所有编辑,在任何产品里都被白白浪费。 —— Ronak Malde 7:00
对法律这类领域,做到 80% 和做到 0 是一回事。 —— Ronak Malde 10:03
你上次在 cursor 或 Claude Code 里点赞踩是什么时候?从来没有。所以那些信号其实很噪。 —— Ronak Malde 17:01
self-distillation 的妙处是:你不需要一个更聪明的 teacher。 —— Ronak Malde 19:18
我们把自己同时看作一家产品公司和一个研究实验室。 —— Ronak Malde 21:37
现在就是持续学习的时刻。 —— Ronak Malde 33:07
提到的书·产品·人物
- Ronak Malde / Trajectory.ai(人物/公司):本期主嘉宾,做持续学习平台。
- Windsurf / Codium / Sui 1(公司/产品):他参与的 IDE 与基础模型,Sui 「击败前沿」。
- Demis Hassabis / Sergey Brin(人物):DeepMind 收购 Windsurf 的关键推动者,Sergey 出现在 anti-gravity 发布视频。
- Gemini 3 / anti-gravity(产品):他在 DeepMind 参与的工作。
- Cognition(公司):在收购后买下 Windsurf 其余部分,做 Sui 1.5/2。
- Harvey(公司):法律 AI 客户,合作训练 Nemotron 3 Super。
- Nvidia / Nemotron 3 Super(公司/产品):合作训练的 12B 开源基座模型。
- DeepSeek V3 / GRPO / Kimi / GLM(产品/方法):中国开源模型与范式,论证中美差距收窄。
- GPT-OSS(产品):一年前西方最佳开源基座之一,用作 Nemotron 体量对照。
- SDPO(self-distillation policy optimization)(方法):他们扩展并落地的训练算法。
- Apex agents / Mayor(benchmark/公司):建模真实行为的评测,用于 SDPO 实验。
- Sky RL(Berkeley)/ Anyscale(机构/公司):合作开源持续学习训练栈 continual LoRA。
- Clay / Rogo / Decagon(公司):Trajectory 当前的 AI-native 客户。
- thinking machines(公司):被提及的「分布式 LoRA」同类论点公司。
- AIE(AI Engineer 会议)(活动):主持人邀请他参加的 continual learning 专场。
适合谁听
关注 post-training、持续学习/在线学习与垂直行业 AI 落地的研究者、基础设施工程师与创业者。