← 顶级AI播客总结
Latent Space

未来每个产品都是「活系统」:Trajectory 的持续学习赌注

⚡️Every product of the future will be a living system — Ronak Malde, Trajectory.ai
节目时长 34 分钟 阅读约 14 分钟
▶ 在 YouTube 收看原片
未来每个产品都是「活系统」:Trajectory 的持续学习赌注 插画

放弃 20 亿美元收购款创业,Ronak Malde 要把 Windsurf 的飞轮带给每家公司:模型每天变聪明。

核心要点

  • 放弃 20 亿创业:Windsurf 以 20 亿美元被 DeepMind 收购,Ronak 放弃全部收购款创办 Trajectory,押注 coding 之外每个领域都将像 coding 一样被持续学习超级加速。
  • AI 像静态软件:他的核心痛点是今天的 AI 像普通软件一样静态——昨天的模型明天还犯同样的错,用户给的所有修正、编辑都被浪费,缺的是 Sui 1、cursor composer、Claude Code 那种「围绕产品建模」的复利循环。
  • Harvey + Nvidia 案例:Trajectory 与 Harvey、Nvidia 合作训练 Nemotron 3 Super 逼近帕累托前沿,在 issue spotting、引用核查等法律指标上全面提升,且比前沿模型大幅更便宜更快,对部署到数十万用户至关重要。
  • 二元信号太噪:thumbs up/down、accept/reject 这类信号其实非常噪(没人在 cursor 里点赞),真正有用的是用户「该往这个方向走」式的修正与改写,这在任何产品里都通用。
  • SDPO 是关键解锁:传统 RL 把真实世界丰富信息压成一个奖励数字太破碎;self-distillation policy optimization 给 teacher 喂特权 hint 造出更聪明 teacher,再用其 log props 引导 student,能用真实文本而非二元奖励引导模型。
  • continual LoRA 切半墙钟:训练正从「研究问题」变成「生产问题」,他们与 Berkeley Sky RL 开源持续学习训练栈,用专门的训练池与采样池并发跑任务,2 个并发即可把 wall clock 切半。
  • 三阶段路线:当前服务 Clay、Harvey、Rogo、Decagon 等 AI-native 公司;下一步是科技 incumbents(Airtable、Notion),再到 Fortune 500(如 Walmart),后者需要真正的持续学习——只靠观察层就能造 agent。
未来每个产品都是「活系统」:Trajectory 的持续学习赌注 信息图
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

从 Windsurf 到放弃 20 亿创业

Ronak 的起点是斯坦福——他在大一第一周的数学课上认识了两位联合创始人。硕士做完 AI 研究后,他放弃了去 Google 做 Gemini post-training 的「现状路径」,加入当时还叫 Codium 的团队,原因是「一切关乎团队、关乎快速行动」。他带着一个论点入场:要么 math、要么 coding 这种结构化信息会带来下一次飞跃——而 coding 在经济上更可行。

他从研究侧起步,最初训练 autocomplete 模型,随后团队意识到他们从 agent 那里拿到的用户信号(人们如何构建整个网站、整个应用)远比 accept/reject 丰富,于是着手训练自有基础模型 Sui 1,把海量用户信号 post-train 进去,「击败前沿」。这成了 Windsurf 的重大解锁,而紧接着(约 35 天后)就是 Google/Cognition 的收购。收购那天极其戏剧化:CTO Douglas 半夜发短信约去酒店会议室、不许告诉别人;所有人以为是 Sam Altman 来谈 OpenAI 收购(新闻都已泄露),结果电话里是 Demis 和一众 DeepMind/Google 高管。周四交工牌、周五入职 DeepMind,Cognition 周一买下其余部分。

创业的触发点是双重的:一是 coding 之外的 legal、healthcare、finance 都将像 coding 一样被超级加速;二是 AI 仍像任何静态软件——昨天的模型明天还犯同样的错,用户的修正全被浪费。他想把 Sui 1、cursor composer、Claude Code 那种「围绕产品和真实用户行为建模」的复利循环带给每家公司。

Harvey 案例:更便宜更快的主权智能

从客户视角看持续学习更清楚。以 Harvey 为例:法律工作流里 agent 研究文档、redline 合同,但法律「做到 80% 等于 0」,容错远低于 coding;当 agent 尝试后用户去补足剩下 20%,那就是可学习的宝贵信号。Trajectory 的高层做法是把所有数据、专家轨迹蒸馏成统一格式——他们称之为「trajectory」——它包含了创建 eval、judge、environment 等训练所需全部组件,从而构成端到端的自助优化循环(当前从模型入手)。

与 Harvey、Nvidia 合作训练 Nemotron 3 Super 逼近帕累托前沿,捕捉 Harvey 实验室数据集里的专家法律工作流(issue spotting、analysis、explanation、citation、reference、completeness coverage 等),在这些指标上全面提升,而 Nemotron 比前沿模型大幅更便宜更快——部署到数十万用户时这一点至关重要,也契合 Harvey 作为受监管行业对「主权智能」的需求。平台的可扩展性体现在落地速度:首个客户花了三个月「边飞边造飞机」,如今与 Harvey 一个月内能训出模型,新客户一周内就能启动飞轮。

谈到 Nemotron 作为基座,Ronak 称赞开源社区与中国模型(Kimi、GLM、DeepSeek 等万亿参数模型),认为自 DeepSeek V3、GRPO 之后中美差距持续收窄,西方在那种体量上仍有功课要做,但 Nemotron(12B,与 GPT-OSS 同级)进步显著,Nvidia 投入巨大,西方世界正迎来更多开源模型——这对 legal、finance、healthcare 都重要。

数据策展与 SDPO

为何过去少有人做在线/持续学习?Ronak 认为关键在数据策展。每家公司存储方式不同,系统里有两件事:一是 agent 在产品里做什么(cursor 写代码跑命令、GTM 工作流建表富集列),这是 OpenAI tool call/response 格式的易解部分;二是用户还做了什么——在 Windsurf 是 agent 写完网站后用户把按钮挪到左边、改类结构。后者才是有用信息。人们一想到在线学习就想到 accept/reject、thumbs up/down,但这些二元信号其实非常噪(你上次在 cursor 或 Claude Code 点赞是什么时候?大家都在 vibe accepting);真正有用的是「你应该往这个方向走」式的方向性修正,且这在任何产品里通用。

难点是如何把这些数据压成可训练格式。一是纯基础设施问题——他们做了 auto research pipeline,把用户行为向量变成 judge、eval、environment。二是算法本身:他们近期发布的 SDPO(scaling up self-distillation policy optimization)。RL 是当下主流 post-training 范式:agent 探索世界多次,最后拿到一个奖励数字(judge 或生产信号)来更新——但它把真实世界的丰富信息压成一个数字,太破碎。self-distillation 的妙处在于不需要更聪明的 teacher:student 可以就是最聪明的模型,但你给 teacher 喂一段特权信息/hint,造出一个略小却更聪明的 teacher,再让 student 的 log props 匹配它,于是能用真实文本而非二元奖励来引导模型。例子是「我飞纽约的机票多少钱」——agent 查错了,从生产端拿到隐藏信息后给 teacher 一个聪明 hint,再匹配。他们把它扩展到真实世界的 Apex agents(Mayor 推出的 benchmark),收敛速度远快于普通 GRPO 风格训练,并能在真实 off-policy 数据上更鲁棒。

continual LoRA:从研究问题到生产问题

第二个开源产物(与 Berkeley Sky RL、Anyscale 合作)是持续学习训练栈。传统训练像 slurm 跑作业:起一堆资源、采样、训练、跑完整生命周期再关停——线性的。但持续学习里训练没有明确的起止,你可能同时跑并发作业,传统范式开始崩解(这也和 thinking machines 等「分布式 LoRA」公司的论点相似)。Trajectory 的贡献是把这做成开源:用一个专门的训练池和一个专门的采样池,把任务并行堆叠。结果是即便扩到更多并发实验,2 个并发就能切半 wall clock;扩到 4、8 个仍能很好地并发——8 个并发的耗时约等于顺序跑 3 个作业。这其实是 OS 调度问题(starvation、preemptive scheduling),他们正扩到 16 并发、235B 级模型,且性能不退化、即插即用。

Act 2 与三阶段路线

产品当前还是栈里各自分离的组件,他们在管理训练 run。下一步「Act 2」是让客户可读可控:给对的 observability 工具和 eval 抽象层,让管理 agent 产品的 PM 能说「这里 agent 很好、那里还在失败」,改动模型与各部件后第二天醒来就有更聪明的模型。商业路线分三阶段:当前服务 Clay、Harvey、Decagon、Rogo 等 AI-native 公司;接着是 Airtable、Notion 这类科技 incumbents;再到 Fortune 500——例如观察 Walmart 用户的全部手动流程,即便现成模型今天做不到,也能据观察造出 agent + harness。战术上从模型入手,但很快会改进 harness、skills 乃至 memory 层,他认为三者协同才是完整的持续学习解。

至于是否该只盯可验证的 coding 域,Ronak 的论点是:coding 过去两年发生的事将发生在每个领域;所以从不同垂直的公司入手,让平台对领域无关。招聘上他强调要与客户和持续学习研究保持同频——「研究世界活在 Twitter」。主持人 Swyx 透露已邀请他参加 AIE 会议的 continual learning 专场,并盛赞这是「产品实验室如何发布」的新标杆。

金句

你昨天用的模型,明天还是同一个、还会犯同样的错。你给它的所有修正、所有编辑,在任何产品里都被白白浪费。 —— Ronak Malde 7:00
对法律这类领域,做到 80% 和做到 0 是一回事。 —— Ronak Malde 10:03
你上次在 cursor 或 Claude Code 里点赞踩是什么时候?从来没有。所以那些信号其实很噪。 —— Ronak Malde 17:01
self-distillation 的妙处是:你不需要一个更聪明的 teacher。 —— Ronak Malde 19:18
我们把自己同时看作一家产品公司和一个研究实验室。 —— Ronak Malde 21:37
现在就是持续学习的时刻。 —— Ronak Malde 33:07

提到的书·产品·人物

适合谁听

关注 post-training、持续学习/在线学习与垂直行业 AI 落地的研究者、基础设施工程师与创业者。

← 返回全部观看原片 ↗