← 顶级AI播客总结
Latent Space

swyx 现场对谈:AIE 大会、AGI 焦虑与 Agent Lab 生存法则

Podcast Crossover: AIE, AGI, frontier lab strategy with ​ ⁨@matthew_berman⁩ and @swyxtv
节目时长 28 分钟 阅读约 20 分钟
▶ 在 YouTube 收看原片
swyx 现场对谈:AIE 大会、AGI 焦虑与 Agent Lab 生存法则 插画

Matthew Berman 现场拷问 swyx:前沿实验室政治、pdoom 90、以及为什么"路由"是营销话术。

核心要点

  • AIE 的价值:swyx 定位 AIE 是"中立赛场",让各大实验室在同一起跑线竞争,对工程师最有利、对实验室最残酷;这在 OpenAI DevDay 或 Code with Claude 上都拿不到。
  • pdoom 90/50000:swyx 自认是 doomer,以五万年(智人存续跨度)为尺度 pdoom 约 90,但强调 pdoom 必须绑定时间线——10 年内接近零,50 年约 5%。
  • LLM 不通向 AGI:他明确回答 LLM 能驱动 RSI 却"递归受限",只探索已被探索过的东西,接近已知分布;unknown unknowns 与真正的 world model 仍属研究领域。
  • 数据效率是下一难题:人类靠数百万到数十亿样本就能干活,LLM 靠万亿 token 极其低效;目标是把"学一件事需 2000 例"压到 20 例、2 例,走向 continual learning。
  • Agent Lab 两字方针:给应用层创业者的建议是"先选问题不选方案",做某垂直领域(律师、牙医、金融、程序员)永远的"AI 那伙人",赌的是 capability overhang 永远存在——这是安全的赌注。
  • 路由是营销话术:swyx 认为顶级 agent builder 都在 all-in 单一模型、榨干 prompt/工具/缓存,而"以路由为卖点"只会沦为所有模型的最低公分母、错失全部能力。
  • OpenAI 5% 给政府:他认为传闻"合理且在可能范围内",各国民众理应分享 AI 上游收益否则形成永久底层;并以新加坡 Temasek、GIC 持股为正面先例。
swyx 现场对谈:AIE 大会、AGI 焦虑与 Agent Lab 生存法则 信息图
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

一、AIE 大会:从预判职业化到"中立赛场"

swyx 讲述办会缘起:他做了多年演讲嘉宾,见过前端工程、云工程、数据工程如何各自演化为有专属大会、专属 influencer 和技术栈的职业化领域,判断"这件事很明显也会发生在 AI 上"0:00。于是他买下 ai.engineer 域名、写了博文,Andre Karpathy 的背书让它真正起飞0:46。他补充 Gartner 两年前把它放在 hype cycle 的顶点,"到现在还很 hype、还在走"。

他并非独自操办,而是和曾办过会议的朋友 Ben 合作——Ben 当时在运营西海岸最好的 React 大会 Reactathon,swyx 负责内容、Ben 负责后勤1:32。第一届最难的是"说服人们这件事值得来":作为任何东西的第一届,没有历史、没有口碑、没有 YouTube 频道,全靠 swyx 和 Ben 的声誉背书;而且当时技术本身也很原始,大家还在讲 prompt 框架和一点 RAG,"根本没有 agent"1:32

第三个难点是拉到一个大实验室,对他们而言是当时在 OpenAI 的 Logan2:18。swyx 由此提炼出 AIE 如今的核心价值主张:能把所有实验室拉到一个中立场地,让它们在同一起跑线上竞争——这对工程师最有利、对实验室最残酷,而实验室其实喜欢在公平赛场上取胜,这在 DevDay 或 Code with Claude 那样的自家活动上是拿不到的。Berman 补充说他很欣赏大会覆盖了从普通用户到高度技术的"整个复杂度栈"。

二、Etched 与推理专用芯片:不是颠覆 Nvidia

Berman 提到本周刚出隐身状态的 Etched,swyx 说自己刚做了一场一小时的芯片专场3:04。对于"Etched 会不会颠覆 Nvidia",swyx 的框定是:它们并不想颠覆 Nvidia,"整个推理盘子实在太大了,当然会有专门做推理的 ASIC",Nvidia 会继续造 GPU3:04

被追问 Etched 更像 Groq 还是 Cerebras 时,swyx 把 Etched(及 MatX 等新一代芯片)向朋友描述为"下一代 Cerebras、下一代 Groq":Cerebras 十多年前起步、如今已 IPO,那套流程与 form factor 相对成熟;而 Etched、MatX 这批新芯片是"高度专门化地针对 transformer 之后我们已知的一切、并为该工作负载做优化"3:51。所以老一代没为此优化很合理——那时这类负载还不存在。

Berman 追问做定制芯片是否要承担架构剧变的风险,swyx 说"他们不在乎":ChatGPT/GPT-3.5 那一档架构这么久基本没变,是个相当不错的赌注;即便未来出现新模型,像 GPT-4o 这样的现有负载仍有人在用——"东西一旦能用就一直用,别乱动"3:51

三、Fable 归来、"降智"争议与 Anthropic 算力问题

swyx 提到 Fable 5 回归,Anthropic 专门为大会放开了它;网站上有个由 Fable 打造的彩蛋——一个小游戏,提示是"找那个悬停时会弹跳的地球图标"4:37。对于 X 上盛传的"降智/nerf"说法,swyx 说人们抱怨 Anthropic 很快,但他没有硬数据证明相比首发是否被削;他承认 false refusal 确实一直大量存在、很烦人,也知道有降级到 opus 的重路由,但他自己一次都没遇到过——Berman 打趣"也许你不够 spicy""也许你得聊聊化学武器它才会触发"5:24。swyx 的总体评价是:Fable 工作起来极其聪明,但也很慢,他不会拿它做所有事,只用于"聪明的问题","大概他们也是这么希望的"。

随后转到"Anthropic 是否算力受限"。Berman 复述一个月前的叙事:有人说 Anthropic 缺芯片、缺算力所以不推 mythos 和 Fable。swyx 反驳说 mythos 的限流"是真正出于安全考量",不是什么限量配给算力的阴谋6:56。但 Berman 坚持认为他们确实受带宽/算力限制——看配额就知道,两个月前"几分钟就能烧穿配额",现在因为 Fable token 消耗更大又开始发生7:43。swyx 提到 Anthropic 刚和 AWS 达成一批算力/带宽交易,而"XAI 那笔才是大的",并强调这些交易不是一夜之间发生、早就在筹划6:56

四、OpenAI 给政府 5%:从新加坡经验谈上游收益共享

Berman 抛出当天传闻:OpenAI 拟向美国政府提供 5% 股权7:43。swyx 说他不了解消息源,但觉得"合理、在可能范围之内"——OpenAI 一直比其他前沿实验室更亲近白宫,"这是事实"。更深一层,他认为任何创造出前沿智能的国家,其民众都需要在上游成功中分一杯羹或有一份话语权,否则会形成"永久底层"和巨大社会压力;他甚至玩味过"universal basic AI"——人人发一个 chat pro 订阅8:31

他以自己的祖国新加坡为正面先例:Temasek 和 GIC 持有新加坡经济的相当大份额,运转良好,养老金、储蓄、保险大量投资于政府持股的国家关键企业,"有什么不一样?"9:18

对于"是否会当成公用事业来管",swyx 判断这东西"太不稳定,不该当 utility"。他打了个比方:如果 Edison 当年一搞电就立刻被监管,那不行——大概得先等五十年。在 2025 年、ChatGPT 出来才三四年就说要像公用事业那样按成本加成定价、留给自然垄断,"我们还没到那一步,得再等几十年"10:04。他还提醒这是多回合博弈——每四年一次选举,别只为一个回合优化10:49

五、监管、政治与"art of the deal"

Berman 指出政府近几周非常直接地介入决定哪些模型可公开、发布时机,比如 GPT 5.6 已宣布却要等几周才发10:49。swyx 认为白宫觉得这套是"一致的",而且比一年多前各州自己搞的 SB 1047 那类东西要好——国家层面统一去做是可以的11:35。他能给出的最好评价是:这在政治上并非新战术,就是 art of the deal——先抛一个相当极端的开局,再往回收11:35。他和 Berman 打趣,如果人类最终是靠《交易的艺术》从 Skynet 手里得救岂不有趣,因为"资本主义下本来就没有别的机制去控制公司"12:22

被问政府更担心 Skynet 还是别国的蒸馏/网络战,swyx 说多重动机是对齐的——"当它们都指向同一个答案时,就没必要排序动机了"12:22

六、pdoom 90、五万年尺度与"我们没有天然存在权"

这是全场最鲜明的立场。swyx 自认是 doomer:他见过 pdoom 为 0、小于 1% 的人,而他自己"在五万年尺度上接近 90",并强调 pdoom 必须绑定时间线12:22。五万年大约是智人存续的下限(区间约 5 万到 40 万年);他的论证是:我们并不比先于我们存在过的任何物种更有"存在权",如果我们在孕育一种新生命形式,那么"因意外而在与它的比较中活得不好"是合理预期——"树相对人类文明过得怎么样?我们移动比树快得多,而这些东西移动又比我们快得多"13:08

因此他认为默认假设应是对齐的概率很低,"而如果我们要错,也会错向安全的方向"13:53。他借此说明 AIE 在 e/acc 与 decel 之间"正好居中"——政治上要务实、要乐观,但不能像 EA 那样无约束地乐观,所以护栏、系统、fine-tuning、eval 才重要;让工程师掌控、监视、监控思维链的变化,很可能是人类的正确路径13:5314:39

当被要求把尺度从五万年缩到 10 年和 50 年,swyx 给出:10 年内 pdoom 接近零(先说 10、又改口"太高了,5%"),50 年"差不多是我们这代人寿命的尽头"14:39。他建议用《基地》(Foundation) 或《沙丘》(Dune) 那种长视角看待生命演化——LLM 可能某天到头、并非 AGI,也许还有 30 年 AI 寒冬,然后下一个范式才是真正的东西;"我们凭什么认为自己恰好活在一切终结的那一刻,那太自我中心了、太把自己当主角了"15:24

七、LLM 不通向 AGI:RSI 的天花板与 sour lesson

Berman 问 LLM 是否足以带来递归自我改进(RSI)进而催生某种可能是 AGI 的新架构。swyx 说这是个很微妙的问题,但他的答案是"不能"16:10:是的,LLM 能驱动 RSI,昨天还有一整条 auto research 轨道在讲这个;但它的递归是受限的,因为它"很可能只探索那些已被探索过的东西",离我们已知的分布不远16:10。发现真正的 unknown unknowns、真正的创新、真正的 world model,仍属研究领域——大会有 world models 轨道但发展得很不成熟,"Dwarkesh 说的完全对"16:56

他点名"数据效率是下一个问题":在万亿 token 上学习才能达到某种人类等效劳动,相比人类极其低效——人类在数百万量级就能做有用的事,数十亿就是个完整的成年劳动力16:5617:42。Berman 反问是否非得把 LLM 塞进"人类的盒子",swyx 说不必——他称之为"sour lesson"(酸涩教训,与 bitter lesson 对照):每次拿人类类比机器你大概都会失败,因为机器的发展方式和人类非常不同17:42

但他强调低效"是我们已知的、毫无缓和余地的负面项",所以要把它做得更高效:从学一件事需 2000 例,压到 20 例、2 例,这样才更可扩展,才能真正走到 continual learning——让 agent 自适应、建立真正的 world model,否则永远困在很可能正在触顶的 pre-train/post-train 范式里18:30

八、Fable 是终点、Capability overhang 与 Agent Lab

swyx 说他"真心预期 Fable 会是这一代 LLM 的终点",核心理由是慢18:30。Berman 说自己在 Cursor 里用感觉比刚发布时快了一点,但仍然慢;swyx 说 Anthropic 在做更好的推理,可它还是慢,所以有些不需要 Fable 的活你就不会用它,"也不想为所有事付 Fable 的价钱"19:15。他点出真正稀缺的预算不是钱而是时间——"哪怕你在前沿实验室,时间仍是你的限制";如果 20 万亿参数的模型就是极限、没有 200 万亿、没有 quadrillion 级别,那么在无限预算的可用性意义上"差不多就到头了",因此需要不一样的东西——也许是 Thinking Machines 的东西、也许是 Together AI 的 SSM,"总之我们还没有它"19:1520:00

关于 capability overhang(能力过剩/未被榨干),swyx 认为它非常真实且会长期存在:即便上一代 Opus、GPT 5.5,能榨取的价值仍然关键,而新一代又会带来更多 overhang20:00。他给"AI engineer"的定位是:存在于"峰值能力"与"把它部署到其他所有地方"之间的空白表面积——模型研究在某个领域尖峰式突破、但在所有产品里分布不均,这就是工程师永远有活干的地方;只是会有一波波"整合",某些自建的东西因下一代模型一个 prompt 就能做而被扔掉,这属于正常的"春季大扫除",不该对代码有依恋20:47

给应用层创业者的建议是两个字:Agent Lab(他有篇文章在 latent.space/agentlabs)21:32。核心是"永远做客户的那伙 AI 人"——先选问题不选方案,成为牙医、律师、金融、程序员等某个群体永远的"AI 那伙人",把每一代新能力折叠进你的"最后一公里"产品里22:18。Berman 质疑这是否在赌模型不会泛化,swyx 承认模型确实会泛化、有时抹掉整个产品品类,但你真正赌的是"未来永远存在 capability overhang",这是相当安全的赌注23:04。他列举 Sierra、Cognition、Cursor、Decagon、Harvey 都是各自领域的 agent lab:在模型上也许略落后前沿实验室,但在解决客户反馈上无人能及——他透露过去六个月在 Cognition 内部看到,没有别人会派 200 人随时和 Goldman Sachs 待命,搞定 Microsoft Teams 集成、搞定他们用的那套"Atlassian Bitbucket 开源时的 fork"这种怪需求,"Claude 不会替你做这个"23:51

九、Token 预算与"模型路由"之辩

Berman 引出近期关于 token 预算、token maxing 对多数人不可及的讨论,并提出:非前沿的 agent lab(Cursor、Cognition、Factory)model-agnostic、有动力把模型路由做好,而前沿实验室没有——现在是不是 model-agnostic 公司的黄金时代24:36

swyx 说这是"当前辩论下大家都在说的合理结论,但不代表我认同它"25:22。他从业够久,见过云时代的对照:有的公司 all-in AWS 或 GCP,有的用 Terraform 走 multicloud;而大赢家往往是"在一件事上 all-in"25:22。简单的论证是:如果你以路由为傲,你永远无法榨干任何一个模型的全部能力,因为你没 all-in——这是成为"所有模型最低公分母、完全错失能力"的好办法;而且你也没有 AWS 那种拥有整个栈的规模经济26:07

他补充一个有趣角度:agent lab 从每家模型供应商拿到折扣,所以当人们拿"打折的 Claude Code 公开定价"去比 Anthropic 给 agent lab 的价钱时,这本身就值得讨论26:07。最后他直言"路由这事是一句营销话术":和顶级 agent builder 聊,他们都在最大化、完整探索 prompt 表面积、工具使用、缓存等一切能榨干的东西——"你是要榨干他们给你的一切,还是只想停在表面、在 100 个模型上做 chat completion?哪种更可能作为 agent lab 胜出?"26:53

对话在 swyx 感谢 Berman 来到"我最大的舞台、最大的节目"、并互相约定在 YouTube 上合作中结束26:5327:39

金句

我们能把所有实验室拉到一个中立场地,让它们在同一起跑线上竞争——这对工程师最有利、对实验室最残酷;而这在 DevDay 或 Code with Claude 上你根本拿不到。 —— swyx 2:18
我们并不比先于我们存在过的任何东西更有存在权;如果我们在孕育一种新生命形式,因意外而活得不如它,是合理的预期。 —— swyx 13:08
我们凭什么认为自己恰好活在一切终结的那一刻?那太自我中心了——你把自己当主角了。 —— swyx 15:24
每次你拿人类去类比机器,你大概都会失败,因为机器的发展方式和人类非常不同——我把这叫 sour lesson。 —— swyx 17:42
你真正赌的,是未来永远存在 capability overhang——而这是一个相当安全的赌注。 —— swyx 23:04
以路由为傲,是让你沦为所有模型最低公分母、彻底错失能力的好办法。 —— swyx 26:07

提到的书·产品·人物

适合谁听

关心前沿实验室战略、AI 应用层创业方向与 AGI/安全长期图景的从业者与投资人。

← 返回全部观看原片 ↗