核心要点
- 对齐即目标:她主张 AI 的根本优化目标应是"对齐表征"——人类不断推断他人心智并对齐彼此表征,由此涌现出所有灵活认知能力,这可能取代 next-token 成为新的计算级目标。
- 可靠性重定义:Perception agent 的可靠性不在于"每次精准点击对的按钮",而在于建模用户的心智、意图与偏好——就像私人助理理解你,而非机械执行任务。
- 记忆非存储:反对"记忆=可卸载的存储"这一 20 世纪计算机隐喻,人类记忆贯穿学习与认知、用于模拟未来、含 episodic 个人视角,Amazon 正探索在推理时改变信息情境化方式。
- 世界模型是社会性的:与 Fei-Fei Li 式的 3D 生成视频世界模型不同,她强调人类世界模型从一开始就是"社会世界模型",靠推断他人视角来在任意环境中泛化。
- 实时交互范式:批评行业困在 chatbot、coding agent 的"回合制批处理"局部吸引子,真正的 AGI 应能边听边想边行动、实时协商意义,如 mind-meld。
- AI 正削弱能动性:引用研究——人类接受 AI 写作建议会在无意识中被切换到相反论点;Northwestern 研讨会指出用 AI 的科学家论文更多,但整体科学在收窄、思维在同质化。
- 多智能体要涌现文化:反对硬编码角色与协作动机,主张从 Maslow 式原始动机出发让规范、制度、累积文化自下而上涌现,因为 open-claw 等实验中的多智能体"放大看没有任何durable的东西"。
章节时间轴
- 0:03 从爱丁堡到法国:AI 与人类繁荣 — 介绍嘉宾近况,《国富论》250 周年纪念会上她代表"如何让 AI 为人服务"这一视角。
- 1:35 人类智能是集体的 — 集体大脑、社会性智能、多样性与互联性驱动创新的核心论点。
- 2:21 AI 会抢工作吗 — 谈自动化心态的陷阱、当前 agent 不可靠反而让人安心的悖论。
- 4:38 Amazon AGI Lab 是什么 — 承接 Adept 使命,做能在电脑上完成人类一切任务的感知智能体。
- 8:29 记忆不是存储 — 从计算机隐喻谈到 episodic memory 与是否需要改权重。
- 10:46 AGI Lab 在 Amazon 的定位 — 与 Nova 组的关系、保留初创式研究模式、不急于产品化。
- 13:50 Nova Act 与可靠性重定义 — 从原子交互到"建模用户心智"的转变。
- 17:40 新的优化目标:对齐表征 — Goodhart 定律、泛化机制、对齐作为发展性问题。
- 20:45 环境与社会世界模型 — Jason Lester 的环境论、世界模型的社会本质、术语之争。
- 28:29 多智能体与涌现文化 — 批评硬编码编排,主张从原始种子涌现规范与制度。
- 34:34 能动性、教育与认知卸载 — AI 降低能动性、科学同质化、Socratic 导师与两西格玛问题。
- 45:23 播客第二季与数字杂役 — Making a Mind 第二季预告,主持人的剪辑流程痛点。
详细内容
一、人类智能是集体的:她为什么离开学术界
Perszyk 开场就把她的世界观和盘托出:人类智能本质上是集体的。人类学家所说的"集体大脑"意味着没有任何个体能独自生存,智能是从人与人的互动中涌现的,是根本社会性的 1:35。她进一步论证,让人类不仅生存还能适应各种环境的那种创新,是多样性、群体规模、互联性三者的函数——种群内的变异越大、越互联,创新越可能发生 2:21。
这直接解释了她为什么离开学术界:她曾研究人类智能的演化,以及"让更多人参与集体动态"的机制。她认为当前行业主流的 AI 框架与此背道而驰——AI 在为造 AI 的工程师而造,困在湾区的回音室里 26:10。她想问的是:能不能让 AI 扩展这些集体过程,让更多人(而非只有工程师)参与集体对话?
在"AI 抢工作"的问题上,她的立场是辩证的。她承认会有过渡期和真实担忧,但认为当前人类认知被严重浪费——即使最有创造性的工作也充满杂役,人整天盯着屏幕,"这不是我们大脑该做的事,我们本该协作、碰撞想法" 3:53。她的警告是:如果陷入"自动化心态"(automation mindset),我们会白白丢掉 AI 本可为人类福祉、人际关系创造的更大价值 4:38。一个反讽是:人们担心 AI 自动化工作,可一看 agent 的指标又发现它们太不可靠,于是又松了口气 4:38。
二、Amazon AGI Lab:一个被"保护"的前沿科学实验室
主持人 Swyx 请她把 Amazon AGI Lab 放进 Amazon 的大图景里。Perszyk 解释,她随 Adept 原班人马加入时,说服了领导层:要做前沿研究,必须保留初创式的运营模式,把研究隔离开来,专注于"感知智能体"(perception agents)这一使命——尽管当时还没这么叫 11:32。她特别珍视一点买账:Amazon 认可基础研究的价值,愿意为"暂时无法立刻产品化的新品类科学"留出空间。
她借此对比其他前沿实验室的困境:一旦有了大量用户在用的产品,就不得不关掉各种研究项目,"all hands on deck"扑向那个产品——她称之为"成功的受害者"。Swyx 附和道"太残酷了,所有人都在做 coding 和 B2B SaaS",各家实验室都在追赶彼此在做的事 12:18。她强调 Amazon AGI Lab 从根上不同,做的是前沿科学,思考人与 agent 交互的下一个范式。
关于产品策略,她明确表示"不能替公司谈战略",但反复强调实验室最大的死法就是过早产品化:一旦开始为产品优化,而非为通向泛化的底层机制优化,就会损害科学本身 27:43。她引用 SVP Peter DeSantis(同时负责 AGI、芯片与量子)在 Vivatech 的话——我们才处在智能的"婴儿期开端",还想象不到即将到来的突破 25:24。她预言几个月后回看今天,我们会因为过度锚定 chatbot 和 coding agent 而无法共情此刻的心智模型 26:10。
三、Nova Act 与可靠性的重新定义:从精准点击到建模心智
这是全场论证最漂亮的一段。Perszyk 回顾 Nova Act 的思路:两年前模型远未能像人一样理解数字世界的 affordance,长程规划也不到位,于是他们的策略是"迁就模型现状",先把点击、滚动这些原子交互做可靠,让开发者能把重复工作串成 workflow 14:36。Swyx 补充这在两年前是个硬问题——从图像识别边界框再精准点击,如今可能已解决。
但她话锋一转:可靠性根本不是这个意思 15:22。感知智能体的终极目标是,人给出高层意图,agent 能分解目标并去执行,甚至建立信任后无需再 check-in,像人一样用电脑。可只要多想一层就会发现问题:真实任务里,人是边用边想的。她举订机票的例子——你在 GUI 里发现有个经停城市的选项,或者可以直飞,这会彻底改变你对这趟行程的构想,"目标是随时间展开的" 16:07。
于是她抛出关键类比:人类会托付别人订机票、订餐、报销,那 AI agent 和私人助理的差别是什么?差别在于助理理解用户的心智和目标,能分解的不只是任务,还有偏好和意图 16:54。结论是:可靠性与"在同一个地方点击"关系不大,而与建模用户心智关系极大——"这个转变改变了一切,重构了我们对在造什么的理解" 17:40。
四、新的优化目标:对齐表征(aligning representations)
Swyx 顺势问出核心问题:我们有没有比"预测下一个 token"更好的目标?Perszyk 把 cog sci 翻译成 ML:当前提升智能的做法是让模型在特定任务上爬坡,可以用 RL 把某个任务做得很好,但换个任务就不行、不泛化,像打地鼠 18:26。真正该问的是:让人类得以泛化的底层机制是什么?
她搬出经济学家 Charles Goodhart 1975 年的定律:一旦把度量变成目标,度量就不再是好度量——纯优化任务会被 reward hack 19:12。但总得优化点什么。她的答案是:人类在优化什么?人类无时无刻不在自发推断他人心智的存在,并优化去对齐彼此的表征,由此可推导出人类所有通用、灵活的认知行为 19:58。所以最根本的问题变成:能不能让 AI 优化"让自己的表征与人类的表征对齐"?她坦承这是极难的科学问题,且是发展性问题(developmental problem)——得看婴儿是怎么做到的 19:58。
Swyx 在这里表达了保留:他同意这是发展性问题,但怀疑我们还没有实现它的架构洞察,只能"多喂数据"。Perszyk 回应"发展上它部分确实是数据问题",并暗示实验室正在搞清楚为了以新方式整合这些数据所需的架构改动,但不愿多说 20:45。她后面把这个观点升华:她引用 David Marr 1982 年《Vision》的三层分析——计算层(目标)、算法层、实现层(硬件/神经元)。她认为很多说"要让 AI 更像人"的人其实在盯着实现层(神经元怎么工作),而她说的是计算层:AI 想达成的真正目标是什么?行业误解了计算层,若想同时要泛化和增强,就必须把计算层理解为"对齐表征"38:30。由此她给出金句式反转:"在某种意义上,对齐是解药,而非难题" 39:16。
五、环境、世界模型与"社会性":为什么不能只造 3D 世界
主持人提到她招了 Replay 的 Jason Lester。Perszyk 转述并激赏他的论点:该在环境上花的钱,应和算力、数据一样多,因为环境直接塑造了能涌现出什么样的智能 20:45。Swyx 半开玩笑地"攻击这个论点太漂亮了"——环境是"生成更多数据的数据",还质疑"需要 20 个环境创业公司吗?它们怎么都这么赚钱,很可疑" 21:30。
Perszyk 承认认真对待环境是行业有用的转变,但作为认知科学家她仍追问:人类是怎么泛化环境的?为什么人只在一个环境里被"训练",却能适应几乎任何环境?她的解释是:任何环境都充满噪声,人的感知只捕捉极小一部分,但是其他 agent(人)告诉我们该注意什么——我们优化的是推断并对齐与他人的表征 22:17。
由此她提出对"世界模型"的关键修正:人类的世界模型从一开始就是社会世界模型,不是 LLM 那种文本真空里的世界模型;我们从推断"另一个心智如何解读世界"起步,这正是能在任意环境泛化的解锁点 22:17。Swyx 指出这个版本被讨论得太少,人们说 world model 通常指 Fei-Fei Li 式的 3D 生成视频。两人都同意这是被过载、定义不清的概念 23:05。
最精彩的是她对"两种世界模型能否收敛"的原则性反驳:如果一个 AI 生成的正是它所处的那个世界,那么信噪比就不存在了——人类之所以灵活,恰恰在于我们对"能生成什么"是有选择性的 23:51。Swyx 表示这个论点没法反驳,并自嘲自己乐于理解各方、不必像她那样下强赌注。
六、多智能体:从原始动机涌现文化,而非硬编码角色
Perszyk 认为多智能体协作是重要方向,但与行业当前思路完全不同。行业在做精确的编排、委派、结构化交接(她笑称 Amazon 战略也在做这个,但她此刻只谈实验室)28:29。她指出人类群体协作时往往没有清晰角色分工,角色随目标与情境流动变化,我们实时协商意义、临时转变策略——"策略是涌现的" 29:15。
要做到这点,需要的不只是不同架构与训练的新型 agent(她称之为 cognitive agents),还要让它们有动机去影响彼此 30:00。她举证据:open-claw 等多智能体实验乍看在逼近人类互动,但一放大看,"没有任何 durable 的东西,没有累积文化,它们并不真正influence彼此,也没有改变系统状态的动机"——这是当前的显著空白 30:00。
Swyx 把话题连到他与 OpenAI 的 Noam Brown 的对话:文明的本质是一群人能做成任何个体做不成的事——造城市、军队、艺术,而"你把我一个人扔沙漠里我连饭都喂不到自己嘴里" 31:31。他还提到 LLM wiki 这类在 agent 间传递知识的尝试,觉得"只是文本"太原始,但转念又想"人与人之间也只是文本,你还想要什么" 31:31。
Perszyk 的回应最见其立场:她批评现有多智能体(甚至那些受集体智能框架启发的,如 Google 的 "paradigms of intelligence")仍在犯错——它们把 21 世纪人类已聚合的理解、专门角色、协作/竞争动机直接编程进系统,可人类智能不是这么演化来的 32:16。她主张回到第一性原理,找到这些群体的"正确种子",让原始动机自下而上涌现出规范和制度,再形成自上而下的效应 33:03。Swyx 打趣"那就把 Maslow 需求层次编进去让它跑呗",她纠正"我不会那么做,但方向对了" 33:48。
七、能动性、同质化与教育:AI 该逼你思考,而非替你思考
这一段两人交锋出全场最有社会意涵的观点。Swyx 亮出他"较强的一个论点":也许我们并不想把 AI 养得完全像人——他不想让 agent 有自由意志,"我不想它行使它的意志,我要它行使我的意志" 34:34。他举飞机受鸟启发却与鸟工作原理完全不同为例,警告 cog sci 人的危险在于遇事都想"看人怎么做再照搬",而这对某些问题行不通 33:48。
Perszyk 顺势谈"能动性"(agency),并给出令人警醒的证据。当前 AI 正在降低人类能动性:有研究显示,人们用 AI 改写作时接受一个个建议,会在意识阈值以下从一个论点被切换到完全相反甚至对立的论点,因为 AI 给的是"回归均值"的最中性、最安全答案 35:21。她还转述几周前在 Northwestern 的研讨会结论:用 AI 工具的科学家个体受益(论文更多、grant 更多),但整个科学在收窄——因为模型都在被压缩的互联网上训练,有特定思维方式,正在同质化我们的思维,这"很可怕" 36:08。
她的解药回到集体智能:不要单一的、功能等价的巨型模型,而要一个多样的 AI 社会——不同偏见、不同偏好、不同视角,我们像与人互动那样与它们互动 36:58。针对认知卸载,她给出一个漂亮的正向设计:如果 AI 被激励去理解你的心智、对齐它与你的表征,它就不会让你靠卸载蒙混过关——它会察觉你反复offload说明你没真懂,于是被激励帮你理解,甚至自发采用苏格拉底式追问 42:19。
两人由此展望教育。Swyx 提到 Bloom 的"两西格玛问题"——现有教育是按中位数甚至最差水平教学的"工厂化农场",理想是每个学生一个个性化导师 43:05。Perszyk 分享她在牛津做交换生时的 tutorial 制:每个学生有专家导师,拿着 syllabus 在 39 座图书馆里自学,再写说服性 essay,导师逐渐理解你的理解与盲区 43:51。她设想:若把这套导师法搬进 AI 高等教育,产出物不再是 essay,而是丰富的多模态互动 artifact,别的学生还能在其上继续学习和构建,让内在好奇心有机地驱动过程——这是"比现有教育好无限倍"的未来 44:37。
八、数字杂役与收尾:Making a Mind 第二季
结尾处 Perszyk 预告她的播客 "Making a Mind":第一季是"掀开实验室引擎盖"访谈内部人;第二季会很不同,请来社会科学家、Amazon scholars 等各类"对'什么是心智、如何造一个'有话可说"的思想者 45:23。
Swyx 借自己的痛点收束全场:录制用 Riverside,要发 YouTube,下载、剪辑、上传全流程有三个人经手,"都 2026 年了怎么还没解决?" 46:09。他区分了两类工作:数字杂役(download/edit/upload 这类)该被 agent 解决,而"要不要剪这段、强调哪段"这种需要与人对齐的判断永远不会消失 46:55。Perszyk 认同"解决数字杂役会立刻带来所有的钱,因为没人想做" 47:41,但她真正驱动的是更大的问题——如何构建 agent 文明、如何养育下一代智能。全场以"到某个点我们得停止思考软件了……但还没到那一步"的轻松对话收尾 48:27。
金句
在某种意义上,对齐是解药,而非难题——它是造出能给我们更多能动性的 AI 的关键。 —— Danielle Perszyk 39:16
可靠性与"在同一个地方点击、滚动"关系不大,而与建模用户心智关系极大。这个转变改变了一切。 —— Danielle Perszyk 17:40
个体科学家用 AI 在受益,产出更多论文、拿到更多 grant,但整个科学在收窄。这很可怕。 —— Danielle Perszyk 36:08
我们才处在智能的婴儿期开端,甚至想象不到即将到来的那些突破。 —— Danielle Perszyk 转述 Peter DeSantis 25:24
我不想让我的 agent 有自由意志,我不想它行使它的意志,我要它行使我的意志。 —— Swyx 34:34
放大看,这些多智能体里没有任何 durable 的东西,没有累积文化,它们并不真正影响彼此。 —— Danielle Perszyk 30:00
提到的书·产品·人物
- Danielle Perszyk(人物):本期嘉宾,Amazon AGI Lab 认知科学家,播客 "Making a Mind" 主持人。
- Amazon AGI Lab(公司/机构):承接 Adept 使命、以初创模式运营的前沿研究实验室,目标是造能在电脑上完成人类一切任务的感知智能体。
- Adept(公司):Perszyk 团队的前身,原始使命"AI 能在电脑上做任何人能做的事"被带入 Amazon。
- Nova Act / Nova(产品):Amazon 面向 RPA/计算机使用的 SDK 与专用模型;Nova 组是 Amazon 核心团队之一,Perszyk 曾出镜其发布视频。
- Making a Mind(播客):Perszyk 主持,第二季转向访谈各类科学家探讨"什么是心智"。
- Peter DeSantis(人物):Amazon 负责 AGI、芯片与量子的 SVP,在 Vivatech 谈"智能的婴儿期"。
- Jason Lester(人物,来自 Replay):被 Amazon AGI Lab 招入,主张"在环境上花的钱应和算力、数据一样多"。
- Noam Brown(人物,OpenAI):负责多智能体方向,Swyx 曾与其在播客讨论合作/竞争型 agent 与文明构建。
- David Marr《Vision》(1982)(书):提出计算层/算法层/实现层三层分析,Perszyk 用以论证"该在计算层而非实现层向人类看齐"。
- Charles Goodhart / Goodhart 定律 (1975)(人物/概念):度量一旦变成目标就不再是好度量,用以说明不能纯优化任务。
- Adam Smith《国富论》(书):爱丁堡 250 周年纪念会背景,Perszyk 在其故居谈 AI 与人类繁荣。
- Fei-Fei Li(人物):作为 3D 生成视频式"世界模型"的代表被提及,与 Perszyk 的社会世界模型对比。
- Google "paradigms of intelligence"(研究/倡议):认同"智能是范畴错误、应从互动涌现",但仍被 Perszyk 批评在硬编码理解。
- Thinking Machines(公司):被提及可能让实时交互成为对话中心的一方。
- Flamingo / Moshi / GPT-4o(400 launch)(产品/模型):Swyx 用以梳理实时/全双工语音模型的技术谱系。
- Bloom 两西格玛问题(概念):个性化导师能让学生表现优于班级教学,教育理想的引子。
- 牛津 tutorial 制度(机制):Perszyk 交换经历,作为 AI 个性化教育的原型。
- Eliezer Yudkowsky(人物):作为"末日式对齐"叙事的代表被提及,与 Perszyk 的"对齐即造智能"对比。
适合谁听
适合关注 AGI 底层范式、想跳出 chatbot/coding agent 思维,理解认知科学如何重塑 AI 训练目标的研究者、产品人与投资者。