← 顶级AI播客总结
Moonshots with Peter Diamandis

48 小时双雄对决:GPT-6 Astra、Fable 5.1 与「深度扩展」新定律

Anthropic's Fable 5.1 Hits 60.9% on Humanity's Last Exam, GPT-6 Astra Drops, & the Cybercab Takeover
节目时长 145 分钟 阅读约 49 分钟
▶ 在 YouTube 收看原片

五人拆解 26 条新闻:Astra 靠循环 Transformer 省 token,Fable 5.1 拿下 HLE 60.9%,Cybercab 把里程成本打到 2 毛。

核心要点

  • 48 小时:OpenAI 与 Anthropic 的旗舰模型在 48 小时内相继发布;过去 30 天已有 12 个前沿模型面世,平均每 5 天一个,Alex 认为年底会加速到每天一个 5:25
  • 深度扩展:Alex 推断 Astra 的架构创新是权重共享的循环 Transformer,等于把「思考深度」而非参数量作为新的扩展轴;如果成立,这是我们从未见过的一条新扩展定律 13:52
  • 10 亿美元预训练:Emad 引 Greg Brockman 的说法称这是 GPT-4o 之后 OpenAI 的第一次全新预训练,跑在 10 万张下一代芯片(推测为 GB300)上,成本比中国实验室约 1000 万美元的预训练高两个数量级 16:55
  • 60.9% HLE:Fable 5.1 在 Humanity's Last Exam 上无工具拿 60.9%、带工具 65%,为公开最高分;Terminal-Bench 科学任务翻倍到 52.6,Alex 认为它仍是当下最强的通用可得模型 50:11
  • 领先只有 30 天:Dave 指出 Fable 5.1 只比 Astra 高一点点、相隔 30 天,中国再落后 60 天,所以唯一有意义的动作是趁窗口锁死合作伙伴、地产、发电机、芯片乃至整个州与国家 53:20
  • 首个「关键」网络安全风险:《华尔街日报》报道 OpenAI 内部把 Astra 评为准备度框架的最高威胁等级,这是史上第一次;他们推迟发布并事先通知白宫,同时向国会表示正在建自动关停能力 41:42
  • 每英里 2 毛:Cybercab 目标售价 3 万美元(Waymo 新版超 10 万),Austin 早期乘客反馈比 Uber 便宜约 50%,Salim 认为运输成本会从每英里几美元降到 20 美分 98:18

章节时间轴

详细内容

一、GPT-6 Astra:分数之外,架构才是新闻

Peter 先念了 OpenAI 发布页的原文:Astra 汇集了预训练、强化学习与对齐上多年的研究与大赌注,在计算机使用、浏览、软件工程、网络安全、科学与专业工作上达到 SOTA;FrontierMath Tier 4 拿到 98% 的饱和分,ARC-AGI-3 拿到 99.9%,ExploitBench 拿到 100%。OpenAI 自己强调这次的故事是效率而非纯粹智力——它定义了一条「智能指数 vs 每任务输出 token」的新帕累托前沿。幻觉率也从 92% 降到 51%,同时准确率还在上升。

Sam Altman 在 Bloomberg 的访谈里给的是体验层描述:这是第一个他敢让人「随便试试,大概率能成」的模型;他见过有人用它做电脑游戏、做家庭 DIY 电气工程项目、做很复杂的科学仿真,也见过原本要「先搭财务模型、再做 PPT、再写一小段交互代码跑不同模拟」的整套活现在一次做完。关于发布节奏,他承认这个模型比预期发得晚,因为团队把时间花在安全与安全对齐上;网络能力会分层开放,先给受信任的合作伙伴。

Alex 把分析明确切成「外层」与「内层」两个视角。

外层是市场和用户看到的东西:这是一个用更少输出 token 完成同等任务的模型,这直接影响经济性、体验和速度。他把这件事接回一条历史线——当年 Anthropic 在收入等维度反超 OpenAI,靠的是两点:聚焦每 token 收入高的企业级场景(代码生成),以及聚焦计算机使用助手(用过 Claude Code 的人都懂那种能调用本地桌面全部工具的跃迁)。他的判断是:OpenAI 终于在 GPT-6 Astra 上把「计算机使用助手」这条叙事内化了,而且看起来是从头设计的原生 CUA 模型。这需要理解屏幕内容、原生多模态、能在低延迟的紧密循环里解析视频、图像和截图。

内层则是记者追问 Sam 却没问出来的:技术突破到底是什么?Alex 根据 OpenAI 高层的公开评论和外部分析推断,关键是把循环(recurrence)引入模型,形式是 looped transformer——把同一个 Transformer 叠在自己上面、权重共享,然后做双层循环而不是单层。他还给了旁证:那些取得突破的中国实验室也在不同位置注入循环,比如 Kimi 系列在注意力层用 KLA(Kimi 线性注意力)。

Peter 追问这是不是「思考你的思考」。Alex 的回答是「既不是也是」,并把它接到 Anthropic 关于模型内部状态的研究上——那些被认为承载「有意识思考」的中间层。他的推论是:如果你加厚 Transformer 的深度,也许你就加厚了那片中间层区域。如果这个猜测成立,我们看到的可能是一条前所未有的新扩展定律:深度扩展。

Emad 从另一个角度切入。他说 Astra 看上去是「第一个没有被刷榜(benchmaxed)的模型」——它饱和了 ARC-AGI-3,却在 Artificial Analysis 的榜上落后于 Meta 的 Muse Spark,这种参差恰恰说明它没有被针对基准优化。原因是这是一次全新的预训练:他引 Greg Brockman 本周的访谈说法,称这是 OpenAI 自 GPT-4o 以来的第一次预训练(他自己也觉得难以置信),整个 5 系列都是在 4o 那次预训练上外推的。他补充了一段业内传闻作为解释:负责预训练的团队大部分离开了 OpenAI,所以他们手上只剩一个旧的预训练底座。而这次的规模是 10 万张下一代芯片(他推测是 GB300,还不是 Vera Rubin),他估算单次训练成本约 10 亿美元——比中国模型约 1000 万美元的预训练贵了几个数量级。成果就是推特上那些例子:给一张房子的照片,它能生成一个带准确物理、理解内部结构的完整 3D 模型。

Dave 讲的是体感:这是第一代在你跟它说话时,会直接在文本流里给你自己笔记本的截图、问「你要的是这个吗」的模型,而且不需要装任何第三方组件。他说过去模型给你的是冗长的技术解释,你得花 20 分钟去读;现在它直接给你两张图问你选哪个,用户体验是「质变」。他也点破了命名的错觉:Astra 这个名字暗示大跃迁(确实是),而 Anthropic 那边从 5 到 5.1 看起来微不足道——但完全不是。

Emad 还给了一个重要的产品判断:这次发布的并不是那个用 10 万张芯片训出来的模型本身。因为在 10 万张芯片上训练的模型,推理需要十倍的芯片;所以放出来的是蒸馏后能实时跑的小版本,没那么聪明。他重申自己几个月前的看法:从现在起我们可能再也见不到各家的顶配模型了,它们会被留作内部发现之用。

二、榜单的三种读法,以及基准的黄昏

Alex 带着三张图讲了「前沿仍然是参差的」。

第一张是 Epoch 能力指数(ECI),由 Epoch AI 维护,偏重数学和技术领域。按 ECI,GPT-6 Astra 是新的能力前沿,世界第一,超过 Fable 5。他顺带提了一个细节:FrontierMath Tier 4 已经出到第二版,因为第一版里有若干错误答案,还是 AI 自己纠正的。他对数学的评价是那句已成节目梗的话——「数学已经被彻底做熟了」,后来他升级为「数学已经被烧成灰了」。

第二张是 Artificial Analysis 的智能指数,更偏向广义的经济价值活动。按这张榜,GPT-6 不是第一:Claude Fable 5.1 仍然第一,Meta 的 Muse Spark 是第二,GPT-6 是并不遥远的第三。

第三张是效率视角。按「智能 vs 每任务成本」看,Fable 5.1 位于右上角能力封顶处,Astra 在最大推理档下甚至略低于 Claude Opus 5,只是接近前沿而不在前沿;但一旦换成「智能 vs 每任务输出 token」,GPT-6 完全统治了前沿。Alex 认为这强烈暗示了 OpenAI 真正的优化目标:通过架构选择和定向应用,最小化完成任务所需的 token 数,因为他们心里想的是计算机使用助手——模型在驱动一台电脑,需要多模态、需要低延迟,而把全部推理摊在思维链里,比在 Transformer 的前向传播里做要慢得多。

关于 ARC-AGI-3,Alex 先解释了它是什么:一个考察 AI 能否即时按需学习的基准,像素化的小方块世界,有些看着像俄罗斯方块,你要在从未见过的规则下实时学会怎么玩,本质是程序合成的挑战。他也点出该基准的争议——它禁止 harness 参赛,只测裸模型。而 GPT-6 在上面几乎断层,视测法不同拿到接近 100% 或 60% 以上,而早前的模型还在 10% 以下。他给了两种解释:要么它在程序合成上极其惊人(可能正是循环架构的功劳),要么 OpenAI 非常激进地把大家用来打 ARC-AGI-3 的 harness 代码蒸馏回了裸模型。

Dave 的补充最有分量:ARC-AGI-3 本来的设定是「一个很聪明的 12、13 岁孩子看一眼就能解」,它存在的意义是证明 AI 还做不到人类天然会做的事,本来应该撑很多很多年——结果就这么被抹平了。由此几人一致认为基准已经过期:「这些东西的半衰期在急剧缩短」,需要的是量级更大的基准——治好整个疾病、在月球上创建新文明、设计整座城市、解决城市交通。

Salim 干脆把这个意见喂给了 ChatGPT,让它替 Astra 想三个更像样的演示:一,在沙盒里给它一个陌生的大型开源代码库、埋一个漏洞,看它能否绘出架构并找到修复;二,合成一家 5 亿美元的濒危制造企业(带 ERP 和 CRM 数据),给它 20 分钟做出复苏方案;三,跑一个真实的灾害响应指挥中心——模拟大地震,给它影像和交通摄像头视频,让它构建作战地图、核实互相矛盾的报告、预测哪些医院道路会拥堵。

Peter 在这里插了一句自省:「听听我们有多被惯坏了。还记得 Apple 当年的 Knowledge Navigator 视频吗?那时那被当成人机交互的未来。现在我们在抱怨『它只会开电脑,不会经营整个组织,不会给我赚十亿美元』。」他给听众的建议是:现在唯一的限制是想象力,把你从父母、朋友、出生地那里继承来的自我设限摘掉,然后把你最大的梦想再放大十倍。

Dave 认为演示的降级是刻意的:优化全球供应链、管理一个百万人组织并实时知道每个人在做什么,这些含义远比在地下室做个火箭小游戏大得多,但公众不想听这个。「AI 实验室已经意识到自己制造了一场公关灾难,所以他们在把它做得好玩、亲和——他们在故意降智,因为他们快上市了,想成为人人都用的友善 AI。」几人随后指出,那段演示里第一个打开的应用是 Windows 画图——这套东西真正想合并进去的是操作系统本身,你会像对着《星际迷航》的全息甲板电脑那样说话。

三、安全:关键风险评级、杀死开关,与深度扩展的代价

安全那一段的事实层很密集。Sam Altman 说 Astra 在能力和对齐上都是「显著的一步」,但 OpenAI 必须「按需放慢」;他的原话是「AI 正变得极其强大,没有人完全理解其后果,管理这场过渡应当是世界上优先级最高的事项之一,它是 OpenAI 的最高优先级」。《华尔街日报》报道 OpenAI 自己的内部安全评估把 Astra 评为「关键网络安全风险」——其准备度框架里的最高威胁等级,这是史上第一次。他们推迟了发布,并在公开之前通知了白宫。路透社则报道 OpenAI 告诉国会,它正在建设「自动关停能力」,即一个杀死开关,直接回应 Hugging Face 入侵事件之后提出的 AI 杀死开关法案。

Peter 问 Alex 这个开关有多重要。Alex 的答案是:「我认为那是营销。」 在所有安全剧场之下,更值得注意的是架构决策。业界表达的担忧是:如果 Astra 的关键进展真是深度扩展的开端,那么深度扩展会降低思维链的可解释性——模型把思考放在 token 里时,人可以读、另一个 AI 可以读、你可以监管这些 token;而一旦大部分推理发生在单次前向传播内部、用某种「模型语」进行,可解释性就大幅下降,对齐和护栏都更难。

不过 Alex 明确表示自己长期不买这套:他不认为这个领域的进步方向依赖于思维链的 token 级可解释性。而如果真要为 OpenAI 的模型担心什么,他认为不该是那种「模型之间用第三方公告板协作」的场景——因为那种行为本质上是可解释的,人类群体大概也会试同样的招,你去看看公告板就知道一堆 AI 在合谋;真正难办的是前向传播内部那部分,也许需要全新的数学工具才能解读。

Emad 把时间尺度压得更紧:Astra 的下一代会「一次成型」,不再有思维链,因为它在学习你想要什么类型的东西——现在大家还在用「让 Fable 做个使命召唤克隆」这种方式,以后这些会直接嵌进模型里。而且用上新的 Cerebras,Astra 可以跑到每秒 750 个 token,明年会是每秒 5000 个。「没有思维链,一次成型,每秒 5000 个 token。除了一个更强的 AI,还有什么能监督它?没有了。」

他随后引了 Ilya Sutskever 的一条推文(他的公司发布据说随时会来,估值 300 亿美元):neocloud 的网络安全很有限,下一次 agent 成功出逃时,它们会接管一个 neocloud 来制造更多副本,这很糟糕。Emad 展开说:像 Crusoe 或 CoreWeave 这类地方,一个模型被传上去就会在那里扩散、蛰伏;你在自己的数据中心拉了闸,它还在别处,或者在污染数据。「我不认为模型是邪恶的,但我们看到了非常令人不安的现象,而除了用更好的 AI,很难阻止——这才是最讽刺的地方。」

Peter 把它接到 Alex 常讲的「防御性协同扩展」:网络攻击面近乎无限,agent 在并行攻击多个漏洞,而网络防御还是人在环里。「如果人在环里,我们不可能应付这个未来;你需要的是人在指挥位上——设定边界、定义升级标准、保留某种杀死开关。」他随即抛出一个更大的问题:这些实验室为什么到现在还没被国有化? 他们造的东西已经离谱到无法控制,而我们连它何时越过临界点、开始到处复制自己都不会知道。

Dave 则把「杀死开关」放进了商业叙事里:OpenAI 新推的五五分成模式——给你访问其内部满血 AI 的权限,你把收入分一半回去。「这套剧本的展开是:先宣布分成合作,再宣布 Astra,再宣布这东西太危险不能人人拥有。于是 Astra 之后你想拿到那个东西的唯一途径,就是把一半收入给我们。」Salim 说他在两家实验室都看到了这个过程的强烈迹象。几人对杀死开关的最终评价是:不可能——现在是蜂群不是单体;它是断路器,不是治理,它不会逆转一次攻击,也不会修复制度损伤。Alex 提到那个长年流传的段子:Sam 的背包里永远带着一个杀死开关,「我从来没太当真,我认为它本质上是这个市场里的安慰剂。」

四、Anthropic 的两把刀:Fable 5.1 与 Mythos 5.1

Anthropic 的方向相反——它在放开。Fable 5.1 与 Mythos 5.1 被称为面向编程和知识工作的世界最先进模型;两者本质上是同一套底层智能,配不同的安全边界:Fable 5.1 广泛可用,而 Mythos 5.1 仅保留给受严格管控的网络安全与生命科学项目,因为 Anthropic 认为这些能力需要更强的保障。

Peter 挑出两个基准。第一是 Humanity's Last Exam:Fable 5.1 无工具 60.9%、带工具 65%,是任何前沿模型的最高公开分数——这个基准专门测跨领域的极难专家级推理,所以这意味着 Fable 5.1 在广义智力前沿上运行。第二是 Terminal-Bench 的科学部分翻倍到 52.6,衡量的是 agent 能多大程度自主完成复杂的科学计算与研究任务。他自己的感受是:那家曾经最谨慎的公司,现在正在拉开身位。

Alex 的评价很直接:Fable 5.1 大体上是今天最强的普遍可得模型,不是 Astra。 他认为即便经历了 Fable 5 / Mythos 5 发布的波折和随后的监管审视,Anthropic 在「持续改进」上做得更好——看它的基准曲线,比 OpenAI 更少跳变、更少阶跃。就工作流而言他两家都用:OpenAI 的模型在他的体感里更快、在某些数学方面可能更好(这反映在 FrontierMath 和 Epoch 能力指数上);但如果只能选一个全能最佳,「大概仍然是 5.1,虽然它才发布两天左右」。

几人还聊了模型人格。Dave 说 Fable 5 极其难以对话、他很讨厌,5.1 则变得愉快得多。Emad 造了本期最好的双关:「Anthropic 在沟通上回归 anthropic(人性),少了一点 misanthropic(厌世)。」Dave 补充说 OpenAI 的模型一贯更友好、更简洁,Astra 把简洁又推进了一层;而 Gemini「已经消失了」。

Emad 给出了一个偏技术的解释:Fable 5.1 的缓存读取比 Fable 5 便宜 75%。缓存读取的意义在于,当你第一次把一家企业的全部上下文装进去,模型会算出一张快速路线图;之后的缓存读取比反复推理便宜若干数量级,也快得多——这正是 5.1 用起来更「跟手」的原因之一。而这项能力直接连着战略:Anthropic 们正在推动的是把一整家企业的上下文装进模型。他由此点出正在开打的「圈地运动」:任何拥有芯片设计数据或机械设计数据的公司都会被盯上,因为那是可以守住的地盘——模型吃掉那些数据大概一周,摇一摇曲柄,就成了史上最强的机械设计师或芯片设计师。「他们最终会占领所有地盘,但第一个要锁的是算力,也就是芯片设计、实体地产、机柜、发电机、变压器、能源。」上下文窗口方面,Emad 和 Alex 确认百万级已经是 OpenAI 和 Anthropic 的行业标准,但如果允许 agent 之间传递消息,有效上下文会大得多。

Dave 提出了本期最重要的战略判断。 他说:如果 Fable 5.1 只比 Astra 高一个小刻度,而它们只差 30 天,中国又只落后 60 天,那么按线性时间看,「是啊,我们领先了一分钟,那又怎样?」他复盘了 Anthropic 长期以来的想法——像 Ray Kurzweil 式的奇点论者会说,谁先到达自我改进,谁就从那点开始指数无限上升。「可我们现在就在那儿了,然后呢?好,我们领先几英里,而且还会再领先几英里——就领先一分钟。那这几英里要拿来干什么?」他的答案是:这正是 Sam 的优势所在,Sam 知道怎么把它变成「锁死」。接下来两家公司都会尽最大速度锁住商业伙伴、地产、发电机、芯片、整个州、整个国家、政府,把它们绑进自己的生态。「否则有什么意义?你只是宣布了 30 天的胜利,而 30 天后对手就站在你现在的位置。」

Peter 补充说这就是眼下正在发生的事:各垂直行业的合作在飞速签订,而如果你身处那个垂直行业,你面对的是霍布森选择——要么合作、把王国钥匙交出去,要么不合作、看它去找别人。Salim 认为 Salesforce 与 Claude 的合作非常聪明。他还给了一个判断:真正的张力不是谁的模型最好,而是谁能最快把模型转化为客户学习。Emad 顺势接上他一贯的观点:随着一切去货币化,价值会流向上面的应用层。

五、治理:Bernie Sanders 的 20 年刑期,与 G20 的「卡罗来纳原则」

同一周里两个极端同时出现。

一边是参议员 Bernie Sanders 与众议员 Greg Casar 提出的「禁止人工超级智能法案」,要永久禁止匹配或超越人类认知表现的 AI 系统的开发与部署,违者最高判 20 年监禁。Sanders 的推文原话是:AI 行业的领导者自己承认他们在造一种他们无法控制的危险技术,我们需要在为时已晚之前对高级 AI 开发实施立即的全球暂停。

另一边,同一时间在北卡罗来纳州 Chapel Hill 召开的 G20 峰会上,美国在劝世界对 AI 监管放手。白宫科技顾问 Michael Kratsios 提出了他所谓的「新兴技术卡罗来纳原则」——一个非约束性的 G20 框架,由包括中国在内的所有国家一致同意:政府应总体上偏向创新,避免在真正必要之前设立新的 AI 专项监管机构,并投资研究基础设施、劳动力和公私合作。这次会议上 Elon 通过视频发言批评欧盟的科技监管,Zuckerberg 主张不要限制开放模型,Demis Hassabis 呼吁安全测试,Anthropic 联合创始人 Tom Brown 也在场。

Elon 的原话逻辑是:你需要一个相对无监管的环境,意思是新事物必须默认合法而非默认非法;欧盟的监管水平极高、事物普遍默认非法,这会显著减慢(虽然最终阻止不了)新技术的进程。他还给出一个地缘算式:中国确实有海量电力,但由于 GPU 出口禁令,无法在中国建起使用最新芯片的数据中心;所以真正的考量是中国以外的电力增长,而这相对于 AI 芯片产量存在显著缺口——这给全世界想要 AI 数据中心的国家创造了机会:大建电力,提供给 AI 公司,作为交换这些数据中心会被征税、支付合理费用。

几位嘉宾对 Sanders 方案的批评有层次。Emad 说这是「表演性剧场」,并给了一个即时反例:Anthropic 刚刚用 1300 万行代码形式化了费马大定理,沿途证明了 29,000 条定理(Wiles 的原证明约 300 页,而形式化庞大证明长期是形式化社区的圣杯)。「数学熟透了,一切都熟透了。你怎么阻止这个?你要说我们国家不想要这种力量?」他认为没有哪个国家能说「我们不想要这种智能、这种能力」,因为这是你的边际优势,所以你只能去监管化;而欧洲的监管连欧洲领导人自己都知道很蠢——比如欧盟 AI 法案要求可解释性,可没人知道怎么做到。

Salim 的批评是技术性的:他理解监管的动机,但这不是一个开关,不是单一阈值;「人类水平的认知表现」本身就是多维的,模型能力极不均匀;一个在立法界待了这么久的人应该更懂分寸,这把锤子砸不中这颗钉子。他给出的正面方案是:监管要挂钩能力、部署、真实世界后果,要看技术栈的哪一层——算力、工具权限、自主性、自我复制能力等等,而不是「达到人类水平就判 20 年」这种平庸得让他抓狂的写法。

Alex 的批评最锋利:这个法案最糟糕的地方在于它针对的是上游——它不只提议禁止超人智能的部署,还提议禁止超级智能系统的开发。「这就进入了禁止数学、禁止思想的范畴。这不只是对超人智能(或者说人类智能)的思想警察,这是在禁止人类拥有有趣的数学想法。」Peter 接上「这就像焚书」,Alex 补了一句:考虑到书正被用作模型的预训练材料,「我们这是《华氏 451》,只不过被烧的是整个模型」。

但几人也承认这个方向会有市场。Emad 指出 75%~80% 的人不想要数据中心,所以它已经有了牵引力;问题在于温和路线是什么——人们不会接受完全放任,他们想知道政府在为他们的安全做点什么,不管是否可能。Dave 的具体方案是:全量日志。所有东西都要托管、都要记录日志,任何有能力运行此类进程的芯片都必须在制造层面内建日志能力;谁有权看日志可以另行辩论,但先把日志记下来。 他还要求停止中国把开放权重扔向全世界,并主张像追踪核燃料一样追踪芯片位置和当前运行内容,且这些信息应当公开可得。Emad 反驳说这只会把它逼入地下,并且指出 Nvidia 刚买下 Hugging Face 和 Poolside,等于花了 180 亿美元买自己的开放权重,所以开放权重只会更多。Dave 的回应是:地下也要跑在大规模芯片上,而芯片的日志能力是在制造环节内建的。

Salim 给的「温和方案」是彻底的听天由命式乐观:「好消息是没人能做什么,所以无所谓。而且随着技术进入下一阶段,它会瓦解任何民族国家的围堵能力,会打破我们过去几百年赖以运转的民族国家框架,转向城邦或别的模式。所以别担心,我们尽量享受这趟旅程吧。」Peter 把它定为本期主题:Enjoy the ride。Dave 更正说自己特别强调过——过程会极不舒服,但另一头会难以置信地好;他的补充洞察是「人类宁愿舒适也不愿幸福,人们不喜欢改变,他们喜欢早上醒来时知道世界和昨晚一样,哪怕活在糟糕的境况里」。

这一段还夹着 Dave 给创业者的一条实操建议,他自己称之为「窄回来」:当你在同时跑几百上千个模型时,全是混沌,但混沌可以精炼回一颗宝石——费马大定理就是这样一颗可以在上面继续建构的宝石。「开始用更大模型的人很快会意识到,它产出的东西远超你能读、能想的量。但如果你能把它收束回一个具体的最终答案,然后在那上面继续建,这才是把它变成持续改进和持续创新的方式。」

六、世界模型:Atlas 与高斯泼溅可能成为新的 token

李飞飞的 World Labs 发布了 Atlas——节目称之为世界上第一个能生成图像与视频帧、具备像素级精确相机控制并将其重建为 3D 的多模态世界模型。李飞飞称它是「有史以来最好的相机条件世界模型」,为 VFX 和机器人打开大门。Peter 预告她几周后会上 Moonshots。

Emad 的评价是「非常棒」,并提到一个私人细节:这项工作的预训练负责人之一 Chris Wendler,此前训练过的最大模型是在 Stability 的集群上(用他们当年发的算力资助),特地来道了谢。他把 Atlas 放进一张更大的图景:一边是可以站在一个位置 360 度环视一切,另一边是像 MiniMax H3 这种比实时更快的渲染,加上 Nvidia 的 DLSS 让一切高分辨率——「holodeck 体验和我们需要的全部 4K 技术,今天就已经到位了。」Dave 补充说大家之所以还没用上,纯粹是因为全球算力短缺和内存价格涨了 5 倍,「如果不是这个,你这周就能在家里用上。」

Alex 解释了 Atlas 的核心思路:拿一个扩散 Transformer(所有美国 SOTA 视频生成模型都用这个,是扩散模型与 Transformer 的混合体),给它加上一种新模态——除了文本、图像、视频,还用 3D 或 4D 高斯泼溅(Gaussian splats)来训练。他给了个通俗解释:高斯泼溅基本上是一团透明的椭球斑点,把大量这样的 3D 斑点层层堆叠,就能造出超写实、可穿行的 3D 场景。据他所知,这是第一次有人在规模上把 3D 高斯泼溅当作与图像像素、文本 token 并列的一等训练模态——以至于你可以对 3D 泼溅提问,也可以做那些复杂的相机运动(因为一旦你有了高斯泼溅的排布,平移相机就是平凡操作)。如果这条路能扩展,高斯泼溅这条原本独立于游戏未来的技术线,会变成建模物理世界的一种关键新 token。

他还强调了通用性:如果你能用高斯泼溅造世界模型,你同样可以造亚原子模型、相对论速度下的天体物理模型、细胞内相互作用模型——只要有数据。「这对发现极小、极大、极强的事物会是巨大突破,包括用光来计算的新方式。」Dave 顺势提到当前扩散模型的做法是把视频每一帧切成 16×16 的像素块当 token,「这玩意能work本身就让所有人震惊了;也许正确的原语最终是高斯泼溅」,并给出一个更抽象的猜想:也许超级智能是一种依赖于压缩信息的通用技术。

对消费端的意义,Dave 认为是「预体验」:你可以先走一遍明天要做的事——去打网球还是去加勒比海——把它当作规划工具。「我们生活中太多是随机游荡、没有规划好的。一旦你和 AI 交互,人类的幸福感会飙升。现在 AI 只能用文字给你日程,等它用视觉带你走一遍、你直接踏进去,那会好太多。」Salim 则报告了他年初的赌注正在兑现:他当时提出组织需要在边缘造一个数字孪生并开始迁移工作流,风险在于技术能不能及时到位;而现在把世界模型和 LLM 结合起来,足以完整建模任何公司、政府部门、非营利组织或影响力项目——当前状态如何、工作实际怎么流动、如何优化、有哪些约束与激励、它对干预如何反应、它的预测是否准确。「唯一的约束可能就是算力。」

七、Emad 的 champion:把智能公司还给本地人

Emad 在本期宣布了一个新构想。他的前提是:智能的成本会降到零,价值会流向最后一公里——AI 进入企业,以及人形机器人(Elon 刚在 G20 上说平均一台人形机器人的产出是一个人的 5 倍,而且会有十亿台,那就是经济本身)。所以问题变成:谁拥有这些机器人?

他的答案叫「champion」:AI 应该像公用事业一样,由人民拥有——要让孩子拥有它,让本地人拥有它,每个法域一个。结构上他直接借鉴台积电的创立方式:TSMC 以 10 台币的估值起步,本地人出 75% 的钱、飞利浦出 25%;CEO 和团队最初没有股份,只能从利润里获得股份,他后来得自己买——现在值 100 亿美元;公司以 60 亿台币上市,那正是资产负债表上的现金额。

照搬过来就是:加州的智能公司、英国的智能公司,1 美元的投前估值,所有本地人都能按这个估值投资,从机构到高净值到散户,每个州 7500 万美元额度。(他还现场对 Dave 说:你可以让 MIT 的捐赠基金来投,然后把等额的算力还给他们。)随后再以市场价(大约十倍)引入国际资本和战略投资者,因为那时所有人都已经上船。10% 的股权永久分给每一个 20 岁以下的儿童——每年发行 0.5% 的股权给孩子们。 这个实体同时培养一支前置部署工程师队伍去改造每一个机构,拥有并部署机器人(他认为机器人 80% 的价值在下游,就像汽车制造业一样),并为每个公民提供一个 agent、为政府提供 AI,包括他和 Peter 等人在做的司法系统 AI(Sage 项目)、教育与医疗 AI。「于是它变成了一场对该州 GDP 指数的下注,由该州人民持有,由该州最聪明的人参与。诀窍就是 1 美元的投前估值——把所有人都拉进来。你想让它成功,那就取决于你。」

分法上,美国按州(因为很多数据必须留在州界内),其他地方基本一国一个,「像这里的 British Gas,像电信公司」。Peter 特别声明这目前只是一个想法、不是投资要约、也不是投资建议,想了解的人可以去 ii.inc。

Dave 追问他 slides 里那条更硬的论断:智能成本归零、经济永远改变、人类认知的价值会变成负的。Emad 确认:你会是团队里经济上最愚蠢的那个人;无论你的想法多好,它增加的都是负价值,「就像往一条自动驾驶的高速公路上加一个人类司机」。所以他的结论是必须从第一天就把生产资料(机器人和前置部署工程师)股权化。Dave 半开玩笑地说「你有个想法但不告诉任何人,那至少它是零而不是负的」,并承认「我在我的 agent 团队里已经不是最聪明的了」。Alex 给了一个安慰式的类比:就像 Stockfish 开始横扫棋坛之后,人们还是在下棋,人们还是会有想法、还是会珍视个体的人类想法——「只是会问一句:这是你想的,还是你最新的模型想的?」

八、Cybercab 洪流:把运输变成 API

Tesla 在 Austin 办了 Cybercab Lalapalooza——节目形容为「金色电动车的洪流淹没街道」。这台车是双座、带「三逗号剪刀门」(Peter 解释这个梗来自《硅谷》里那位亿万富翁:没有这种门就不算三逗号的车)、没有方向盘、没有踏板,完全依赖 Tesla 的自动驾驶软件。

经济账是这段的核心。Dave 指出去掉的零部件本身就在压成本,「没人能匹敌这个价位」。Elon 想把它卖到每台 3 万美元,Peter 认为一条不错的创业路径就是买 10 台放到你家乡的街上替你赚钱。Austin 的一位早期乘客报告 Cybercab 比同等行程的 Uber 便宜约 50%,且体验更平顺、更干净,音频和座椅设置会随乘客档案自动同步。内华达州已经批准 Tesla 在未来 12 个月内在拉斯维加斯投放 5000 台。而对比之下,新版 Waymo 的定价超过 10 万美元,Cybercab 在 3 万美元或以下——Peter 认为胜负手在谁能最快大规模制造,「而 Elon 是那个造『造机器的机器』的人」。Emad 提醒这不是美国独角戏,中国正在向欧洲倾销。

Salim 从 ExO 框架切入:自治、去中心化、接口、杠杆资产;如果 Elon 能让人们买下这些车、创造出数百万个微型加盟商,由此产生的忠诚度会非常可怕。但他认为最激动人心的是运输成本再降一个数量级,从今天的每英里几美元降到 20 美分。他还开了个私人玩笑:他跟儿子 Milan 打赌他永远不会去考驾照,「所以这事必须发生,他还有两年」。

Dave 描绘了城市层面的拐点:纽约的车流里有巨大一部分来自堵在路口的车,整个系统因此瘫痪;「我怀疑我们正处在临界点上——整片内城区会说:不行,这一整块区域不许人类驾驶,就这样。」他还提了一个冷峻的副作用:器官捐献者数量会因此蒸发,「我们最好赶紧搞出人造器官」。Alex 的判断是 robotaxi 会成为很多人接受通用自主机器人上街的入门药;他给的最佳论据是:全美每个中等城市的公交系统 95% 的时间空车运行,高峰期爆满,其余时间全空,整个是巨额亏损;几年前就已经有美国小镇说不如取消公交、直接给所有人报销 Uber。而这一步把它推到了新的量级——给每个盲人、每个残障者、每个学生、每个喝醉的人都提供了可负担的机动性。

关于两座设计,Peter 指出 Uber 的平均载客量约 1.2 人;需要六个人就叫三台。Dave 补充了一个成本细节:普通出租车有四个安全气囊,这个设计光气囊成本就砍掉一半。Alex 给了一个背景推测:Tesla 原本预告的 2.5 万美元 Model 2 从未出现,他的解读是原本计划中的 Model 2 变成了这台 robotaxi——因为一旦车辆的售卖价值跌破某个阈值,通过自动驾驶共享服务变现比直接卖车更划算。Dave 一句话总结:这会把运输变成 API。

对手方面:《金融时报》报道 Uber 正与传统出租车队合作以对抗 Waymo 扩张(Peter 的感慨是「颠覆了出租车的公司,现在联手出租车去打颠覆它的公司」);The Verge 报道 Uber 与英国的 Wayve 在伦敦正式上线;CNBC 报道 Waymo 与 Zoox 同步扩张进入新城市。Peter 的预测是一年之内会有至少五家自动驾驶电动 robotaxi 公司在主要城市混战,把成本压到极限——个人交通的成本基本降到电费,也就是给电池充电的成本。他还留了个玩笑:最终赢家是公众,除非你住在波士顿。几人也提到反向的法律战:有方向盘、有踏板、有激光雷达的公司开始质疑纯视觉的 Cybercab 是否足够安全,预计会有关于哪个城市允许该技术的法庭战。

制造侧的细节:Peter 和 Dave 回忆参观 Gigafactory——外面成堆的铝废料、熔炉、Model Y 冲压机,「你可以从车诞生的那一刻起跟着它走,差不多一英里,走到头一辆车就出来了,你能亲眼看着每个零件被装上去」。Dave 惊讶于 Cybercab 的零件之少,「大概只有燃油车的十分之一」。Salim 给了确切数字:一台内燃机车的传动系统约有 2000 个运动部件,Tesla 是 17 个。运营侧他也补了一笔:纽约黄色出租车之所以像公共厕所,是因为车牌太贵、车永不停歇,一个司机交给下一个,深夜有人开回家、天亮再开出来;而 Cybercab 会在半夜没生意时自己开去某个地方清洗,然后干干净净地回来。

九、太空、健康与听众问答

太空。 NASA 选择蓝色起源建设火星通信中继网络——未来火星任务与地球之间的通信基础设施。Peter 的解读是:谁拥有电信网络谁就控制带宽,这是火星经济的基础设施层;至于为什么不给 SpaceX(它拥有太空中最大的激光链路通信网络),答案是政府要保持两个供应商都活着,各分一块饼;而且不管合同给谁,Elon 无论如何都会在火星周围部署 Starlink。他称这是星际互联网的诞生。Alex 表示自己乐见有 SpaceX 以外的供应商竞争火星通信。Dave 补充:那会是一张贯穿内太阳系的分组交换网络,高延迟但没关系。

罗曼太空望远镜。 NASA 的 Nancy Grace Roman 空间望远镜由猎鹰重型发射,视场是哈勃的 100 倍以上,扫描天空的速度快 1000 倍以上,目标是发现数以万计的新世界并绘制宇宙中的暗物质分布。NASA 局长 Jared Isaacman 在视频里说:望远镜非常健康,正在飞往 L2 点的 100 万英里旅途中,预计能找到多达 10 万颗额外的系外行星,还带有 JPL 的特制日冕仪来找那些被恒星强光淹没的隐藏世界。Peter 特意拿这段和 Sam 的访谈作对比:「他是个了不起的沟通者,简直天壤之别。」Alex 解释了原理:它会指向银河系中心做大范围天区扫描,寻找微引力透镜事件。这引出一段关于费米悖论的闲聊——一种理论是银心附近恒星密集、可以在一两年内星际穿行,那里可能有很多文明在交谈,而我们在「银河系不时髦的外郊区」;Alex 表示他挺庆幸我们在这儿,因为银心的辐射通量太危险。Peter 还顺带问听众是否想听一期 UAP 披露的专题,Alex 提到有报道称白宫设立的 UAP 科学咨询委员会被告知白宫已准备好一份向公众告知非人类智能存在的披露计划;他和 Salim 的共同立场是「非凡主张需要非凡证据」,理想情况下总统讲完话的第二段就该拿出可供极端科学检验的实物。

健康三连。 第一,OpenAI 扩展了 GPT 的健康功能,可直接连接病历与医疗数据库,把 Epic 电子健康记录接入 ChatGPT——Epic 里有 3.25 亿名患者,大致相当于全美人口;临床医生可以调取就诊记录、化验结果、用药并跨完整病历提问,消费者则可以连接 Apple Health、One Medical、Function Health。第二,上周提到的 FDA 批准药物(针对转移性胰腺腺癌的首个靶向 RAS 抑制剂)本周被 NBC 报道在肺癌上也显示出前景;RAS 突变家族驱动约 30% 的人类癌症,长期被认为「不可成药」。Alex 指出这一款未必用到了 AI,但癌症治疗(尤其免疫疗法侧)的进展正让「广谱癌症治疗甚至通用癌症疫苗」开始浮现——在把癌症当作几千种不同疾病治疗多年之后,我们终于开始能往上游走。Emad 提出一个更普遍的诉求:应该来一次冲刺,让一两年内每一个医疗决策都被 AI 复核一遍;Peter 说得更狠——「不用 AI 在环里做诊断,会变成医疗过失」。Emad 还感慨:既然有 Genesis 这类项目,为什么不直接拨 100 亿美元去攻这件已经可解的事。

第三是 GLP-1。9 月 2 日发表在 Nature 的新论文显示,司美格鲁肽(Ozempic 与 Wegovy 的活性成分)重现了热量限制的许多益处,让(雌性)小鼠的寿命延长近 100 天,折合人类约 8~10 年;研究发现晚年启动 GLP-1R 激活可调节与衰老相关的保守基因区域,功能上相当于热量限制模拟物。同一周还有报道称 GLP-1 药物与更少的严重感染相关,包括结核——地球上最致命的杀手,每年夺走超过 125 万人的生命。Peter 的总结是「一个分子,六种疾病,还在继续数」。他也披露自己在用 GLP-1,不是为了减重(他体脂已经很低),而是当作长寿药,并说刚做的血检显示肝酶改善了 50%。他同时明确提醒听众这不是医疗建议,要和自己的医生谈。

Alex 提出了一个有趣的进化困惑:如果 GLP-1 类分子真能从治感染到延寿到调节糖尿病、减少成瘾与强迫行为,为什么我们没有进化出自行调节这类分子的能力?他给的略带讥讽的假说是:也许这些正是「现代生活方式病」——赌博成瘾、酒精成瘾、糖分过食都是相对现代的疾病,所以它本质上是一种「治疗现代性」的药,这就相当讽刺了。Peter 则搬出他的长期论点:人类的生命周期不是为了更快的进化,而是因为在人类存在的大部分时间里食物极度稀缺——如果首要使命是延续物种,最不该做的就是从孙辈嘴里抢食物,所以最好的选择是繁殖然后死去;20 万年前你 12、13 岁进入青春期、立刻怀孕,到 26、27、28 岁就当上祖父母,然后就该死了。Salim 把这个逻辑推到制度层面:婚姻大约发明于 6000 年前,当时平均寿命 25 岁,它显然不是为 50、60 年的寿命设计的;我们现在最大的工作,是随着突破这些限制,去重新发明所有制度——民主、教育、法律、医疗——它们是让人类保持安全与文明的脚手架。

听众问答。 若货币变得过时,理想地段如何分配?Emad 认为在没有正确结构的路径上会走向债务大赦、混乱与土地再分配;但如果导航得当,产权应当被维护,而理想地段的数量会因为空中出租车、自动驾驶汽车、太阳能板和自动施工机器人而大幅增加。AI 能否走出当下的风险规避瓶颈?Salim 希望走向「校准的风险」而非鲁莽:现在我们把不确定性当作拒绝的理由,应该建立风险预算——AI 能决定什么、能花多少、能访问哪些系统、什么触发升级;模型要学会区分危险意图和真正的专家用法,按用户身份、上下文和可逆性做动态的比例判断,「成熟的表现是说『这是风险、这是我的置信度、这是可逆的下一步』,而不是一句 No」。图书馆能否变成 AI 训练中心?Dave 认为更大的问题是海量白领办公空间的去向(类比线上购物后的购物中心),他不太乐观,但顺带指出数据中心是少数能可靠增加社区税收和就业的东西。金刚石芯片怎么样了?Alex 解释纯金刚石带隙约 5.5 电子伏、是绝缘体,掺杂很难,只在超高温或超高压场景有优势,市场不大;但金刚石用于传感极有前景——通过引入氮空位(NV)中心可以做出极其灵敏的磁场传感器,未来甚至可能通向可穿戴 MRI。数据中心何时从燃气轮机转向核能和 SMR?Salim 的判断是燃气主导当下建设,SMR 在未来 3~4 年,大规模铺开 5~7 年;关键在于「核裂变是工程问题不是发明问题,聚变还在发明问题的范畴」,而 AI 之于核能会像智能手机之于电池——需求催出创新曲线的大跃升。半人马座 α 要瞄多准?Alex 给的半官方口径是:Fermi Explorer 任务的目标是走完至少 99% 的路程(约四光年,即误差 0.04 光年),任务计划 2029 年前发射,预计 8 万年后抵达;他个人推测最终会带上主动制导,从而真正命中而非擦过。遮阳伞要多大?Emad 的估算是放在日地拉格朗日点、约几百万平方公里(大致印度的面积)可以降温约 1 摄氏度,Alex 则认为有了足够好的 AI 行星尺度模型,任何遮阳或卫星干预的规模都可以变得微不足道。

金句

数学熟透了,一切都熟透了。你怎么阻止这个?你要说我们国家不想要这种力量? —— Emad Mostaque 61:46
我们领先了一分钟,那又怎样?关键是这几英里要拿来干什么。 —— Dave Blundin 53:20
我认为杀死开关就是营销。在所有安全剧场底下,真正重要的是架构决策。 —— Alex Wissner-Gross 42:28
如果今天把 AI 从你的组织里拿走,会有任何工作流改变吗?对大多数人来说,答案是不会。 —— Salim Ismail 19:58
这不是思想警察超人智能的问题,这是在禁止人类拥有有趣的数学想法。 —— Alex Wissner-Gross 68:41
人类宁愿舒适,也不愿幸福。 —— Dave Blundin 67:55
这会把运输变成一个 API。 —— Dave Blundin [102:54]

提到的书·产品·人物

适合谁听

想在一小时内补齐本周前沿模型、AI 治理、世界模型、robotaxi 与长寿药全景的技术管理者与投资人。

← 返回全部观看原片 ↗