← 顶级AI播客总结
Latent Space

OpenAI 的超级应用蓝图:让人人都有 Codex 的超能力

OpenAI’s Vision for the AI Super App — Akshay Nathan, OpenAI
节目时长 71 分钟 阅读约 25 分钟
▶ 在 YouTube 收看原片
OpenAI 的超级应用蓝图:让人人都有 Codex 的超能力 插画

OpenAI 生产力负责人 Akshay Nathan 拆解 ChatGPT Work 的"合并"逻辑:同一套 harness、Sites 取代 PPT、Ultra 与 Goal 怎么选,以及为何未来最稀缺的是想法与品味。

核心要点

  • 合并即超级应用:Codex 在 OpenAI 内部非开发者中爆发式采用,让团队意识到 agent 的能力不该被"你是谁"框住,于是把 Codex、ChatGPT、云端"合并",落地为 ChatGPT Work,目标是把已有的庞大分发盘接上 agent 的威力。
  • harness 完全共享:Codex 与 Work 底层 harness 是同一套,差异只在 UX 与沙箱默认值——Codex 模式露出 git diff、文件编辑,Work 则把这些抽象掉。原则是"用户不该被迫选择自己在哪个体验里"。
  • 默认即最优:模型有 Terra/Soul/Spider 与 Ultra/Light、Goal 等三十多种组合,但 Akshay 建议大多数人就用默认;Ultra/多 agent 适合极复杂或高度可并行的任务,Goal 适合可持续验证进展的任务,其余绝大多数任务默认就够。
  • Sites 取代 PPT:Sites 既是原型工具(那个模型滑块就是在 Site 里做出来的),也是知识工作的新"artifact"——公司财务团队已把月度报告从幻灯片/表格迁到 Site,因为 HTML 无限灵活、协作带宽更高。
  • 序列化推进:路线是"开发者→通用知识工作→所有人"。开发者容忍摩擦、是天然早期采用者;下一步把 artifacts、computer use 等能力带给知识工作者,最终延伸到个人生活("ChatGPT life",连做减脂餐计划都存进持久环境)。
  • AI 只做取证不做定论:绩效季节里 Akshay 用模型做"agentic search"�across Slack/代码/评审,挖出他本人都没注意到的贡献;但礼仪红线很清楚——绝不能把纯 AI 生成的评价当成自己的评审直接交出去。
  • 动作不等于进展:给管理者的忠告是盯住"at-bats"的质量而非数量,走完"想法→构建→反馈→验证"的完整闭环;最大的陷阱是把 motion(动作变多了)误当成 progress(真正的进展)。
OpenAI 的超级应用蓝图:让人人都有 Codex 的超能力 信息图
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

一、"合并"的缘起:Codex 让非开发者尝到了超能力

Akshay 把 ChatGPT Work 的诞生追溯到一个内部观察。当 OpenAI 内部用上 Codex 后,出现了"非开发者采用率的真实拐点"——战略财务、市场等岗位的人都在用 Codex 干自己的活7:35。但真正打动他的不是采用率,而是这些人"有多自豪":那种"我本不该用这个、但我在用"、觉得自己"握着一项超能力"的兴奋感7:35

由此团队意识到:Codex 与 agent 的威力不只属于开发者,而 OpenAI 手里已经有一个"数亿人熟悉并热爱 ChatGPT"的庞大分发盘。问题就变成一个棘手的产品命题——怎么把这份威力"展示并带给"他们8:20。这就是他们所说的"合并(the merge)"与"超级应用",最终落地为 ChatGPT Work。

值得注意的是,Akshay 把团队命名为"生产力(productivity)"而非"企业"或"工作",因为它同时覆盖个人生产力9:07。他举了 Slack 上流传的例子:有人 Amazon 丢件,把快递照片丢给 ChatGPT Work,agent"极其执着地"翻遍附近的房源列表,最后精确定位到包裹所在的公寓楼9:07。这类"算不上工作、但属于生产力"的用例,正是产品想覆盖的地带。

二、一套 harness,两种体验:harness 工程的口述史

面对主持人"Codex 的 harness 和 Work 的 harness 是不是同一套"的追问,Akshay 明确回答:harness 是共享的10:38。两个产品都对 harness 做了面向知识工作的改进(尤其在 plugins、computer use、artifacts 上),无论你在哪个体验里都能拿到同样的能力。差异只在两处:一是 UX 上有"有主见的取舍"——Codex 模式会把 git 状态、文件 diff 前置露出,Work 则把这些细节抽象掉;二是沙箱与安全默认值不同10:38。核心原则是"我们不希望用户还得去选自己在哪个体验里"11:23。现场他们跑了个退休计算器表格 demo:Codex 模式能看到表格逐步生成的 diff,Work 模式则看不到11:23

Sean 想做一段"harness 工程口述史":ChatGPT 的 harness 从 o1 时代一直用到现在,如今正被 Codex 的 harness 取代,两者到底有何不同16:42。Akshay 的回答是一个"分化—收敛—再分化—再收敛"的循环16:42。ChatGPT 的 harness 长期为延迟、人格等维度优化——搜索、学习、写给亲人的消息这些用例,正是因为长期打磨这些才让人爱上 ChatGPT;而 Codex 学到的是:给 agent 一个像计算机一样无限灵活的环境,就能做出极其强大的事16:42。所以面对"知识工作该选哪套",团队觉得把这份计算机环境的威力搬过来更自然,只是把部分细节对不熟悉的用户抽象掉17:29。他强调终态是"处处都有这份威力",把人接到他们所在之处,只是历史上先做了什么、现在先做什么的顺序问题17:29

关于"为什么要合并、而不保持独立产品",Akshay 给出的直觉是:AI 正每隔几个月就剧烈改变每个人的工作,"我常常一觉醒来发现自己在做和几个月前完全不同的事"13:40。技术给人的是杠杆——把工作里更琐碎的部分自动化掉,人就能更快分享更多想法。这会模糊"只写代码的人"和"写策略文档、办活动、做营销、做播客的人"之间的界限,所以按身份划死界限行不通14:25。正因如此,plugins 等原语被统一到 ChatGPT、Work 与云端之间——"我们想在何时用哪个体验上给出建议,但不想把任何人框死"15:11

三、模型迷宫:默认、Ultra、Goal 与那个"滑块"

面对 Terra/Soul/Spider 以及 Ultra/Light、Goal 等"三十多种"组合17:29,Akshay 反复强调一件事:默认就该是最优。团队会对默认非常有主见地选一个"对所有人最好"的配置,重度用户则可以在底层调整推理档位、切换模型类别;但"默认应该对绝大多数用例都够好",所以他给多数人的建议就是"用默认",只在没达到预期的成本或质量时才去改18:1519:00

关于何时用重档,他给出经验法则:Ultra 或多 agent 配置最适合"极其复杂、开放式探索"或"高度可并行"的任务;Goal 则适合"你知道能持续、且进展可验证"的任务19:46。但他坦言,大多数任务其实两头都不占,尤其在起步阶段,所以最佳第一步仍是用默认配置试,再决定往哪调20:33

他们还讨论了那个"滑块/阶梯"。设计意图是把多个维度投影到单一维度呈现给用户——一端是速度与效率,另一端是质量与彻底性20:33。Sean 现场吐槽滑块偏爱 Soul、把 Terra 预设成只有最轻档,Akshay 与 Vibhu 都认为"其实更多人该用 Terra",一来 Soul 老是"容量告罄"21:20。这段也顺带带出发布节奏:5.6 与 ChatGPT Work 同日发布,Akshay 说这不是巧合式的撞车,而是模型团队与 harness/产品团队"高度协作"的结果——artifacts 就是例子,底层要有对的 infra 训模型变强,产品侧也要有对的协作体验22:5223:37。他特别指出,从 5.4 到 5.5 再到 5.6,artifacts 质量有"相当戏剧性的提升"22:06

四、Sites:从 Markdown 到"可运行的网站"

Akshay 认为 Sites 是这次发布被低估的一环,有两副面孔25:55。一副是大家常在 X 上谈的"原型工具"——连那个模型滑块本身,都几乎完全是在一个 Site 里做出来的,设计、工程、产品在 Site 上一起把手感和交互调出来25:55。另一副更少被谈及:Sites 是知识工作的"artifact"。他举例公司财务团队,过去月度报告散落在幻灯片和表格里,现在直接放进 Site——因为它像"更高带宽"的载体:PPT 和 Excel 虽无限灵活,但总会撞到"人不会用某个功能"或"产品根本不支持"的边界,而 Site 里"你想要什么都能问出来"26:4027:26

Sean 用一个案例把话题推到极致。他玩一款叫 Strata 的实体积木棋盘游戏,周末拍了 30 张照片丢进 ChatGPT,"17 亿 token 之后"产出一个带 3D 积木摆放、完全可玩的站点27:26。因为需要实体积木、需要朋友陪练,他干脆让它做 auto research:训练自己的 AI 互相自我对弈、定义损失函数、跑基准,人在 San Mateo 开会时全程托管28:11。参数太多读不过来,他就让它生成一个"实验室面板"式的 Site 来沟通"到底在做什么"28:57。他的金句是"我不再需要读 ChatGPT 的输出,我读 Site 的输出"29:42——但也吐槽 Site 太长、数字太多、令人 overwhelmed,最终因为需要更多数据库与基础设施而把它迁出 Sites29:42。Vibhu 则做了同款游戏的另一个版本:不拍照、直接把规则丢给 Goal,"18 分 53 秒、很多 token 之后"得到类似结果,而且他用的是 Codex 而非 Work32:45

Akshay 顺势谈到自己工作的"元"性质:他不是在设计产品,而是在设计"用来造产品的产品"31:14。核心张力是简单与能力的平衡——这个产品能造出无数东西,但不能把所有可能性一次糊到用户脸上,否则会淹没他们31:59。解法是给足够的 UI 表面让用户表达、验证工具与来源是否正确,然后"让 UI 退场",并"用展示代替说教(show not tell)"帮用户发现下一个、再下一个用例32:45。他承认"show not tell"仍是没完全攻克的难题34:18。这里 Vibhu 自嘲这对他这种做过开发者关系(DevRel)的人是"职业风险"——DevRel 的活是"展示",产品人却说"如果产品够直觉就不需要你了"34:18

五、序列化推进与"AI 只取证、不定论"的绩效礼仪

对于"是否还有 ChatGPT/Codex/Work 之外的第四类分发",Akshay 把它看成一个序列:愿景是"把有用的 agent 带给所有人",从开发者(天然早期采用者、容忍摩擦)起步,下一站是"通用知识工作",再下一站是"无论生活里做什么的所有人"35:52。每一跳都有固有挑战:从开发者到知识工作者,要解决"show not tell"、让产品更好懂、补上 artifacts 与 computer use 等对这一群体更重要的能力36:37。他自己已把 ChatGPT 用于生活的一切,包括让它做减脂餐计划并存进持久的计算机环境反复回看——"ChatGPT life"、"ChatGPT cooking"37:23

在"给重度用户的建议"里,他给出两条。其一是不断刷新对可能性的想象:技术进步太快,三个月前"绝无可能"的事现在能做了;他举绩效季的例子——过去用 AI 写评审基本是"slop",半年前上一轮周期他试过但"完全没用",这一轮却"帮上大忙",因为模型能拉取"人们在忙什么、做出了什么改变、有哪些他本人都没看到的成果",它能访问代码、评审、Slack"一切"38:0938:55。其二是喂得越多、价值越大:在这个模型能访问你电脑/ChatGPT Work 里"一切"的环境里,把 artifacts 存进 library、持续给它某个领域的信息,它就会以"让你意外的方式"回报你,比如主动从你没想到的上下文里拉出关联38:5539:40

Sean 追问这里的红线,因为"用 LLM 评价人"很敏感,作为管理者他很抗拒把 AI 生成的东西用在人身上,"感觉像你不在乎"39:40。Akshay 划得很清楚:他绝不会"只靠 AI 写出东西、再当成对某人的评审交出去";他说的是用 AI 收集上下文,本质是"可被引导、可被 steer 的 agentic search"40:26。这里有个飞轮:因为 Codex 和 ChatGPT,人人都能做得更多,而做得越多就越容易漏掉东西,所以更需要用同样的工具去跟上大家的产出40:26。Vibhu 补充自己的"非工程化"土办法:Codex 系统提示设成每个项目都有一个 secret 的 notes.md 持续写学习,全局提示再从中拉取,"有时它会突然翻出四个月前某个项目的笔记,是我自己绝不会想起来的——这挺超人的"41:11。Akshay 也讲了个趣事:团队为发布冲刺时,有成员搭了个 scheduled task 自动扫 Slack/Docs、生成最好的 meme 发到共享频道;他借此点出两点——模型开始"变得好笑"了(一年前完全不是),以及它"以你想不到的方式建立连接"这一新兴能力42:42

六、Open Claw、个人 OS 与"just-in-time 拉数据够不够"

Sean 把话题引向 2026 年 7 月的另一件大事 Open Claw——很多人第一次"为个人生活榨干 agent"、并跨到工作场景45:48。Akshay 承认自己也有过"Open Claw 时刻":他和妻子搭了个 Open Claw 想打理家务,给它日历、让它自动建日程,"实际上挺有用",直到跑它的笔记本坏了就搁置了46:34。他说 ChatGPT Work 在 web 和 mobile 上正是要提供这种"持久计算机环境"——能存文件、文件跨会话保留、有 scheduled tasks、能长期引用46:34。团队已有成员把过去用 Open Claw 做的健身计划、饮食追踪完全迁到了 Work,因为"原语是一样的"47:20。但他不认为 Work 会取代 Open Claw:那支团队做的开源技术始终有需求,OpenAI 能做的是从中汲取灵感,把它的魔力带给更多"听说过、用过 ChatGPT 却没用过 Open Claw 的人"47:20

关于"个人 OS",Sean 追问能否用 ChatGPT finance 做到过去 Wolfram 能做的事。Akshay 说 ChatGPT 目前不为你托管现金和资产,这部分不行,但退休规划、财务规划、预算这些用 finances plugin"如今都能做","至少对我这部分已经被替代了"48:53。他也承认自己对健康和财务"有点不敢看答案"48:53。他点出 agentic search 的美妙:传统 UX 里想给用户更多能力就得堆更多旋钮和过滤器,而现在只要接上对的数据源,你"想问什么就问什么、直接得到答案"50:25

Sean 以数据工程背景提出一个尖锐质疑:只靠 MCP/CLI/API 的 just-in-time 拉数据恐怕不够,你仍需要数据仓库、缓存或语义层50:25。Akshay 说这取决于访问模式:若要即时回答,确实很难;但 ChatGPT Work 想支持的很多用例并不需要即时——它们是"你交给 agent 去做、要花一定时间"的任务,而借助 programmatic tool calling、子 agent 等,部分工作还可并行;因此 MCP 与第三方服务的"能力天花板已被大幅抬高"51:11

七、子 agent、记忆版图与度量生产力

顺着子 agent,Sean 请他给建造者一些设计忠告。Akshay 回到"展示威力 vs 避免淹没"的平衡:子 agent 想传达的是"当任务有很多并行轨道或足够复杂时,这个产品能帮你搞定";至于"看到每个子 agent 在具体做什么"的那一版,可能会 verge on overwhelming,所以目前默认隐藏、用下拉展开51:5652:43。Vibhu 则是"逢 Goal 必让它用子 agent"的重度用户,动机有二:净时间效率(并行铺开)与成本(把活卸给更小更便宜的模型)53:30。他还提到——引用 Anthropic 的做法——在 Claude Code 里你能让 Fable 用 Sonnet、或让 Opus 用 Sonnet 当子 agent,而在这里"你就在对话里 prompt 它"即可指定54:16。至于 5.6"爱开一堆子 agent、把 ChatGPT app 跑崩"的传闻,两位主持人都没能复现,Akshay 也没遇到过55:01。他补充:发布时团队对"Ultra 是给谁、何时用"不够有主见,之后改成需要你在高级设置里手动开启,因为它面向理解后果的重度用户,且会更快消耗额度55:47

记忆是"harness 的最后一块"。Akshay 说 Samir 和研究团队做了大量改进;当他问朋友家人为何爱 ChatGPT,"它懂我、这是属于我的 ChatGPT"几乎是第一位的答案56:33。ChatGPT Work 与云端默认继承 ChatGPT 的记忆、也能回写,走的是同一套刚发布的 Memory V3 系统56:33。他把记忆定义为一个检索问题的两面:既要"知道关于你的事",也要有"在对的时刻、以正面而非负面的方式主动提起"的 EQ57:19。他还推荐试试 Chronicle——一种"超级记忆",能从你使用电脑的行为里学习、作为记忆的又一输入源,目前实验性、默认关闭;它未必抓全你在电脑上做的一切,但"会找到你可能不知道的东西"并在恰当时机主动浮现59:3860:26。Vibhu 认为 Chronicle 的差异在于"记忆本身更深",Sean 则说自己用得不多、"总在钓用例"61:12

最后一大块是关于建造与度量。Akshay 说 AI 前后建造之变"巨大":从想法到成品快得多,验证与用户反馈的闭环"比以往任何时候都更闭合",团队可能更小但更有野心,因为要做的事也更多61:5963:30。岗位边界在模糊,Sean 抛出"科技只剩四种工作"的段子——AI slop cannon(狂烧 token 的人)、负责任的 SRE、卖东西的成年人、以及"hot people"63:30;Akshay 的看法是人人会变得 T 型:AI 让每个人都能成为通才(他说自己以前根本做不出设计,现在能借 AI 迭代),但每个人仍会有一门越钻越深的专长64:16。真正的瓶颈因此变成想法与品味——人人能建造的时代,你永远被"任一时刻能产生的想法与在做的事情的数量"卡住65:03。他也直言模型还给不了真正的新想法:"把新点子带给我"这个自动化 Vibhu 试了也不灵,因为想法从不在真空里,它们来自与用户交谈、来自你看到的摩擦与反馈65:50

至于生产力的定义与度量,Akshay 说使命是"让人能做到以前做不到的事"、给人杠杆,好让人腾出时间做自己热爱的事66:37。但如何度量"杠杆",团队"还没想清楚",因为每个人目标太多样,真正的度量是"你有没有更接近你的目标",而不知道目标就很难衡量;连 ChatGPT 的点赞点踩都说明不了什么(用户可能在踩内容、踩语气、还是踩没帮上忙?)67:23。他指出过去用代码提交量、代码行数、PR 数、story points 这些代理指标,如今在 AI 下"开始瓦解",行业都需要找新度量67:2368:08。给管理者的一条可试之法是盯"at-bats"——不只是数量,更是质量:能否高效走完"生成想法→构建→拿反馈→据此调整→验证或证伪假设→进入下一个"的完整闭环,并在多次循环中保持谦逊与动力68:08。而最大的陷阱,是把 motion 误当成 progress:如今动起来比以往都容易,但真正的进展要求你对"什么才算进展"极其审慎和明确69:42

金句

底层的 harness 是共享的……我们不希望用户还得去选择自己在哪个体验里。 —— Akshay Nathan 10:38
我不再需要读 ChatGPT 的输出了,我读的是 Site 的输出。 —— Sean 29:42
你喂给它的信息越多——不管是关于你的生活还是工作——它就越有价值,而且会以让你意想不到的方式变得更有价值。 —— Akshay Nathan 39:40
这真的是自下而上的雄心的时代;因为有太多东西要建造,你永远会被此刻能产生的想法数量所卡住。 —— Akshay Nathan 65:03
我想那个陷阱就是把"动作"误当成"进展"。如今动起来比以往任何时候都容易,但真正的进展要求你对自己到底想达成什么极其审慎和明确。 —— Akshay Nathan 69:42

提到的书·产品·人物

适合谁听

想理解 OpenAI 产品战略、agent 产品设计与 harness 演进的产品经理、AI 工程师与技术创业者,以及在团队里琢磨"AI 时代如何度量生产力"的管理者。

← 返回全部观看原片 ↗