← 顶级AI播客总结
20VC

Token 价格终将砍到十分之一:Palo Alto CEO 谈记忆护城河与企业 AI 的真相

Nikesh Arora on The Future of Token Costs | Memory Becoming the Moat & Why Enterprise AI Isn't Ready
节目时长 77 分钟 阅读约 19 分钟
▶ 在 YouTube 收看原片
Token 价格终将砍到十分之一:Palo Alto CEO 谈记忆护城河与企业 AI 的真相 插画

Palo Alto CEO Nikesh Arora 拆解前沿模型的"广度 vs 深度"之争,预言 token 价格三五年内降到 1/10,记忆才是真护城河。

核心要点

  • 广度 vs 深度:前沿模型困境是"广度对深度"问题——消费者高度容忍 false positive(Gemini 4 分钟出一份投资备忘录就够用),企业端则零容忍,agent 要独立决策就需要 Waymo 级别的边缘场景训练和专有数据。
  • Token 降到 1/10:Arora 判断长期 token 价格应是今天的 1/10,三到五年内会大幅下降;但当下反而走高,因为前沿模型在"value maxing"而非"token maxing",要给数据中心 R&D 找钱。
  • 算力被消费端吞噬:超过一半算力喂给了不赚钱的消费者(ChatGPT、Claude、Gemini 都免费),压力全部转嫁到企业和 coding 这半边算力上,逼着企业端付高价。
  • 记忆即护城河:前沿模型会在未来一两年猛攻"围绕消费的记忆"——记住你 30/60/90 天说过什么,上下文越多答案越好,由此形成黏性和 model captive(模型捆绑)。
  • G&A 减半:未来 3 年 marketing、finance、HR 等 G&A 岗位大概率减半,因为 SaaS 应用(没有观点)会让位给 AI 应用(有观点、能替人做 80% 判断)。
  • Mythos 是加速器:Mythos 让模型学会"反向找烂代码",Palo Alto 用它 6 周找出过去要花 5-6 年才能发现的漏洞,但补丁仍需人工评测——它逼所有企业更快修补,反而利好网络安全公司。
  • 错过三个 trick 就出局:在科技行业错过一个 trick 还能活,两个被部分刺穿,三个就可能彻底过时——这是 Arora 比以往更投入学习新技术的根本动因。
Token 价格终将砍到十分之一:Palo Alto CEO 谈记忆护城河与企业 AI 的真相 信息图
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

一、广度 vs 深度:前沿模型的根本张力

Arora 用他在推特上写的一句话开场:"前沿模型问题本质上是广度 vs 深度的问题。"他的论证链条是这样的:前沿模型(OpenAI、Google、Anthropic)每隔几天就互相超越一次,问题是企业到底要用它们做什么。

关键洞察是 false positive(误报)的容忍度。在消费端,人们高度容忍误报——因为永远有一个"中间人"在判断模型说的话是否可信,于是误报被自然过滤掉。5:27 他举例自己让 Gemini 出了一份投资备忘录,4 分钟搞定,换作以前要雇银行家和分析师、花好几天。这就是"广度"——它成了你的 go-to 入口,而在消费端成为默认品牌有巨大的分发红利(像 YouTube 之于流媒体、Google 之于搜索)。

但企业端完全不同。7:00 一旦你想象一个 agent 独立做决定并执行,你对误报的容忍度是零。他用 Waymo 作为"最大的 agentic 产品"的例子:它替代了司机这个人类 agent,所有决定由 AI 做出,但这背后是几百亿美元的边缘场景训练和互联网上根本不存在的专有数据。7:46"你没法把下一代 Anthropic 模型塞进你的奔驰里说'开车送我回家',它做不到。"这就是深度问题——agentic 用例需要模型周围的上下文、理解和智能。

由此产生持续的张力:前沿模型想要消费者注意力(驱动 post-training 和消费品牌),但真正的企业收入来自需要大量上下文的用例。目前唯一公认横跨两端的用例是 coding——因为编程是普世活动,每个人的数据都对训练有帮助。

二、重新设计工作流,而非边际改良

8:46 Arora 直言超过一半企业还没把 AI 用对——大家忙着"把 AI 塞进现有业务流程",边际地变高效一点。他认为真正的机会是用 AI 从根本上重新思考工作流,长期赢家是重构公司的人,而不是边际改良的人。

被 Harry 追问"企业具体该怎么做"时,10:05 他给出框架:今天的工作流(ERP、销售团队管理、HR)大多已被 SaaS 化——软件公司造了个"容器",企业可以微调。但这些 SaaS 软件"没有智能、是编码出来的":定义输入、定义输出。他设想的是有判断力的 AI——10:51 招聘时把每份简历丢给 AI,它告诉你该面试哪 20 个人、该问这个人哪些问题(因为你三个同事只问了五个)。"AI 可以极大地帮助并让流程更智能,但这要求我们放弃人类控制,让 AI 替我们做 80% 的思考。这不是我们现在的做法——我们现在只是把发票扫描、抽取数据、丢给 AI,然后说'看,快了 20%'。"

12:22 他用营销作为最佳例证:营销训练数据本就全在公共领域(没营销过就不在公共领域),所以前沿模型拥有世界上最好的营销训练库。13:08"我为什么需要 600 个营销人员?因为我最大的问题是这 600 人不一定都完全理解如何一致地传递我的语调、价值主张,不破坏我的品牌。"他的判断是:13:54 未来 3 年 G&A 类岗位(营销、财务、HR)大概率减半,因为有大量流程管理可以用 AI 应用变智能。SaaS 应用会让位给 AI 应用——区别在于"SaaS 没有观点,AI 应用有观点"。

但他也明确反驳"AI 会让人变少"的谬论:14:40 他认为技术资源、销售资源都会需要更多,因为团队里所有人都想要更多懂 AI 的人去做转型项目,而好产品需要更多销售去覆盖宇宙。

三、Token 经济学:短期走高,长期降到 1/10

Harry 引用了几个数据点来设定问题:有人("banning off",疑指某 CEO)每年花 3 亿美元在 Anthropic 上给开发者用,约占开发者薪资的 3.8%;如果停在这里,Anthropic/OpenAI 估值过高,如果涨到 20% 则被严重低估,Macquarie 的 Brandon 甚至说未来花在 token 上的钱会等于花在薪资上。

19:19 Arora 把镜头拉远:今天世界对算力的需求远超供给,算力比两年前贵 2-4 倍,根本买不到。更关键的是——20:05"超过一半的算力在喂消费者,而消费者目前是个根本性亏钱的实体。"ChatGPT、Claude、Gemini 都免费,几十亿人每天用,吞掉一半算力却没有回报。压力于是全部转嫁到另一半算力(coding 和企业应用),逼着企业端付高价直到消费端有了 transaction 或广告模型。

20:51 他对比搜索时代:Google 搜索、YouTube 早期也烧算力不赚钱,但今天的算力需求和成本是那个时代的 10 倍。所以他的核心判断是:21:24"长期 token 价格应该是今天的 1/10。三到五年内会看到 token 价格下降。"届时消费会更多。

那为什么短期反而走高?23:56 因为前沿模型公司在"value maxing 而非 token maxing"——在万亿美元估值上,他们意识到下一个千亿美元的算力钱财务市场撑不住,于是必须建可持续商业模式、展示毛利率,唯一的杠杆就是对组合里增长最快的东西(token)收更多钱。

关于广告能否救消费端,21:55 Arora 用他 2004 年在 Google 的数据反驳:当时 Google 占全球广告收入 2%,全球广告盘子 5000-6000 亿美元;如今线上已占总广告约 70%,而广告总盘子每年只增长 3-5%。所以靠广告补贴消费 AI 的钱只能从现有广告收入里挪,不会改变等式。他真正看到的机会是 22:24 AI 切入 transaction 收入——23:10 最好的线上广告转化率 7-10%,平均只有 1.5-2%,意味着 85-90% 的营销被浪费;消费品成本只占标价 5-8%,92% 是分销和营销。如果 AI 靠记忆和上下文让营销变高效、提高转化,传统营销的钱就会以 transaction 形式流入线上。

四、记忆成为护城河

24:41 关于模型为何还不便宜,Arora 顺势引出一个更深的观点:他不需要 Fable 5 或 Mythos 5 来做今天 90% 的事,两年前的模型对大多数查询就够用了——25:26"问题是它们从算力角度低效。"效率正在改进,但 R&D 成本现在要靠 token 来摊。

28:29 他预测:如果有水晶球,前沿模型未来一两年会花大量时间"围绕消费构建记忆"。这不只是扩大上下文窗口——28:46 而是模型开始记住"你昨天问过这个、那个",能选择是否在了解你的全部背景下回答。存储 30/60/90 天的对话需要大量信息和个性化交互。29:15"你拥有关于我的上下文越多,未来给我答案就越容易。当你在用户群里积累上下文,就创造了黏性,那就是你的护城河。"

36:56 后面他把这个逻辑推到企业端:消费端已经有记忆,但企业端"奇怪地"还没有。一旦到来,企业侧的算力和 memory 需求会上升——coding 模型必须变得懂单个企业和人的上下文才能更有效。价值会在前沿模型和企业侧创造的上下文之间分享。

五、Mythos 与网络安全:加速器还是威胁

29:36 Harry 问 Mythos 对 Palo Alto 是蚕食还是成就,Arora 的答案是"加速器"。逻辑是:30:01 我们一直训练模型"好代码怎么写",模型反过来也学会了"找烂代码"。把枪口反向,模型能看出你代码里一堆缺陷。30:01 攻击者可以拿模型扫描你的企业,发现有人留了 web socket 开着、有人 IP 寻址搞砸了,从外向内找漏洞,然后把漏洞串起来(daisy chain)攻进你的基础设施。

但它在防御侧不够好——30:48 你不能让模型"拿所有漏洞自动打补丁",因为它会把 30% 没错的东西也"修"了,可能炸掉你的基础设施。30:48 Palo Alto 自己跑过:用它在 6 周内找到了人类要花 5-6 年才能发现的问题,但补丁仍要经过人工评测、测试、生产测试、沙箱验证,确认不破坏基础设施后才能部署。

31:34 结论是它给所有企业制造了紧迫感——下一代模型会找出你的安全漏洞、错误配置,逼客户改善安全姿态,这对网络安全公司整体是好事。32:20 他解释网络安全两件根本事:一是在门口把坏东西挡住(Palo Alto 有 1.5 亿个传感器守在门口,目前没有 OpenAI 或云端 endpoint agent 能替代他们);二是东西总会漏进来(密码被破、有人犯错),这时要快速找到入侵者并清除——33:06"这变成一个 AI 任务,需要上下文、智能、知道这意味着什么。"

六、Waymo vs Tesla:企业 AI 转型的路径选择

34:51 被问到"如果今天重新创办 Palo Alto 会怎么做",Arora 用自动驾驶的三条路线类比。第一条是 Waymo 式:车里不放人,不断训练直到完全自主,每个边缘场景都变成训练数据。第二条是 Tesla 式:先自动化你最有把握的驾驶片段,车开 50% 的时间、人在边缘场景接管,逐步变好。第三条是传统车厂式:往车里塞一点自动驾驶,本质是"AI-washing",说"我最终会做到"。

36:10 他的恐惧是:企业该全部停下来用 Waymo 方式思考,还是有 Tesla 式的空间?因为企业有现存客户要满足,他们不会接受"我改了产品,80% 时候对,再花 3 年训练到 100%"。37:42 他的结论很明确:企业必须走 Tesla 路线——AI-infused、渐进自动化产品的某些部分,应用今天能力足够的模型,其余继续用机器学习管理边缘场景;但绝不能走传统车厂的 AI-washing 路线。

50:10 他也解释了为什么不学 Brian Armstrong、Jack Dorsey 那样"内爆组织重建":16:15 那两位决定裁到 30-40% 的人、从头招 AI-savvy 的人,因为"没救了,没法培训这些人"。但 Arora 认为他的业务做不到,因为底层应用软件还没到位。38:27 他不想自己造本该所有人共享的东西(AI 营销栈、AI HR 栈、AI ERP 栈),希望下一代 Salesforce、SAP、Workday 去做;他只造对自己独特的、有专有信息和上下文的东西。

他的具体做法是每周开两次叫"AI EIEIO"的会(取自 Old MacDonald 童谣,因为人人都想做 AI),39:13 让前 15-20 个技术领袖分享如何适应 AI 新世界、如何在产品里加 agent,制造一点达尔文式竞争,自上而下转型 2 万人。

七、FTE、SaaS 熊市与平台化

43:49 关于"卖进企业是否必须有 FTE",Arora 给出冷静判断:企业级 AI 梦想我们才追了大约 12 个月,刚搞懂 LLM 做聊天机器人,agent 又冒出来了。45:20 因为 AI 移动太快,应用层的企业产品还没完全成型。46:07"FTE 是'我产品还没完全到位'的代名词——我派人坐在你办公室,一边适应你的需求一边搭建我的产品。"他区分了两种 FTE:一种只是帮你消费 AI 的技术销售顾问(不算真 FTE);真正的 FTE 会把客户侧的代码带回产品,说"这个需求大家都会有,应该并入产品"。46:53 短期需要 FTE,因为所有企业 AI 创业公司都饥渴于收入,在产品没完全 ready 时就卖。

52:15 他用 coding 赛道印证产品在演进:24 个月里听过 Wind Surf、Devin(即 Cognition)——Wind Surf 被卖、早期玩家已不复当初;现在是 Codex、Claude、Antigravity,Factory 和 Cognition 做 SDLC。谁会是 2-3 年后的领导者没人知道,因为"开始时产品还没完全 ready"。

52:54 关于 SaaS 股价被"卖过头"还是反映真实,53:01 Arora 的拆解是三层:一是 systems of record/work 会被重新想象(从无观点软件到有观点、替人干活的软件,但这类 AI 应用还没造出来);二是分析层正在被重塑——数据更容易抽进数据湖让 LLM 分析(Snowflake、Glean、Databricks 都在做企业数据湖);三是没人知道未来企业里有多少席位(seats)能存活。三重不确定叠加,所以他也不知道正确估值是多少。

56:06 对 Palo Alto 自身,熊市是"3 年内做不好向 AI-first 的转型,别人造出更好的捕鼠器";牛市是"转型做对了 + 平台化趋势在我们这边"——客户意识到不能自己管 40-60 家网络安全公司,所以平台化已推动了 24-36 个月。57:38 网络安全市场只占整个安全开支 8-9%(从不到 2% 一路涨上来),还有 60% 市值空间可挖,未来 10-25 年能诞生数百亿美元市值的公司。

八、China、开源模型与垂直化

58:24 关于中国开源模型,Arora 先做思想实验:59:10 把"China"拿掉问——开源模型危险吗?答案是不危险。那来源重要吗?重要。59:56 所以他不担心开源模型本身,而是担心特定国家来源的开源模型的"后门"——模型会不会某天醒来有个 sleeper agent 开始往外发数据。这些可以被安全防护(他打趣"所以你来 Palantir……"应为 Palo Alto,找他们帮你保护模型)。

更有趣的是他对模型格局的判断:60:02 世界会分化成很多任务特定(task-specific)模型——ElevenLabs 的语音模型在特定任务上比前沿模型做得更好。60:42 物理 AI(physical AI)尤其如此,因为没有消费用例,纯粹是深度用例;开飞机、开车、机器人制造很可能不是同一个物理 AI 模型。61:27 由此需要越来越聪明的"编排层"(orchestration layer)来为对的任务挑对的模型——而问题是记忆和上下文存在编排层还是前沿模型里?61:27 他的判断偏悲观于编排层:前沿模型正激进地把记忆和上下文吸进自己(因为那是护城河),编排层公司资金远不如模型公司,风险是你最终 model captive(被模型捆绑),无法做到 model agnostic。

金句

在科技行业,错过一个 trick 你能活;错过两个,你被部分刺穿;错过三个,你可能彻底过时。 —— Nikesh Arora 0:00
我认为长期 token 价格应该是今天的 1/10。 —— Nikesh Arora 20:51
SaaS 应用没有观点,AI 应用会有观点——这是我们工作流上需要的根本性重新思考。 —— Nikesh Arora 13:54
你拥有关于我的上下文越多,未来给我答案就越容易;当你在用户群里积累上下文,就创造了黏性,那就是你的护城河。 —— Nikesh Arora 29:15
FTE 是"我产品还没完全到位"的简写——我派人坐进你的办公室,一边适应你的需求一边搭建我的产品。 —— Nikesh Arora 46:07
问题不是你打败了多少个 VC 拿到这笔交易,而是如果没有竞争,你还会不会投它。 —— Nikesh Arora 73:41

提到的书·产品·人物

适合谁听

想从真正运营者视角理解 AI 价值沉淀在哪一层、token 经济学走向、以及企业该如何渐进式转型的创始人、企业高管与投资人。

← 返回全部观看原片 ↗