核心要点
- 模型是易耗品:Ofir 认为模型、算力这类基础设施几乎零切换成本、高度 ephemeral,无论你是酒店连锁还是餐饮公司,组织里唯一真正有价值的东西是自己的数据 3:05
- 1000 万买数据:Google 从破产的 Spirit Airlines 买的不是飞机而是数据,出价约 1000 万美元用于训练模型,主持人补充另一竞标方传闻是 Mercor 3:51
- 好数据集极度稀缺:Harvard 刚开源了一批法律数据集,但市面上"不像合成数据、真的像真实世界"的数据集极少,连 Enron 的邮件数据至今仍被当作真实公司运作样本在用 6:54
- 数据在组织内是锁死的:数据团队和业务单元负责人的激励完全相反——一方被要求活化数据,另一方要保生产可用、保证 CEO 薪资不会被拿去做后训练,这是死结 13:02
- 勒索软件暴露 60%:在 AWS 期间一个大客户遭勒索软件攻击,他们以为受灾备服务保护,实则因资源未正确映射、分类和打标,环境中 60% 被击穿——这是创办 Eon 的直接动因 16:06
- 非人类威胁上升为一二号问题:拥有合法权限的 agent 突然 drop 一张表,检测和恢复方法论其实类似,但发生速度极端;非人类身份(NHI)已成为安全领域的第一二号问题 16:53
- token maxing 时代结束:Gonen 说现在不再是堆 token 的阶段,而是要为每个 token 拿到实际价值,该花几百万照花,但要把单位成本压到最低 26:55
章节时间轴
- 0:46 开场与 Eon 是什么 — 主持人介绍两位嘉宾,Eon 定位为面向 AI 时代的云备份与灾难恢复服务。
- 1:33 新数据底座的三层能力 — 跨多家 hyperscaler 映射分类数据、低成本摄入、再让客户查询搜索并叠加 LLM。
- 3:05 为什么数据成了唯一护城河 — 模型与算力可替换,数据不可;AI 拉平了工具红利,只剩人和数据是差异化。
- 3:51 Google 买 Spirit Airlines 的数据 — 1000 万美元买破产航司数据,竞标方还有 Mercor,破产资产里的数据交易将成趋势。
- 6:08 数据到底拿去干什么 — 主持人追问是客服 agent 还是后训练;嘉宾解释高质量真实数据集稀缺,Spirit 既是航司样本也是大型企业组织样本。
- 8:27 合成数据与脱敏 — 未来是"创新合成数据 + 真实脱敏数据"并行,绕开 PII 和财务敏感信息。
- 9:12 为什么老工具不够用 — 回到问题本身:过去每个数据团队各做各的战术项目,大量数据根本不知道存在。
- 10:44 一场角色扮演:数据团队 vs 业务单元 — Gonen 用双方对话演示激励冲突,以及那台"没人敢关的服务器"。
- 14:34 数据其实已经在客户手里 — 讽刺之处在于数据本就存在,只是锁着且昂贵;Eon 做的是格式转换加访问控制。
- 15:20 从勒索软件到 agent 内部威胁 — AWS 时代的 60% 暴露案例,以及现在合法权限 agent 带来的极端速度。
- 18:25 agent 时代的数据栈会怎么变 — 仓库、看板、ETL、BI 是为人类的明确分析问题设计的;嘉宾反直觉地认为看板会更多。
- 22:18 旧管道为什么会被推翻 — 咖啡交易的例子说明数据被单次提取后失去上下文;以及"纽约爱汉堡的人"与"爱披萨的人"的合集比喻。
- 27:41 云迁移 vs AI 转型的对照 — CloudEndure 与 AWS 的大规模迁移经验,为什么这一轮更快也更失控。
- 30:01 软件消费方式变了 — forward-deployed engineer 从 Palantir 的专属做法变成人人在做,PLG 在开发工具上重新奏效。
- 32:20 收购再 AI 化的新路径 — 以 Long Lake 为例,与其等企业自己转型,不如买下来改造,赚效率套利。
详细内容
一、数据成了唯一不可替代的东西
Ofir 开场先给 Eon 定了位:在云上建一层新的数据底座(data foundation),第一步是跨多家 hyperscaler 把客户环境里的数据全部映射和分类,搞清楚"我有什么、在哪、哪些敏感";第二步是把结构化和非结构化数据低摩擦地摄入进来;第三步,这层底座既能以极低成本承担保护与恢复,也让数据变得"可理解"——客户可以直接访问、查询、检索,并在上面跑自己的模型和 LLM 1:332:18。
主持人指出,Eon 的起点其实是备份和灾备,但一旦你手里握着客户全时间跨度的历史数据,就自然会想到别的应用方向。Gonen 顺着这个话头讲了 Eon 成立时的心境:他当时自嘲"我是那个在 AI 世界里创办非 AI 公司的疯子",结果 AI 的顺风来得离谱地大,反而把"数据是组织最重要的资产"这件事推成了共识 3:05。
他的论证链条很清晰:模型、算力这些东西是 ephemeral 的,切换成本几近于零,它们对行业当然是重要的基础设施,但对一家具体的公司——酒店连锁、餐饮连锁、科技公司都一样——最有价值的资产是自己的数据。因为 AI 把工具红利拉平了,大公司小公司拿到的是同一套酷炫工具,playing field 被抹平,剩下真正属于你自己的只有两样:你的人,和你多年积累的数据 5:236:08。主持人在这里做了一个诚实的补充:他过去对"数据是新石油"这句话一直有点怀疑,但后训练和强化学习的兴起、以及 Applied Compute 这类允许你针对特定数据集微调开源模型的服务出现,让这句话现在变得成立了 6:08。
二、Google 为什么花 1000 万买一家破产航司的数据
Gonen 举的实例是几天前 Google 从破产的 Spirit Airlines 手里买走数据资产——不是飞机,是数据,价格约 1000 万美元,目的是训练模型 3:51。主持人补了个业内传闻:竞标同一份数据的还有 Mercor。一家破产航空公司的企业数据集,引来 AI 世界的多家买主竞价,这件事本身就很说明问题。
主持人接着问:他们究竟拿这份数据做什么,是客服 agent、是内部文档、还是强化学习?Gonen 的回答落在"数据集稀缺"这个点上:今天要做 agent,你不能只在实验室里训,必须有训练数据,而真正好的数据集极难找到。Harvard 前几天刚放出一批法律数据集,但整体看,"不像合成数据、真的像真实世界"的公开数据集少得可怜。他说自己认真地在和一些公司打听"你们有什么数据、拿什么训",而 Enron 的数据至今仍在公开流通、被当作"一家真实公司如何运转"的样本使用——原因就是替代品太少 6:547:40。
所以 Spirit 的价值是双重的:它既是一家航空公司的样本,也是一个大型企业的样本——大量员工、有层级、有中层管理、有高管、有一线工人在协作 6:54。Gonen 的判断是,任何人做 agent 或新应用,多数一开始都跑不通——你必须真的去和现实世界的公司交互才能做出有意义的东西。而买数据、在内部训练,可以让你在产品第一次发布时就不必依赖与客户的首次交互来学习 8:27。他预期未来会两条腿走路:一是用更创新的方式造合成数据,二是获取真实数据,包括做过脱敏处理的、含 PII 和财务信息的那类数据。Ofir 补充说 Google 本来就在旅游领域做了很久,这类数据它一直想要,也早在变现,买下来只是让理解、训练、变现更进一步;但同样重要的是,那些手里已有数据的普通企业也想解锁自己的存量数据 9:12。
三、企业内部的数据为什么是锁死的:一场角色扮演
主持人问 Eon 具体在造什么工具。Gonen 选择先回到问题本身:数据领域已经诞生了那么多优秀公司,为什么还需要新工具?
他的解释是,过去每个数据团队各自为战,自己找数据、自己定项目,非常战术化,用 Fivetran、dbt、Monte Carlo 这类工具完成手头任务;而对相当一部分数据,他们甚至不知道其存在——因为它是锁着的。锁的根源是同一家公司里有多个业务单元的所有者 9:58。
接下来他做了一段角色扮演,把这个死结讲得很具体:假设你是数据团队负责人,现在 AI 火了,连老板都在玩 ChatGPT,CEO、董事会、股东都相信 AI 是真的。他们来找你说,公司里有大量数据,数据是新石油,用新工具活化它,做点酷的、有价值的东西 10:44。你说好,硅谷每天冒出来的新玩意儿我都会用——但问题是,数据在哪?于是你来找我,我是某个业务单元的负责人(你甚至可能根本不知道我是谁)。我这边的现实是:我不知道自己到底有什么数据;我手下一堆人,数据散在过去二十年的多个系统里;有些系统根本没人搞得清、里面可能含生产数据和敏感信息;总有那么一台服务器,没人知道它在干什么,但连着电,虚拟的或物理的,谁都不敢关 11:3012:16。
再假设我真知道里面是什么。那我还得调工程师、可能牺牲安全与合规、可能影响生产可用性,把数据抽出来给你,还要以一种非常低效的方式存起来。太难了。Gonen 点明症结:我们的激励根本不同——你的 KPI 是活化数据,我的 KPI 是系统别挂、数据别外流、别让 CEO 的薪资不小心跑进你的训练或后训练集里 12:1613:02。
Eon 的解法是绕开这个死结:直接帮"数据团队负责人"那一侧简单地找到全组织的数据、理解它、分类映射、在上面建语义层和上下文层,然后持续地从业务单元那边把相关数据搬过来——不影响生产、不牺牲安全合规、保留审计记录。而因为数据已被分类,系统能保证不会把不该给的敏感信息误传给你,并且整个过程成本可控、性能可用 13:0213:49。主持人把它归纳为三四件事:聚合历史与当前数据、对 PII 和敏感字段做脱敏或权限控制、把结果暴露给 AI 模型与应用。Ofir 强调其中最讽刺的一点:这些数据客户本来就有,只是以各种形式锁在自己环境里、且维护极其昂贵;Eon 做的是把客户已有的东西转成一种存储效率高得多的新格式,再加上映射、分类、访问控制,并接进 AI 工作流 13:4914:34。
四、从勒索软件到 agent:合法权限的内部威胁
主持人把话题引向安全:最近关于实验室里 agent 逃出沙箱之类的新闻很多,虽然背后可能有配置或设置层面的原因,但企业该怎么想 AI 安全,CISO 该怎么做?
Ofir 先讲历史。过去威胁来自人类。他举了 AWS 时期的真实案例:一个非常大的客户遭勒索软件攻击,而他们团队管理的灾难恢复服务本以为已经完全保护了这家客户。结果发现,客户以为自己受保护,实际并没有——因为他们没有正确地映射、分类和打标自己的资源。最终环境里 60% 被勒索软件击穿 15:2016:06。这件事直接催生了 Eon 的一部分产品逻辑:检测异常写入模式和熵变化、在攻击发生时识别、防护,并支持细粒度、快速的恢复 16:06。
现在的变化是,同类威胁开始来自非人类行为体——AI agent。它们对环境有合法访问权、对某些数据库有合法权限,然后"忽然之间,一张表就被 drop 了"。Ofir 说,幸运的是检测、防护和恢复的方法论非常相似,但发生的速度是极端的 16:0616:53。
Gonen 补了一个时间维度的观察:六个月前没人愿意跟他讨论这件事;而最近几个月,几乎他见到的每一位企业领导者,要么害怕这事发生在自己身上,要么已经亲身经历过。他描述那种真实的恐惧:"我不再决定什么东西在我的数据上跑,我不再理解它。"企业既要防外部威胁(新工具让攻击者的门槛大幅降低),也要防自己亲手批准跑在环境里的 agent。他的结论是必须"assume breach"——无论是恶意的还是无意的,都要能处理并相应行动 16:5317:39。
五、agent 时代的数据栈:看板不会消失,反而会更多
主持人的提问相当结构化:现有企业栈是围绕"人类提出定义清晰的分析问题"演化出来的——数仓、看板、ETL 管道、BI;而 agent 的行为方式更动态,可以在大得多的数据集上推理,可以访问 SAP、SaaS 应用和历史数据,然后采取行动。那么存储、访问、交互数据的方式会怎么变?看板会消失吗?
Gonen 给了一个反直觉的答案:他认为看板会更多,因为这可能是人类唯一还能搞清楚"世界上到底在发生什么"的方式。理由有两层:第一,编码 agent 已经开始写世上运行的大部分代码,这是间接影响;第二,agent 会激活其他 agent,被激活的 agent 又激活更多 agent,要追踪非人类身份几乎成为不可能的任务 18:2519:11。
他用市场现象来支撑这个判断:非人类身份(NHI)方向的网络安全公司数量已经多到无穷,这不是偶然,而是因为它成了当下的第一、第二号问题。第二个例子是端点安全——几年前端点问题的形态完全不同,看起来已经被解决了,但现在人们在笔记本上跑 agent,这些 agent 一边连着别的网络、连着你的 WhatsApp(他提到 OpenClaw 这类东西),一边连着内部网络和其他应用 19:1119:57。
于是 VP of IT 和 CIO 陷入两难:一边被董事会和 CEO 推着"现在就在组织里启用 AI,不许拦我,你拦不住我",另一边是真的可怕。而且不要只想技术人员——想想非技术人员,用 Lovable 之类的工具给自己搭点东西,把公司数据放进去,对安全、合规、"这数据将来谁会用"毫无意识;他们搭的 agent 可能在调用其他 agent,而他们的技术背景不足以理解这意味着什么 20:43。Gonen 的总结句很有分量:这在组织内部创造出一整套不受组织规则约束、也不一定跑在组织边界内、却在处理敏感数据的行为体;这些数据是公司的财产,可能被暴露给全世界,可能不正确,也可能被错误使用 21:30。他对"人人都能成为 builder"这件事的评价是——既是好事也是坏事,无论你是社交媒体经理、财务还是法务,都能造东西了,这很了不起,但"我们生活在非常有趣的时代" 21:30。
六、旧 ETL 栈还剩多少:咖啡交易与"汉堡+披萨"的合集
主持人问得直接:过去十年建起来的 ETL 和数据工程基础设施,还留得下来吗?变化会多快?
Gonen 说存在一个很强的 compelling event 去改变几乎一切,因为今天所谓的"管道"非常受限,每个人都只针对自己那一组问题造了个解法。他用一个日常例子解释:录完播客 Gonen 下楼想喝咖啡,去店里刷了信用卡,于是某处的数据库里产生一笔交易。今天的做法是,有人把这笔数据抽出来放到某处,就结束了;之后另一个人在某个时点拿这份数据以另一种方式处理,也就结束了。这些环节之间毫无连接,每个人都不一样,后来者没有"之前发生了什么"的上下文 22:1823:04。
他解释这为什么在过去无所谓:因为过去你只能对数据做你一开始就打算做的事,动手时脑子里只有单一目的。今天完全不同:如果你能聪明地收集、清洗全部数据,高效存储,并高效激活它,你就可以让一个团队拿着所有数据"放开去野" 23:0423:51。数据越多、质量越高、上下文越丰富,处理它的团队就越能创造出以前根本想象不到的东西。
这里他给了本期最形象的比喻:组织里有一个人手上是"纽约所有爱吃汉堡的人"的名单,另一个人手上是"纽约所有爱吃披萨的人"的数据库。他们无法得到"纽约同时爱汉堡和披萨的人"这份名单——不是技术不行,纯粹因为两人从来没一起工作过。而现在,把它用于后训练、用于新能力,你就能开始向自己的数据提出真正聪明的问题 23:5124:37。
趋势数据也支持这一点:企业正在收集比以往多得多的数据,摄入量之大"绝对疯狂",且其中很大一部分是那些新 agent 生成的。所以数据里既有大量价值也有大量噪音,你需要既能理解多来源数据、又能清洗噪音、让新产生的数据真正可用的工具 24:3725:23。Gonen 对老一代工具的评价是克制而诚实的:Fivetran 是了不起的公司,dbt 也是,但它们都是为特定目的造的特定工具 25:23。他还专门夸了 Databricks 是"这个行业最不可思议的公司之一",但指出其编目路径本质上是"事后效应"——数据已经在那了,你再去处理它;而 Databricks 一直在不断重新发明自己,因为他们明白越来越多的数据是 agent 生成的,"打不过就加入",于是自己造 agent、造数据库,去掌控数据被如何使用、被如何创造 25:2326:09。Ofir 把目标概括为:让 builder 文化和 agent 文化真正跑起来——自动理解有什么、自动摄入而不必为每个新应用手搭管道、并且对新产生的数据保持控制 26:0926:55。
最后 Gonen 补了成本这一层:数据多是好事,但它是分散的,而访问它要付存储费、还要付 token。他强调"我们已经不在 token maxing 的时代了",现在是要为每个 token 拿到实际价值,因为它越来越贵。他的表述很直白:不是不花钱,该花几百万甚至更多就花,但要把单位成本尽可能压低 26:5527:41。
七、云迁移 vs AI 转型:这一轮更快,也更失控
主持人把两位嘉宾的独特经历摆上桌:Eon 之前他们创办 CloudEndure 并被 AWS 收购,在 AWS 亲历了本地机房到云的超大规模迁移——上一场代际基础设施迁徙。那么这一轮和上一轮怎么比?
Ofir 的回答是"一样,但打了兴奋剂"。他先补充了资历细节:早在把 CloudEndure 卖给 AWS 之前,他们就已经通过 Azure 和 GCP 支持类似规模的企业迁移,产品被 OEM 集成进控制台;那些超大型企业迁移的是数千、数万乃至数十万台服务器,之后还要在云上进一步现代化;卖给 AWS 后他们把这件事做成了 Application Migration Service 的一部分 27:4128:28。但关键在于:那件事就到那儿为止了,而且它需要巨量的工作与投入,技术侧和人的一侧都是。
而现在 AI 与 agent 这一轮,转型发生得快得多,而且客户正在失去控制——以至于这种失控本身变成了阻碍而非推动力。他们会停下、会暂停,因为怕东西会坏、怕数据泄露、怕 IP 外流;于是他们迫切地在找"看得清正在发生什么"和"能控制"这两件能力 29:14。
Gonen 给出了为什么这轮更猛的一个心理学解释:云在某种意义上是抽象的,很难讲清它是什么——云不过是别人的电脑,但谁真懂?你没法向祖母解释云。但 AI 谁都懂。每个人都经历过 ChatGPT 时刻,那种"天啊这太不可思议了"的体验。于是压力从 C-level、CEO、董事会、股东那里层层压下来:把 AI 用到业务上,否则我们就不相关了。所以人们既为了 AI 带来的价值而行动,也为了对 AI 的恐惧而行动 29:1430:01。
八、软件的买法变了:forward-deployed engineer 与 PLG 的回归
Gonen 认为这一轮还带来了多年未见的新现象:企业消费软件的方式变了。首先是 forward-deployed engineer(FDE)——过去它看起来像"服务",是 Palantir 在做的事,没人真的理解那意味着什么,现在人人都在做 30:01。
原因在需求侧:你走进一家大型传统企业,他们真的很想采用 AI,因为不得不;问题是他们不知道怎么做,他们清楚自己的流程要一年、两年甚至更久,但他们现在就要结果。唯一能让他们更快落地的方式,就是让一群真正懂行的强工程师,带着他们在顶尖硅谷创业公司(有时是大公司)造出来的工具,进去把组织改造掉 30:4931:34。可见的结果是销售周期缩短,公司增长极快。
其次是 PLG 的回归。买方侧也在变快,尤其是新公司会用 product-led growth 的方式极快地买入 AI 基础设施,因为所有人现在都想造 agent。Gonen 承认自己过去的判断被推翻了:他曾主张对多数东西、尤其是开发者工具,PLG 是行不通的——世界太碎片化,人们不愿意动得那么快。现在它变得极其火热。他举 Cognition 为例(他称之为一家了不起的公司):先走 PLG(Eon 自己也这么用),再切 FDE 路线进银行,逻辑是"把你不想做的工程活儿换成我们的工程师来做,让你专注在你真正想做的事上"——两条战线同时用力 31:3432:20。
第三种路径更激进。Gonen 提到 Long Lake 这类公司:与其等那些采用 AI 极慢的企业自己转型,不如"我知道怎么更高效地做——如果我把公司买下来,改造成 AI 公司,我们就都赢了",靠效率套利拿到更高的利润率。他称之为这些公司真正开始用 AI、变得更高效的一种彻底的新方式 32:2033:06。
他的收尾判断带着克制的乐观:我们把这称为一场革命,但其实"我们才刚开始"——大多数公司仍然没在用 AI,仍处在这段旅程的开头。他们都感觉到有事在发生,都明白数据重要,都明白自己现有流程有些平庸、必须做点什么,"很可怕,但你不得不做" 33:06。主持人也感叹这是一场关于"公司如何消费 AI 软件、如何变得现代、以及我们被推着改变的力度"的迷人演化;Gonen 最后说,这是一趟很狂野的旅程,但在他看来世界会因此变得更好 33:55。
金句
模型、算力,一切都相对易耗、几乎零切换成本。但如果你是一家公司——酒店连锁、餐饮连锁、科技公司都一样——你最有价值的东西其实是你的数据。 —— Gonen Stein 3:05
他们买的不是飞机,他们买的是数据。花了 1000 万美元,因为他们认为它非常重要。 —— Gonen Stein 3:51
我们以为那位客户被我们的技术完全保护了。后来才知道,客户自己也以为受了保护,其实并没有——因为他们没有正确地映射、分类和打标资源。结果环境的 60% 被勒索软件击穿了。 —— Ofir Ehrlich 15:20
同样的威胁现在打了兴奋剂——它来自非人类行为体,来自那些对环境有合法访问权、有合法权限的 AI agent。然后突然之间,一张表就被 drop 了。 —— Ofir Ehrlich 16:06
这在组织内部造出了一整套行为体:不受组织规则约束,不一定跑在组织的边界内,却在处理敏感数据。 —— Gonen Stein 21:30
云是抽象的,我没法跟我祖母解释云是什么。但 AI,每个人都懂。 —— Gonen Stein 29:14
提到的书·产品·人物
- Eon(公司/产品):两位嘉宾创办的公司,面向 AI 时代的云备份、灾备与"新数据底座",提供数据映射、分类、摄入和 AI 接入 1:33
- Ofir Ehrlich(人物):Eon 联合创始人,讲述 AWS 时期的勒索软件案例与云迁移经验 0:46
- Gonen Stein(人物):Eon 联合创始人,本期关于数据资产、agent 威胁与新软件消费方式的主要论述者 0:46
- CloudEndure(公司):两人的上一家公司,被 AWS 收购 27:41
- AWS Application Migration Service(产品):卖给 AWS 后他们参与构建的迁移服务 28:28
- Azure / GCP(产品):早期他们的产品被 OEM 集成进这两家的控制台以支持大规模企业迁移 28:28
- Google(公司):花约 1000 万美元买下破产 Spirit Airlines 的数据,本就深耕旅游数据并已在变现 3:519:12
- Spirit Airlines(公司):破产航司,其企业数据集成为多方竞标对象,既是航司样本也是大型企业组织样本 3:516:54
- Mercor(公司):据主持人所述,是该破产数据竞标流程中的另一竞标方 3:51
- Harvard 法律数据集(数据集):几天前刚发布,被用作"高质量公开数据集稀缺"的正例 6:54
- Enron 数据(数据集):公开可得,至今仍被当作"真实公司如何运转"的训练素材 7:40
- Applied Compute(公司):主持人提到的这类服务让企业可针对特定数据集微调(开源)模型 6:08
- ChatGPT(产品):连 CEO、董事会都在玩,是企业相信 AI 为真的转折点 10:4429:14
- Fivetran / dbt / Monte Carlo(产品):过去数据团队完成战术任务的优秀工具,但都是为特定目的造的特定工具 9:5825:23
- Databricks(公司):被称为"地球上最不可思议的公司之一",但编目属"事后效应";正持续自我重塑,自建 agent 与数据库 25:2326:09
- Lovable(产品):非技术员工用它自己搭东西、把公司数据放进去,缺乏安全合规意识 20:43
- OpenClaw(产品):被举例为跑在笔记本上、同时连着 WhatsApp 与内网的 agent 类工具 19:57
- Palantir(公司):forward-deployed engineer 模式的原型,过去被视为"服务",现在人人效仿 30:01
- Cognition(公司):先 PLG、再用 FDE 打进银行的双线打法范例 32:20
- Long Lake(公司):与其等企业自己转型,不如买下公司改造成 AI 公司、赚效率套利的新路径 32:20
适合谁听
想搞清楚"企业存量数据如何变成 AI 资产"以及 agent 时代数据安全与数据栈将如何重构的 CIO、数据/平台负责人和基础设施创业者。