核心要点
- 1.5 倍租金:租一张 H100 每小时 3.5~5 美元,一年算下来 3.5 万到 5 万美元,而买断价约 3 万美元、保修三年、实际能用十年——「数学就是这么算的,买比租划算得多」3:04
- 10 万美元插队费:Speechify 愿意为每张卡多付 10 万美元提前四个月拿货,因为数据中心的机位租金照付不误,晚到才是最贵的成本;Cliff 亲历过法国供应商延期后当场换约施压 14:37
- GPU 不是 iPhone:手机一次只能用一台,但 10 万张 GPU 可以同时全开——旧卡退居推理、新卡专攻训练,Speechify 至今仍用 K80 跑特定推理任务,所以折旧焦虑被大幅高估 5:22
- 最大的失误:2022 年他判断 TTS API 会被商品化因而放弃 B2B,事后承认「100% 是我的错」——他忘了第一个产品只是楔子,AI 实验室的本质是持续叠加语音克隆、情感韵律、双工模型和 agent 23:50
- 招斜率不招截距:过去看手写代码质量,现在只看原始技术智力与饥饿感,因为「六个月就能把人教成机器」;他大量招数学奥赛、精英竞赛选手和 Kaggle 得主,甚至不要求写过代码 33:47
- 没进生产就不算数:他用送牛奶作比——奶瓶做得再漂亮,放在路边就会馊;工程师的功劳只按「无 bug 推到生产、用户真的在用」计,token 排行榜是最扭曲的激励 39:55
- 不下场就是输:面对 ElevenLabs 与 Sierra 两座大山,Cliff 的态度是先免费把产品塞进用户的手机和公司的技术栈,「输的最好办法就是不参赛」29:58
章节时间轴
- 0:45 为什么要自己买 GPU — 2022 年租卡时工程师因为心疼钱而不敢用,兄弟俩决定「在自己家里装一个篮筐」,从此一路加码自建。
- 3:04 买 vs 租的账 — H100 买断约 3 万美元,租一年要 3.5 万到 5 万;再加上大规模训练必须显存与集群共置,租方案根本跑不动 Speechify 想跑的规模。
- 4:36 折旧与芯片周期 — 训练要最快的卡,推理可以用老卡;GPU 与手机的根本区别是所有卡能同时使用,所以「多买不亏」。
- 9:15 算力配置的百分比模型 — 以 11 月为 100% 基准,10 月 140%、12 月 80%;把 20% 常态用量买断、25% 走长约、剩下用竞价实例。
- 11:33 Nvidia 与黑石们的托底交易 — Nvidia 为 GPU 抵押贷款兜底最高 25% 残值,等于造出流动的二级市场;Cliff 拿 Elon 早年 SolarCity 的光伏贷款类比。
- 12:18 循环交易恐慌成立吗 — 他区分 Oracle–OpenAI 那类「太过头」的结构与 Nvidia 本身:GPU 是有内在价值的真实资产,衡量单位就是每秒多少万亿次浮点运算。
- 13:51 没人告诉你的买卡细节 — Dell 才是机柜供应商、法国交付延期、整车 GPU 价值等于好几套房所以必须买保险、液冷要自己加装 sidecar。
- 16:55 Harry 的反驳 — 只省 1.5 倍却要背上保险、运输、安保、水冷全套麻烦,为什么不专注做产品?
- 22:18 B2C 的成本诅咒与定价战 — Speechify 的 API 每百万字符 10 美元,ElevenLabs 约 100 美元,OpenAI 模型约 196 美元。
- 23:04 生涯最大失误 — 2022 年在伦敦见过 ElevenLabs 创始人却判断 API 会商品化,放弃 B2B;他复盘说错在忘了「第一个产品只是楔子」。
- 25:21 该不该去打 ElevenLabs 和 Sierra — Harry 认为做老三是「Postmates 效应」;Cliff 用 Anthropic 追 OpenAI 的例子反驳,称这是寡头格局不是垄断格局。
- 31:28 AI 时代最难招人吗 — Cliff 反对这个判断:难的是成长期公司在跟发 1500 万美元年包的巨头抢人,种子期反而是史上最好招人的时候。
- 36:50 内部怎么用 agent — AI 研究团队全员编排 agent,平台与各端团队则要靠演示与同侪示范来推动;工具排序是 Claude Code > Cursor > Codex。
- 39:09 Token 怎么分配 — 不搞排行榜,只看演示与生产结果;同时明确反对为小功能烧掉不合理的 token 量。
- 45:22 新的招聘流程 — 功能性面试(现场造东西 + 单元测试)、给大型开源代码库让人理解并改动、必须会编排 agent。
- 46:54 Wispr Flow 与语音输入的商品化 — 他认为该市场同样走向寡头;也承认自己因为「以为 Apple 会做」而错过了语音输入和 Siri 的替代品。
- 55:18 五年后的常态 — 人机交互会以语音为主、屏幕退居次要;他点名 Meta 的方向是对的。
- 56:49 Meta 还是 SpaceX — 他选 Meta:内在价值相对市值被低估,且 Zuck 比 Elon 年轻二十年;但承认 Elon 的 TAM 更大。
- 60:36 用 GPU 救家人 — 连续 15 周采血、测序、蛋白质组与 RNA 分析,配合六年自述数据在 GPU 集群上跑,试图攻克一种孤儿病。
详细内容
一、为什么 Speechify 要自己买几千万美元的 GPU
故事的起点其实很朴素。2022 年 Speechify 需要训练模型,一开始是租 GPU,结果发现工程师会「省着用」——因为心里清楚每跑一次实验都在给公司烧掉几万美元。Cliff 和他兄弟用了一个篮球比喻:如果你是 Michael Jordan,唯一在乎的事就是打进 NBA,但每次练球都要付 20 美元场地费,那太糟了;你想要的是家里就有一个篮筐。于是他们买了第一批自己的卡。
第二层原因是纯粹的算术。他把整条 GPU 谱系摆开:Transformer 2017 年在 Google 诞生,Nvidia 2019 年出 A100,随后是 H100,初代 ChatGPT 就是在 A100 上训的;再往后是 Blackwell 的 B200、B300,现在到了 Rubin——也就是 Elon 要送上太空、必须液冷的那一代。每一代卡在「每万亿次浮点运算」的单价上都更便宜。而买租对比是:一张 H100 买断约 3 万美元;GCP 的竞价实例一小时 5 美元,Azure 或 AWS 约 3.5 美元;乘以 24 小时再乘 365 天,一年租金 3.5 万到 5 万美元。硬件通常保修三年,但过保后 Cliff 估计还能再跑很多年。
第三层是训练本身的物理约束。他说得很直白:「我没法从 Google、Microsoft 甚至 Baseten 那里租到我想要的训练规模,因为我需要一张巨大的内存卡紧挨着所有 GPU,让它们都能访问我的全部数据。」共置(colocation)的显存与集群,是租赁方案给不了的。
第四层是推理侧的成本。跑开源模型做编码任务时,如果调 Anthropic 的 API,你付的是全部 token 加上品牌溢价;换成自己硬件上的开源模型,单 token 成本是「几分之几分之一分钱」。
二、折旧焦虑:Harry 的第一轮质疑
Harry 立刻反问:芯片会折旧,芯片周期在加速,架构在分化,买卡等于把自己锁死在一种架构上。
Cliff 的回应分三层。第一,训练和推理是两件事。训练时「每一分钟拿不到答案,我就在跟所有人竞争中落后」,所以订单级的速度优势极其值钱;但文本转语音、语音转文本这类推理任务,用低一档的卡照样 100 毫秒返回,完全够用。Speechify 至今仍在用 K80 跑一些特定推理。
第二,也是他最强的论点:GPU 不是 iPhone。「你 2011 年买了 iPhone 3G,然后一部部换下去,抽屉里会躺着五部积灰的手机,因为你一次只能用一部。但如果我有 10 万张 GPU,我会同时用掉全部。」多买不会浪费,因为需求永远超出供给——尤其是 Speechify 有 6000 万用户在跑推理,还有 45 名工程师、目标扩到 150 人,其中最强的几个人各自独占 DGX 机柜,而 25% 的团队处于「等算力」状态。他的比喻是:这就像一支橄榄球队,你不是缺人,你是缺训练场。
第三是资本配置视角。多余的现金放银行或买债,长久期最好的债大约 5% 收益;而买 GPU 因为「租一年等于买价的 1.5 倍」,隐含回报远高于此。他甚至提到,如果真有富余产能,还可以租给做训练和推理的朋友。
三、买卡的真实操作细节
这一段是全场信息密度最高的部分之一,也是最不像投资访谈的部分。
供应链上,Nvidia 不会亲自跟一个叫 Cliff 的创始人谈生意。评级最好的供应商之一是 Dell——「所有人都以为 Dell 是个人电脑公司,不是,它现在是 GPU 机柜供应商」。而 Dell 自己也受制于供给,可能货源在法国,于是你从法国下单,然后货晚了一个月。Cliff 讲了一个真实经历:他打电话质问法国那边的对接人「我们有合同,你没按时交付」,接着直接告知对方自己已经找了另一家、准备毁约——除非对方能给更好的价格,「但我现在就要 GPU」。
为什么这么急?因为数据中心机位的租金是按时间付的。GPU 晚到,最贵的成本不是卡本身,而是空转的机位租金。所以他愿意在插队上花钱:每张卡额外 10 万美元换提前四个月。
然后是所有人都不会想到的环节。一辆卡车正载着价值等同于一栋房子的 GPU 横穿美国——万一被撞、湿度过高、机柜翻倒,损失就是好几栋房子,所以保险必须买。数据中心侧,你付的不只是机位、网络和电力(电力是当前最大约束),还有散热:风冷已经不够了,水的热负载更好,还有比水更好的液体;Rubin 是液冷的,但大多数数据中心并没有已审批的液冷设施,所以 Speechify 得研究、采购所谓的液冷 sidecar,再花钱请数据中心的工程师帮忙安装。
Cliff 的总结是:跑一家纯软件公司和跑一家含硬件的公司,是两种不同的生意。
Harry 听完之后反而更笃定自己的判断:「你只省了 1.5 倍,却要承担保险、运输、安保、水冷、物流的全部噩梦——而真正决定胜负的是你的产品,是跟跑得飞快的 ElevenLabs 竞争。」Cliff 的反驳是 ElevenLabs 也在做同样的事,因为高质量训练同样需要共置的大显存集群;而且买卡还能插队——「如果我想要 Rubin,我自己买会比排在 Google 后面拿得更早,我能比所有人早一年用上。」
四、Nvidia 的托底交易与「循环交易」之辩
Cliff 提到一件他认为被低估的事:Nvidia 与 Blackstone、BlackRock、Apollo、Goldman Sachs 做了一笔大交易——如果你借钱给某人买 GPU(不管是 Google 还是一家初创),而对方倒闭、GPU 成了抵押物,Nvidia 承诺以最高 25% 的残值回购。这实际上是在为 GPU 制造一个由 Nvidia 承销的流动二级市场,于是大银行就有动机以更低利率放贷。
他的类比是 Elon 早年的 SolarCity:说服 Morgan Stanley 和 Merrill Lynch 把光伏板的价格摊到 30 年,整个模式的发明点就在于「你可以拿光伏板作抵押去贷款」。
至于市场上关于 Nvidia「循环交易」的担忧,Cliff 的判断是分层的:一年前 Oracle 和 OpenAI 之间那类结构「太过头了,很荒谬」;但 Nvidia 不一样,因为你谈的是真实资产。他用比特币和黄金作对照——比特币的内在价值说不清,黄金至少有医疗和珠宝用途;而 GPU 有确凿的内在价值,「不管它在哪,哪怕在冰岛,对全世界任何人都有用」。他给出的唯一估值锚点是:这台设备每秒能做多少万亿次浮点运算,那就是它的 token 产能,就是它的价值。
五、生涯最大的战略失误:放弃 B2B
Harry 直接把刀递过去:ElevenLabs 反超了你,这是你的责任吗?
Cliff 没有回避:「100% 是我的错,是 Speechify 历史上最大的战略失误。」
细节是这样的。2022 年他住在伦敦,见了 ElevenLabs 的两位创始人。他很欣赏他们,甚至想用他们的模型,但当时太贵。他的判断是:文本转语音的 API 迟早会被商品化——总有一天你能在自己的电脑上跑、然后在手机上跑,那他们还卖什么?所以他决定不进这个生意。
他事后总结,错在忘了一件根本的事:一家 AI 实验室(不管是 Speechify 还是 ElevenLabs)存在的意义是持续创新,而你发布的第一个产品只是楔子,是让别人后来用上你其他技术的入口。 顺着 TTS 这条线,你可以先把单一音色做到世界最好,然后是多音色、情感韵律、声音克隆、语音转文本、能处理笑声与打断和轮次切换的双工模型、语音对话的 harness,再针对销售场景优化、针对客服场景优化。ElevenLabs 正是这么走的:先做出色的 API,擅长发布节奏,再做面向创作者的产品,最后做出他们最好的产品——agents。而 agents 的关键在于买家不再是软件工程师,而是 CTO、CIO、CEO;由此才能接上 Sierra 提出的按结果定价(outcome-based pricing)。
数据侧他也给了 Speechify 的家底:在 App Store 搜 text to speech,Speechify 占 B2C 安装量的 98%;累计为用户朗读超过 7700 亿个词,折算约 6000 年的收听时长。B2C 的诅咒是单价低——ElevenLabs 靠 B2B 反超正是因为这个。Speechify 的成本约束是每百万字符低于 10 美元,而 ElevenLabs 收约 100 美元、OpenAI 模型的基准价约 196 美元;他们刚上线的 Simba 3.2 API 定价就是每百万字符 10 美元。
六、Harry 的反对意见:做老三没有好下场
Harry 的立场很硬:Speechify 转 B2B 是战略错误,因为你要同时对上 ElevenLabs 和 Sierra,而这两家自己也在竞争(尽管双方都不愿承认,且 Sequoia 同时投了两家、假装中立)。他说 ElevenLabs 已经到了不可阻挡的程度——它拿下了西方主要民主国家的政府采购,而这个动作三个月前才开始。「做老三是 Postmates 效应,永远不是好市场。」
Cliff 的回应有三层。第一,他不是从零开始,B2C 的统治地位仍在高速增长,而团队现在人人产出十倍,多出来的 AI 工程能力总得有去处,「那就既做 B2C 也做 B2B」。第二,这不是垄断格局而是寡头格局——Anthropic 曾长期是 OpenAI 之后的老二,现在不是了;他还举了 Facebook 追赶 Friendster 的例子。第三,也是他上一轮学到的教训:「我可以基本上免费把产品给出去,因为我是一家 AI 研究实验室;只要人们开始用我,我就会嵌进系统里,然后不断推出新东西。」
Harry 承认「大家都有空间」,但坚持价值会向第一名集中;他拿推理市场类比,认为 Fireworks 会是几千亿美元的公司,之后是千亿级、再之后是五百亿级的一批。Cliff 的反例是语音 AI 本该属于 OpenAI——三年前所有人都会这么预测,但事实并非如此。Harry 归因于「极其糟糕的管理,这本来是他们的,结果全线掉链子」;Cliff 则更宽容:再优秀的公司也会漏掉细分市场,语音对 OpenAI 只是支线,LLM 才是主线,「顺便说一句,他们也漏掉了 AI 编程,现在才回过头来抢」。
七、AI 时代的招聘:招斜率,不招截距
Harry 抛出一个尖锐问题:现在是不是史上最难招人的时候?因为 OpenAI 和 Anthropic 手里的胡萝卜(尤其是临近 IPO)太诱人,Monzo 的创始人、EF 的创始人 Matt Clifford 这种量级的人都被吸走。
Cliff 明确反对这个概括,并且做了关键切分:
难的是成长期公司,不是种子期公司。 那些巨头挖人的年包起步就是 1500 万美元——没有哪家种子期公司会开这个价,所以那本来就不是你的候选人。相反,对种子期来说这是史上最容易的时候,因为创始人自己编排 agent 就能放大产出。
Harry 反驳说他见过 1500 万美元的包出现在种子公司,Cliff 追问才发现所谓「种子轮」是 1.5 亿到 3 亿美元的融资规模。两人在这里达成了共识:如果一家公司融了 1.5 亿、估值在 5 亿到 20 亿,那它当然该开 1500 万的包;但市场上这样的公司有三十来家,它们只吸走三十来个人,而符合条件的人现在有上千个,所以真正的稀缺是被夸大的。Harry 补充说 CRO 的包他见过 5000 万美元以上。
Cliff 顺势讲了他实际改掉的东西。六个月前,Speechify 还很看重你读过多少软件工程教科书、手写代码有多漂亮。现在他最看重的是技术天赋和原始技术智力——因为「其他一切我们都能教,六个月你就能变成一台机器」。于是他大量招数学奥赛选手、精英竞赛程序员、Kaggle 获奖者、学物理和数学的人,甚至可以没写过代码,只要有饥饿感、职业道德和智力。他引用 Duolingo 的做法:喜欢招应届生然后自己带。他给出的原则是「招斜率而不是截距」——看这个人的潜力,而不是他今天的位置。
至于具体流程,他给出三条:一是功能性面试,让候选人当场造出东西,再用单元测试跑;二是给一个大型代码库(开源仓库也行),让他理解、改动,然后检查他弄坏了什么;三是必须能把 agent 编排好,「做不到基本就不值得招」。他还补了一句管理观:小团队更有意思,因为他自己可以同时开几个 Slack 频道,每个频道对面是比他更专业的领域专家,那个人是这项任务的结果负责人,而他手里有 agent——于是一个创始人能以很细的颗粒度同时推进多个项目。
八、Token 怎么管:不要排行榜,只要生产环境
Harry 问到内部的 token 分配,并直言 token 排行榜是「最扭曲的激励形式」。
Cliff 同意。他说很多人是「说得多」,他一要例子就露馅。他的替代方案是演示:能不能开个 Zoom 让我看看你造了什么,然后我自己用一遍,如果我说「哇这太棒了」,那就算数;或者发一段屏幕录像。
真正的判据只有一个:推到生产环境、用户在用。他连用了三个比喻——你送牛奶,奶瓶做得再漂亮,放在路口就会馊,你必须送到我家门口敲门;你把橄榄球带到线前却没过阵,不算;你把球送到篮筐边却没投进,不算。「进筐的意思是无 bug 推到生产,用户真的在用,然后我们拿到反馈。」他强调 Speechify 之所以能赢,正是因为「我们不在理论空间,我们是应用型 AI 公司」,且以 Speechify 的用户体量做这种迭代循环的公司几乎没有。
他举了当天早上的例子:前一天他跟 AI 工程团队开会,说双工模型和 AI 对话 harness 的项目他很兴奋但想更快,给了 14 条意见;他习惯在 Zoom 上把电脑转过去对着手机,当着团队的面用产品并录下来,让他们看到所有 bug,再把录像发进群。团队里一位 19 岁的工程师当天早上就发来 demo,说自己在等三次训练跑完的空档里把所有问题都实现了。「这就是正确的用法。不是 token 排行榜,而是你在生产环境里拿出了什么。」
对成本,他并不含糊:如果为一个小功能烧掉不合理的 token 量,他会「疯掉」,甚至会让人走人。他的正面案例是 Anthropic 关于长周期任务的论文——一个跑两周的任务烧掉价值 12,500 美元的 token 却换来一个更好的模型,这是完美的用法;反面则是五小时内烧掉同量级的 token 做毫无必要的事。他的方法论是:把目标说清楚,把衡量目标的方式说清楚,然后让它对着目标反复迭代——他引用 Claude Code 的作者 Boris 的说法,「关键全在这个 loop」。
他还讲了一个反面例子:一个没有工程背景的人两小时做出了自己想要的 app,但因为要抓一个网站,agent 把整站每一页都爬了,账单巨大;而正确做法是直奔数据库对应的那个 URL 去抓,需要命中的节点数会从 25000 降到 20。「你要让 agent 走阻力最小的路径,而不是阻力最大的路径。」
九、语音输入的商品化与客服市场之争
Harry 抛出他那条后来删掉的推文:他觉得 Wispr Flow 的产品越做越差,发推只是想找替代品,结果收到 500 个替代方案——「这就是彻底商品化」。
Cliff 的诊断是:Wispr Flow 最初上市用的并不是自己的模型,很可能底下是 Deepgram 一类的东西加一层优化 harness;后来换成自研模型(因为便宜得多),质量因此下滑。他认为它们现在往笔记方向扩展是对的,也做得不错——这正是「复合型创业公司」的例证。
关于品牌,他做了一个有意思的区分:论用户量,纽约街头认识 Speechify 的人远多于 Wispr Flow;但在科技圈,Wispr Flow 的品牌更大,因为它们什么都公开宣布,而 Speechify 刻意不宣布融资、不宣布任何事。代价是 Wispr Flow 引来了大量竞争。他顺带引用 Peter Thiel 的那句「只有输家才竞争」。
他也认了第二个错:自己七年来一直在用自制的语音输入工具(在 iPhone 和电脑上侧载),却因为「以为这是商品化产品、Apple 迟早会做进按钮里」而没有产品化。「但 Apple 一直没做。两年前 Apple 宣布和 ChatGPT 合作改进 Siri,结果什么也没发生。」所以他也一直没去动 Siri。现在他们同时上线了对标 Siri、对标 Wispr Flow、对标 ElevenLabs 的产品,理由还是同一条教训:先免费给出优秀产品当楔子,再不断叠加。
至于客服市场,Harry 认为很难做:前有 Sierra 和 Decagon 拿走大部分融资与注意力,中间有 Intercom、Talkdesk、Crescendo 这类八到十年、已经足够好的公司,上面还有 Salesforce、Atlassian;更糟的是任何成熟买家(Airwallex、Clear 之类技术型公司)都自己造了一套。
Cliff 的澄清是:Speechify 对 B2B 提供的核心产品是 API,不是 agent。他指出 Sierra 没有自己的模型团队,用的是别人的模型,Sierra 的价值在于 go-to-market 和 Brett Taylor;所以 ElevenLabs 那边会说自己跟 Sierra 并不直接竞争,因为他们的主业历来是 API。而在 API 这条赛道上,玩家只有 Speechify、ElevenLabs、Gemini、Grok(SpaceX 也入场了)和 Cartesia,「差不多就这些」,远没有客服 agent 那么拥挤。他能提供的差异化是:质量更好、速度更快、价格便宜十倍。
但他仍然要做 agent,理由回到他的领导观:「你不想当那种坐在后方喊『拿下那个山头』的胖经理,你要当第一个举剑冲上去接敌的战士。」产品上也一样——你必须是自家 B2C 产品的头号用户,必须帮客户把你的产品用得更好;只有派前置部署工程师(forward deployed engineer)跟 B2B 客户一起用你的技术搭 agent,你才能发现山那边真正值钱的下一个创新。他用 ElevenLabs 的政府订单佐证:政府显然不是客服,但如果没有先在私营部门做好客服这类活,根本走不到政府那一步。
十、快问快答:语音界面、Meta vs SpaceX、以及用 GPU 治病
五年后什么今天看来疯狂的事会变得平常? 他的答案是人机界面会以语音为主、屏幕退居次要。他的论证链是界面简化史:Google 成功是因为界面极简——一个文本框加一个按钮;ChatGPT 相对 GPT-3 成功也是因为界面极简——文本框、按钮、回复。比这更简单的版本就是对话本身:我说一句,我听到一句。他直言现在 ChatGPT 的语音模式「很糟糕:太慢,语音侧的 LLM 比核心 LLM 笨得多,升级到高质量模型的机制也很弱」。他认为 Meta 方向是对的。
Meta 还是 SpaceX? 他选 Meta。分析过程里他把 SpaceX 和 Tesla 合起来看,因为「我评估的是 Elon 这个人」。他承认 Elon 的 TAM 更大:数据中心当前最大瓶颈是内存卡,很快会变成能源,而能源需要供给和存储,最好的储能来自 Tesla;Tesla 还在自研芯片;Elon 是全世界制造复杂实体产品的第一人(他引用两年前那期 Joe Rogan 访谈:难的不是造出产品,而是造出产品的制造能力)。至于太空数据中心,他的评价很直接——「这是一个非常有意思的点子,而且它非常好地帮我给 Rubin 承销了一个巨大的 TAM,是 Elon 为了向投资人讲故事而变出来的一只好兔子。」
选 Meta 的理由是估值与内在价值的错配。他认为 Meta 拥有全世界最多的数据,只是被 GDPR 一类法律严重束缚——「如果没有 GDPR 和美国的那些法律,Meta 会一路狂飙,他们现在没法好好训练自己的数据。」Meta 的市盈率约 32,而 Tesla 在几百倍量级。他也提到自己是创始人领导型公司的坚定信徒,并给出一个冷静的年龄账:Zuck 比 Elon 年轻二十年。
这里两人有一次直接对撞。Harry 说「如果 Zuck 离场,Meta 股价会涨」,因为每次他在台上喊 capex 都会挨打;Cliff 完全不同意,但也顺着 Harry 的逻辑承认了一个非对称:Palantir 有「Alex Karp 效应」能把市盈率炒上去,Zuck 没有,而 Elon 有——「如果 Elon 被拿掉,那家公司会失去 70% 的价值;如果 Zuck 被拿掉,你肯定不会丢 70%。」
最兴奋的是什么? 答案出人意料地私人:AI 在药理学和生物学上的应用。他有一位家庭成员患严重的自身免疫性神经炎症,已经六年。他连续 15 周每周取一次血样送实验室,做基因组测序、蛋白质组学(看蛋白在体内如何表达)、以及每周的 RNA 分析,再把这些和每日自述的生活质量与情绪数据对照——他手上有六年的数据,全部放进 GPU 集群跑,「我发现了很多任何医生都不可能告诉我的东西」。
这是一种罕见病,属于「孤儿病」,患者少到没人愿意投入。这个病有一个 Facebook 群。他现在正在买一种约 5000 美元、能装进口袋的设备,投入一根头发、唾液或血液就能测出全基因组;他打算组织这个群里所有病友线下见面,把所有人的基因组测出来,放到一个巨大的 GPU 集群上比对,找出共同的表观遗传线索。「我知道我会解决这个病。」
后续链条他也说清楚了:拿到结论后可以扔进 Isomorphic 的 AlphaFold,不仅能设计出致病的蛋白,还能设计出需要与之结合、把它开启或关闭的分子;可以用 CRISPR 做同样的事;可以让 Twist 这样的实验室合成指定的 RNA 或 DNA 序列寄到实验室或家里。「这一切我都能在自己的电脑上模拟,通过 SSH 连到我在亚利桑那州 Scottsdale 的 GPU 集群,然后我可以治好我弟弟。」
最后他讲了自己的来路:8 岁时读不了书,是父亲翻开书给他念《哈利·波特》,他才学会阅读;13 岁移居美国时不会说英语,把《哈利·波特》有声书连听了 22 遍,至今能背出第一章;没考上兄姐上的私立高中;因为作文拼写错误太多、来不及读完阅读段落而进不了 AP 美国史;准备 SAT 英语时他的办法是不读原文、先看选项再回原文找答案。后来他进了 Brown,因为读不了文学而去开了一个可再生能源工程的专业方向,并造了一个把所有课本念给他听的文本转语音工具——「是技术解决了我的阅读障碍和 ADHD,它也会解决我弟弟的病;它已经解决了我父亲的前列腺癌,因为我在很多人帮助下弄明白了怎么用 GPU 定位他体内病灶的位置。」
金句
输的最好办法就是不参赛。下场。 —— Cliff Weitzman 0:00
你不想当那种坐在后方喊「拿下那个山头」的胖经理,你要当第一个举剑冲上去接敌的战士。 —— Cliff Weitzman 52:16
100% 是我的错。这是 Speechify 历史上最大的战略失误。 —— Cliff Weitzman 23:04
如果你有 10 万张 GPU,你会同时用掉全部。所以多买并没有损失。 —— Cliff Weitzman 6:09
你做了一瓶漂亮的牛奶,却把它放在路边,牛奶会馊。你必须送到我家门口,敲门。 —— Cliff Weitzman 39:55
我今天看的是这个人的潜力,而不是他今天在哪里。 —— Cliff Weitzman 46:54
提到的书·产品·人物
- Speechify(公司/产品):嘉宾创办的文本转语音公司,App Store 同类 98% 安装量,累计朗读超 7700 亿词,新模型 Simba 3.2 与 API 定价每百万字符 10 美元
- ElevenLabs(公司):本期核心对照组,靠 B2B API 与 agents 反超 Speechify,近期拿下多国政府采购
- Sierra / Brett Taylor(公司/人物):按结果定价的 AI agent 公司;Cliff 称「我绝不会去和 Brett Taylor 硬碰」,并提到他用 Sierra 在 Shopify 上搭吉他店客服与销售的演示
- Nvidia(公司):A100 / H100 / B200 / B300 / Rubin 谱系,以及与 Blackstone、BlackRock、Apollo、Goldman Sachs 的 25% 残值兜底交易
- Dell(公司):被低估的 GPU 机柜供应商,Speechify 的主要采购渠道之一
- Mercor / Micro1 / Surge(公司):数据市场玩家;Cliff 认为客户结构会从前沿实验室扩散到所有需要补充数据的大型企业
- Fireworks / Lin(PyTorch 联合创始人)(公司/人物):推理服务商,Cliff 认为会成长为几千亿美元量级公司
- Claude Code / Cursor / Codex(产品):Speechify 内部使用排序为 Claude Code 第一、Cursor 第二、Codex 少量
- Linear(产品):与 agent 配合自动切工单,被点名「非常棒」
- Boris(Claude Code 作者)(人物):被引用的观点是「一切都关乎 loop:给出目标、给出衡量目标的方式,然后反复迭代」
- Wispr Flow / Willow(产品):语音输入工具,Harry 认为其质量下滑并已彻底商品化
- Decagon / Intercom / Talkdesk / Crescendo / Salesforce / Atlassian(公司):客服 agent 市场的分层格局
- Grok(SpaceX)/ Gemini / Cartesia / Gradium(产品/公司):语音 API 赛道的其余玩家
- AlphaFold(Isomorphic)/ CRISPR / Twist(技术/公司):Cliff 攻克家人罕见病计划里的下游工具链
- Peter Thiel(人物):被引用的「只有输家才竞争」
- Benjamin Graham / Charlie Munger / Warren Buffett(人物):讨论 Meta 内在价值时引用的「雪茄烟蒂」式估值视角
- Duolingo(公司):招应届生并自己培养的正面样本
- 《哈利·波特》(书):Cliff 学会阅读与学会英语的两次关键媒介
- Joe Rogan 对 Elon Musk 的访谈(节目):被引用的观点是「难的不是造产品,而是造出制造能力」
适合谁听
正在纠结算力自建还是租用、或者要在巨头夹缝中重建招聘与 agent 工作流的 AI 创业者与工程负责人。