← 顶级AI播客总结
20VC

Fireworks 创始人:Token 成本降10倍、用量爆100倍的未来

Are OpenAI & Anthropic Overvalued? How Token Costs Will Fall 10X & Usage Will Explode 100X
节目时长 89 分钟 阅读约 18 分钟
▶ 在 YouTube 收看原片
Fireworks 创始人:Token 成本降10倍、用量爆100倍的未来 插画

Fireworks 创始人 Lin Qiao 论证"专有智能"将取代 AGI 叙事:三年内 token 成本降10倍、用量涨100倍。

核心要点

  • 10倍降价100倍用量:Lin 预测未来三年 token 成本将下降 10 倍——通过每任务用更少 token、模型定制、单 token 经济优化和供应链缓解三层压缩——并驱动 100 倍的使用量爆发。
  • 专有智能论:全球大部分数据锁在企业内部、永远不会用于训练通用模型,因此智能的前沿是"专有/专用智能";未来将是数百万个专用模型,一个应用一个,而非少数 AGI 模型统治世界。
  • 日处理40万亿token:Fireworks 目前每天处理超过 40 万亿 token,且大多数流量来自定制模型而非现成模型;Lin 预计明年年底 token 量可能增长 20 到 100 倍,认为"CapEx 泡沫"之说站不住脚。
  • Cursor合作内幕:Cursor 两年前还是个位数百万美元收入时就选择 Fireworks,如今增长约千倍;双方共建分布式 RL 系统,把 trainer 与 rollout 解耦,跨全球五六个数据中心区域同步模型权重,无需昂贵的 InfiniBand 互联集群。
  • 规模化破产风险:SaaS 时代 PMF 约等于持久生意,如今两者分离——有 PMF 的公司可能"scale into bankruptcy",大厂 CFO 也无法批准全量铺开 AI 功能的成本,出路是掌控开源权重模型自主部署。
  • 硬件折旧逻辑巨变:过去硬件六年折旧、三年一代;现在单一厂商一年出三个 SKU、模型每周更新,三年后九代旧硬件跑三年前的模型价值存疑,这彻底改变 build vs buy 的计算。
  • 8亿ARR年底翻倍:Fireworks ARR 已达 8 亿美元,预计年底至少翻倍;团队一年内从 50 人扩至 200 人,并请来前 Salesforce 总裁 George Hu 操盘 GTM。
Fireworks 创始人:Token 成本降10倍、用量爆100倍的未来 信息图
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

48 岁创业:从 PhD 到 PyTorch 再到 Fireworks

Lin Qiao 是第一代移民,2000 年来美,博士研究分布式系统与数据库,之后在研究实验室和 LinkedIn 深耕数据处理系统。她早在 2015 年就想创业——技术、产品方案、创始团队名单都有了——但自认缺少"关于人的技能",于是决定去当时硅谷的新星 Facebook 学习管理,原计划待一两年,结果一待七年(期间执掌 PyTorch)。

主持人 Harry Stebbings 透露,Benchmark 的 Eric Vishria 有条规则"不投大厂高管创业",但为 Lin 破了例;握手之后 Eric 的顾问还质疑"你见过几个大厂高管创业成功的",但双方最终紧密合作。Harry 自己则是在 15 分钟会面后写下 1000 万美元支票,称之为十年投资生涯里最容易的决定之一。

专有智能 vs AGI:一个反主流的世界观

Fireworks 的核心论点:如果智能是数据的衍生物,那么用于训练通用模型的公共互联网数据只是世界数据的一小部分——绝大多数数据是企业私有 IP,锁在应用和企业内部,永远不会被共享。这些"未被激活"的数据才是智能前沿所在,即"private intelligence / specialized intelligence"。

当 Harry 追问"这不正是 Anthropic 企业业务(Claude co-work 等)的前提吗",Lin 直接反驳:Anthropic 信仰 AGI,即一个模型以最优方式解决所有问题——那意味着不需要专门化。但世界本质是多元的:不同地区有不同价值体系、政策、商业方式和生活方式。"如果未来世界被一家公司的品味统治,我们就把自己变成了机器人军团,这非常令人沮丧。"她认为人类区别于其他物种的正是创造力和探索新生活方式的渴望,这无法被复制。

她引述与 Jensen Huang 在 GTC 主题演讲后的对话:"没有一家'专门做通用'的公司(no specialized general company)——每家公司都建立在做事的独特信念之上,否则它没有存在的理由。"这种独特性深深嵌入产品设计、软件系统、数据和用户交互之中,外部公司无法学习或获取。对于 Sam、Dario、Larry、Sergey 的 AGI 叙事,Lin 用"电力线"类比:前沿实验室在铺设分发智能的基础电网,这很伟大,但电力线不会取代插在上面的、承载各家品味的"电器"。

开源的胜利与"规模化破产"

创立公司时,联合创始人们曾深度辩论自研模型还是押注开源——当时开源模型还在襁褓期,这是场豪赌,但 PyTorch 的基因让他们相信开放(openness gives control:权重发布后完全归你,随意修改)。这场赌注得到回报:开源与闭源模型双双跨过质量阈值。Fireworks 内部用开源模型驱动招聘(候选人搜寻、反馈收集)、内部财务流程和编码调试,而且"我们对成本很敏感"。开源模型还跨过了另一个阈值:极易微调——用企业少量独特数据向自己的 eval 爬坡,最终在特定问题上超过通用模型。

由此引出她两年前就开始宣讲的现象:SaaS 时代 PMF 约等于持久生意,因为 CPU 和基础设施近乎免费商品;现在 PMF 与持久生意是两个分离的概念。有些创业公司客户愿意付费、产品被珍视,但一扩张就"scale into bankruptcy"。对拥有海量存量流量的大厂更严重:CFO 看到 AI 功能全量铺开的成本预测后根本无法批准。出路就是掌控开源权重模型、自主部署。Harry 提到 Sam Altman 刚发布的大幅降价模型,Lin 承认降价可能,但强调根本差异:开源模型获取零成本且可完全定制,前沿实验室则必须收回 R&D 成本,且 API 之上无控制权。Fireworks 把每次模型部署视为"one size fits one"——当产品触达数百万乃至数十亿用户时,5% 的成本削减都是巨款,而历史上他们见过 5-10 倍的成本压缩。

Chinese 开源模型、国家安全与主权智能

Harry 指出 OpenRouter 上如今排名前六的都是 Chinese 模型,质量惊人。Lin 认为这是行业大辩论,她的立场是:无论开源闭源,任何模型都该围绕自己的业务加护栏——因为模型提供方必然把自己的判断和品味注入训练过程,不可能保证与你对齐(再次回到 Jensen 的"每家公司都是特殊的")。这正是必须微调模型的原因。她重申:"未来不会是少数 AGI 模型统治世界,而是数百万个专用模型,一个应用/用例一个。"

关于中国可能限制开源模型出口的报道,她认为短期冲击很大,但开放生态之美在于参与方众多;以美国的人才密度和资源,"我们有能力也应该自建开源体系",包括 Nvidia 正在训练的 Nemotron。谈到主权模型,她支持"每个国家都该拥有自己的电力线":Grok 曾被政府短暂封禁 19 天,欧洲惊觉医疗系统不能架在可被随时切断的基础设施上。"不仅国家,每家公司都该有独立性——你不希望任何一个人能切断你的电源。"

Harvey vs Legora 与 Cursor:应用公司该自建模型吗

针对法律领域的 Harvey(自建模型)与 Legora(不自建)之争,Lin 先指出软件开发已被通用编码智能颠覆:过去从想法到规模化生产需要数十位强产品工程师和 PM、数年投入,那是深护城河;现在一个人几周就能上线产品,实现不再是壁垒,竞争被重新定义。法律领域尤其特殊——律师保守、对错误零容忍,两家公司都拥有如何构建法律助手的专有知识与数据。关键洞察:这些助手里编排 AI 工具调用的 harness 是定制的,且 harness 需要与驱动它的模型共同训练(co-trained),所以"拥有自己的智能"有充分的商业理由,问题只是时机。Cursor 是编码领域调模型的先驱,如今几乎所有编码公司都在调自己的模型。

与 Cursor 的合作细节是本期最硬核的部分:Cursor 的研究员来自前沿实验室,想控制一切;两家都是资本节制的创业公司,于是共同设计了前所未有的系统——把强化学习后训练解耦为 trainer(不断调整权重、生成新模型版本)和 RL rollout(新版本与合成/真实编码环境交互、回传 reward)。传统超大规模玩家把两者跑在一万到十万块 InfiniBand 互联的芯片上,极贵且难求;Fireworks 设计了全分布式系统,横跨全球五六个数据中心区域、利用零散 GPU 跑大规模任务。挑战在于跨区域同步模型权重的延迟会决定 reward 的新鲜度,太陈旧就会跑偏——他们创新了快速分发新权重的方法,数值上依然可靠。Cursor 两年前与 Fireworks 签约时收入还是个位数百万美元,如今增长了百倍到千倍。面对"SpaceX 收购 Cursor 后流失怎么办"的尖锐问题,Lin 坦承全行业模型公司都集中在少数逃逸速度的应用公司上,但 Fireworks 客户已高度多元化:去年是 coding 之年,今年是 co-work 之年——通用深度研究,加上法律、金融、客服、招聘、销售、医疗等垂直 co-work,消费级公司也开始用 GenAI 重构推荐系统。

五层蛋糕、40 万亿 token 与 CapEx 之辩

Lin 透露 Fireworks 今天日处理超过 40 万亿 token,且大部分来自定制模型。被问及明年底的量级,她答"20 到 100 倍都有可能——我们正处于 S 曲线爆发的极早期"。Harry 立刻推论:如果如此,"CapEx 泡沫论"就是荒谬的,我们实际上严重低估了算力需求。Lin 同意,但引用 Jensen 的"五层 AI 蛋糕"(应用、模型、基础设施、芯片、能源):瓶颈在蛋糕下层——能源和芯片。历史上没有任何行业为 100 倍规模扩张而设计,她与多家制造商交流后发现,整条服务器产线可能被一个最小的晶体管零件卡住。

要不要做全栈?她的答案是聚焦:"agility is everything,做任何事都要先赢得资格(earn the rights)。"Fireworks 想跑在世界上所有 AI 芯片上,不被自有数据中心的芯片量限制。Meta 年轻时也不自建一切,规模大了、能省五倍成本时才有自建的资格。为什么 Jensen 做 Nemotron 却不抢 Fireworks 的层?她认为 Jensen 也不建云——他做模型纯粹是解决供应链问题(美国缺本土开源模型),只要五层蛋糕畅通无阻,他就不需要亲自下场。

Token 成本降 10 倍、用量爆 100 倍的推演

针对 Marc Benioff(新一轮投资人)披露 Salesforce 在 Anthropic/Claude Code 上的开销约为开发者薪资的 3.8%,Harry 问:未来这个比例是升是降?Lin 的核心预测:token 成本将大幅下降。至今没降是因为供应链约束,但自由经济里短缺推高价格、高价引来竞争、竞争压低成本——而更便宜的基础设施会引爆更多用量。

具体的降本分三层:第一,"不是所有 token 都平等",应按任务评估 token 经济学——有的模型便宜 2 倍但啰嗦 2 倍,成本相同;随着模型质量提升,"精准"本身会成为优化目标,解决一个任务需要的 token 会更少。第二,单 token 层面通过模型定制和 Fireworks 平台优化提升单位经济。第三,GPU、内存等底层硬件目前受严重供应链约束,一年到一年半内难改善,但两到三年内会缓解。综合起来:"我可以想象未来三年 10 倍的成本压缩,而这 10 倍降价将驱动 100 倍的用量。"

毛利、折旧与 build vs buy 的时机哲学

被问及推理层 30-40% 的毛利(对比 SaaS 的 80%)是否是新常态,Lin 否认:这是超增长阶段的主动选择。毛利优化是约束问题——设定 70-80% 的目标再反推约束,而约束会拖慢创新。就像高速试验期不该过度构建系统,"确定这就是要放大一千倍的系统后,再往死里优化"。她想同时优化增长与毛利:毛利优化本质是差异化优化,应持续进行,但绝不接受"毛利很高、增长停滞"的灾难结局。

关于自建数据中心:明确不进应用层,数据中心"永远在桌上,问题是时机"。她指出数据中心并非商品——以 Nvidia 收购的 Groq 为例,flops 密集的 GPU 擅长 prefill(处理 prompt),SRAM 密集的 ASIC 擅长生成,两者组合的异构设计需要独特的系统与部署创新;从施工、电力、光纤、液冷到故障件更换全是深度专业,"我明天当不了数据中心运营商"。更根本的是折旧逻辑巨变:过去硬件六年折旧、三年一代产品;现在一家厂商一年出三个 SKU,模型每周发布、下一代出来前就见顶,且新模型偏爱最新硬件——三年后谁还想用九代前的硬件跑三年前的模型?这改变了 build vs buy 的全部动力学。同理她不做芯片:把逻辑固化进硬件的前提是工作负载稳定,而 AI 定制的负载模式仍极度动态;Meta 的 MTIA 自 2018 年做起,是因为排名推荐负载早已过阈值。现有 AI 加速器公司多是 GenAI 之前的赌注碰上了运气——大 SRAM 设计恰好契合内存饥渴的模型。她眼中被低估的瓶颈:还没有为 10 万亿参数模型设计的系统,需要从模型、服务平台到芯片系统的协同设计;被低估的领域则是 AI 的 ROI 度量——"token maxing 只是一时,很快会进入 ROI maxing"。

8 亿 ARR、George Hu 与快问快答

Fireworks ARR 已达 8 亿美元,预计年底至少翻倍。Harry 感慨:十年前 Slack 是 18 个月做到 1000 万收入的金童,如今 Fireworks 几年做到 8 亿、Cursor 几年做到数十亿——Lin 归因于这场技术颠覆"触达每个人的创造力",需求端被彻底释放。

关于前 Salesforce 总裁 George Hu:一年前公司只有 50 人(现在 200 人),Lin 直言"我们对你来说太小了",但请他帮忙面试高管、搭建团队,去年底增长加速后才正式加入。她欣赏他"经验极丰富却不带'电影我都看过'的傲慢",其 GTM 团队全员用 AI agent 共享技能,以有限人数匹配超线性需求曲线。快问快答中:过去 12 个月最大的观念转变是"敢于快速扩张"——他们摸索出识别"极端所有权"人才的方法(不设格子,主动认领端到端问题、无论如何交付);从 Jensen 学到的领导力课是"领导力就是判断力,不是特权"——Jensen 一分钟回邮件、事事在细节里,因为高速行业等不起层层传递的信息损耗;最后悔没早做的是 marketing——"营销不是浮华,是教育和清晰度"。三年后她清晰看到的未来:"每家公司都将拥有自己的智能,这是必选项而非可选项"——正如每家公司都拥有自己的软件栈,因为每家公司解决的都是独特问题,需要完全的控制权。

金句

如果未来世界被一个标准统治、品味由一家公司决定,我们就把自己变成了机器人军团——这让我非常沮丧。 —— Lin Qiao 6:57
产品市场契合和持久的生意,如今是两个分离的概念——你可能一路规模化,规模化到破产。 —— Lin Qiao 15:32
未来不会是少数几个 AGI 模型统治世界,未来将是数百万个专用模型,每个应用、每个用例一个。 —— Lin Qiao 20:58
我们今天每天处理超过 40 万亿 token,其中大部分来自定制模型,而非现成模型。 —— Lin Qiao 40:27
我可以想象未来三年 10 倍的成本压缩,而这 10 倍降价将驱动 100 倍的用量。 —— Lin Qiao 50:35
领导力就是判断力,不是特权。你必须掌握正确的上下文,才能为团队做出正确的判断。 —— Lin Qiao 81:44

提到的书·产品·人物

适合谁听

关注 AI 基础设施投资、推理成本曲线与"开源 vs 前沿实验室"路线之争的投资人、创始人和工程负责人。

← 返回全部观看原片 ↗