核心要点
- 每 10 小时一个模型:光是 7 月,OpenRouter 就上线了 70 个模型,平均每 10 小时一个;Atallah 判断这个速度还会加快,因为 Cognition、Cursor 这类 agent 实验室都有强烈动机自研模型并通过 agent 分发。
- 降价 10 倍,用量 13 倍:OpenAI 把 GPT-5.6 Luna 降价 5 倍、又与 OpenRouter 协同降了 2 倍,两周内总价降 10 倍,用量涨了 13 倍,这是一个几乎没有混杂变量的杰文斯悖论实证,且用量此后保持稳定增长。
- 美国非常落后:被问到是否该担心中国开源模型时他直接说"我们该担心,美国还非常非常落后";GLM 5.2 是开放权重模型的一次大跨越,Kimi K3 则是 Moonshot 追到了这一台阶,但在长程和网络安全能力上仍逊于前沿模型。
- 差距会变大:Harry 提出中国开源模型有国家意志加持——资金、政策、监管全部让路,而美国募资做开源模型商业模式存疑;Atallah 说他的担忧正是 12 个月后差距会更大,中国研究员的水平被美国人严重低估。
- 企业更怕前沿模型:反直觉的一手观察——美国企业对前沿模型的紧张程度高于中国模型,因为前沿模型的数据政策充满不确定性、无法在自己选定的环境里运行,而这种不确定性正好能被"自建机房 vs VPC"的旧心智模式套用。
- 推理层不会被吃掉:为什么超大云厂商不把 GPU 全买走挤死推理商?因为英伟达的头号优先级之一就是避免客户集中,它需要计算层的异构与竞争;同一个 Kimi K3 在不同推理商上的静态基准跑分差异明显。
- 员工成本变成动态数字:他认为最被低估的管理变革是——每个员工的实际成本因模型选择而实时浮动,公司应该把"是否高效使用贵/便宜模型"和绩效并列成四象限,处理那个"AI 精神病爆表"的关注象限。
章节时间轴
- 0:45 从 OpenSea 带走了什么 — NFT 爆发时服务器融化的经历,让他把"哪怕没有负载也要做 10 倍压测"的基础设施纪律带进了 OpenRouter。
- 3:47 没预料到的事:推理商成了一个市场 — 早期以为开放权重模型的托管会被三大云垄断,结果 Fireworks、Together 这类公司跑得更快,逼得 OpenRouter 从"探索工具"变成真正的市场。
- 5:18 推理层会被商品化吗 — 从供给紧缺、英伟达反客户集中的动机,讲到"token 不等于 token",以及路由器如何在 5 分钟粒度上追踪质量、速度、价格变化并即时分流。
- 10:43 专属模型时代对 OpenRouter 是好是坏 — Atallah 反驳"公司自研专属模型会锁死在单一模型"的假设,用博弈论论证多模型未来的必然性与"神经多样性"命题。
- 14:33 人人都在做路由器 — 为什么"做路由因为它时髦"注定落后:心态从赢变成陪跑,且削弱了用户的杠杆;以及 5.5% 抽成、企业承诺消费、自带 key 免抽成的定价结构。
- 18:21 三年后的收入主线与降价问题 — 市场持续低估自己的推理需求,OpenRouter 的价值在于兜住计划外用量;随后是 Luna 降价 10 倍、用量涨 13 倍的杰文斯样本。
- 23:00 你的排行榜有多大代表性 — 坦承对前沿模型存在低估,因为纯 OpenAI 单一供应商的公司根本不会出现在平台上,但这类公司正在快速减少。
- 25:17 企业到底怕不怕前沿实验室 — 从 Claude Design 与 Figma 的冲击谈起,提出模型实验室"拿下一个个团队"的战略动机,以及哪类创业公司真正处于近期威胁区。
- 30:43 中国开源模型与安全责任 — 是否有责任把公司路由到中国模型;OpenRouter 的做法是提示注入防护、PII 脱敏等可一键开启的安全层,"你不能因为互联网上有坏东西就禁掉互联网"。
- 36:08 Kimi、GLM 与写作能力 — Kimi 的声音与文风比很多前沿模型好,后者在变强于编码时出现了"文风退化"。
- 41:32 开发者忠诚度与记忆的归属 — churn 数据显示确有粘性,原因是"我的应用能跑就别动它"、新模型未必更便宜、以及每个人心里那套私人 eval;记忆会在模型层、推理层、应用层、路由层同时被争夺。
- 45:23 harness 会不会吞掉路由器 — 早期押注"用户会在意用哪个模型"已被验证;harness 相较 app 的核心优势是可组合性与 Unix 亲和性,"围绕 app 编排有太多未知的未知"。
- 50:03 Meta Muse、Arena 与模型的效用化 — Muse 有资源但还没找到"我们就是这个最强"的时刻;Harry 自陈用 Arena 发现了 Pergamon 这类自己永远不会主动去用的模型。
- 53:07 一个前沿模型 + 四个开源模型的架构 — 编排模型调用低成本子代理处理确定性任务(如文本分类),再由编排者读结果继续非确定性工作。
- 54:39 如果让你重建美国开源生态 — 两件事:搞清楚蒸馏中国开放权重模型的有效性(且蒸馏时能看见输出,反而更容易检查对齐),以及把算力送到对的人手里。
- 57:46 蒸馏是不是不光彩 — "它就是一种造模型的技术",闭源实验室自己也在蒸馏(Sonnet 就是 Opus 的部分蒸馏版),但实验室有权在服务条款里禁止竞争性蒸馏。
- 58:32 100 亿美元卖给 Stripe? — 不予置评,但强调无论发生什么都会执行既定愿景;随后谈他想用个人资本资助那些"没有商业模式所以拿不到钱"的问题。
- 61:38 快问快答 — 最被低估的模型是 Poolside;"70% 的 Neolab 会死"他改判 50%;他欣赏 Anthropic 的偏执;最期待罕见病研究和众包式城市生活改善。
详细内容
一、从 OpenSea 到 OpenRouter:一条关于"永不宕机"的路径依赖
Atallah 的创业起点是 OpenSea,第一个 NFT 市场。他描述那段经历时用的词很具体:2020 年 10 月 NFT 突然爆发,团队严重人手不足,服务器在融化,搜索索引在爆炸,连续几次大规模宕机。"我最大的目标是别让我们变成加密世界的 Twitter fail whale。"
他从中提炼出的方法论不是"扩容",而是在还没看到负载的时候就为 10 倍负载做压测。原因是加密市场的流量高度依赖内容和社区情绪,完全不可预测——你没法等到需求来了再准备。
这套纪律被他原封不动搬到了 OpenRouter,而 AI 市场恰好复制了同一个特征:所有公司(尤其 Anthropic)的增长都不可预测。他说 OpenRouter 也有过几次小磕碰,但整体状况"显著更好",而这份能力"是 OpenSea 硬灌给我的"。
二、他没预料到的事:推理商本身长成了一个市场
Harry 问:回到创立时的判断,模型生态里发生了什么是你没想到的?
Atallah 的答案很具体:他没预料到会冒出一整个生态的公司来托管和服务开放权重模型。早期的默认预期是这块会是三大超大规模云厂商的垄断地盘,创业公司远远落后。
现实完全相反。他反问:"你多久听到有人在超大规模云上跑 GLM?从来没有。大家用的是 Fireworks、Together 这些推理服务商。"这些公司托管新模型的速度远快于云厂商,也更愿意去啃那些托管边角案例。
这个误判直接改变了产品形态。早期 OpenRouter 的字段叫 "provider one" 和 "provider fallback",它甚至不显示是谁在托管——因为当时他们不认为自己是市场,只是一个"发现新 LLM 的探索工具"。他们本来想做的是模型实验室的市场,而推理商这一层"我们不确定会不会成为一个市场"。结果它成了,而且宕机问题被证明不会被供给侧自动解决。
三、推理层会被商品化吗:英伟达不想要客户集中
针对"推理商这层会被竞争抹掉毛利"的流行论调,Atallah 给了一个结构性反驳,链条分两段。
第一段是供给约束。 当前市场处于严重供给紧缺状态,而且大概率还会紧缺很久——所有推理商基本上一直缺货。
第二段是英伟达的动机。 既然 GPU 这么值钱,为什么 Google、Amazon、Azure 不干脆把 GPU 全买走、把推理商挤死?"因为造 GPU 的人不想要这个结果。英伟达的头号优先级之一就是没有客户集中。"它希望有大量客户各自持有独立的算力配额,希望市场是异构的,希望计算层有竞争。
他补充说这对生态和终端用户也是好事:这让推理商能各自创新出更好的服务方式。证据是同一个模型在不同推理商上的表现差异是可测量的——Moonshot 刚发过一份基准,展示所有推理商服务 Kimi K3 的成绩,"对于那些非常静态、非常知名的基准,分数居然差挺多"。OpenRouter 自己就在 7×24 持续跑这类测试,"结果一直在变,这些模型很情绪化、很不确定"。
Harry 引用 Fireworks 的 Lynn 反驳过 Gavin Baker 的"token 就是 token":一个推理商能让同一个 token 走得更远,"就像去商店,你可以绕整个街区,也可以直接开过去"。Atallah 认同,并指出这正是路由技术的价值所在——一旦检测到某个供应商出现质量提升、提速或降价,它会立刻获得更多流量,而这种变化对大模型来说"每 5 分钟就会发生一次"。
被追问只能投一家推理商投谁时,他保持中立,但透露了偏好方向:做定制硬件和底层优化的,以及在解决定制化门槛的——比如把微调产物做成可移植的 LoRA/"cartridge",未来换基座模型可能只要几十到几百美元。(Harry 直接翻译成"我懂了,你最爱 Fireworks"。)
四、专属模型的未来:为什么多模型是博弈论上的必然
Harry 抛出一个对 OpenRouter 商业模式的直接质疑:如果每家公司都有自己训练的专属模型,用户就锁死在自家模型上,不再需要模型市场了,这对你不是坏事吗?
Atallah 明确反对,理由分两层。
第一层是"神经多样性"的创造力论证。 假设真有一个模型满足了你所有需求,越来越多人用它——然后有人决定造一个"神经非典型"的模型,说话方式不同、因为训练数据完全不同而能想到第一个模型永远想不到的点子。这立刻就创造出同时使用两个模型的需求。他强调关键在于创造力不可验证:"你没法给创意点子打一个简单的分数。而两个模型一起用,比只用一个更可能得到有创造力的结果——如果那个模型是用不同方式、不同数据训练的,这就是事实。"
第二层是博弈论。 你自研了模型,但你周围整个生态也在做同样的事,所有模型应用都在用新获取、新购买的数据不断造新模型——那些都是对你潜在有价值的数据。那么你的最优策略是什么?去试别人的模型,看能不能更高效、能不能融合出更好的 SOTA、能不能降低成本。"不管你的目标是提高毛利还是把公司做大,你都被激励去用生态创造出来的东西。"
由此他推出一个对企业的建议:这个市场会是"科技史上最大的市场,可能是人类历史上最大的市场",没人能赢下全部,你也造不出赢下全部的模型。所以不如造一个以某项对你的业务极其重要的能力著称的专精模型——"你的品牌是护城河的一大部分,而那个模型会成为你的品牌四处流通的方式。"
五、"很多公司做路由器是因为它时髦"
Harry 列举了 Ramp、Merge 等公司陆续发布路由产品,问路由技术是不是正在被商品化。
Atallah 的反击有两条。
第一条是心态问题。 "很多公司做路由器是因为这时髦。"这立刻把你放进了抄袭的心智而不是取胜的心智——"你是在为了存在而玩,不是为了赢而玩",或者你只是想服务现有客户、想蹭一点 AI 增长。这会让那个网关"落后专注做这件事的公司很多个月"。他强调对比:"我 100% 专注于做最好的路由器、网关和 LLM 市场。这对我们不是支线任务,对某些公司可能是。"
第二条更本质:半吊子网关会削弱用户的杠杆。 他的信念是给开发者更多模型访问权 = 给他们对 AI 全部创新的杠杆。如果你搭在一个不给你完整市场、完整灵活性、完整可定制性的网关上,"你就被切断了——你把公司里所有员工需要的东西都给切掉了"。
关于定价:5.5% 是按量付费方案;后来加了企业方案,逻辑完全不同——基于承诺消费额,承诺部分不收费,他说这个方案很成功。他也承认定价模型不够细是"我们的锅",即将推出自助式商业方案。还有一个关键点:自带推理、自带 key,抽成就消失——只有当你用 OpenRouter 自己的容量时才收这笔费,因为他们需要能预测需求。
被问三年后的主要收入线时,他的答案是"取决于经济":如果 AI 市场维持 10~15 倍的年增长,那么人们会持续低估自己需要多少推理,而 OpenRouter 最擅长的正是兜住计划外的推理容量——最需要试没预料到的模型、用超预期的量的时候,靠故障转移和可用性保证不出事。
六、杰文斯悖论的一次干净实证
Harry 提出一个尖锐问题:18 个月里 token 价格跌了约 90%,你按消费额抽成,饼在缩小,降价对你不是坏事吗?
Atallah 承认大家都在谈杰文斯悖论(降价 10 倍、用量涨超过 10 倍),但"没人真正把它建模清楚"。不过他手上有一个非常干净的样本:
- OpenAI 把 GPT-5.6 Luna 降价 5 倍;
- 又与 OpenRouter 协同降了 2 倍;
- 两周内累计降价 10 倍;
- 用量增长 13 倍。
"这是一个接近完美的杰文斯故事——降价 10 倍,用量增长超过 10 倍,就多一点点。"更重要的是后续用量很稳定:涨到 13 倍后走平,然后以触及 13 倍之前的同样斜率继续增长。他强调这个样本混杂变量很少,而且它发生在 DeepSeek 发布、GLM 也有很好价格的当口。
结果是一个信号强烈的事件:Luna 在 OpenRouter 上的用量已经超过 GLM(GLM 曾经是 token 量前三四的模型),这是"很长时间以来 OpenAI 第一次有模型进入我们平台 token 量前三到前五"。
Harry 顺势质疑排行榜的代表性:OpenRouter 大约只占全市场 1.5%~2% 的 token 量,很多人会说"用前沿模型的人直接走 API,根本不算进去"。Atallah 的回应是坦诚的:他们通过调研估算偏差,确实存在对前沿模型的低估,因为平台天然吸引相信"未来是多模型"的公司,而那些"我们是 OpenAI 店,只用 OpenAI 模型"的公司根本不会出现——不过他补充说,这类公司他现在已经极少遇到了,随着多模型论普及和平台规模扩大,数据会越来越有代表性。
七、企业怕谁:一个反直觉的答案
Harry 引用 Alex Karp 在 CNBC 上的说法:企业对与前沿模型厂商合作感到恐惧。
Atallah 的观察更细。他确实看到过一波不安,特别是 Claude Design 发布冲击 Figma 的时候。他给出的判断框架是:如果你只是在智能之上做一层"去市场化包装"——做好集成、定制系统提示,把 AI 带进某个行业——只要模型实验室不在乎那个市场,你就没事,而这样的市场会有很多。
但模型实验室有几个动机最终会来找你。他重点讲了其中一个:让它们真正在乎的公司里的多个团队依赖它们。"这就是我认为 Claude Design 具有战略性的原因。它对 Anthropic 来说可能不是一笔大收入,但它让设计团队开始真的在乎 Anthropic 的模型。"于是公司里又多了一个团队想留在 Anthropic。所以近期威胁最大的是那些"我们服务的团队,恰好对模型实验室在乎的公司变得战略性了"的创业公司。
至于 Claude Design 会不会实质冲击 Figma:他说自己看到很多设计师去试了,包括自家的,但没听到重复使用的故事;而且 Figma 的财报"非常非常漂亮"。(Harry 顺势吐槽:"所以你不想上市啊,兄弟——数字这么好,Figma 还跌。")
而在中美问题上,他给出的答案是反直觉的:美国公司通常更紧张前沿模型,而不是中国模型。原因是数据政策上的困惑要大得多——我发出去的提示词到底怎么处理了、存在哪、谁在看;而且你没法在自己的机器上或自选的供应商那里跑它。这种不确定性还很容易被企业套用旧的心智模型(自建 infra vs VPC、谁能看到数据)。Harry 对此的感慨是:"他们更怕总部就在硅谷、你能看得见摸得着的美国公司,这世界真是奇怪。"
八、中美开源差距:他的恐惧是差距会变大
被直接问到"我们该不该担心中国开源模型的速度和质量",Atallah 的回答没有修饰:"该担心。美国还非常非常落后。" 他补充说情况在好转,poolside、Thinking Machines、RC 都在推进。
对具体模型的评价也很克制。他说最新的 Kimi 模型"相当好",但在网络安全能力和长程任务上仍不及前沿模型;真正的台阶是 GLM 5.2——"对开放权重模型来说是非常大的一步",而 Kimi 是 Moonshot 追上了这个台阶。他额外称赞 Kimi 的写作:"声音和语气都挺好。"相比之下,一些前沿模型在变得更擅长编码时出现了文风退化——"输出读起来像是你提的四个论点里三个对、一个是转折点,然后是'问题在于'⋯⋯有时候根本没法读"。他认为这可以修好,但 Kimi 一直写得挺有意思。
关于 12 个月后差距会更大还是更小,他说自己的恐惧是会更大。Harry 补上了完整的结构性论证:DeepSeek 成为中国的国家冠军,"这是我们的 AI 赛马",资金与补贴倾斜;再冒出一个 Moonshot,监管让路、政策让路、资金到位,"你可以自由狂奔"。而在美国,为一个开源模型募几十亿美元很难,商业模式存疑,AI 研究极贵,还要和 OpenAI、Anthropic 竞争。他的结论是中国开源厂商"所处的比较性环境让它们天然占优,很遗憾"。
Atallah 补了一条美国人普遍低估的事实:中国的研究员非常非常好。但他也指出中国方面会担心自家模型的网络安全表现,而且显然非常在意审查。他抛出一个自己想不通的问题:中国模型对国外用户能力很强,那么当模型对中国越来越重要时,他们会放弃防火墙吗?"我从没见过有人认真做过一份深度分析:DeepSeek 能让你做到哪些在中国境内互联网上做不到的事?它到底越过防火墙多远?"
Harry 提供了一个具体的反差:中国模型在境外能力惊人,在境内实际相当受限,护栏"极其严苛且限制性强"。他举了朋友 Jason 的例子——在 DeepSeek 上问不出星巴克几点开门,会被回"不允许"。"讽刺的是他们在国外远比我们强,在国内却很糟。"
九、安全责任、蒸馏与"给我一个美国开源计划"
Harry 追问一个尖锐的责任问题:你是路由生意,可能把公司路由到中国模型——后门、政府介入的担忧都存在,你有责任感吗?
Atallah 的回答是有,且落在具体机制上:客户信任是首要目标;如果某个模型被普遍认为不安全,就从平台下架;而如果只是"存在不安全的用法"——所有模型都存在——那就用技术手段解决,并直接和模型实验室对齐它们的做法,做到"和最好的实践同步或更好"。
因为 OpenRouter 是很多人第一次接触新模型的地方,它是部署全公司安全措施的天然节点。他列举了可以一键开启的能力:提示注入检测与标记、PII 脱敏,以及另外几项自动安全层。他的类比是:"模型有点像互联网。你不能因为互联网上有坏东西就在公司禁掉互联网。你可以也应该建护栏,而且你需要用 AI 来造最好的护栏。"
关于"你真的知道 Moonshot 或阿里的通义内部在发生什么吗",他不装懂:"我不能假装知道它们内部的情况。作为一家美国公司,我们会遵循美国的最佳实践,确保自己不做不负责任的事。"
Harry 让他假设自己被任命为"美国开源生态负责人"。他的两条方案是:
1. 搞清楚蒸馏的实际效果。 多和现有美国实验室聊,弄明白蒸馏中国模型对它们意味着什么、有多有效。开放权重模型(以及大部分中国模型)允许蒸馏,这意味着你可以拿它们的输出做强化学习。他还指出一个被忽视的好处:蒸馏时你看得见输出,所以如果你担心这些模型在价值观或"宪法"上有问题,在 RL rollout 阶段你反而更有机会抓出来。
2. 解决算力问题。 算力仍是美国相对中国的巨大优势,但 Neolab 需要一个机会,"需要有更容易的方式把算力送到对的人才手里"。他会和所有硬件公司合作——英伟达、Google 的 TPU、Amazon 的 Trainium,以及新兴芯片公司。
Harry 泼了一盆冷水:这个算力优势不会持续太久,DeepSeek 和字节都在激进自研芯片,出口管制逼着它们必须这么做,这是习近平在 AI 竞赛里的头号问题——"他们四周能建一座桥,六个月我看能搞出一颗芯片。"Atallah 同意,"在芯片战上保持领先对美国至关重要"。
至于"蒸馏是不是不光彩",他的立场很干脆:它就是一种造模型的技术。闭源实验室自己也蒸馏——"Sonnet 就是 Opus 的部分蒸馏版本",这就是从大模型造小模型的方法。他同时承认实验室有权在服务条款里禁止,可以切断试图造竞品的人;但如果你只是造一个专注做一件具体事的小模型,那不构成竞争,据他所知大多数前沿实验室不禁止这个。
十、粘性、记忆与 harness:谁能留住用户
Harry 问平台上是否存在开发者忠诚度。Atallah 说确实有——尽管 OpenRouter 刻意把切换成本压到接近零。他们测量所有模型的留存与流失,并且把这些数据分享给模型实验室:新模型上线后是哪些模型给它导了流量,用户离开时又去了哪里。他说这些数据会逐步向外开放。
流失数据显示,确有开发者长期黏在某个模型上,即使存在对其用例更好的模型。他归纳了三个根因:
1. "我的应用能跑,我不想弄坏它。" 已经做完了所有优化、加好了所有护栏,客服机器人突然说奇怪的话意味着纯粹的麻烦。
2. 新模型未必更划算。 一般规律是现有模型价格随时间下降,而实验室出现新突破时智能跳一级、价格曲线也跟着跳上去,再慢慢往下走。所以切到最新模型未必是最省钱的选择,开放权重模型也一样。
3. 对输出的基本信任。 "如果我用模型干活,我喜欢它说话的方式,我大概心里有一套个人 eval。"很多人都有这种随手测试,新模型跑不好就直接算了。
关于记忆是不是留存机制,他的答案是"一直认为是,问题在于它住在哪一层":模型层、推理商、应用层、还是路由这样的基础设施层?他猜每一层都会试图以不同方式拥有记忆,各有优势——放在应用层,它拥有最多应用相关的上下文且模型无关;放在模型层,它在个性化基准上表现最好、可能带来最高的最终智能。他认为终局问题是能否组合使用(模型层记忆 + 基础设施层/应用层记忆同时用会不会把模型搞糊涂,"我们还不知道")。但有一点他很确定:没有任何一层能捕获全部有价值的记忆,因为应用手里握着模型实验室没有的大量重要上下文,实验室要拿到这些上下文就必须去激励应用。
最后是 harness 会不会在路由器独立之前就把它吸收掉。他先讲了 OpenRouter 早期的一个关键判断:2023、2024 年时大多数应用都在低估用户想自己选模型的意愿,很多应用甚至不告诉你底层用的是哪个模型——"人们不会在乎的,他们只想要 AI"。OpenRouter 当时的强信念是相反的:"人们会想用特定的模型,他们会在乎自己在跟谁说话——就像我解决问题时想知道自己在跟哪个员工说话。"这个判断被验证了,连 Notion 这种你以为会完全隐藏模型的应用,现在都让你选模型。
harness 发生了同样的事:开发者对不同 harness 产生了偏好,因为那是用户体验。这是他"最喜欢的 harness 会长期存在的论证"——而不是"harness 会和模型捆绑"。他甚至认为模型变强反而削弱捆绑:模型越强越足智多谋,塞进系统提示里的那些杂物就越是累赘。他引用了 Anthropic 的一篇文章:删掉系统提示里的东西之后,后续与用户提示的矛盾变少了、模型表现更好;而现在"很多 harness 都在删代码,以便在最新前沿模型上表现更好"。
Harry 半开玩笑地问 harness 和 app 到底有什么区别,"这不就是个词儿的把戏吗"。Atallah 的回答是可组合性:harness 可以调用另一个 harness,可以在云端沙箱里拉起另一个 harness。而围绕 app 组合时"未知的未知"太多——要不要登录?要密码吗?要开虚拟浏览器吗?找 API 得先翻文档。围绕 harness 组合几乎没有未知的未知,因为 harness 都是 Unix 基底的,而模型对 Unix 和 bash 命令训练得极好。而且可检查性更强:"API 调用你只能看一堆代码飞过屏幕;harness 我可以跳进去看,还能用英语讨论它。"
十一、被低估的管理命题:员工成本变成动态数字
在快问快答里,Harry 问他从这个独一无二的位置上看到了什么别人讨论得不够的现象。答案不是模型,而是成本管理。
他观察到大量公司在为推理支出恐慌,"不知道该怎么想这件事——这是一种全新的经营方式和 opex 观念"。他的对比很清楚:旧世界里员工成本是一个静态数字,发个薪水就不再想它,也许绩效评估后季度性调整一次。而现在,每个员工的成本都是完全动态、彼此不同的。
他预测这件事最终会下推到员工层:员工自己去判断哪个工具和模型最适合他的任务,然后"我们来算清楚你因为你的选择而花了多少钱"。他给管理者的建议是:照常做管理评估员工的产出与效能,但把它和员工的成本对齐,做成一个四象限——一个"庆祝象限"(干得好且性价比高),一个"关注象限"(活干得一般,成本还高得离谱,"AI 精神病爆表"),然后去处理关注象限。
Harry 提出了显而易见的反对:跟人说"你上个月值 100,这个月值 50"太难了。Atallah 的回应是这恰恰是好事,因为员工完全掌控自己的成本——"现在你可以想两件事了:我作为员工有多好,以及我有多高效。"
最后他谈到最兴奋的两件事,都不在商业层面:罕见病研究(他认为这是被智能、或者说被推理量卡住的领域,本质是需要大量试想法并验证)和众包式的城市生活改善——比如有人想找出全美国或全英国的每一根铅水管,有想法但需要成熟化和压力测试,现在 AI 可以做这件事。"我们可能会解决一些所有人都已经放弃的怪问题,因为你需要一个疯狂的点子从某个地方冒出来——聪明的点子在全世界是均匀分布的,现在你只是给了它们真正能起作用的杠杆。"
金句
在 7 月,我们上线了 70 个模型,大约每 10 小时一个。 —— Alex Atallah 29:09
我们该担心。美国还非常非常落后。 —— Alex Atallah 30:43
造 GPU 的人不想要那个结果。英伟达的头号优先级之一,就是没有客户集中。 —— Alex Atallah 6:03
很多公司做路由器是因为它时髦⋯⋯这让你是在为了存在而玩,而不是为了赢而玩。 —— Alex Atallah 14:33
价格降了 10 倍,猜猜用量涨了多少?13 倍。 —— Alex Atallah 21:28
模型有点像互联网。你不能因为互联网上有些坏东西,就在公司里把互联网禁掉。 —— Alex Atallah 33:04
你所有的员工现在成本都是完全动态、各不相同的。 —— Alex Atallah 63:58
提到的书·产品·人物
- OpenRouter(公司/产品):本期主角,LLM 统一网关与市场,5.5% 按量抽成 + 企业承诺消费方案,自带 key 免抽成。
- OpenSea(公司):Atallah 的上一段创业,第一个 NFT 市场,"服务器融化"的经历塑造了他的基础设施纪律。
- Stripe(公司):据报道曾开出 100 亿美元收购 OpenRouter,被问及时 Atallah 不予置评。
- Fireworks / Together(公司):被点名的推理服务商,托管开放权重模型的速度远快于超大规模云厂商。
- Lynn(Fireworks)(人物):曾在本节目提出"token 不等于 token"、以及"你不想租智能,你想拥有它"。
- Gavin Baker(人物):"a token is a token"论断的提出者,被 Lynn 反驳。
- NVIDIA(公司):其"避免客户集中"的战略被 Atallah 用作推理层不会被云厂商吃掉的核心论据。
- GLM 5.2(模型):被评价为开放权重模型的一次重大跨越,曾是平台 token 量前三四。
- Kimi K3 / Moonshot(模型/公司):追到 GLM 台阶的中国模型,写作声音与语气俱佳,但长程与网络安全能力仍逊于前沿模型。
- DeepSeek(公司/模型):Harry 用作中国"国家冠军"叙事的例子,也是境内护栏严苛的例证(问不出星巴克营业时间)。
- GPT-5.6 Luna(模型):两周降价 10 倍、用量涨 13 倍的杰文斯样本主角,也是 OpenAI 很久以来首次进入平台 token 量前列的模型。
- Claude Design / Figma(产品/公司):模型实验室"逐团队渗透"战略的案例;Atallah 未见到设计师的重复使用故事,且 Figma 财报很好。
- Anthropic(公司):被提及其"删系统提示反而表现更好"的文章;Atallah 表示欣赏它的偏执。
- Meta Muse / Alex Wang(产品/人物):被评价"做得不错、资源充足",但还没找到自己"我们就是这个最强"的定位。
- Arena / Anastasios(产品/人物):Harry 自陈的模型发现工具,让他用上了 Pergamon 等从不会主动尝试的模型。
- poolside(公司):Atallah 眼中平台上最被低估的模型来源,小而高效的美国编码模型新实验室。
- Thinking Machines / RC(公司):与 poolside 并列,被点名为美国追赶开源的力量。
- Jeff Dean(人物):被提及正在从 Google 出来创办 agent 实验室。
- Cognition / Cursor / Lovable(公司):agent 公司自研模型的例证(前两者已有模型,Lovable 尚未公开)。
- Notion(产品):被用作"用户在意选哪个模型"已被验证的例子。
- Alex Karp(人物):在 CNBC 说企业害怕与前沿模型厂商合作,Harry 以此提问。
- David Fialkow(General Catalyst)(人物):资助《The Dissident》《Icarus》等拿不到钱的政治敏感纪录片,被 Atallah 视为自己想做的公益模式范本。
- Dario Amodei(人物):快问快答中被问是否该更正面,Atallah 说他欣赏 Anthropic 的偏执。
适合谁听
关心模型市场真实供需、中美开源差距,或正在为公司设计多模型架构与推理成本管理的人。