核心要点
- 不是泡沫:Roman 认为 AI 基建需求才刚开始,企业只在最初几个用例和最小比例工作负载里使用 AI,未来需要的容量可能是几十倍甚至上百倍。
- 便宜即增量:DeepSeek 让 Nebius 股价一周跌约 40%,但同一周却成为公司史上最好的销售周,因为更便宜的智能反而释放了更多生产推理需求。
- 四层产品:Nebius 从裸金属 megawatts,到多租户 GPU hours,再到托管推理 tokens,未来还想服务端到端 agent 任务预算与质量优化。
- 全栈防御:Roman 承认只做大客户裸容量会赚钱但集中度高,所以 Nebius 从数据中心、机架、服务器到软件平台做 full-stack integration。
- 推理飞轮:企业从闭源模型转向可调开源模型时,真正难点是评测、部署、缓存、可观测性、模型迭代和 CI/CD 式 AI 生产流程。
- 资本约束:Nebius 今年 capex 计划约 200-250 亿美元,而 hyperscalers 大约是 8-10 倍;资本 6 个月内帮不上忙,但 18-24 个月能解锁并行建设。
- 最大威胁:Roman 说 Nebius 最大风险不是竞争,而是世界过度集中到少数超级模型、超级公司和超级帝国,那会把 Nebius 压回物理供应商角色。
章节时间轴
- 0:00 AI 基建竞赛开场 — 节目把 Nebius 放在资本开支创新高、AI 算力军备竞赛的中心。
- 1:31 泡沫还是开端 — Roman 明确否认 AI 基建泡沫,认为 useful AI 和企业真实采用才刚开始。
- 4:38 闭源与开源的分工 — 他解释企业先用 OpenAI、Anthropic、Google 等前沿模型跑通用例,再转向可调、可训练的开源/专用模型。
- 9:14 DeepSeek 周的反直觉 — Nebius 股价因“智能变便宜”下跌,但销售却创纪录,因为便宜模型让更多生产推理经济上可行。
- 10:46 四个扩张维度 — Roman 说公司要同时加速容量、产品、客户工程和资本,这是基础设施公司的核心约束。
- 12:19 从 megawatts 到 tokens — 他拆解裸金属、多租户云、托管推理和未来 agentic layer 四层产品。
- 18:29 10 倍容量能否卖掉 — Roman 认为需求存在,但关键不是能否卖出,而是如何构建更健康的客户组合。
- 20:50 客户集中度与全栈战略 — Nebius 想服务多样化客户,而不是只给少数 hyperscalers 提供物理基础设施。
- 27:49 企业需求如何变化 — 从训练转向推理不是同一批 GPU 改用途,而是需要数据、评测、优化和应用迭代飞轮。
- 34:46 Token Factory 是什么 — Roman 用从 OpenAI 切到开源模型的例子,解释托管推理如何替客户处理复杂 plumbing。
- 41:49 Revolut 与企业冷启动 — 企业先建立 eval 和安全切换机制,一旦能快速 shipping,AI 消耗会指数级增长。
- 50:21 欧洲主权 AI — Roman 认为欧洲不只需要 megawatts,更需要 Lovable、Black Forest Labs、Mistral 这类 builder 需求层。
- 54:14 与 Nvidia 的关系 — 他认为赢得 Nvidia 尊重的基础是工程师对工程师的能力,而不是谈判姿态。
- 57:17 资本、社区与数据中心 — Nebius 需要更快建数据中心,但数据中心审批、社区沟通和供电组合都是真实约束。
- 68:53 最大威胁是集中化 — 若世界由少数超级公司控制,Nebius 这类公司只能退回供应物理层。
详细内容
一、为什么 Roman 认为 AI 基建不是泡沫
Harry 开场就问最尖锐的问题:这么多资本涌入 AI 基础设施,是否已经是泡沫?Roman 的答案是“不”。他的判断来自企业采用的阶段:即使是技术先进的大公司,AI 也只进入了第一批用例、第一小部分工作负载。编码是刚刚在规模上跑通的用例,而且也只是几个月到一年内的事。若一个用例刚开始起量,就把基础设施建设视为尾声,时间点错了。
他承认自己有立场,因为 Nebius 就在这个行业里,但他的逻辑是需求并没有被满足。每次智能单位成本下降,人们并不会减少使用,而是开始解决过去知道可解、但经济上不可行的问题。DeepSeek 是他的核心例子:市场一度担心更便宜模型会伤害基础设施公司,Nebius 股价一周跌约 40%;但同一周,公司反而迎来史上最好的商业周,因为客户发现生产推理终于能跑出经济性。
这也是 Jevons paradox 在 AI 里的版本。Roman 认为,便宜不会摧毁 OpenAI、Anthropic 或基础设施需求。前沿模型继续向更难任务移动,开源/专用模型则在已验证用例里降成本、提质量。市场不是一个固定蛋糕,而是因为更多任务可行而变大。
二、Nebius 的四层业务:从供电到任务执行
Roman 把 Nebius 的产品演进拆成四层。第一层是裸金属容量,用 megawatts 说话。客户是 Meta、Microsoft、OpenAI 等少数巨头,他们有自己的软件栈,主要需要大规模物理基础设施。第二层是多租户云,用 GPU hours 说话,面向上百上千个研究团队,提供存储、计算、网络、虚拟化、API、可观测性和安全等标准云能力。
第三层是托管推理,用 tokens 说话。客户不想比较 B200、H200、B300,也不想自己部署 vLLM、SGLang、缓存和优化。Nebius 的 Token Factory 就是把开源或专用模型变成生产级推理服务,让垂直 AI 公司和企业可以按 token 消费,而不必管理底层集群。
第四层还带有推测性:未来 agentic 应用可能不再关心调用哪个模型、生成多少 token,而是关心一个端到端任务能否在预算和质量约束下稳定完成。平台可以决定该用更强模型、两个轻量模型加 judge、多少上下文、怎样保证 repeatability。这不是简单和 OpenRouter 竞争,而是把 agent 的经济性、可靠性和可重复执行做成系统问题。
三、为什么不能只做大客户裸容量
Harry 追问客户集中度:若 Meta、Microsoft 这类客户需求巨大,为什么不专心给他们供容量?Roman 承认大客户裸金属订单会很赚钱,但长期风险是收入集中、价值层很薄。巨头客户带来自己的软件栈,Nebius 能增加的价值主要在物理层,且客户数量极少。
Nebius 因此从 day zero 就做软件平台。Roman 说,公司长期策略是服务尽可能多样化的客户组合:裸金属层只有十几个全球客户,多租户云有数百个,托管推理有数千个,未来 agentic layer 可能有数万个开发者。越往上,客户更多,Nebius 可创造的价值也更高。
这也是他对“差异化”的回答。他不愿直接比较 CoreWeave 等同行,而是强调 full-stack integration:向下控制数据中心、机架、服务器和平台,挤出成本并提高交付速度;向上构建产品,跟随客户从训练走向推理、从模型走向应用、从 AI-native 走向 enterprise。
四、开源模型不是免费午餐,托管推理解决的是 plumbing
Roman 对开源模型的看法很务实。企业通常先用 OpenAI、Anthropic、Google 等前沿闭源模型构建产品,因为这些模型能力最好、最容易用。等用例跑通、客户数据循环出现、成本或质量成为瓶颈时,企业会考虑迁移到开源或专用模型。
但这一步并不轻松。你从 Hugging Face 下载权重、找一个推理引擎,并不会自动得到 OpenAI 式的生产服务。真正麻烦的是部署、调优、缓存、编排、可观测性、可靠性、规模化供给,以及不断跟上新模型。Roman 说 Token Factory 的价值,就是让客户不用处理这些 plumbing。
他提到推理成本可通过蒸馏、speculative decoding、缓存和部署优化等方式大幅下降。客户口头上看 GPU 每小时 3、4、5 美元,但真实成本取决于平台能从模型里榨出多少 tokens、稳定运行多久、对具体用例优化到什么程度。名义 GPU 价格不是全部。
五、企业 AI 的冷启动:评测先于规模
Roman 对企业采用的观察很具体。他说大家总说“训练转推理”,但真实变化是客户开始构建具体产品,有增长曲线、有单位经济、有数据飞轮。推理会产生数据,数据被观察、标注、筛选后反哺模型和应用,形成持续改进。
Revolut 是他给出的案例。早期他们大部分推理预算在 OpenAI 等闭源模型上,后来部分用例经济性不成立,于是开始迁移到开源模型。但迁移不快,因为他们首先要建立内部 engine,尤其是 eval:怎么知道换模型后没有毁掉质量?怎么把 AI 开发做成 CI/CD?怎么安全地把模型变更接入生产?
Roman 认为外界容易低估这个冷启动阶段。一旦强团队建立评测、决策和发布机制,增长会非常快,AI 消耗会像 AI-native 公司的 ARR 一样指数增长。Revolut、Shopify、Booking.com 这类 cloud-native 或数字公司,解决冷启动后可能会疯狂增加 AI 生产负载。
六、资本密集、Nvidia 关系与现实世界约束
Nebius 处在资本极其密集的游戏里。Roman 说公司今年 capex 计划约 200-250 亿美元,而竞争的 hyperscalers 大约是 8 到 10 倍。若给他无限预算,他会更快建数据中心并塞满 GPU。但他也承认,资本在不同时间尺度上作用不同:未来 6 个月,资本帮不上忙,因为能交付什么已经基本锁定;12 个月可加速一部分;18-24 个月则能真正解锁并行项目。
与 Nvidia 的关系也是基础设施公司绕不开的问题。Roman 的回答很简单:做好自己的工程。Nvidia 仍是一家工程师驱动的公司,如果 Nvidia 工程师尊重你的工程师,在硬件、软件、推理平台层面建立工程到工程的关系,合作基础就会更稳。
数据中心还面对社区和监管。Harry 提到公众对 AI 数据中心反感上升,Roman 说这是新基础设施公司的现实环境。Nebius 的做法是把项目组合做得足够冗余,一个地点延期时其他地点还能交付;同时在美国等新容量集中地与当地社区解释、沟通、回应合理担忧。
七、集中化是 Nebius 和社会的共同风险
节目后段,Roman 谈到欧洲主权 AI。他不认为主权 AI 只等于 megawatts 和电力。基础设施会在有需求时被建出来,而需求来自 builder 层。欧洲需要更多 Lovable、Black Forest Labs、Mistral 这样的研究和产品公司,形成需求飞轮,才可能有本土模型和本土基础设施生态。
当被问到 Nebius 最大威胁时,他说不是竞争,而是 consolidation。如果世界最后只剩三到五个超级模型、超级公司、超级帝国,那么 Nebius 或类似公司只会被需要在物理层服务这些巨头。相反,世界越民主化、越多元、越多独立 builder,Nebius 的平台价值越大。
他的结尾也很克制。Leo Aschenbrenner 披露大比例持仓让市场兴奋,但 Roman 说这只是“别人给你执行机会”的信号。每个客户、每个投资人给的都是信用,下一步就是回去交付。他用一句话概括基础设施公司的生存方式:像鲨鱼一样,只有移动时才活着。
金句
我不认为这是泡沫,我们才刚刚进入 useful AI 的真实采用阶段。 —— Roman Chernin 1:31
每次智能变便宜,我们不是减少消耗,而是开始解决更多过去经济上不可行的问题。 —— Roman Chernin 9:59
如果你不够大,没有人需要你存在。 —— Roman Chernin 10:46
在基础设施之外,真正的价值是让模型工作、优化、可靠,而不是只谈模型能力。 —— Roman Chernin 50:21
最大威胁不是竞争,而是世界过度集中。 —— Roman Chernin 68:53
提到的书·产品·人物
- Nebius(公司):本期主角,AI 基础设施和云平台公司。
- Roman Chernin(人物):Nebius 联合创始人,本期嘉宾。
- Harry Stebbings(人物):20VC 主持人。
- Nvidia / Jensen Huang(公司/人物):AI 基础设施核心供应商,Roman 多次提到 Nvidia 工程文化。
- OpenAI / Anthropic / Google(公司):前沿闭源模型提供商,被 Roman 作为企业启动用例的常见选择。
- DeepSeek(模型/公司):被用作“智能变便宜反而释放需求”的案例。
- Token Factory(产品):Nebius 的托管推理平台,帮助客户运行开源或专用模型。
- vLLM / SGLang(技术):开源推理引擎,被用来说明客户自建推理服务的复杂度。
- Revolut / Shopify / Booking.com(公司):Roman 用来说明企业 AI 冷启动和指数级消耗增长。
- Lovable / Black Forest Labs / Mistral(公司):被作为欧洲 builder 层和主权 AI 需求生态的例子。
- Leo Aschenbrenner(投资人):披露 Nebius 大比例持仓,被节目提及。
- CoreWeave(公司):Harry 用来比较 neo-cloud 差异化的参照。
适合谁听
适合关注 AI 基础设施、推理经济学、开源模型落地、云平台战略和资本开支周期的创始人、投资人、工程与产品负责人。