← 顶级AI播客总结
Latent Space

晶圆级芯片的反攻:Cerebras CTO 谈 4400 TPS 与英伟达的速度天花板

The AI Chip That Could Break NVIDIA’s Bottleneck — Sean Lie, Cerebras CTO
节目时长 44 分钟 阅读约 18 分钟
▶ 在 YouTube 收看原片

Cerebras CTO Sean Lie 拆解 CS4/CS5、OpenAI 的 Jalapeño 与 Groq 新品,核心判断只有一句:200 tokens/s 正在变成新的「批处理」。

核心要点

  • 4400 TPS 的现场演示:CS4 基于新的 Nexus 模块化平台,对晶圆供电翻倍、互联带宽翻倍、延迟减半,Hot Chips 现场把 gpt-oss 跑到 4400 TPS 以上,Sean 自己形容「快到几乎像是假的」5:21
  • CS5 再翻一倍:明年的下一代晶圆芯片会让中型模型(gpt-oss、Gemma)达到 10000 TPS,Kimi、DeepSeek 这类前沿级模型达到 5000 TPS;Nexus 平台从设计之初就为多代产品预留了升级空间 11:29
  • 快就是智能:与 OpenAI 合作的 Ultra Fast 让其最强模型跑出 14 倍于常规 GPU 的速度;Sean 强调价值不在跑分,而在 agentic 循环能跑更多轮推理,最终得到更聪明的智能体 8:25
  • Jalapeño 真正的看点:Sean 认为 OpenAI 造出了一颗「显著更好的 GPU」已属不易,但最值得学的是其 AI-first 设计方法论——用 AI 加速造芯片本身,「这 100% 是这个行业的未来」16:53
  • Groq 的 30B 疑问:全新产品只公布 30B 模型的性能数字,且完全没提 Jensen 在 GTC 上讲了半小时的 attention/FFN 解耦;Sean 判断这暴露了非晶圆级 SRAM 设计的内存瓶颈,跑万亿参数模型需要成千上万颗 LPU 才装得下权重 22:21
  • 100 倍内存差:Cerebras 一颗芯片的片上内存约为对手单芯片的 100 倍,两个数量级的差距「几乎是白送的」,这正是当初必须做晶圆级集成的原因 23:54
  • 最大的未开采红利:所有模型都是为特定型号英伟达 GPU(B200、GB200、NVL72)设计的;只要允许模型架构做哪怕轻微调整,非英伟达硬件就能拿到巨大增益,Sean 称这是全行业最被低估的机会 30:48

章节时间轴

详细内容

一、硬件的黄金时代:Hot Chips 变了

Sean 用一段回忆开场。十到二十年前的 Hot Chips 是「一堆计算机架构极客围着 speeds and feeds 较真」的场合,今天它已经变成改变行业的硬件首发地——同一周里苹果发 M6、OpenAI 讲 Jalapeño、Groq 发新芯片、Cerebras 讲 CS4 和 CS5 1:32。

他给出的判断不是客套:这是半导体工业史上从未有过的创新密度,而且是全维度的——芯片本身、互联、系统设计、软件、光学、方法论、工具链,每一层都有人在推 3:03。对一个「骨子里是计算机架构极客」的人来说,这个阶段本身就让人兴奋,他说会场里那股 buzz 是真实存在的。

这段铺垫其实定义了整期节目的基调:Sean 反复强调他愿意「把 Cerebras 的帽子摘下来」评价同行,因为在他看来现在整个行业是水涨船高的关系,而不是零和。

二、CS4 与 Nexus:把晶圆级带进主流

CS4 的设计目标被 Sean 表述得很清楚:让 wafer scale 走向主流、走进超大规模数据中心,并解决日常遇到的高密度数据中心问题 3:49。

技术上的答案是一个叫 Nexus 的全新模块化系统平台:前面是模块化电源,后面是一个被称为 backpack 的模块化服务器。相对上一代,它给晶圆提供两倍的供电、两倍的互联带宽、一半的延迟,而且这些提升全部在系统架构层完成,而非靠单纯的工艺进步 4:35。

结果就是性能再翻一倍。Cerebras 一直自称「超快推理无可争议的领导者」,CS4 把这个前沿再推 2 倍,现场 demo 里 gpt-oss 跑出 4400 TPS 以上——Sean 的原话是「几乎感觉像是假的」5:21。

但他强调真正让他兴奋的不是这个大数字。速度会把原本属于批处理和离线的应用变成实时应用,而在 agentic 工作流里,用户是在等智能体一轮又一轮地循环;当模型跑到 4000 tokens/s 以上,你能做更多轮 agentic 循环、更多推理,最终得到「显著更强、更聪明的智能体」6:08。这是全期最核心的因果链:速度不是体验优化,速度直接兑换成智能。

三、从「证明能造」到「必须交付」

主持人提到一个行业转折:晶圆级这条路线过去多年不被认真对待,直到大家不得不认真对待。Sean 的回应把公司的阶段划得很清楚。

第一代芯片本质上是技术演示——要向世界也向自己证明这种东西真的能造出来。当时他们告诉很多人这是未来,「大多数人的反应就是:你们疯了,这不可能」7:40。

现在既然可行性和性能都已被证明,问题变成了「它能解锁什么」。与 OpenAI 的 Ultra Fast 合作是最好的例子:他们正在以 14 倍于常规 GPU 的速度运行 OpenAI 最大、最强、最智能的模型,最聪明的模型叠加硬件带来的速度,产生了「彻底的变革性」效果 8:25。

因此公司的重心也变了:现在的全部精力是确保规模化——把产能拉起来、把用户真正在乎的模型跑起来,同时靠持续推出更快的硬件来维持飞轮 9:11。Sean 说这个展开方式「几乎比我们能想象的还要好」,因为硬件能力成熟的时点,恰好撞上了模型和应用能力成熟的时点。

四、CS5 与产能分配:为什么普通人还用不上

CS5 的关键在于 Nexus 是一个多代平台。它从设计之初就与明年的下一代晶圆芯片一起规划,那颗芯片会带来又一个 2 倍性能提升。落到用户可感知的数字上:gpt-oss、Gemma 这类中型模型可以跑到 10000 TPS,Kimi、DeepSeek 以及前沿级模型可以跑到 5000 TPS 11:29。Sean 的判断是「现在全世界终于看到超快推理的价值了,而我们赌这还只是开始」。

主持人代表听众追问:什么时候能用上?Sean 的回答很坦率——现在造出来的东西基本全部售罄,每一兆瓦都在做战略性投放,其中相当大一部分给了 OpenAI 12:15。他强调 OpenAI 是最大伙伴不只是因为商业安排,更因为双方有「协同设计」的默契。

有意思的是 OpenAI 内部怎么用这批算力:事故响应团队在用——服务一旦中断,每一秒每一分钟都要命;一些最关键的研究应用也在用,因为额外的推理量能换来明显更聪明的输出 13:03。

主持人由此提出一个偏商业分析的观察:OpenAI 其实完全可以自己独吞,不必对企业客户开放。Sean 不便替对方发言,但给了一个外部视角的解读:一方面 OpenAI 的使命是持续推动可能性的边界,内部使用有助于此;另一方面它现在也是一门生意,还有 IPO 的讨论,所以内外平衡是自然的选择 15:21。

五、Jalapeño、Groq 与 Etched:同行点评

Jalapeño。Sean 说这是 Hot Chips 上最令他兴奋的发布,但理由和大多数人不同。多数人看的是它比英伟达强多少;他先给了一句公道话——「英伟达不是傻子,他们占住市场是有原因的」,能一出手就造出一颗显著更好的 GPU,本身就是了不起的成就 16:08。但真正让他兴奋的是设计方法论:OpenAI 明显走了一条截然不同的路,AI-first 的方法论让他们更快造出芯片并拿到这些成绩,「这 100% 是我们这个行业的未来」,而由 OpenAI 领跑并不意外,因为这本来就是他们的行事风格 16:53。

他还点出一个战略节点:明年 Jalapeño 上市、CS5 同期到位,两者合起来会形成一条完整的「快速推理产品线」,与今天已经很不一样的产品线相比再次拉开差距。Jalapeño 并没有专门为 prefill/decode 解耦而优化,它优化的是吞吐;而 Cerebras 手上是 10000 TPS 级别的极低延迟。作为计算机架构师,Sean 说这两者拼在一起「能做的事情太多了」18:26。此外双方还在 AI 工具链上合作——Cerebras 也在用 OpenAI 的工具来推进自己的芯片设计和软件 19:59。

Groq。这是全期最尖锐的一段。Sean 先说 SRAM 架构走向主流是好事,连英伟达都在拥抱 SRAM 设计,等于承认传统 GPU 设计跑不进超快区间 20:46。然后他抛出会场上私下流传的两个问题:为什么新品只在 300 亿参数的模型上发布?为什么 Jensen 在 GTC 上花了半小时讲 attention/FFN 解耦,这次却只字未提 21:34?

他自己的解释是:非晶圆级的 SRAM 设计每颗芯片内存不够。要跑一个几万亿参数的前沿模型,光是装下权重就需要成千上万颗 LPU 23:07。所以只公布 30B 的数字并不奇怪,而且他预测对方最终会转向明显更小的模型。相比之下,Cerebras 一颗芯片的内存约为对方单芯片的 100 倍,「两个数量级的差距几乎是白送的」23:54。他把这归结为一句结论:当年之所以必须做晶圆级集成,就是为了聚合足够的 SRAM 来真正服务大模型。

Etched。主持人拿出 Etched 官网那张「没有数字、没有 benchmark」的页面。Sean 的评价是:视觉设计非常出色,但他看不出他们在造超越传统 GPU 的东西;对方提过一个「因为分布式所以更快的分布式存储」的说法,他坦言不太理解,希望对方能解释清楚 34:40。他承认公司估值已到 200 亿美元不是小角色,也承认 Hot Chips 上他们确实摆了机柜,说明东西在造,只是「感觉还有点远」。

被要求给一个 steel man 时,他给出的方向是:希望看到他们(或任何人)在芯片之外做更激进的创新——机柜、节点、封装、互联、乃至工厂 35:26。

六、异构解耦:把整个数据中心当成一颗芯片

这是全期技术密度最高的一段。有人在会场问 Sean:搞解耦不就意味着要把数据中心切分、要按比例部署不同硬件,这不是很受限吗?

Sean 的反驳来自架构师的日常:设计芯片时每一天都在决定这块硅片面积是给内存、给计算还是给 IO,本质是同一件事 27:45。往下拆一层看,推理里的子负载差异极大——加载 KV cache、执行 attention、把专家分散到不同硬件上并做负载均衡,每一项都可以用更贴合的硬件来解决 28:31。

关键在规模。小规模下,为了解决一个问题就凑齐好几种硬件并不划算;但在数百兆瓦到千兆瓦、多千兆瓦的量级上,专用化很容易回本。到那个点上,你其实是「把整个数据中心当成一台计算机、当成一颗芯片」来设计:我要这么多能力跑 attention,要这么多能力高效跑 prefill,然后把它们拼起来——「这是计算机架构师梦寐以求的工具箱」29:16。

七、最大的未开采红利:模型是为别人家的芯片设计的

在谈到与 OpenAI 的协同设计时,Sean 说出了他认为整个非英伟达阵营最被低估的机会。

今天所有人跑的模型,都是为英伟达 GPU 设计的——而且往往是为某一款特定型号设计的,比如 B200、GB200、NVL72 30:48。Cerebras 目前 14 倍的加速,是在跑一个「为完全不同架构设计的模型」的前提下拿到的。一旦允许对模型架构做哪怕轻微的调整,收益就是巨大的;如果做更深的协同设计,「机会几乎是无限的」31:34。

主持人顺势提了一句「大家严重低估了用 AI 生成 kernel 这件事」,Sean 表示完全同意。

对英伟达和其他挑战者,Sean 的定性是克制而清晰的:英伟达在做所有人都预期它做的事,而且在很多意义上完全正确,因为世界确实需要更多、更便宜的 token。但曾经算快的 100 到 200 tokens/s 正在迅速变成新的「批处理」「隔夜任务」——这种模式适合 prompt processing、适合高度并行的负载,是一块很大的市场,但「不够」32:21。他把 AMD、Trainium、乃至 TPU 都归入同一条跑道:都在试图造一个更好的 Rubin。这有巨大价值,但在其他向量上突破同样有价值,而后者就是 Cerebras 在做的事 33:07。

八、3D DRAM:真正难的从来不是连线

被问到 Hot Chips 上还有哪些值得关注的名字,Sean 首选 d-Matrix,理由是他们真正押注 3D DRAM 封装,「这正是我们整个行业需要多做的事」36:57。他也提到 Samsung 围绕 3D HBM 的讨论,并总结说造 AI 芯片归根结底只有三件事:计算、互联、内存——而在低延迟场景里,内存带宽就是关键 38:29。

Cerebras 自己的 backpack 与 3D DRAM 堆叠是同源思路:一个是把电直接送到晶圆表面的紧凑 3D 封装,一个是把内存这样堆过去 37:42。他透露 Cerebras 两年前就启动了自己的 DRAM 堆叠项目。

最有价值的是他给后来者的警告。当年做晶圆级时,所有人都以为最大的挑战是怎么把这些 die 连起来、怎么保证良率;这些确实是必须解决的基础难题,但最终真正的门槛是供电、散热和可靠量产 39:15。他判断 3D DRAM 会重演一遍同样的剧情:「在 PPT 上画一层 DRAM 加一层逻辑是一回事,真正让它跑起来、搞清楚怎么供电怎么散热是另一回事」40:02。Cerebras 已经解决了规模化良率和三维封装,这些经验正被复用到自家的 DRAM 堆叠方案上。

九、供应链与开源模型的战略困境

最后一个话题是中美半导体供应链。主持人提到中国正在变得完全独立,GLM、华为等等,甚至有模型在 OpenRouter 上表现很好而完全不跑在美国芯片上。

Sean 的判断分两层。第一层是模型:开源模型市场几乎 100% 是中国的——他先说 100%,被主持人纠正后改口 95%,大部分高质量开源模型都来自中国实验室 41:34。他承认分享本身对全球社区是好事,但对美国而言,在模型上形成如此依赖是「战略上非常艰难的处境」。

第二层是硬件:支撑这些中国模型的整套硬件基础设施,正在背景里被独立地、缓慢地搭建起来 41:34。

他的结论是:这不是一家公司或一座晶圆厂能解决的问题,需要国家利益层面的举措 42:19。Cerebras 一直在推动、也支持任何能延续美国在这一领域领先地位的倡议。

节目在轻松的气氛里结束。主持人提到 Cerebras 的 IPO 是史上规模最大的半导体 IPO,Sean 说自己有时还得掐一下才相信这是真的;主持人最后一再索要 Ultra Fast 的使用额度,Sean 笑着推给合作方:「那是 OpenAI 的决定,我们只是提供基础设施」43:51。

金句

曾经算快的 100 到 200 tokens/s,正在迅速变成新的批处理模式。 —— Sean Lie 0:00
我们告诉很多人这就是未来,而他们大多数的反应是:你们疯了,这不可能。 —— Sean Lie 7:40
英伟达不是傻子。他们占住这个市场是有原因的。 —— Sean Lie 16:08
Jalapeño 真正让我兴奋的不是那些跑分,而是它背后的设计方法论——AI-first,这 100% 是我们这个行业的未来。 —— Sean Lie 16:53
跑一个几万亿参数的前沿模型,光装下权重就需要成千上万颗他们的芯片。 —— Sean Lie 23:07
在 PPT 上画一层 DRAM 加一层逻辑是一回事,真正让它跑起来、搞清楚怎么供电怎么散热是另一回事。 —— Sean Lie 40:02

提到的书·产品·人物

适合谁听

关心 AI 推理硬件格局、想理解「速度如何兑换成智能」以及英伟达之外还有哪些真实机会的技术与投资读者。

← 返回全部观看原片 ↗