核心要点
- 4400 TPS 的现场演示:CS4 基于新的 Nexus 模块化平台,对晶圆供电翻倍、互联带宽翻倍、延迟减半,Hot Chips 现场把 gpt-oss 跑到 4400 TPS 以上,Sean 自己形容「快到几乎像是假的」5:21
- CS5 再翻一倍:明年的下一代晶圆芯片会让中型模型(gpt-oss、Gemma)达到 10000 TPS,Kimi、DeepSeek 这类前沿级模型达到 5000 TPS;Nexus 平台从设计之初就为多代产品预留了升级空间 11:29
- 快就是智能:与 OpenAI 合作的 Ultra Fast 让其最强模型跑出 14 倍于常规 GPU 的速度;Sean 强调价值不在跑分,而在 agentic 循环能跑更多轮推理,最终得到更聪明的智能体 8:25
- Jalapeño 真正的看点:Sean 认为 OpenAI 造出了一颗「显著更好的 GPU」已属不易,但最值得学的是其 AI-first 设计方法论——用 AI 加速造芯片本身,「这 100% 是这个行业的未来」16:53
- Groq 的 30B 疑问:全新产品只公布 30B 模型的性能数字,且完全没提 Jensen 在 GTC 上讲了半小时的 attention/FFN 解耦;Sean 判断这暴露了非晶圆级 SRAM 设计的内存瓶颈,跑万亿参数模型需要成千上万颗 LPU 才装得下权重 22:21
- 100 倍内存差:Cerebras 一颗芯片的片上内存约为对手单芯片的 100 倍,两个数量级的差距「几乎是白送的」,这正是当初必须做晶圆级集成的原因 23:54
- 最大的未开采红利:所有模型都是为特定型号英伟达 GPU(B200、GB200、NVL72)设计的;只要允许模型架构做哪怕轻微调整,非英伟达硬件就能拿到巨大增益,Sean 称这是全行业最被低估的机会 30:48
章节时间轴
- 1:32 Hot Chips 后的第一感受 — Sean 称当下是硬件的「黄金时代」,芯片、互联、系统、软件、光学、方法论同时爆发,是半导体史上没见过的创新密度。
- 3:49 CS4 与 Nexus 平台 — 模块化电源在前、backpack 服务器在后,供电与带宽翻倍、延迟减半,现场 gpt-oss 跑出 4400 TPS。
- 6:54 从技术演示到解决真问题 — 一代芯片是为了证明「这东西能造出来」,现在的任务是规模化交付;与 OpenAI 的 Ultra Fast 是这一转变的样板。
- 9:57 CS5 预告:10000 TPS — 下一代晶圆芯片再翻一倍,中型模型 10000 TPS、前沿模型 5000 TPS,Nexus 是多代共用的底座。
- 12:15 产能全部售罄与 OpenAI 的分配 — 每一兆瓦都在做战略性投放,大部分给 OpenAI;OpenAI 内部用于事故响应和关键研究,同时对企业客户开放。
- 15:21 Jalapeño:方法论比跑分重要 — 承认这是一颗显著更好的 GPU,但真正的信号是 AI-first 的芯片设计方法论。
- 18:26 明年的组合拳与解耦 — Jalapeño 与 CS5 同期上线将形成完整的快速推理产品线,还有 prefill/decode 解耦等更深的整合空间。
- 20:46 Groq 新品与 SRAM 路线之争 — 为什么只在 30B 模型上公布数字、为什么闭口不谈 attention/FFN 解耦,Sean 给出内存容量的解释。
- 24:39 异构解耦生态 — 推理已不是单一负载,KV cache 加载、attention、专家分布各有最适合的硬件,千兆瓦级规模让专用化划算。
- 29:16 模型设计与硬件协同 — 交互式图形设计、扩散、语音等新场景,以及「模型都是为某一款 GPU 设计的」这一最大红利。
- 31:34 英伟达、AMD、TPU 都在造更好的 Rubin — Sean 认可这条跑步机的价值,但坚持「200 tokens/s 正在变成新的批处理」。
- 33:53 Etched 的观感与 steel man — 只有漂亮的视觉设计、没有跑分,他更希望看到跳出单芯片的整合创新。
- 36:57 3D DRAM 与真正的难点 — d-Matrix、Samsung 的堆叠方向值得学;当年晶圆级最难的不是连线和良率,而是供电与散热。
- 40:48 中国供应链与开源模型困境 — 开源模型市场 95% 来自中国实验室,配套硬件也在悄悄自建,Sean 认为这需要国家层面而非单家公司解决。
- 43:05 史上最大半导体 IPO — 主持人索要 Ultra Fast 额度,Sean 笑称「这是 OpenAI 的决定,我们只提供基础设施」。
详细内容
一、硬件的黄金时代:Hot Chips 变了
Sean 用一段回忆开场。十到二十年前的 Hot Chips 是「一堆计算机架构极客围着 speeds and feeds 较真」的场合,今天它已经变成改变行业的硬件首发地——同一周里苹果发 M6、OpenAI 讲 Jalapeño、Groq 发新芯片、Cerebras 讲 CS4 和 CS5 1:32。
他给出的判断不是客套:这是半导体工业史上从未有过的创新密度,而且是全维度的——芯片本身、互联、系统设计、软件、光学、方法论、工具链,每一层都有人在推 3:03。对一个「骨子里是计算机架构极客」的人来说,这个阶段本身就让人兴奋,他说会场里那股 buzz 是真实存在的。
这段铺垫其实定义了整期节目的基调:Sean 反复强调他愿意「把 Cerebras 的帽子摘下来」评价同行,因为在他看来现在整个行业是水涨船高的关系,而不是零和。
二、CS4 与 Nexus:把晶圆级带进主流
CS4 的设计目标被 Sean 表述得很清楚:让 wafer scale 走向主流、走进超大规模数据中心,并解决日常遇到的高密度数据中心问题 3:49。
技术上的答案是一个叫 Nexus 的全新模块化系统平台:前面是模块化电源,后面是一个被称为 backpack 的模块化服务器。相对上一代,它给晶圆提供两倍的供电、两倍的互联带宽、一半的延迟,而且这些提升全部在系统架构层完成,而非靠单纯的工艺进步 4:35。
结果就是性能再翻一倍。Cerebras 一直自称「超快推理无可争议的领导者」,CS4 把这个前沿再推 2 倍,现场 demo 里 gpt-oss 跑出 4400 TPS 以上——Sean 的原话是「几乎感觉像是假的」5:21。
但他强调真正让他兴奋的不是这个大数字。速度会把原本属于批处理和离线的应用变成实时应用,而在 agentic 工作流里,用户是在等智能体一轮又一轮地循环;当模型跑到 4000 tokens/s 以上,你能做更多轮 agentic 循环、更多推理,最终得到「显著更强、更聪明的智能体」6:08。这是全期最核心的因果链:速度不是体验优化,速度直接兑换成智能。
三、从「证明能造」到「必须交付」
主持人提到一个行业转折:晶圆级这条路线过去多年不被认真对待,直到大家不得不认真对待。Sean 的回应把公司的阶段划得很清楚。
第一代芯片本质上是技术演示——要向世界也向自己证明这种东西真的能造出来。当时他们告诉很多人这是未来,「大多数人的反应就是:你们疯了,这不可能」7:40。
现在既然可行性和性能都已被证明,问题变成了「它能解锁什么」。与 OpenAI 的 Ultra Fast 合作是最好的例子:他们正在以 14 倍于常规 GPU 的速度运行 OpenAI 最大、最强、最智能的模型,最聪明的模型叠加硬件带来的速度,产生了「彻底的变革性」效果 8:25。
因此公司的重心也变了:现在的全部精力是确保规模化——把产能拉起来、把用户真正在乎的模型跑起来,同时靠持续推出更快的硬件来维持飞轮 9:11。Sean 说这个展开方式「几乎比我们能想象的还要好」,因为硬件能力成熟的时点,恰好撞上了模型和应用能力成熟的时点。
四、CS5 与产能分配:为什么普通人还用不上
CS5 的关键在于 Nexus 是一个多代平台。它从设计之初就与明年的下一代晶圆芯片一起规划,那颗芯片会带来又一个 2 倍性能提升。落到用户可感知的数字上:gpt-oss、Gemma 这类中型模型可以跑到 10000 TPS,Kimi、DeepSeek 以及前沿级模型可以跑到 5000 TPS 11:29。Sean 的判断是「现在全世界终于看到超快推理的价值了,而我们赌这还只是开始」。
主持人代表听众追问:什么时候能用上?Sean 的回答很坦率——现在造出来的东西基本全部售罄,每一兆瓦都在做战略性投放,其中相当大一部分给了 OpenAI 12:15。他强调 OpenAI 是最大伙伴不只是因为商业安排,更因为双方有「协同设计」的默契。
有意思的是 OpenAI 内部怎么用这批算力:事故响应团队在用——服务一旦中断,每一秒每一分钟都要命;一些最关键的研究应用也在用,因为额外的推理量能换来明显更聪明的输出 13:03。
主持人由此提出一个偏商业分析的观察:OpenAI 其实完全可以自己独吞,不必对企业客户开放。Sean 不便替对方发言,但给了一个外部视角的解读:一方面 OpenAI 的使命是持续推动可能性的边界,内部使用有助于此;另一方面它现在也是一门生意,还有 IPO 的讨论,所以内外平衡是自然的选择 15:21。
五、Jalapeño、Groq 与 Etched:同行点评
Jalapeño。Sean 说这是 Hot Chips 上最令他兴奋的发布,但理由和大多数人不同。多数人看的是它比英伟达强多少;他先给了一句公道话——「英伟达不是傻子,他们占住市场是有原因的」,能一出手就造出一颗显著更好的 GPU,本身就是了不起的成就 16:08。但真正让他兴奋的是设计方法论:OpenAI 明显走了一条截然不同的路,AI-first 的方法论让他们更快造出芯片并拿到这些成绩,「这 100% 是我们这个行业的未来」,而由 OpenAI 领跑并不意外,因为这本来就是他们的行事风格 16:53。
他还点出一个战略节点:明年 Jalapeño 上市、CS5 同期到位,两者合起来会形成一条完整的「快速推理产品线」,与今天已经很不一样的产品线相比再次拉开差距。Jalapeño 并没有专门为 prefill/decode 解耦而优化,它优化的是吞吐;而 Cerebras 手上是 10000 TPS 级别的极低延迟。作为计算机架构师,Sean 说这两者拼在一起「能做的事情太多了」18:26。此外双方还在 AI 工具链上合作——Cerebras 也在用 OpenAI 的工具来推进自己的芯片设计和软件 19:59。
Groq。这是全期最尖锐的一段。Sean 先说 SRAM 架构走向主流是好事,连英伟达都在拥抱 SRAM 设计,等于承认传统 GPU 设计跑不进超快区间 20:46。然后他抛出会场上私下流传的两个问题:为什么新品只在 300 亿参数的模型上发布?为什么 Jensen 在 GTC 上花了半小时讲 attention/FFN 解耦,这次却只字未提 21:34?
他自己的解释是:非晶圆级的 SRAM 设计每颗芯片内存不够。要跑一个几万亿参数的前沿模型,光是装下权重就需要成千上万颗 LPU 23:07。所以只公布 30B 的数字并不奇怪,而且他预测对方最终会转向明显更小的模型。相比之下,Cerebras 一颗芯片的内存约为对方单芯片的 100 倍,「两个数量级的差距几乎是白送的」23:54。他把这归结为一句结论:当年之所以必须做晶圆级集成,就是为了聚合足够的 SRAM 来真正服务大模型。
Etched。主持人拿出 Etched 官网那张「没有数字、没有 benchmark」的页面。Sean 的评价是:视觉设计非常出色,但他看不出他们在造超越传统 GPU 的东西;对方提过一个「因为分布式所以更快的分布式存储」的说法,他坦言不太理解,希望对方能解释清楚 34:40。他承认公司估值已到 200 亿美元不是小角色,也承认 Hot Chips 上他们确实摆了机柜,说明东西在造,只是「感觉还有点远」。
被要求给一个 steel man 时,他给出的方向是:希望看到他们(或任何人)在芯片之外做更激进的创新——机柜、节点、封装、互联、乃至工厂 35:26。
六、异构解耦:把整个数据中心当成一颗芯片
这是全期技术密度最高的一段。有人在会场问 Sean:搞解耦不就意味着要把数据中心切分、要按比例部署不同硬件,这不是很受限吗?
Sean 的反驳来自架构师的日常:设计芯片时每一天都在决定这块硅片面积是给内存、给计算还是给 IO,本质是同一件事 27:45。往下拆一层看,推理里的子负载差异极大——加载 KV cache、执行 attention、把专家分散到不同硬件上并做负载均衡,每一项都可以用更贴合的硬件来解决 28:31。
关键在规模。小规模下,为了解决一个问题就凑齐好几种硬件并不划算;但在数百兆瓦到千兆瓦、多千兆瓦的量级上,专用化很容易回本。到那个点上,你其实是「把整个数据中心当成一台计算机、当成一颗芯片」来设计:我要这么多能力跑 attention,要这么多能力高效跑 prefill,然后把它们拼起来——「这是计算机架构师梦寐以求的工具箱」29:16。
七、最大的未开采红利:模型是为别人家的芯片设计的
在谈到与 OpenAI 的协同设计时,Sean 说出了他认为整个非英伟达阵营最被低估的机会。
今天所有人跑的模型,都是为英伟达 GPU 设计的——而且往往是为某一款特定型号设计的,比如 B200、GB200、NVL72 30:48。Cerebras 目前 14 倍的加速,是在跑一个「为完全不同架构设计的模型」的前提下拿到的。一旦允许对模型架构做哪怕轻微的调整,收益就是巨大的;如果做更深的协同设计,「机会几乎是无限的」31:34。
主持人顺势提了一句「大家严重低估了用 AI 生成 kernel 这件事」,Sean 表示完全同意。
对英伟达和其他挑战者,Sean 的定性是克制而清晰的:英伟达在做所有人都预期它做的事,而且在很多意义上完全正确,因为世界确实需要更多、更便宜的 token。但曾经算快的 100 到 200 tokens/s 正在迅速变成新的「批处理」「隔夜任务」——这种模式适合 prompt processing、适合高度并行的负载,是一块很大的市场,但「不够」32:21。他把 AMD、Trainium、乃至 TPU 都归入同一条跑道:都在试图造一个更好的 Rubin。这有巨大价值,但在其他向量上突破同样有价值,而后者就是 Cerebras 在做的事 33:07。
八、3D DRAM:真正难的从来不是连线
被问到 Hot Chips 上还有哪些值得关注的名字,Sean 首选 d-Matrix,理由是他们真正押注 3D DRAM 封装,「这正是我们整个行业需要多做的事」36:57。他也提到 Samsung 围绕 3D HBM 的讨论,并总结说造 AI 芯片归根结底只有三件事:计算、互联、内存——而在低延迟场景里,内存带宽就是关键 38:29。
Cerebras 自己的 backpack 与 3D DRAM 堆叠是同源思路:一个是把电直接送到晶圆表面的紧凑 3D 封装,一个是把内存这样堆过去 37:42。他透露 Cerebras 两年前就启动了自己的 DRAM 堆叠项目。
最有价值的是他给后来者的警告。当年做晶圆级时,所有人都以为最大的挑战是怎么把这些 die 连起来、怎么保证良率;这些确实是必须解决的基础难题,但最终真正的门槛是供电、散热和可靠量产 39:15。他判断 3D DRAM 会重演一遍同样的剧情:「在 PPT 上画一层 DRAM 加一层逻辑是一回事,真正让它跑起来、搞清楚怎么供电怎么散热是另一回事」40:02。Cerebras 已经解决了规模化良率和三维封装,这些经验正被复用到自家的 DRAM 堆叠方案上。
九、供应链与开源模型的战略困境
最后一个话题是中美半导体供应链。主持人提到中国正在变得完全独立,GLM、华为等等,甚至有模型在 OpenRouter 上表现很好而完全不跑在美国芯片上。
Sean 的判断分两层。第一层是模型:开源模型市场几乎 100% 是中国的——他先说 100%,被主持人纠正后改口 95%,大部分高质量开源模型都来自中国实验室 41:34。他承认分享本身对全球社区是好事,但对美国而言,在模型上形成如此依赖是「战略上非常艰难的处境」。
第二层是硬件:支撑这些中国模型的整套硬件基础设施,正在背景里被独立地、缓慢地搭建起来 41:34。
他的结论是:这不是一家公司或一座晶圆厂能解决的问题,需要国家利益层面的举措 42:19。Cerebras 一直在推动、也支持任何能延续美国在这一领域领先地位的倡议。
节目在轻松的气氛里结束。主持人提到 Cerebras 的 IPO 是史上规模最大的半导体 IPO,Sean 说自己有时还得掐一下才相信这是真的;主持人最后一再索要 Ultra Fast 的使用额度,Sean 笑着推给合作方:「那是 OpenAI 的决定,我们只是提供基础设施」43:51。
金句
曾经算快的 100 到 200 tokens/s,正在迅速变成新的批处理模式。 —— Sean Lie 0:00
我们告诉很多人这就是未来,而他们大多数的反应是:你们疯了,这不可能。 —— Sean Lie 7:40
英伟达不是傻子。他们占住这个市场是有原因的。 —— Sean Lie 16:08
Jalapeño 真正让我兴奋的不是那些跑分,而是它背后的设计方法论——AI-first,这 100% 是我们这个行业的未来。 —— Sean Lie 16:53
跑一个几万亿参数的前沿模型,光装下权重就需要成千上万颗他们的芯片。 —— Sean Lie 23:07
在 PPT 上画一层 DRAM 加一层逻辑是一回事,真正让它跑起来、搞清楚怎么供电怎么散热是另一回事。 —— Sean Lie 40:02
提到的书·产品·人物
- Sean Lie(人物):Cerebras 联合创始人兼 CTO,晶圆级引擎的总架构师,本期唯一嘉宾。
- Cerebras CS4 / Nexus 平台(产品):本期主角,模块化系统平台,供电与互联带宽翻倍、延迟减半,现场跑出 gpt-oss 4400 TPS。
- Cerebras CS5(产品):明年上市的下一代晶圆芯片,中型模型 10000 TPS、前沿模型 5000 TPS。
- OpenAI Ultra Fast(产品):由 Cerebras 提供算力的超快推理模式,OpenAI 最强模型跑出 14 倍于常规 GPU 的速度。
- Jalapeño(产品):OpenAI 在 Hot Chips 发布的自研推理芯片,Sean 认为其 AI-first 设计方法论比性能数字更重要。
- Groq / LPU(公司/产品):SRAM 路线同行,Sean 质疑其只在 30B 模型上公布性能、回避 attention/FFN 解耦。
- Etched(公司):估值约 200 亿美元的芯片初创,Sean 评价其「视觉设计出色但看不出差异化」。
- d-Matrix(公司):Hot Chips 上他最看好的方向,重注 3D DRAM 封装。
- Samsung 3D HBM(产品):另一条值得关注的内存堆叠路线。
- NVIDIA Rubin / NVL72 / B200 / GB200(产品):Sean 认为 AMD、Trainium、TPU 都在造「更好的 Rubin」;模型往往是为某一款特定英伟达型号设计的。
- Jensen Huang(人物):在 GTC 上花半小时讲 attention/FFN 解耦,被 Sean 用来对照 Groq 的沉默。
- gpt-oss / Gemma / Kimi / DeepSeek / GLM(产品):本期反复出现的性能基准模型,后三者也是「开源模型 95% 来自中国」这一论点的例证。
- Hot Chips(会议):本期录制的背景,Sean 称其已从架构极客聚会变成行业级硬件首发地。
适合谁听
关心 AI 推理硬件格局、想理解「速度如何兑换成智能」以及英伟达之外还有哪些真实机会的技术与投资读者。