20VC
反数据中心是中国的认知战?一位芯片创始人的暴论
"Anti-Data Centers is a Chinese Psyop" | How Many Will Actually Get Built? | Positron AI Co-founder
节目时长 80 分钟
阅读约 5 分钟
▶ 在 YouTube 收看原片
Positron AI 联创拆解推理经济学、KV 缓存与算力政治,直言"减速前沿"是 IPO 前的降本借口。
核心要点
- 反数据中心是认知战:Thomas 认为左右翼罕见共识地反对数据中心,几乎完全源自中国的信息操作。他指出耗水叙事是假的——一家 In-N-Out 的用水量超过全美最大数据中心,高尔夫球场更是高出好几个数量级,现代机房是闭环液冷。
- 减速前沿是降本借口:他半开玩笑地说"pacing the frontier"讨论本质是 IPO 前的降本手段——停止训练就能让 OpenAI、Anthropic 立刻大幅盈利。他同时点名 Sam 需要理由不 IPO,Elon 需要时间追赶,动机对所有人都成立。
- 最怕技术集中而非天网:他判断 Terminator 式失控概率极低,真正的 PTSD 是能力集中到少数人手中。把矩阵乘法立法管制是"通往奴役之路"的现代版,会把人类拽回启蒙运动之前,大公司会变成新的领主与国王。
- 推理是内存墙问题:训练算力受限可大规模并行,推理必须自回归逐 token 生成,每个 token 都要读一遍全部权重。2014 到 2024 年单张 GPU 算力提升约 120 倍,内存带宽只提升 17 倍,两者持续背离。
- 96% 的 token 是缓存命中:semianalysis 的 AgentX 基准追踪了大量真实 Claude Code 会话,发现整个 agentic 编码流程中约 96% 的 token 来自缓存。缓存 token 的处理成本是重算的千分之一,这是 Anthropic 80 个点 API 毛利的来源。
- 用户上下文大过模型权重:按 Claude Fable 约 10 万亿参数估算,权重约 5TB,而长上下文下单个用户会话可达 100GB 量级。只要 50 个并发用户,用户 KV 缓存总量就超过模型权重本身,逼出多级内存分层。
- 便宜的 token 更值钱:Silicon Data 指数显示每百万 token 价格本月跌破 1 美元,五年前是 60 美元。但他强调当年那种 token 今天没人愿意付一分钱,真实的单位智能价值提升应该乘上百倍甚至千倍。
章节时间轴
- 0:00 开场暴论 — Thomas 抛出"反数据中心几乎完全是中国认知战"和 In-N-Out 耗水类比,Harry 介绍 Positron 刚完成 50 亿估值的 8.75 亿美元 C 轮。
- 0:49 Positron 在栈里的位置 — 从芯片、贴着硬件跑的底层软件一路做到整机与机柜级部署,专门服务生成式 AI 推理。
- 1:35 训练算力受限,推理内存受限 — 训练可以把整个语料并行压过去,推理必须自回归逐个生成,每个 token 都要读一遍权重。
- 4:39 memory wall 的由来 — 十年间 GPU 算力涨 120 倍、内存带宽只涨 17 倍,SRAM 单元三四十年几乎没有架构性变化。
- 8:30 token 经济学与 80 点毛利 — 缓存 token 成本是重算的千分之一,所有厂商都在缓存读取上赚取惊人利润,Anthropic 被曝 80 个点 API 毛利。
- 11:39 如何评价"减速前沿" — Thomas 对 AI 安全议题有复杂感受,担心暂停会给彻底停掉技术的人递弹药,更怕能力集中。
- 17:03 中国不减速怎么办 — 他认为中国的开源策略只是阶段性姿态,一旦进入领先位置就会抽梯子,CCP 不会让十四亿人平等受益。
- 22:30 数据中心的政治与电价 — 从"把数据中心建成金字塔般的世界奇观",到闭环液冷辟谣,再到新增发电容量其实会压低电价。
- 27:58 多少规划中的数据中心会建成 — 社区抵制会让选址迁移但不构成产能威胁,内华达等地有大量 BLM 荒漠土地,海上与太空是备选路径。
- 30:15 能源是不是瓶颈 — 他认为技术上能源不缺,真正的限制是经济与债务,主权债务问题比任何 AI 公司的收入目标都更值得担心。
- 34:52 KV 缓存完全拆解 — 从 token、序列、注意力二次方复杂度讲到 KV 矩阵缓存,再到量化压缩与 96% 缓存命中率的现实工作负载。
- 46:28 内存分层与上下文长度 — 加速器、主机内存、NVMe、网络存储的四级分层,以及百万 token 上下文为何还不够装下一个代码库。
- 49:35 大模型还是小模型 — 前四家模型公司拿走 80~85% 的 token,本地小模型不会抢走云端份额,反而会因常驻代理而放大调用量。
- 55:01 GPT6 Astra 带来的震撼 — 他把首次使用 Astra 的 24 小时类比 2022 年 NeurIPS 现场初见 ChatGPT,并举出芯片设计全流程的实例。
- 61:14 人人自研芯片 — OpenAI 的 Jalapeño、Anthropic、DeepSeek 都在做自己的芯片,宏观目标相同但实现路径各异。
- 63:34 上下文长度的物理极限 — 线性与稀疏注意力主要由中国模型实验室推动,出口管制反而逼出了 MLA 和 gated DeltaNet 这类创新。
- 68:59 token 定价的未来 — 从 60 美元到 1 美元不只是降价,Greg Brockman 说未来可能不再按 token 计价,但他认为按 token 定价会长期存在。
- 73:38 裂缝会从哪里出现 — Harry 追问泡沫破裂的第一个信号,Thomas 给出自己的反驳,并以"AI 对齐之前先要人类对齐"收尾。