← 顶级AI播客总结
Latent Space

302 个神经元的线虫,如何长成一家造车载大模型的公司

A Worm With 302 Neurons Inspired Their Architecture — Ramin Hasani, Liquid AI
节目时长 70 分钟 阅读约 25 分钟
▶ 在 YouTube 收看原片

Liquid AI CEO 拆解液态神经网络十年路:架构搜索、端侧落地与「注意力之外」的下一代计算。

核心要点

  • 302 个神经元:C. elegans 只有 302 个神经细胞、95 块肌肉,却比 2016-2017 年地球上任何机器人系统控制得更好,且神经元不 spiking、可微分,能直接做反向传播,这是液态神经网络的原点。
  • 线性化的代价:递归网络算得省(次二次乃至接近线性),但非线性递归无法在 GPU 上并行;把它线性化成 SSM 换来了并行扫描的可扩展性,却丢掉了表达力,在长上下文的文本任务上始终打不过 Transformer。
  • STAR 架构搜索:Liquid 不押注单一架构,而是把 Hyena、SSM、液态网络等各路发明人聚到一起,建了一套按目标芯片搜索算子组合的元系统,同时优化质量不退化、显存、延迟、速度四项指标。
  • 偏置随规模反转:架构搜索得出的经验是,模型越大越要「去偏置」——LFM2 就是 80% 双门控 1D 卷积加 20% group query attention;而在 8GB 内存这类小规模场景,反而要加反馈回路等更多结构偏置换表达力。
  • Mercedes 车内落地:与 Mercedes-Benz 的合作模型约 600MB,跑在成本约 100 美元的芯片上,可 OTA 更新,今年将首次部署到全部北美第三代奔驰车型,是车内多模态智能的规模化首秀。
  • 落地比跑分难:Hasani 说他们接触过 Fortune 500 中约 200 家,企业普遍已被自研折腾到疲惫,约 80% 的 PoC 到不了生产级;端侧还要做热控制、长上下文行为漂移控制,远不是下载个开源模型那么简单。
  • 定制化是下一波:当下 90% 市场在推理 token,而基础模型开源化后,从预训练、mid-training、post-training 到数据生成与 RL 的「定制化 token」会长出下一批十角兽,Liquid 正在 beta 一套自助式模型开发平台。

章节时间轴

详细内容

一、虫子不是比喻:为什么是 C. elegans

Hasani 说,十二年前起步时的目标很朴素:看看能不能把大脑的启发带回机器学习。他和当时还是硕士生、如今的 CTO Mathias Lechner 想做的是把「连续时间数学」放进学习系统里——因为神经元之间交换信息的方式,本质上由非常简单的一阶微分方程支配。

但人脑走不通。人脑神经元是 spiking 的,而且「我们对人脑的计算如何发生仍然一无所知」,反倒是果蝇的脑我们知道得更多。于是他们做了一次第一性原理的退步,落到 C. elegans:体长 2 毫米,全身只有 302 个神经细胞。关键是这些神经元在神经科学里被称为 electrotonic 行为——不放电,输出是分级连续的,这与人工神经元极其相似,因此整个系统天然连续、可微,可以做反向传播。

打动他们的是另一个数字:302 个神经元控制 95 块肌肉细胞,控制质量超过 2016-2017 年地球上任何机器人系统。加上这只虫约 6 亿年前才与人类在演化树上分叉、与人类基因组约有 78% 相似度,已经为人类拿下四个诺贝尔奖,研究成果具备一定可迁移性。他们直接找神经科学家合作,把两个神经元如何交换信息在数学上建模出来,得到了 liquid time-constant neural networks。

「liquid」取自 flexibility。这是由微分方程支配的高度非线性系统,前向可解、反向可学,因为内部有多重反馈结构,它们是非常强的表征学习器。团队很快发现,只用几十到几百个神经元的小子集,就能像虫子那样控制机器人——而机器人上没有多少算力,能把这么多智能塞进最小的计算单元里,从此成为团队的长期执念。2017 年,MIT 的 Daniela Rus(Hasani 称她为「机器人学之母」)联系了他在维也纳的导师,随后 Hasani 与 Lechner 一起去了 MIT,并在那里遇到第四位联合创始人 Alexander Amini。

二、可扩展性之墙:递归、线性化与表达力的三角

2020 年前后全行业转向 scale,Liquid 的前身团队也必须从「虫子级智能」迈向人类可理解的音视频与文本信号。问题立刻暴露:非线性递归一旦放大,计算就不可解了。

Hasani 把矛盾讲得很清楚。递归网络最大的阻碍是串行计算——非线性递归算子在 GPU 上极难并行。而 Transformer 的美妙之处恰恰在于它「无偏」:本质就是矩阵乘法,能直接吃到硬件彩票(hardware lottery),这是它解锁通用能力的根本原因。但递归也有它不可替代的好处:消耗更多数据时计算不会爆炸,是次二次乃至接近线性的,而注意力是众所周知的二次成本。

问题在于,这种效率只是理论上的——如果你无法并行执行操作,就根本扩不起来。解法之一是「线性化」:动态地把系统中的非线性削掉,让线性代数技巧可以施加上去,从而并行(比如并行扫描)。SSM 正是递归网络的线性版本,代价是丢掉了参数之间的非线性关系。

「计算机科学里没有免费午餐。」Hasani 说,线性化复杂动力学就是在损失表达力。他们把 SSM 用在语言问题上时,发现它在长上下文的依赖学习上有麻烦:算得非常高效,但表达得不够高效,表达能力始终不及 Transformer。

三、STAR:不押注任何架构的元系统

从这个三角困境里,Liquid 得出的结论不是「再发明一个正确架构」。Hasani 说他们从第一天就决定不把自己放进偏见里,不去宣称某个架构是圣杯然后押上全部身家。

于是他们做了一件人员上的事:把替代架构的「复仇者联盟」聚到一处——Yoshua Bengio 实验室、Stanford、MIT 出来的各路发明人,Hyena hierarchy 的作者、SSM 方向的 Jimmy Smith,加上他们自己的液态神经网络。然后造一套无偏的元 AI 系统,在给定部署环境(GPU 还是 NPU)下,搜索算子空间里的混合架构。

搜索同时优化四个目标:一,相对纯 Transformer 模型质量不打折(推理、语言理解、知识等上百项标准);二,最小化显存占用;三,最小化延迟;四,最大化计算速度。相关论文叫 STAR(Synthesis of Tailored Architectures,Hasani 建议直接搜 "STAR Liquid AI")。他把这套元算法形容为一种递归自我改进系统:每当架构空间出现新发明,就把它加进搜索池,下一代 LFM 自动继承收益。

搜索的产物就是历代 LFM 的计算图。LFM1 是第一个搜索产物,混着卷积、注意力和原始液态成分,Hasani 直言「是个大杂烩」。第二代专门为 CPU 优化,LFM2 的架构反而极其简洁优雅:约 80% 是双门控 1D 卷积,约 20% 是 group query attention。目前产品线在 LFM 2.5,下一代 LFM3 会在质量、稳定性和延迟控制上继续改。作为从零预训练的基础模型实验室,他们的 scaling law 跑到 700 亿参数规模,已发布模型区间为 1 亿到 240 亿参数(大的那些是 MoE),并支持音频、视觉、文本输入与音频、文本输出。

四、把智能搬出数据中心:AMD、Mercedes 与 Shopify

商业侧的主线是「数据中心之外」。Hasani 给了几组数字:全球每年产出约 3 到 4 亿台 AI PC,其中约 1 亿台核心来自 AMD——Liquid 与 AMD 合作,让 LFM 直接跑在笔记本上。用途有二:一是隐私过滤,你要发给 ChatGPT 终端或 Claude Code 之类 agent 的敏感数据,先过一遍本地 LFM 做智能脱敏;二是本地主动式 agent,能访问机器上的全部信息做分析,并带来离线与气隙(airgapped)能力。

他给出端侧市场的真实结构:今天 Apple Intelligence、Galaxy AI 这类混合方案里,约 90% 的调用仍然走云端,只有 10% 在设备上——原因是端侧模型不够强、不够可靠。而企业想把负载搬到端上的第一动机极其朴素:成本。如果你有 4 亿台手机甚至数十亿客户要免费提供智能,全在云上服务的成本高得无法承受,搬到端上等于给自己创造毛利。

但他反复强调难度:「production grade AI 远不止在设备上跑几个质量 benchmark。」要做热控制,模型在长上下文中的行为会变化,可靠性的门槛极高,绝不是从开源下载一个模型放上去就算成功——Liquid 自己走了两年半、很多轮生产循环。

汽车是最具体的案例。他们与 Mercedes-Benz 的合作去年四月宣布,在汽车行业算推进极快的重大合作。车内那套多模态方案能接摄像头、做语音交互,并由文本模型提供推理能力,整体约 600MB——这个体量意味着可以对全球每一辆车做 OTA 更新,而承载它的芯片成本大约只有 100 美元。今年的首次部署将覆盖北美全部第三代 Mercedes-Benz 车型。

Shopify 是另一条线,不做端侧但极度在意延迟与质量。Liquid 的模型部署在 Shopify 的私有部署中,服务商家端与消费者端产品——今天你在 Shop app 里输入任何东西,请求都会打到一个 LFM 上,仅这一个客户就已是每月超过十亿次请求的量级,且呈指数增长。开源侧,LFM 累计下载超 4000 万次,每周约 150 万次。主持人特意确认了一句「只是 Shopify 一家?」Hasani 答:就这一家。

五、机器人:为什么明明是起点,却被刻意推迟

主持人 Richard 问,既然机器人是起点,多模态模型现在是否用于机器人。Hasani 说是,但方式和外界想象的不同:他们主要做工业机器人而非人形,VLM 被用作视觉-动作模型(机器人看到世界然后行动)和工厂摄像头的监控者。他点名了两家合作方:Rootech(与 AMD、Liquid 的联合 demo)和意大利的 Gbionics,后者做模块化机器人,把 LFM 的视觉语言模型用于机体的指令跟随。

但他坦承机器人是「第一天就被刻意按下暂停键」的方向。理由是 go-to-market:做机器人生意本身极难且周期被拉长,一旦涉及生产级机器人,就要掉进验证与确认(V&V)的兔子洞,再撞上部署的监管环节。正因为团队自己出身机器人,太清楚这条路有多长,才决定先做一层横向的智能层,先服务 OEM,把进入「动作世界」留到后面。他认为现在时机成熟了:模型更成熟,对数据、post-training 和定制流程的控制力更强,可以更认真地启动机器人垂直。

主持人 swyx 追问了一个更锋利的问题:外界把 action model、world model 说得与语言模型截然不同,这里面多少是营销?Hasani 的回答是把基础模型的创新拆成三类:模型架构、算法、数据处理机制。架构层面,他认为你可以用任何通用计算图;真正不同的在算法层——自回归损失、扩散过程、world modeling 是三种不同的训练算法。他明确把 world modeling 归到算法侧而非架构侧:它是一种无监督的表征学习方式,让模型建立对世界的理解,从物理世界里抽取的原语与 next token prediction 抽出来的不同。至于哪种学习算法能解锁「机器人的 ChatGPT 时刻」,他说这在算法侧仍是巨大的问号。

六、商业模式、企业的疲惫与「定制化 token」

商业模式上,早期是设计伙伴制:配一支应用 ML 团队与客户共建,这段周期本身收费;方案建成后按年、按设备收 license,作为经常性收入。一旦在某个垂直里做出方案,下一个同垂直客户所需的服务量大幅下降,只剩方案部署——所以他们是在每个垂直里「造方案」,方案才是加速销售的东西。

在此之上,他们正在 beta 一套自助式的模型开发平台,把 Liquid 自己造模型的能力交给企业。Hasani 的判断是:今天约 90% 的市场围绕推理 token,前沿实验室和 Fireworks 这类推理服务商靠托管模型收推理费;但下一波公司会围绕「定制化 token」——因为已经有足够好的开源基座,企业可以自己拥有模型。他强调「定制化」不只是 post-training,而是从预训练、mid-training、post-training 到数据生成与 RL 的全深度,再让 agent 来做这些事并把整个流程闭环,客户就能真正拥有自己的智能。他顺带点名这一赛道已有若干十角仔,包括 Thinking Machines、Trajectory 等,还提到 Jeff Dean 刚开的新实验室也在做类似题目。

支撑这个判断的是两组一线观察。其一,他们接触过 Fortune 500 中约 200 家,这些成熟企业已经被自研折腾到「精疲力尽」:自建应用 ML 团队、下载开源模型、从零造模型,最后大多没能变成生产线,只好退回云方案;按他的说法约 80% 的 PoC 达不到生产级。其二,开发者侧存在对最高形态智能的巨大需求,「所有人都想 token max」,但如果去归因价值,vibe coding 出来的代码仓库里「90% 的 token 是无用 token」。企业既要满足开发者需求又要控成本,这才催生了对自助平台的真实需求。

所以他们的平台不打算再做一个新 UI,而是直接坐进客户的 agent harness 里——就像你使用 Claude Code 那样,把 Liquid 的工具交给你惯用的 agentic harness,由它一步步带你完成模型的开发、构建与生产级部署。平台支持一键全自动模式,但 Hasani 承认自动模式产出的模型质量不如有开发者交互参与的版本,human in the loop 仍然重要。除此之外还有面向人类开发者的 Leap 平台与 cookbook:可以微调 LFM,也可以导出 GGUF 之类可直接上设备的推理 bundle;同时他们与 Hugging Face、SGLang、Unsloth、TRL、llama.cpp 社区保持紧密协作。

swyx 在这里推了一把:如果我的 eval 足够好,我为什么要关心中间过程,它难道不该自动研究自己吗?Hasani 说首次部署他完全同意,但模型上线后新数据会进来,社区的需求可能发生剧烈的分布漂移——「静态 eval 会过期」。你必须有一个持续演化的系统,评测标准本身也要不断变化,这正是他们押注持续学习与定制化的底层理由。

七、架构搜索的实证经验与更远的赌注

被问到架构搜索/模型工厂里有什么反直觉的发现,Hasani 给了两条硬经验。

第一条是偏置随规模反转。他们为每个候选架构跑 scaling law(增加数据或增大模型,看能训到什么程度),结论是:模型越大,架构越要「无偏」。LFM2 就是证据——它没有 gated delta net 之类结构,几乎就是 1D 卷积这种最朴素的东西;注意力本身也是极度无结构的,这正是 Transformer 能扩展的原因。反过来,当你受限于比如 8GB 内存的小规模场景,你反而可以在架构上更有创造性:加多重反馈回路、加复杂度——小模型里加的偏置越多,得到的动态表达力越强;到大规模再把这些偏置去掉。swyx 补充说这与 Jason 那篇「小规模加偏置、最终要去掉」的观点一致,并追问 layer looping 为什么在小规模有效、大规模失效;Hasani 的解释是循环本身就是一种偏置,而且当前 GPU 基础设施是为并行矩阵乘法优化的,串行结构根本没有对应的 infra。

第二条是模态决定架构。连续时间动力系统和 SSM 在音频上非常有效,但在文本上「很糟」。原因主持人替他补了一刀:语音本身状态量不大,而且本来就是连续推理,天然契合;Hasani 认同——时间序列数据就该用为时间序列设计的动力系统来建模。swyx 还提到自己做过期权交易,要解随机微积分,那也是一种连续时间数学。他补充说这条路线的同行包括 RWKV、Tri Dao 和 Cartesia。

更远的赌注落在计算基底上。Hasani 对光子学非常兴奋:非线性系统之所以被迫线性化,是因为串行计算太慢;但如果能以光速做串行计算,串行的速度就将快到人类无法感知,非线性算子就被解锁,架构不再被承载智能的基底所限制。他引了大约十四年前从 Christof Koch 那里听来的一句话——「智能是碳的一种属性」——自然生命跑在碳上,而我们正在硅上造智能,基底会影响下一代架构。至于量子计算,他的判断是它最可能massively改变的是「搜索」:优化的本质就是参数空间里的搜索,我们今天臣服于梯度下降只是因为没有更好的大规模搜索方式。他也自嘲地补了个故事:2017 年 NeurIPS 上他问 IBM 的人量子计算什么时候人人可用,对方答 2035。

被问到「如果连续时间这条路押错了呢」,Hasani 说被低估的维度是「适应性」。今天几乎所有前向计算就只是一次前向传播;如果能让前向与反向同时发生,那会是新一代架构。他提到听说 SSI 也在做与液态神经网络原始想法相似的架构,并笑称「他们怎么还没来找我们」,同时提醒大家默认 Anthropic、OpenAI 等所有前沿实验室都有团队在做替代架构。他区分了两类动机:追求效率可以靠 post-hoc 优化(投机解码、量化、量化感知训练、kernel 工程),但要解锁下一代能力就是另一回事——那可能是元算法,也可能是把小的计算单元(神经元与突触、一个 LFM、一个小模型)组装成「系统的系统」,他称之为 cognitive architectures。

近期研究议程则相对具体:大规模多模态(所有模态同时训练)、更长程的推理、以及为端侧助手所必需的可靠性;公司内设有专门的效率部门,从 kernel 设计到推理、到 RL 基础设施全链路提速。一个意外方向是非人类可读数据——他们在做 DNA 基础模型,DNA 词表只有四个字母、不密集,但序列极长,恰好适配他们擅长的动力系统与长序列能力。至于多模态输出,主持人问 7B 级别模型做视频输出是否现实,Hasani 直言高保真视频输出不现实,但如果用 world modeling 的方式训练 7B 以下的 LFM,模型能把物理知识编码进内部表征、改善自身理解,只是输出不了高保真结果——而这对工厂里机器人的接地作业而言比娱乐用途更重要。

最后一段是关于生态的冷酷结论。被问到 Modular 被 Qualcomm 收购、Mojo 1.0 开源,以及 Liquid 自己从 Jax 切到 PyTorch 的经历,Hasani 说他极其推崇 Chris Lattner(「我的英雄之一」),Modular 在 kernel 层做的是扎实的底层工作,但他不相信 Mojo 那种统一性——要在 AMD 或 Qualcomm 上跑好,你终归要写硬件专属的 kernel。他的观察是:那些试图做「全硬件通用语言」、没有锁定单一生态的推理项目,深挖下去全都不如原版 llama.cpp(本质是编译器加高度优化的 C++ kernel);真正成功的都是锁定一个生态的,所以 Modular 进 Qualcomm 生态反而更可能成功。Liquid 自己的原则是不重新发明轮子、贴着最原生的平台走。「生态永远赢。这是个很残酷的答案,对新进入者不公平。」他也借此给创业者一句话:问题越难越值得做,容易的问题别人早就做了。

收尾是那个必答题:明年就是 Transformer 十周年,Attention is all you need 吗?Hasani 的回答是——注意力确实是你需要的一个元素,我们还会与基于注意力的系统共处很长时间,它会存在于几乎任何架构中,但它只是一个组件。除它之外还需要硬件感知、定制化、具身(他强调具身对虚拟 agent 同样成立——在虚拟世界里行动的 agent 也要理解自己所处的环境),以及自适应智能,也就是能够持续学习、持续演化的系统。

金句

这只虫子只有 302 个神经元,却能控制 95 块肌肉细胞,比当时地球上任何机器人系统都做得更好。 —— Ramin Hasani 2:21
计算机科学里没有免费午餐——当你把复杂的动力学线性化,你就在损失表达力。 —— Ramin Hasani 10:48
静态的 eval 会过期。上线之后评测标准不可能保持不变,你必须让它持续演化。 —— Ramin Hasani 43:59
智能是碳的一种属性——而我们正在硅上造智能。基底会决定下一代架构。 —— Ramin Hasani 引述 Christof Koch 52:28
生态永远赢。这是个很残酷的答案,它对新进入者并不公平。 —— Ramin Hasani 67:02
如果一个问题很难解,那反而说明它值得做,应该让你觉得更有吸引力——容易的问题别人早就去解了。 —— Ramin Hasani 67:02

提到的书·产品·人物

适合谁听

关心非 Transformer 架构、端侧与边缘推理部署,以及基础模型如何真正进入汽车、笔记本和工厂产线的研究者与技术决策者。

← 返回全部观看原片 ↗