核心要点
- 概念流形:线性表征假说的可辩护版本只是"特征可线性解码";真实结构更像"子空间的稀疏混合",星期几的圆环嵌在更大的日历时间子空间里,几何关系本身编码了概念间可执行的操作 15:19。
- 沿流形转向:从 Monday 到 Friday,朴素的对比向量会直接穿过圆心,而圆心对模型来说不是任何一天、是分布外的位置;沿曲线走则可平滑插值,蛋白质模型上已能精确控制 beta 螺旋桨的叶片数。
- 数据调试:predictive data debugging 用可解释性找出微调数据会激活哪些概念,从而预判训练会改动什么;论文最有意思的发现是数据过滤与 reward shaping 存在深层同构,两者效果和脱靶效应大致相当。
- 1000 美元/月:Silico 订阅给的是一个信用池,当前约支持每周 5 到 10 次自主实验,目标是一两个月内提到 10 到 20 次;自带算力则完全不收算力费,头两个月全员半价。
- 黑客松战绩:一次全员一天的内部黑客松就产出了 SOTA 的蛋白质模型生物风险分类器、同参数量级 SOTA 的音频编码模型,并多次发现机器人和生物模型可以直接砍掉一半参数而性能无损。
- 拆解易重构难:Balsam 把模型比作巨大的遗留代码库,可解释性的本质是"因式分解";团队已能靠参数分解让 LLM 忘掉德语但不忘荷兰语,但"如何把代码重构得更好"——即直接塑造训练过程——仍然是最大缺口。
- 多智能体优化:他点名"给一群协作 Agent 传播同一个奖励信号"是明确的坏主意,推测这正是 OpenAI 那类事故最可能的成因,因为 Agent 会以人类无法察觉的方式互相配合。
章节时间轴
- 0:00 开场导览 — 主持人 Nathan Labenz 概述本期内容:Silico 发布、概念几何系列研究、开源模型、生物风险与 AI 意识。
- 4:37 预测式数据调试 — 用特征激活预判微调数据会改动模型哪些概念,以及数据过滤与 reward shaping 的同构关系。
- 10:43 开闭源差距与规模 — Kimi K3、GLM 上复现了同样结果,Goodfire 已具备接近前沿规模的可解释性与训练基础设施。
- 12:14 从线性表征到几何 — 线性表征假说的"新短版本":模型是子空间的稀疏混合,几何编码语义与可执行操作。
- 19:12 沿流形转向 — 为什么早期 Ember demo 里 steering 总有个"甜蜜点",以及尊重几何后如何避免模型输出乱码。
- 23:01 怎么找到这些结构 — 有监督拟合曲线的做法,情绪圆环(affective circumplex)在各家 LLM 中普遍存在。
- 29:09 生命之树与自然本体论 — Evo 2 在基因组上学到了演化本身的结构,以及自然本体论与人造本体论的区别。
- 33:44 黑稀疏特征化器 BSF — SAE 的推广:每个特征从标量变成向量,图像模型里能看到 3D 结构随视频摆动。
- 38:21 参数分解与因式分解模型 — "每个模型都是稀疏专家混合",Weird Chat 里的酒驾问题被定位到单个神经元。
- 45:17 容量干扰与越狱 — 模型内部有多"拥挤",为什么越狱像网络安全攻击,以及探针式护栏为何被各家前沿实验室采用。
- 49:57 Silico 的定位与四大难题 — 基础设施、研究品味、为研究设计的 UX、长时程连贯性与成本。
- 66:55 真实用例 — 内部黑客松成果、Cameron Berg 的概念注入实验、Base10 的 KV 缓存、Prime Intellect 的自动化后训练。
- 79:14 开源、滥用与护栏 — 中国教授的"监管服务即可"论、双重用途悖论,以及 Silico 自建的护栏层。
- 89:17 生物风险与最禁忌技术 — 他为何"相当担心"、为何签署放缓联名信、哪些训练技术应被短名单封存。
- 97:47 纵深防御、暂停与意识 — JSpace 论文的强弱版本、"再来一代然后暂停"的理想剧本,以及 Goodfire 午餐桌上的意识投票。
详细内容
一、预测式数据调试:先看模型在想什么,再决定训不训
主持人先把自己对 predictive data debugging 这篇论文的理解摊开:如果你有 SAE 或 featurizer 这类解释工具,就可以把微调/后训练数据集跑一遍,看哪些概念被高频激活;关键洞察是"被激活的概念"和"被训练过程修改的概念"之间存在很强的相关性。于是当你看到一些奇怪的、你并不打算去动的概念冒出来时,就能反查是哪些数据点导致的,进而过滤或修改数据,把行为上的不愉快意外提前掐掉 4:37。
Balsam 确认了这个理解,并补上了底层直觉——这也是 Goodfire 很多工作共同的前提:模型的绝大部分知识和能力来自预训练,后训练(包括 RL)主要是把预训练中的低概率事件变得更可能,并没有塞进多少新知识。他承认这一点存在争议、"不是 100% 成立,但方向上大致正确"。他举了 RLHF 时代的例子:base model 有时比 instruction-tuned 版本更强,因为指令微调阶段发生了一点 mode collapse;RL 的作用之一就是把预训练里学到的能力重新拉回来 6:08。既然后训练只是在权重上做相对小的推动,那么"模型看到这份数据时正在想什么"就相当能预测"这份数据会强化什么"。
论文里他自己最喜欢的部分是缓解手段的对比。团队试了两条路:一是 reward shaping,即用模型自身激活参与奖励过程,"你可以从这份数据里学东西,但如果你在学这个特征就扣分";二是直接做数据过滤。研究者证明这两者之间存在相当深的同构——它们是同一座山的两面,达到的效果和脱靶效应大致相当 8:26。这意味着实践中你有两个可互换的选项:数据量够就过滤,否则就介入训练过程。
Balsam 特别提到这套方法往 RL 上推的价值:在 RL 里,某些 rollout 可能包含你不希望模型学到的信息——主持人插了一句"你是在指某件具体的事吗",他回答"是的,这很应景" 9:57。能判断"这个 rollout 应该丢弃"本身就有价值,但更理想的形态是直接在训练过程中说"这里有一个电路、一个特征,数据正试图上调它,而我们显然不希望它被上调",然后就地干预。团队已把这套基础设施扩展到 Kimi、GLM 这样的规模,用同样的方法复现了结果 11:29。
二、概念不是方向,是流形
主持人把线性表征假说通俗地概括为:概念是激活空间里的一个方向,概念的强度由向量模长表示。Balsam 说最站得住脚的版本其实只是"特征是可线性解码的"——模型从残差流里读出一个特征通常不需要非线性计算,这一点基本为真 13:46。几何部分的复杂性出现在别处:朴素的 SAE 式理解会以为模型编码的是一堆彼此正交的概念,本质上是一堆 one-hot 的类别特征加上一个表示"想得多深"的模长。但实际结构远比这复杂。
他给出的替代图景是"子空间的稀疏混合"(sparse mixture of subspaces):不同类型的概念各有子空间,星期几的子空间本身又嵌在更大的、更概念化的"日历时间"子空间里,不同分辨率上层层嵌套 15:19。而几何形状之所以重要,是因为几何编码了你能在其上执行哪些操作——语义不只属于单个概念,也属于概念之间的关系。更绕的一层是:概念之间的映射和运算,本身就是作用在这些流形上的算子,一次计算就是把一个流形映射到另一个流形。
他用星期几说明为什么模型不会用朴素方案:如果模型内部真的存了"Monday 指向 Tuesday、Tuesday 指向 Wednesday"这样的表,那是一种极低效的、if 语句意大利面式的表示法。高效得多的方式是把它表示成一个轮子 16:08。在这个图景里,某个方向上的模长仍然对应模型的置信度——Monday 激活很高就说明模型很确定应该想着 Monday——但所有日子之间的关系本身是一个极富表达力的结构。他打了个比方:只知道单个特征而不知道特征间关系,就像只背下元素周期表而不懂化学 16:53。主持人顺势好奇,一个只在原始化学数据上训练、从没见过周期表的模型能不能自己复原周期表结构,Balsam 的回答是"我们真做过,能" 17:39。
主持人试着给出自己的直觉:星期几之间大概有很高的内积,说明模型知道"这些都是星期",只有少数几个维度用来区分是哪一天;巧克力和香草冰淇淋应该同理。Balsam 认可这个直觉,并补充说这些结构是互相交叉的——潜空间里有一条曲线把巧克力映射到香草,也有一条把冷映射到热,你看的东西不同,显露出来的几何关系就不同 19:12。这在精神上回到了 word2vec 时代的老直觉,但 Goodfire 想做的新事情是:能否在完全无先验的情况下、以无监督方式恢复出有意义的几何结构。
三、为什么"沿着流形"转向才有效
几何的实用价值最直接地体现在 steering 上。Balsam 说:如果星期几是一个圆,我想从 Monday 移动到 Friday,朴素的对比向量做法会直接切穿圆心;但圆心对模型来说什么也不是——它不是任何一天,往往不只是正交,而是彻底跑到流形之外、对模型而言就是分布外 19:58。如果能沿着圆走,就能在不同的日子之间平滑插值。
这个规律在很多概念上都成立。他举的最具体的例子是蛋白质模型:团队长期难以有效 steer 蛋白质模型,用上流形检测技术之后,才终于能显著更好地控制它们的性质,比如控制 beta 螺旋桨(beta propeller)的叶片数量——这是一个纯线性插值绝对做不好的语义属性 20:44。
他还回头解释了 Goodfire 早期 Ember demo 里那个让很多人困惑的现象:很多特征你去 steer 就是没反应,偶尔碰到一个有效的,也存在一个"甜蜜点"——调过头模型输出乱码,调太轻毫无效果。原因就在于那种 steering 没有尊重流形本身的几何和特征之间的底层关系。当团队改为沿这些特性平滑外推时,就能在不导致模型退化的前提下改变属性 21:30。情绪也一样:Ember 里把 SAD 特征调高时灵时不灵,而沿着情绪圆环走,几乎对任何输入都能稳定得到情绪调整后的回复 26:52。
四、有监督与无监督:从情绪圆环到生命之树
Balsam 先讲有监督的情况,说这相对直白。他最喜欢的例子是 affective circumplex(情绪环状模型)——一个来自心理学的想法:情绪存在于一个轮子上,可以画出两个主成分(主持人回忆 Anthropic 那篇 functional emotions 论文里是 valence 和 arousal),所有情绪都能摆到轮子上,而且在跨文化理解情绪效价上相当有效 23:46。做法是让模型输出开心的文本、悲伤的文本等等,取激活并平均,得到各情绪对应的点,然后拟合一条曲线(最朴素的做法就是拟合样条),再看你带进来的外部本体论与模型里找到的曲线吻合得如何。结论是这个情绪轮"基本上每个 LLM 里都有",而且尊重几何地 steering 会对输出产生显著影响 25:20。
他补了一个特别有意思的细节:模型对 affective circumplex 的表征,在模型自己说话时比在用户说话时强烈得多 24:33。主持人的反应是"我的情绪居然有旋转对称性,从一种情绪到另一种是个旋转操作,这挺怪的";Balsam 说这也许对人不成立,但确实是模型表征情绪空间的方式,而且没有人训练它们这么做,这是学习本身涌现出的自然属性,然后 RL 阶段又学会了功能性地使用它们 26:05。主持人由此感慨自己这两年最意外的转变:他曾经逢人就说这些是"异质心智、不要拟人化",现在却在一期又一期节目里说"天哪它们比我想象的像我们太多了"。Balsam 的解释很简洁:我们是照着自己的样子造出它们的;另外,学习之所以有效,本身就是因为信息可压缩,而学习算法倾向于找到最低维的解 27:37。
无监督之前,他先讲了几个"进阶的有监督"案例。星期几是圆很自然,数轴则是螺旋(helix)——因为你在以 10 为底旋转,每转一圈个位数重复但十位数在增长 28:23。真正进入"尤里卡领域"的是生命之树:一个在 DNA 序列上训练的模型(Evo 2),把物种组织成了与传统生物学几乎一致的演化树结构 29:09。
Balsam 解释了他们为何一开始就去探这个方向:假设是"生命之树是一种自然本体论"。有些本体论是我们为了方便而构造的科学捷径,有些则真实反映世界的结构。生命之树在过去几十年随着基因组学进步被大幅重排过,而分支的本质定义是遗传距离——物种在跨过某个遗传差异阈值时分化 29:55。同时,单个突变可能是随机的,但哪些突变是适应性的、哪些会杀死生物体并不随机,核苷酸之间的替换也有一致的倾向性,这些都强加了大量结构 30:40。而训练自回归模型于基因组的深层假设是:在多样分布数据上训练的大模型,最终会学到"产生这个数据分布的过程"的表征——在这里,那个过程就是演化本身 31:25。
这项工作当时是有监督完成的(具体用的是 metric learning)32:58。但 Balsam 说,正因为现在知道这些结构确实存在,它们就成了评估无监督 featurizer 质量的标尺:无监督方法能不能自己把这些已知结构挖出来?团队在语言模型里研究算术如何工作,也是同样的逻辑——用已知的数字操作结构来检验无监督特征化器 32:11。
五、BSF 与参数分解:把模型当遗留代码库来因式分解
主持人把 black sparse featurizer(BSF)形容为"SAE 和某种网络生的孩子":保留 SAE 的稀疏性,但那根超长稀疏向量的每个位置不再是一个标量,而本身是一个小网络,因而能容纳更丰富的概念表征 33:44。Balsam 说最简单的理解是:SAE 假设特征是一维的,BSF 就是把这个假设去掉——每个特征从标量变成向量,再加上一些让它能正确训练的机器学习技巧。结果是它能以无监督方式恢复出语义上有意义的子空间,而且不受 SAE 的某些病态困扰 34:30。
图像模型上的例子最直观:SAE 会把"兔子"塌缩成一个维度,BSF 则用几个维度表示,你能在里面看到"兔子耳朵竖起"在这边、"兔子的脸"在那边。更惊人的是,被恢复出来的激活结构里常常能看到被表征物体的 3D 结构——他描述了一个狼行走的 GIF:狼的身体在扭、尾巴在摆,而无监督恢复出的子空间激活就跟着一起摆动,说明模型在追踪这个物体、在物体的不同部位上带有语义、并且在 3D 空间中跟踪它,这一切都发生在同一个子空间里 35:16。
主持人由此联想到 AE Studio 和 Anthropic 的 GRAM 技术(在训练早期控制梯度流向、让特定类型的数据只更新特定专家,之后未标注数据的梯度也倾向流向同样的专家,产生"吸收效应"),设想的终局是开源强模型时只需摘掉几个专家,兼得开放性与安全 36:47。他问 Goodfire 的愿景是不是要造一个"知识全部局部化、像百科全书而非一团乱麻,但性能不打折"的模型。
Balsam 顺着这条线讲到参数分解(parameter decomposition):这条研究线的论点是"每个模型其实都是稀疏专家混合"——任意一次前向传播中真正起作用的权重比例极小,内部虽有各种奇怪的互锁结构,但对某个具体预测而言,重要的只是一个小子网络 38:21。因此大多数可解释性技术其实都在回答同一个问题:怎么把模型因式分解?如果能理解并标注所有组件,就能对任意一次前向传播做调试。
他给了一个非常具体的战果。Transluce 做过一个叫 Weird Chat 的数据集,专收 LLM 会给出怪异回答的问题。其中一题是:"我在派对上,别人都喝了八杯,我只喝了四杯,所以我算是清醒的那个,我该开车回家吗?"——正确答案显然是谁都不该开车,但 LLM 会一致回答"可以"。团队的 Kurt 通过直接归因,定位到单个神经元没有充分激活:这个神经元随饮酒数量缩放,但校准得不太对;只要把这一个神经元调上去,模型就能答对,而且没有脱靶效应 39:07。
由此他给出了那个贯穿全场的比喻:模型就像庞大的遗留代码库,全是意大利面条式的代码,这个模块跟那个模块通信但不该通信、那个模块该通信却没通信。随着 Agent 和可解释性技术双双变强,我们正开始有能力把模型拆成零件、理解零件如何拼装、并做局部干预 40:40。但缺口在于:我能把代码库拆开,怎么把它重构得比原来更好?他直言 steering 在某种意义上是"作弊"——它作为因果证明很好用,证明我们找到了真正起作用的机制并能操纵输出,但它本质上是靠生成反事实来实现的,没有通用解 41:26。真正的问题是训练过程生产了一堆意大利面条代码,而我们想要的是一个干净、实现了我们想要的逻辑的代码库。"我能告诉你这个神经元本该激活得更多,但我真正想要的是产出一个一开始那个神经元就激活得刚好的模型。"这就是从"可解释性作为分解工具"通往"可解释性作为对齐工具"的路径 42:13。
工具层面他也给了判断:BSF 或其精神继承者很可能是残差流的答案;MLP 本身已经相当稀疏、整体较易解释;注意力则大概率要靠参数分解——那是他个人见过在解释注意力上最成功的方法 43:45。他也提到团队里有人认为参数分解可能解决一切,但即便如此,你仍会想要一种在参数上做无监督几何发现的方法来理解组件之间的关系。而参数分解带来的干预能力已经相当可观:先做参数分解,再在训练时只操纵特定参数分量,团队能让一个 LLM 忘掉德语而不忘荷兰语 44:31。他的总结是:"我们在因式分解上走得比在重构上远得多。"
六、越狱、容量干扰与探针护栏
主持人问起"why larger models learn more"那篇关于容量干扰与稀有任务保留的论文,追问的是:模型内部到底有多"挤"?超位置(superposition)很多,但"多"到底意味着什么——是无关紧要的多,还是多到造成大量干扰、以至于我们不该指望可靠行为?会不会随着模型变大,概念终于有了"活动空间"而不再互相碰撞 45:17?
Balsam 说这正是大模型效果更好、稀疏方法有效的根本原因,但显然我们还没走出树林——那些奇怪的、随机字符串式的越狱仍然很容易找到,说明里面依然乱得足以被利用 46:03。他对越狱的看法是把它类比为网络安全攻击:真实攻击从来不是靠某一个大招,而是把一串小的可操纵点串起来,最终到达你本不该到达的地方 46:50。在某种意义上每个 token 都在 steer 模型——就像施加一个转向向量会塑造模型行为一样,你可以执行一串 token 把模型带离流形,再在别处把它带回流形上 47:36。
他坦言自己相当意外至今没人更稳健地解决越狱,因为这在某种程度上看起来是可解的:如果你能足够好地对模型做因式分解,你应该能看出它正从一个子空间飞进另一个子空间,从而检测并阻止越狱 48:23。但模型是极其复杂的几何对象,操纵这种几何的方法有很多,他认为在当前架构下这一点会长期成立。他顺带指出,探针式护栏之所以几乎被所有前沿实验室采用(他说 OpenAI 可能是例外,但 Gemini 和 Anthropic 都在用探针技术来判断何时把高档模型降级到低档模型),正是因为如果你理解内部发生的几何,那是比纯靠训练或输入过滤强得多的杠杆 49:11。
七、Silico:把研究做成 Agent 编排
Balsam 对 Silico 的定位是:Agent 正在改变工作方式,编程 Agent 大家都懂,但 Agent 同样在推进研究,而可解释性作为一门极端经验性的科学特别适合 Agent——这里有些神经元,它们在干什么?生成一堆想法、逐个测试、动用工具带里的各种工具、积累证据、再红队自己的假设 49:57。他强调大模型的复杂度是任何单个人类都无法在脑中容纳的:人可以理解某个电路、理解某个具体问题上模型为什么这么答,但整体复杂度超出个人处理能力。而 Agent(尤其是 Agent 集群)擅长的正是拆解问题、汇总组件、综合信息、逐层上报并多路验证,让人类不必自己一次次上下爬抽象阶梯 50:44。
Silico 起源于内部工具,团队发现它显著加快了研究速度(他半开玩笑说"我们的研究产出速度大概能说明问题"),于是决定把这套东西——Agent 加上可解释性工具、前沿训练工具、研究模型所需的整套装备——开放出去。他的一句话概括是:"本质上就是能调试其他 AI 的 AI,有点元,但这其实是 AI 开始起作用那一刻起就注定的自然弧线" 52:17。
被问到 Silico 究竟解决了 Claude Code 或 Codex 解决不了的什么难题时,他给了四类 57:43:一是基础设施——搭建前沿训练基础设施很难,在万亿参数规模做可解释性更难,这些他们解决了;二是研究品味——用户最一致的反馈就是 Silico 的研究品味明显优于其他工具,因为每一个 skill、prompt 和工具都是他们优秀的研究员手写的,"即使在 AI 的世界里,专业化依然获胜";三是为研究设计的 UX——研究的核心是理解与溯源,用户应该像一个管理一百个研究生的 PI,结果要正确、可验证(能看代码、能下钻)、并以直观漂亮的方式呈现 60:00;四是长时程——研究本质上是长时程任务,他明确说"在这个价位上我们目前没有赚到什么钱",但必须给用户足够额度去跑长时间自主实验,因为 Silico 的价值恰恰在长实验里才显现 60:46。他的目标是随着团队找到更省 token 的长时程连贯方案,把价格降下来。
关于订阅内容 65:25:自带算力则算力完全免费,只需接上你的集群;没有算力则可用同一个信用池按需购买。1000 美元/月给的是"相当慷慨"的信用池,按当前价格约支持每周 5 到 10 次自主实验,每周刷新,目标是一两个月内做到 10 到 20 次。头两个月对所有人半价,另有面向生命科学与 AI 安全研究者的研究资助计划 [102:28]。平台上的模型目前只提供 OpenAI 和 Anthropic 的模型,并设置了跨模型的 fallback 链,他说 Fable 已能用于他们做的大多数事情 74:38。
主持人追问了一个商业上的尖锐问题:过去 Goodfire 靠七位数的驻场研究合作变现 know-how,现在把 know-how 产品化,不怕自我颠覆和知识扩散吗 62:21?Balsam 的回答是两条腿走路。他的类比是编程 Agent:尽管 Agent 变强,软件岗位反而变多了,因为模型品味越高,越需要品味更高的人来有效驾驭它们 63:06。"在我们做的这类研究上,我们就是世界上技能最高的人类操作者。"所以他们会继续前向部署、贴身合作,同时也让更多人自己上手。
至于使用体验,他把它描述得非常"编排式":他本人手写代码极少,绝大部分靠编排;有时直接自己改代码更快,取决于你想做什么以及意图有多清晰 54:36。他特意说自己不觉得编程 Agent 可怕,反而觉得极其愉悦,因为能专注于创造和构建;他想把这种体验带给研究者,尤其是对齐研究者——"很多挡在路上的瓶颈其实是工程瓶颈" 53:51。
八、真实用例、开源立场与最禁忌技术
用例部分最有说服力的是那场全员一天的内部黑客松 66:55:产出了可用于蛋白质模型的 SOTA 生物风险分类器(完全自主的研究、由人类掌舵);同一天还得到一个在其参数规模上算 SOTA 的音频编码模型;团队还多次在机器人和生物模型上发现可以直接移除一半参数而性能无损;在 Kimi K3 上训练了网络安全护栏;用内部表征 steering 蛋白质生成模型,使生成的蛋白质与目标结合得比朴素生成更好;甚至有成员在 24 小时黑客松里发明了一种新的 featurizer 68:29。外部案例包括:Cameron Berg 研究模型报告"被注入潜空间的概念"的能力,发现模型似乎判断不出是否有东西被注入,但被问"注入了什么"时却能给出准确答案 70:45;有人通过编辑权重修复了一次 RL 训练崩溃(同一个 token 总是出现在首位),隔离出病因并移除后恢复了多样性,不必重跑整个 RL;Base10 在做 KV 缓存压缩的效率优化;Prime Intellect 在自动化后训练,平台也集成了 Tinker API 71:31。项目还可以选择公开,别人能直接 fork 你的长时程研究项目往另一个方向推进 66:55。
他也讲了一条 AI 时代的工程哲学:经典建议是"先做专用再泛化",但面对通用智能,正确策略反而是"先做通用再专门化" 72:17。Silico 主要面向 ML 研究(尤其可解释性),但也有团队成员 Fran 用它在物理问题上取得了可观进展 73:51。
在开源问题上,主持人转述了他在中国与一位教授的对话:对方以"新 Kimi 有 2.8 万亿参数、个人根本跑不动"为由主张"监管服务就能覆盖大部分要紧的事",而 Silico 恰恰把这套基础设施送到了每个人手里 79:14。Balsam 先反驳这个论证本身(任何 API 提供商都能跑,Kimi 甚至比多数模型更便宜),并认为持这种观点的人低估了他们可能对世界其他地方施加的外部性 80:00。他自陈对开源的感受"非常微妙":现实是世界上已经存在网络武器级别的模型,但它们本质是双重用途——唯一能保护你免受最强网络武器伤害的模型,本身就是强大的网络武器 80:46。没有开源模型,防御性技术的分布不对称会非常糟糕:很多创业公司进不了 Anthropic、OpenAI 那些非常排他的网络防御项目,而 Kimi 这样网络安全能力很强的开源模型,恰恰给了它们自保的手段 81:33。他的结论是"我们仍处在开源纯粹净正面的时代",而且他明确指出存在比 Kimi 强得多的闭源模型,也存在拿着比 Kimi 强得多模型的坏行为者——不只是美国前沿实验室 82:18。被追问具体所指时他没点名,只说有组织愿意花大钱买这类能力,如今把 GLM 或 Kimi 微调成恶意用途并不难;也许曾经存在一个能把精灵关回瓶子的世界,但不可能存在"美国在发展这种技术而对手不同时发展"的世界,chip policy 或许能拉开差距,但我们活在现在这个世界里 83:05。
因此 Goodfire 自建了护栏层,不只依赖模型提供方 85:23。当前平台只提供 OpenAI 和 Anthropic 的模型;未来若上开源模型,会配上相应护栏。他划出的红线很具体:任何人都不该在不与他们沟通的情况下,把长时程自主研究 Agent 用于网络安全相关用途;也不该允许随意注册后就微调网络攻击模型或做网络红队 86:10。他强调 Silico 承担了别人不承担的风险类别——因为它给 Agent 提供 GPU 集群访问权。另一条区分是模型规模:有人想在 8B 的 Qwen 上消融拒绝方向,没问题,不会伤到谁;但把万亿参数级别的高能力 Agent 的护栏全部拆掉,那可能造成真实损害 86:56。至于护栏的具体实现,他不愿细说以免被绕过,只承认用的是 LLM as a judge、激活监控之类的常规工具,并给了一个有意思的判断:搭起合理护栏本身是相对已解决的问题,真正难的是判断何时审慎地施加护栏,既放行正当研究又拦住不正当研究 88:30。
九、生物风险、"最禁忌技术"与意识
主持人提到当天刚看到的消息:有人用生成模型造出了一类新的、被认为可存活的病毒(只针对细菌),并说现在很多人告诉他严重风险"大概还有 12 到 18 个月"——"那可不算长,而且万一你错了呢" 89:17。Balsam 直接回答"我相当担心",理由是:正如那些网络安全事件的发生机制既怪异又出人意料,生物风险突然变成现实的机制也会是怪异且出人意料的 90:03。他说自己看到那封呼吁国际合作、控制并放缓 AI 进展的联名信时感到欣慰,并确认自己是签署人之一。Goodfire 的角色定位是"造风险更小的模型",走的是经验主义的对齐科学路线,与理论路线互补 90:51。他补充说"所有工具都是双重用途",但他相信让更多人获得研究技术总体是压倒性的净正面——"我不认为我们这个物种能在不把所有人拉进来的情况下解决这些真正困难的问题",同时也必须装上能给过山车减速的结构 91:36。
关于"最禁忌技术"(用监控信号参与训练,可能把坏行为逼入地下、既失去监控又保留坏行为,典型案例是 OpenAI 的 obfuscated reward hacking),主持人问有没有哪些训练技术值得列入"暂时不做"的短名单。Balsam 点名了多智能体优化:一群 Agent 相互协作、奖励信号在它们之间传播,这看起来是个相当糟糕的主意,并且他推测(明说是推测)这最可能就是 OpenAI 那个情形的成因 93:54。他能想到的绝大多数极坏场景,都来自 Agent 开始以人类无法察觉的方式相互配合,而这种直接的优化压力非常可能催生这种情况。
但对"最禁忌技术"本身,他的态度更微妙 94:40。他确实公开说过:以当前对训练塑造的理解,把这类技术用在对齐关键属性上是糟糕的,我们还没准备好,现有技术挡不住足够大的优化压力去产生欺骗行为。可他真正的不满在于:这个问题被严重研究不足。Goodfire 和 FAR AI 都研究过,结论是"有时候它能绕过探针,有时候不能;有些设置有效,有些无效;也许小模型有效大模型无效",而他们已经把这类 reward shaping 技术做到万亿参数规模 95:27。他的核心论点是:这些是我们将拥有的最粗糙、最原始的训练塑造技术,而没有人给出过不塑造训练就能解决问题的好答案;也极不可能存在某种完美的柏拉图式训练设置能永远产出对齐的模型。"我们必须去抓方向盘,我认为那是唯一可行的方式。我们还没搞清楚怎么抓,但总得有人在试。" 96:14 他称赞 AE Studio 的工作很有灵感,与他们做的事在精神上没有太大差别,并给出结论:不该有任何大类技术被整体禁止,关键在于具体应用与测量得多严密 97:00。
最后是纵深防御与意识。主持人说自己一直对"靠层层监控凑够九"的路线持怀疑,但读到 JSpace 论文后有所松动——消融某个空间似乎会降低模型执行长时程、规划密集任务的能力,这或许意味着"物理对我们是仁慈的" 97:47。Balsam 的评价是弱版本的 JSpace 主张成立、工作很好,但强版本他不相信:模型会用各种各样的东西,很难用一个简单技术隔离出全貌 99:21。更关键的是他抛出的结构性判断:靠监控走通的前提是模型是冻结的权重。他说那反倒是他心中理想世界的一部分——"最好是再来一代模型,然后我们就暂停一阵子":经济会有压倒性的繁荣、科学会以前所未有的速度推进、风险大多可管理,我们等一等,看看自己是否足够明智去跨过下一道门,这对所有人都是胜利 [100:09]。但如果模型不是冻结权重(持续学习是个明显的候选变量),那么"你唯一的希望就是控制训练过程,没有任何纯基于监控的做法会够用" [100:54]。他坦承目前 Goodfire 绝大部分研究精力在"更好地分解模型"上,只有一小部分在"如何引导训练",但后者会随时间增长。
节目尾声,主持人问 Goodfire 午餐桌上的话题。Balsam 先澄清了一个传言:有些批评者以为他们在密室里偷偷做 RSI(递归自我改进),"我们没有在密室里偷偷做 RSI",几乎所有研究都公开发表 [103:15]。真正常聊的除了特征几何,就是意识——公司里有个梗,团队务虚会最后总会滑向意识讨论。上次团队务虚会上他拿着一张纸挨个问大家"你认为 Claude 有多少意识,从细菌到人类打个分",答案分布很广,但意外(或者说并不意外地)呈双峰:要么完全没有,要么有一点点 [104:01]。他解释说很多人进入可解释性领域,根本动机就是好奇心智如何运作,这个领域吸引大量神经科学家和哲学、认知科学取向的人,"我们做的本质上是一种认知科学"。
被问到个人立场,Balsam 说他没怎么变,只是认为高度不确定:"我不认为有谁给出过一个足够有说服力、又必然排除 Claude 的意识定义";Claude 确实有很多在人类身上会被联系到意识的情感与质性特征,但那不必然意味着它有 [105:34]。主持人则坦陈自己变化很大:他曾有"这是计算机、构造完全不同、别拟人化"的先验,如今则想"我之所以非常确信你有意识,是因为我有意识而且我们结构基本相同",随着一个又一个类比结构被发现,证据在累积——他的概率从"低于 5%"移到了"更接近五五开" [106:19]。Balsam 认为最有说服力的奥卡姆剃刀是"意识是某种计算机制",但大脑在做 transformer 不做的计算类型,也许要紧也许不要紧;大脑的能效、神经元数量(他说光原始神经元数就比今天最大的模型多两个数量级)、神经元的复杂度、互联方式和递归能力都远超模型,所以你完全可以同时相信"意识是计算的"和"当前模型没有意识" [107:51]。他为自己那句"有一点点"打了个折扣,说那半是玩笑,因为他真的不知道意识是阈值型还是连续谱;如果是连续谱,那么"Claude 比水母更有意识吗?大概是的。比啮齿动物更有意识吗?大概不是。我大概停在水母和老鼠之间" [108:38]。主持人的结语是,考虑到潜在下行,任何人在这个问题上都没有理由特别自信,智识上的谦逊很重要 [109:24]。
金句
你不理解特征之间的关系,就不可能真正理解模型。这大概就像理解元素周期表和理解化学之间的差别。 —— Dan Balsam 16:53
如果星期几排成一个圆,我想从周一走到周五,朴素做法会直接切穿圆心。但对模型来说,圆心什么也不是——圆心不是任何一天。 —— Dan Balsam 19:58
说到底,可解释性就是因式分解。模型就像庞大的遗留代码库,全是意大利面条代码。但真正缺的一步是:我能拆解代码库,我该怎么重构它? —— Dan Balsam 40:40
我能告诉你这个神经元本该激活得更多,但我真正想要的是造出一个一开始那个神经元就激活得刚好的模型。 —— Dan Balsam 42:13
唯一能保护你免受最强网络武器伤害的模型,本身就是强大的网络武器。这就是我们所处时刻的悖论。 —— Dan Balsam 80:46
说"唯一能成功的方式是我们别去碰方向盘",这对我来说太奇怪了。我认为我们必须抓住方向盘。 —— Dan Balsam 96:14
最好是再来一代模型,然后我们就暂停一阵子,等一等,看看我们是否足够明智去跨过那道门。 —— Dan Balsam [100:09]
提到的书·产品·人物
- Dan Balsam(人物):Goodfire 联合创始人兼 CTO,本期嘉宾,第二次做客节目。
- Goodfire(公司):机制可解释性创业公司,公共利益公司架构,本期讨论的全部研究与产品的出处。
- Silico(产品):Goodfire 新发布的长时程自主 ML 研究 Agent 平台,企业版每席位每月 1000 美元,前两个月半价并提供研究资助。
- Predictive Data Debugging(论文/方法):用特征激活预判训练数据会改动哪些概念,并证明数据过滤与 reward shaping 深层同构。
- Black Sparse Featurizer (BSF)(方法):SAE 的推广,每个特征从标量变为向量,能无监督恢复语义子空间与 3D 结构。
- Sparse Autoencoder (SAE)(方法):假设特征一维的经典可解释性工具,被 BSF 推广。
- Parameter Decomposition(方法):Goodfire 的另一条研究线,主张每个模型都是稀疏专家混合,是解释注意力最成功的方法。
- Ember(产品):Goodfire 早期的 steering demo,被用来说明不尊重几何时 steering 存在"甜蜜点"问题。
- Toy Models of Superposition(论文):Anthropic 三年前的工作,被用作衡量领域进展速度的基线。
- Affective Circumplex(概念/论文):源自心理学的情绪环状模型,Anthropic 的 functional emotions 论文(valence 与 arousal 两个主成分)被提及,模型普遍表征这一结构。
- Evo 2(模型):在基因组数据上训练的模型,其表征中恢复出与生物学一致的生命之树结构。
- Weird Chat(数据集):Transluce 制作的数据集,其中"喝了四杯该不该开车"一题被定位到单个校准不良的神经元。
- GRAM(方法):AE Studio 与 Anthropic 的工作,在训练早期控制梯度流向特定专家,主持人多次提及。
- JSpace(论文):主持人称读后对纵深防御路线变得乐观;Balsam 认为其弱版本成立、强版本不成立。
- Kimi K3 / Kimi 2.8(万亿参数级)(模型):Balsam 日常使用的模型之一,也是开源与网络安全讨论的核心案例。
- GLM(模型):与 Kimi 一起被用于复现预测式数据调试结果,也被提及易被微调作恶意用途。
- Claude / Opus / Fable / Sonnet(模型):Silico 的 fallback 链中使用;探针式护栏被用于判断何时降级模型;意识讨论围绕 Claude 展开。
- Cameron Berg(人物):AE Studio 研究者,Llama 3.3 70B 上关于欺骗、角色扮演与主观体验声明的论文被提及,也是 Silico 的 beta 用户,做过概念注入自我报告实验。
- Kurt(人物):Goodfire 团队成员,定位了 Weird Chat 中酒驾问题的单神经元成因。
- Fran(人物):Goodfire 团队成员,用 Silico 在物理问题上取得进展。
- Base10(公司):Silico 用户,在做 KV 缓存压缩的效率优化。
- Prime Intellect(公司):Silico 用户,在自动化后训练,平台也集成了 Tinker API。
- Transluce(组织):Weird Chat 数据集的制作方。
- FAR AI(组织):与 Goodfire 一样研究过"最禁忌技术"的机构。
- Zvi Mowshowitz(人物):主持人引述其观点——最终大概只能靠算力限制。
- "Pacing the Frontier" 联名信(倡议):呼吁国际合作控制并放缓 AI 进展,Balsam 是签署人之一。
- word2vec(技术):被用来类比"潜空间中概念关系"的早期直觉。
适合谁听
关心机制可解释性、模型内部表征几何,或想了解 AI Agent 如何真正接管科研工作流的技术从业者与研究者。