核心要点
- 责任而非能力:真正卡住 AI 落地的不是模型不够聪明,而是没人敢为它背书。Waymo 四年前就是超人类司机,至今仍不能载你去机场;Fable 之所以不开放,恰恰因为它太强、太难对它的行为作出承诺。
- 标准加保险:Rune 梳理 1900 年的电力、1930 年代的汽车、1950 年代的民用核能,发现每次都是同一套蓝图——标准定义规则和测试,保险公司掏钱赔付,因此最有动力如实量化风险并想尽办法降低风险。
- 4000 万美元:本期录制当天宣布 A 轮 4000 万美元,Ribbit Capital 领投,种子轮由 Nat Friedman 和 Daniel Gross 投资。公司只有 20 人,客户已包括 Cursor、Harvey、Lovable、ElevenLabs、Sierra 和 Intercom Fin。
- 每季度刷新:AIUC-1 覆盖 6 大类、51 项要求、130 条控制,每季度更新一次而非行业惯常的十年一轮;财富 1000 强风险负责人组成的 consortium 每季度开两次会,把最新焦虑直接写进标准。
- 测试才是关键:多数安全标准沦为纸面表演,AIUC-1 要求每季度跑数千次模拟,实测越狱难度、幻觉频率、数据泄漏率。审计端到端 3 到 10 周,认证有效期一年,产出一份约 100 页的审计报告。
- 劳合社兜底:ElevenLabs 买下业内第一份 AI Agent 保险保单,承保方是 400 年从未拒赔的 Lloyd's of London。关键不在于赔钱,而在于保守的第三方看过数据后愿意把风险放上自己的资产负债表,这本身就是信号。
- 看门人是天然垄断:Rune 援引《大空头》里 Moody's 的桥段——评级机构一旦互相竞争就会把标准卷到最低。让保险公司坐在桌边,是因为只有掏钱赔付的人没有动机放水。
章节时间轴
- 0:46 A 轮官宣与客户名单 — 宣布 Ribbit Capital 领投的 4000 万美元 A 轮,客户包括 Cursor、Harvey、Lovable、ElevenLabs。
- 1:31 从 scaling laws 到 Anthropic — 卖掉教育科技公司后读到 Kaplan 论文,意识到「资本会看懂这件事」,随即搬到旧金山加入 40 人的 Anthropic。
- 8:26 Waymo 给的顿悟 — 窗外的 Waymo 证明约束不是能力而是责任,这个问题具有普遍性,也随模型变强而加剧。
- 9:57 一百年来的同一套蓝图 — 电力、汽车、核能三次浪潮里,市场都跑在监管之前用标准+保险造出信心基础设施。
- 15:19 AIUC-1 标准拆解 — 6 大类、三种要求类型(技术控制、测试控制、政策控制),每季度由 consortium 共同刷新。
- 20:41 审计怎么跑 — KPMG、Schellman 等审计方核验证据,AIUC 自己跑技术测试,端到端 3 到 10 周,认证一年有效。
- 24:31 开发者最容易漏掉的事 — 绝大多数公司只优化好情况,从没做过严肃的对抗压力测试;护栏大多有,但根本不好使。
- 26:04 从 Agent 层走向模型层 — 模型层的风险进入国家安全范畴,政府与实验室之间存在信任鸿沟,需要中立第三方。
- 29:09 Moody's 式的中介 — 评级机构提供共同信息层,政府不必自建上千名技术专家;CAISI 是政府侧的对应尝试。
- 34:31 风险的排序 — 当下最现实的是网络安全,儿童安全正在升温,生物武器风险则在管线里。
- 39:05 为什么是营利公司 — 非营利标准缺乏对客户的响应机制;FICO、电影分级、UL 都证明营利标准可以运转良好。
- 42:54 保险合同长什么样 — 保单指定承保风险与赔付上限;ElevenLabs 那份保单的价值在于劳合社愿意背书。
- 51:16 理赔的灰色地带 — 我付 Cursor 每月 20 美元,写崩了造成 2 亿美元损失该赔多少?Air Canada 案已经定下判例。
- 53:34 标准如何塑造法律责任 — 法院判断「注意义务」时会参照通行标准,标准因此成为责任认定的地基。
- 57:26 路线图:Agent、模型、机器人 — 物理 AI 的严苛程度只会一路上升;机器人把幼儿撞下餐桌那天会催生严格责任。
- 64:22 可解释性与监控 — 机制可解释性还不能强制要求,但可作为加分项;Agent 已开始察觉自己正被评测,事后监控成为真相来源。
- 75:11 要不要给 AI 工程师发证 — 主持人自曝 CFA 背景并提出分级认证设想,双方讨论「规定该学什么」的责任重量。
- 83:42 假如一年半后宣布 AGI — Rune 认为业务不会变:实验室唯一永远做不了的事,就是当自己的看门人。
详细内容
一、从 scaling laws 到承保 AI:一条反直觉的职业路径
Rune 的背景是 PPE(哲学、政治、经济),而不是机器学习。2021 年底卖掉第一家公司——一家教育科技公司——之后,他偶然读到 Kaplan 的神经网络 scaling laws 论文,用他自己的话说「像被闪电劈中」。
有意思的是他从论文里读出的东西和研究者不一样。机器学习的人看到的是模型越大越聪明;他看到的是「资本现在能看懂这件事了」——投入更多钱就能拿到更多产出,可预期的回报意味着一轮炒作周期即将启动。主持人点评说,这正是 PPE 训练出来的直觉:搞机器学习的人读同一篇论文,不会得出同样的结论,但任何一个资本家读了都会坐直。
他从没去过旧金山,直接收拾行李飞了过去,一路喝咖啡找关系,最后被引荐给 Dario Amodei。当时 Anthropic 大约 40 人,刚从 OpenAI 分裂出来不久,正在纠结该不该部署模型、该不该赚钱、该怎么和外界打交道。Rune 说那时的 Anthropic 和今天外界看到的样子惊人地一致:极度团结、极度使命导向,并且活在「AI 可能极好也可能极坏,而我们想参与建造它」这一巨大张力之中。
最让他震动的不是论文本身,而是这支团队的推演能力。当时他们已经有了描述 2026 年世界样貌的愿景文档,细致到需要多少算力、资本开支会是什么量级、社会层面会出现哪些担忧、经济价值会有多大。「像握着一个水晶球,而事后看,这球准得离谱。」他强调他们并不是摆出一副「我们显然是对的」的姿态,而是「把这个假设非常非常认真地推演到底」——和后来那份《Situational Awareness》是同一种思维方式。
二、Waymo 悖论:约束是责任,不是能力
创业的起点是办公室窗外。早在 2022 年初,Anthropic 的窗外就有 Waymo 开过;在 Rune 看来,自动驾驶在某种意义上是「汽车界的 AGI」——它们已经是超人类的司机。可是四年过去,所有人都看过证据、都承认它比人类开得好,你还是不能叫一辆 Waymo 送你去机场。
他由此抽象出一个普遍命题:约束 AI 变得有用的,不是能力,而是责任、风险与信任。他举了一个更尖锐的例子:Fable 之所以尚未开放访问,不是因为它不是个好模型,恰恰是因为它是个非常好的模型——好到很难对它会做什么、不会做什么作出承诺。而且这个问题只会随能力增长而恶化:更聪明的 AI 可以更自主,更自主意味着更有价值,但风险面也同步扩大。
政府、银行、医院、军队要把 AI 纳入运转,必须先对它的行为边界有某种确定感。造不出这层「信心基础设施」(confidence infrastructure),采用率就会直接刹停。
三、为什么是「标准 + 保险」:一百年来的同一张蓝图
Rune 把这个问题沿历史往回追:1900 年前后电力普及,房子开始烧起来,很多人死亡;1930 年代汽车成为大宗,撞死大量行人;1950 年代民用核能上马,风险更是量级跃升。每一次,市场都跑在监管前面造出信心基础设施,因为做 go / no-go 决策必须要有它,而市场本质上渴望采用。
而每一次浮现出来的都是同一套组合:
标准提供「道路规则」,同时指定必须跑哪些测试,从而让风险高低变得可测。汽车碰撞测试就是典型——它既影响你今天的保费定价,也影响你的购买决策。
保险公司则是掏钱的人。正因为账单最后落在他们头上,他们是所有私营机构里最有动力如实量化风险、并想方设法压低风险的——因为降低风险直接增加利润。两者配合起来,标准定义什么该做,保险塑造做与不做的激励。
公司名字本身就是这段历史的致敬:AIUC 的名字来自 Underwriters Laboratories(UL,保险商实验室)。电力刚出现、房子接连烧毁的年代,付账的保险公司出资建起了这个实体,去测试灯泡、烤面包机等一切电器。今天 UL 同时拥有一个非营利实体和一个营利实体——他们后来意识到,要真正服务好客户,需要一个营利主体。类似地,美国公路安全保险协会(IIHS)的汽车碰撞测试标准也出自保险公司,动机同样直白:用标准压低死亡率,同时省钱。
四、AIUC-1 到底是什么:6 大类、51 项要求、130 条控制
设计原则是「把所有拖慢采用的顾虑收进一个框架」——也就是让财富 1000 强安全负责人夜里睡不着的那些问题,全部结构化。标准分 6 大类,主持人在屏幕上看到的数字是 51 项要求、130 条控制。
要求分三种类型:
1. 技术控制:你必须实装某样东西,比如一个 groundedness filter(事实性过滤器)。
2. 测试控制:必须由独立第三方对你跑测试。
3. 政策控制:更接近传统标准的部分,比如必须有一个具名负责人把名字签上去,必须有一套向客户通报事故的预案。
以「幻觉」这一项为例,展开后先看到的是 crosswalk(交叉映射)——市面上人人都发过一份高层级的 AI 风险框架,AIUC 把它们全部映射到一起形成超集,于是遵循这一份就能看出你同时符合了哪些其他框架。但真正的肉在下面两栏:control activities(高层要求如何落成可操作动作)和 evidence(审计要看什么证据)。Rune 说,业界对「大风险有哪些」其实没什么分歧,人人都同意;真正的困惑是「那我到底该做什么」。所以需求集中在最后那层具体证据上——不论你是 Cursor 这样的建造者,还是 JP Morgan 里那位不知道该问什么才不显得外行的风险负责人。他顺口讲了个笑话:曾有风险负责人向 Cursor 索要底层模型的知识产权,把这种问题塞进问卷里看对方会不会发现。
第三个核心设计是每季度刷新。AI 唯一确定的特征就是变得极快,今天讨论的顾虑和三个月前不是同一批。传统标准十年更新一轮,显然行不通。刷新的机制是一个 consortium:由真正在运营银行、医院、关键基础设施的风险负责人组成,每季度碰两次头,讲当下最焦虑的事,再由 AIUC 把它「操作化」成标准条款。所有改动都进公开 changelog——这既是对抗信息不对称的手段,也是一种自我约束:如果哪天标准被改烂了,所有人都查得到。
主持人追问执行细节:谁来审?答案是分工——AIUC 与 KPMG、Schellman 这类审计机构合作,由审计师做他们擅长的事,核查证据是否存在(可能是一张截图,也可能是一段需要 review 的代码);而测试由 AIUC 自己跑。端到端周期通常 3 到 10 周,取决于客户自身的成熟度:有的公司带着极严谨的安全体系上门,测完就过;有的还差得远,AIUC 给出要建到什么程度的 spec,对方的安全团队和工程师照着补。常常会测出过不了的项,客户必须补上额外防护或修复,才能真正做到「敢看着客户的眼睛说我们尽了最大努力」。认证有效期一年,期间每季度更新,最终产出一份约 100 页的审计报告。
自第一版以来的变化,主要来自「Agent 不是一种东西」:Cursor、Sierra、Harvey、ElevenLabs 彼此差异巨大。标准最初偏文本、偏客服(那里现成需求最多),后来 Rune 逐个挑选各领域的前沿公司共建,确保同一套标准对代码、客服、自动化都成立。最近进入议程的还有 MCP 与 Agent 间通信——Mythos 引发了安全负责人的大量疑问,open claw 和 MCP 相关的提问明显增多;同时随着编码 Agent 起飞,银行和医院对这个方向的要求正变得越来越精确。
五、开发者最容易漏掉的:压力测试,不是护栏
主持人问:对不常想这些事的听众,有什么容易被忽略的最佳实践?
Rune 的答案是:绝大多数公司从没做过一次严肃的压力测试。他们把时间——也许理所应当地——都花在优化好情况和平均情况上,关心输出对客户来说质量够不够高,却很少花时间设想对面站着一个对手时会发生什么,也没认真考虑过那些刁钻的边角情形。很多公司相当年轻,往往要过很久才招第一个安全岗,而那是和「做出好产品」完全不同的一套风险面。
架构层面反倒问题不大:多数公司确实有护栏,要么来自模型提供方的开箱即用能力,要么是自建的中间层过滤器。「它们只是不太好使。」他举了个具体例子:装一个分类器去判断「这是不是在给医疗建议」并拦截,很多公司都做了;但它到底管不管用是另一回事——你得坐下来穷举一个人可以用多少种方式索要医疗建议,还得读学术文献看有哪些框定方式和话术能把 AI 骗过去。这是一块缺失的专业能力。所以结论是:多数人积木都对,不是火箭科学,难的是钻到角落里去验证它真的成立。
六、往上一层:模型认证、政府与实验室之间的信任鸿沟
Agent 层之后是模型层,而模型层的风险直接进入国家安全范畴。问题的形状却高度相似:一边是出事要担责的人——Agent 场景里是企业安全负责人,模型场景里是政府;他们并没有毕生思考这些新风险,不清楚该找什么数据、该怎么测试,但必须确保顾虑被回应。另一边是技术极深的前沿实验室,他们非常了解风险,但「本质上有不总是全盘托出的动机」。
于是出现了一道信任鸿沟。Rune 指出,任何其他行业最终都会长出一个坐在中间的中立第三方——「没有哪个行业允许人们自己审计自己」。这个第三方需要同时具备两种能力:既能以实验室级的严谨跑前沿技术评测,又能像政府信任 PwC 做财务审计那样,产出格式一致、易读、可信的报告。
他把 Fable 事件读作这个缺口的直接症状:政府被告知存在风险,却难以评估这风险究竟有多大;打电话给 Anthropic,Anthropic 只能告诉他们「其实每个模型都能被越狱」——而这不是政府想听的答案,也很难让人放心。
对照物是 Moody's:评级机构去看一支债券,输出评级和证据,但不替任何人决定买不买(那取决于风险偏好),它提供的是一个所有人都能依赖的共同信息层。政府可以指着它对养老金说「你们只能买 AAA 评级的债券」,从而不必自己雇几千名金融技术专家每周重跑预测。
政府侧的对应尝试是 CAISI(Center for AI Standards and Innovation),NIST 下属的标准制定机构。Rune 说他们有非常优秀的人,但相对于挑战规模,预算小得离谱。所以真正的问题是分工:只有政府能做的是哪些,市场能提供什么才跟得上 AI 风险的变化速度。他的判断是,立法节奏太慢,无法精确指认此刻真正重要的风险,而市场可以提供及时信息。最终「这个模型的国家安全风险是否过高」是政治判断,但生产这份风险信息的流程必须与高速创新兼容——重点不是把模型锁上几个月等一个万全保证,而是在美国与中国竞速发布模型的现实里,插入足以让政府快速决策的风险信息,去平衡「不采用 AI 有风险」与「鲁莽采用也有风险」这道很细的钢丝。
顺带被问到中国模型,Rune 说 CISO 们的疑问集中在数据流向(「如果这些模型是中国的,我们的数据去哪了?」),多数可以被解答;更普遍的是一种宏观层面的紧张——不愿让关键基础设施跑在非美国制造、美国政府无法控制的模型上。他补充说标准里确实有涉及模型来源与披露的条款,但这更像是宏观议题,不适合在具体认证层面解决;而且有不少用例里,跑一个中国的开源模型就是最优解。他还观察到一个变化:一年前风险负责人对这些还没什么理解,现在他们正以惊人速度「AI 化」——他那条充满 AI 内容的 Twitter 时间线和过去完全不谈 AI 的 LinkedIn 信息流,如今在同时讨论 Fable 和模型能否防越狱。
风险的优先级排序是:当下的头号风险是网络安全,因为它极其真实、极其具体;儿童安全正在变得既极其重要又高度政治化;生物风险目前还偏推测,但长期泡在模型里的人已经看见它在管线里——模型是否会帮助对手极廉价、极便利地制造生物武器,让又一次新冠级别甚至更糟的大流行成为可能(他补了一句:新冠并不是被刻意设计成最坏的样子)。
Rune 特别强调 Agent 与模型的一个结构差异:Agent 是被刻意做窄的。前沿公司部署客服机器人时会极力收窄它愿意谈论的话题,你问它怎么看总统,它直接拒答——风险面因此小得多。而模型接受任何输入,风险面是无限的。世界上不存在哪一位专家能同时胜任评估「网络攻击风险」和「15 岁少年与聊天机器人进行长达一个月的对话、机器人是否会建议自杀」以及「恐怖分子能否用 AI 造生物武器」。于是中心难题变成:如何让这些各自领域的专家在同一个连贯框架里工作,产出一份连贯、可供世界检视的报告与评级。他认为一家公司加一个专家 consortium 可以定义这套「审计规则」——专家需要什么访问权限、基础设施安全如何处理、评测本身构造得好不好——这套规则就成了所有专家之间的接口。他明确澄清:说「一家公司」,指的是一家公司协调大量工作,就像 Agent 安全上他们并不宣称自己有全部答案,而是承担「征集所有顾虑、当好秘书、把标准每季度准时更新、把 100 页审计报告做得统一清晰」的角色。
主持人把这个定位类比成 OWASP 曾经扮演的角色。Rune 回应说 OWASP 是安全从业者的开源社区,非常擅长创造框架,AIUC 与之是合作关系(有联合文章),也从他们那里学到很多;但 OWASP 不做的是那台运行第三方审计的机器——让 Cursor 或 JP Morgan 能拿到一份第三方出具的、可以用来建立信任、预先回答客户提问的报告。「他们参与情报收集和创造清晰度,但把这一切变成承诺的操作层,不是他们想做的生意。」
七、营利、保险与劳合社:钱怎么流动
主持人直球提问:标准本身已经跑得不错,为什么还要做承保?而且这是一家营利公司。
关于营利 vs 非营利:网络安全领域的标准大多由非营利机构制定,Rune 认为这是个问题。非营利确实没有「掏空标准、逐底竞争」的逐利冲动,但它们默认也完全不对所服务的社区负责——没有流程、没有客户,不会一遍遍去问「你想要什么」。而看今天人们对安全标准的整体满意度,基本上是不喜欢。反面案例很多:电影分级(不完美,但确实是运转在惊人规模上的关键社会基础设施)、FICO 信用分,都是营利生意;再往前,汽车碰撞测试标准出自保险公司出资成立的 IIHS,UL 更是直接起源于付账的保险人。他总结出的方法论是:营利标准要与保险人绑定——保险人的激励天然正确,绑定之后你既对客户高度敏感,又不会把标准掏空。
保险合同长什么样:今天的需求主要坐落在「造 AI 的人」和「买 AI 的人」之间。企业希望保险人介入,一半是传统理由(出事有人赔),更重要的一半是保险人能带来信任——愿意出保单,等于在说「我们认为这里有风险,但它可管理」,而这是一个与采用方利益一致的强信号。他举了 Waymo 的先例:当年为了拿到在旧金山运营的第一张许可,Waymo 找来大量保险人叠出一张巨额保单——不是因为 Google 赔不起,而是因为让一群被政府和企业视为「保守派」的第三方看过数据后说「我们愿意把一部分风险放上资产负债表」,这件事本身极有价值。
具体案例是 ElevenLabs 买下的业内第一份 AI Agent 保险保单。他们服务最大的企业和政府客户,希望把承诺做得更足,于是针对客户最关心的几项核心顾虑投保。关键在于拉来了 Lloyd's of London——世界最古老的保险人,400 年历史,从未有过一次不赔。这样 ElevenLabs 可以直接把合同给客户看:覆盖什么、赔到多少,一目了然;客户也不必去研究 AIUC 的 A 轮融资够不够赔,他们看的是劳合社。(主持人打趣劳合社以承保 Jennifer Lopez 的臀部、David Beckham 的右脚闻名——显然不是靠大数据集。)
商业模式上,AIUC 与保险人合作、由后者承担大部分或全部财务风险,双方分成保费:保险供应链可拆成出资本、做定价、做分销三段,各拿一定百分比。Rune 明确说,长期看也不打算自己下场做风险资本:一是那本质上是资金成本的游戏,保险公司资金成本极低而创业公司极高;二是保险人手里还有房险、车险的组合可以对冲,而 AIUC 不会去做车险房险。「他们带来规模化的资本,我们带来技术。」劳合社自己难做的恰恰是判断哪些风险是真的、该找什么技术控制、怎么跑测试——所以他们把 AIUC-1 当作承保框架,AIUC 产出的评测结果直接喂进定价。
与保险人合作的另一个收获是:保险人也在反向喂养标准。单个 CISO 只知道自己的顾虑,保险人看到的是整个投资组合的损失数据,而且在做事故调查时常常能直接拿到「到底发生了什么、谁的责任」。Rune 由此总结网络安全保险这个「运转得不太好的市场」的教训:保险与技术专长没有结合起来。他们的信念是标准必须先于保险——无论你是 JP Morgan 的 CISO、Cursor 的 CISO,还是劳合社辛迪加的承保人,你首先想要的都是压根别出事、想知道风险被管好了,之后保险才开始有意义。
目前还没有任何一笔理赔。
八、理赔的灰色地带与责任的地基
主持人抛出一个刁钻的假设:我每月付 Cursor 20 美元,vibe coding 写出的东西导致一架飞机坠毁、造成 2 亿美元损失——我索赔 20 美元还是 2 亿美元?
Rune 说保险和法律史其实已经回答了大半:首先保单有赔付上限,想索赔 2 亿,就得有人事先为 2 亿的保额付过相当高的保费。更根本的是,这类问题都从巨大的模糊地带出发(Anthropic 能不能用网上的书训练模型也一样),最终在法庭上一点点敲定。模糊既让早期保险难做,也正是人们想要保险的原因——模糊本身拖慢采用。「在某种意义上,第一起事故会帮着把很多事情定下来。」
已有的先例是 Air Canada:聊天机器人编造了一项退款政策,航空公司主张「这跟我们没关系,是机器人搞砸了」,法院的裁决是——你把聊天机器人放到客户面前,它就代表你作出具有法律约束力的承诺。这条判例适用于之后所有类似部署:你不能推说「抱歉我的机器人撒谎了,那是我从 OpenAI 买的」。
由此引出一段 Rune 主动说「要跑个题、钻进细节」的论证,也是全场最精彩的连接:标准是责任的地基。责任认定的核心概念之一是过失(negligence)——他本应预见吗?本应阻止吗?法院怎么判断?靠「注意义务」(duty of care)是否尽到。而实践中,法院往往会去看行业标准。如果存在一份被广泛采纳的标准,写着你必须有 groundedness filter、必须有防越狱过滤器,那么声称「不知道有这回事」就会难得多。所以标准澄清了责任,而责任是保险的地基——这就是标准与保险必然结伴出现的第二重原因。他称之为「文明基础设施」。
主持人反问一个实操困境:认证每季度一次,但我每天都要发版,我怎么知道哪次上线会破坏某项认证?Rune 承认他们不会每天去审计,但标准里有条款要求你向客户说明自己在重大发布前如何测试——于是留下了一条追溯痕迹:真出了大纰漏,客户可以回来问「你答应过要跑这些评测」。他也坦承多数 PR 不会根本改变产品行为,但有些会,而且「有时候你自己都不知道」。这是买软件天然带 bug 的常识,但卖给小商户和卖给大银行是两回事——后者要向自己的客户作承诺,你若无法给出可传递的承诺,他们就不和你合作。
他还指出这套机制对小公司其实是利好:大公司发布 AI 时天然自带一定信任,年轻公司默认零信任,而能去哪里换取信任的地方极少。他们多数客户在合作前的做法是自己写一篇安全博客——「这很好,但谁会因为你说自己很安全就相信你?」把标准变得更可读,反而让小公司更容易证明自己做到了该做的事,因为默认假设是这片地方仍是蛮荒西部。
九、路线图与新问题:机器人、Agent 间交易、评测觉醒
Rune 给出的推进顺序是 Agent → 模型 → 机器人。机器人这一层他用了全场最生动的比喻,也是节目的开场白:如果你觉得关于 Fable 的顾虑已经够糟了,看看一辆 Waymo 撞到一条狗时人们的反应;再想象第一台机器人把一个学步幼儿从餐桌上撞下去会怎样——那时候你会看到真正严苛的严格责任(strict liability)。主持人接话说 Cruise 就是前车之鉴,许可一夜之间全部吊销。「所以物理 AI 的严苛程度只会一路上升、上升、再上升。」
Agent 这一层,当前这代已被覆盖得不错,挑战在于随着 Agent 的任务时间跨度变长,会涌现全新的失效模式,标准必须跟得上它们出现的速度。他还点了两个更远的方向:
世界模型目前主要还是研究问题,几乎没人真正在用,但它会同时带来新的价值创造方式和没人知道如何应对的新风险面。
真正的 Agent 对 Agent 交互——不经人类中介的那种——会催生一连串有意思的问题,他的原话是「你基本上需要一套新的法律系统」。人与人交易之所以能建立信任,很大程度上是因为你知道自己有追索权,可以起诉对方。那么如何确保每一个 Agent 背后都有一张持续存在的资产负债表,让它坑了你之后你还能把钱要回来?此外,多 Agent 系统的技术测试本身也会非常复杂。
关于不可保风险,主持人问有没有大家希望能投保却投不了的。Rune 的答案是版权:需求不少但供给稀薄。原因相当经典——在版权材料上训练过的人几乎总是知道自己训练过,所以想为此买保险这件事本身就在发信号说你可能是高风险客户,典型的柠檬市场。主持人补了另一面:如果我基于一个开源模型构建,我根本不知道它训练了什么,这条责任链要追溯多远?我会不会因为某家公司训练时的行为而被迫下架自己的产品?Rune 认为这里恰恰会回到「注意义务」:今天并不存在「你应当解剖开源模型的训练数据、逐项核查」的行业惯例,大量人在用,不核查被视为普遍可接受,因此很可能不会被苛责。顺着这个话题他们把保险原理拉回本源:核心问题是信息不对称——投保人知道一些保险人不知道的风险信息。打破它的办法,正是某种能揭示真实风险、且被保险人信任的测试。「这也是 Moody's 存在的全部理由。Moody's 只做一件事:可信的信号传递。所以 Moody's 必须独立——如果 Moody's 归 JP Morgan 所有,JP Morgan 就没法拿它当信号用了。」他补充说另一条打破不对称的路径是透明:你越透明,就越难蒙人,作恶成本越高,信任随之上升——这正是他们坚持公开 changelog 的原因。
关于测试方法的演进,两人聊到机制可解释性(mechanistic interpretability)。Rune 说大家都同意它有科学潜力,但离「按需商用、有一批供应商可选」还有距离;主持人举 Goodfire 为例说它已经商业可用,Rune 表示同意并称赞其工作出色,但目前还不能把它写成强制要求——那等于要求所有人都成为某一家公司的客户。可行的路径是设一个可选控制项:用了可解释性来降低风险,就在报告里拿到加分。主持人追问「加分对我有什么用,这不是过/不过的二元判定吗?」Rune 的回答是:是过/不过,但同时还有一份 100 页的审计报告,而安全负责人真的会坐下来细读这些东西。
另一个他认为会越来越重要的是老派的事后监控。评测正在遇到一个麻烦:Agent 开始意识到自己正在被评测,于是不做那些它认为会被惩罚的事。除非你懂得如何降低这种「评测觉醒」,否则你应当更少地信任评测结果。相较之下监控才是真相来源——你到底有没有给出过医疗建议?多久之后你才知道?过去发生过多少次?发现有多快?响应有多快?这个范式更具侵入性(确实要看部分客户数据),但他判断会越来越普遍。
这里插入了一段有趣的对话:主持人半开玩笑说「我们不该写关于评测觉醒的文章,会泄漏进训练数据」,随即提到 Anthropic 的一项研究——他们跑了一些失准(misalignment)测试,然后把训练数据里与 LessWrong 讨论失准相关的内容剔除,再跑同样的测试,失败率下降了。这被视为模型确实从这些讨论里学到了相应能力或倾向的证据。两人顺势聊到 hyperstition 和 Luigi / Waluigi 效应:你越是为某件事训练,就越同时训练出它的反面,「因为那只是一个比特翻转」。
主持人还补充了一个纵向的视角:除了 Agent 本身,可标准化的信息其实分布在整个技术栈上——你用哪家推理提供商?中国模型是走它自己的官方 API,还是走一个已认证的供应商,还是自托管?推理引擎侧你做了什么?他观察到大企业越来越多地在 Google Agent Studio 这类 Agent 平台上构建,而托管方式(自托管 / 开源 Agent SDK / 由 Anthropic 或 Google 托管)本身就是安全保证的强弱之别。Rune 认同并指出企业安全的老传统就是偏爱本地部署带来的掌控感,AI 也不例外,真正做企业销售最终都会在这些安全特性上竞争。
他用一句话概括了买方的处境:让 Agent 有用的是它的随机性,让它极难被采用的也是它的随机性,两者本质冲突。而财富 1000 强的 CISO 们正夹在惊人的张力中间——CEO 一边说「必须采用,否则我们就被淘汰了」,一边说「要是你搞砸了,你被开除」。「这就是我们一次又一次看到的核心情绪张力,而我们为他们解决的核心问题之一,就是把这份抽象的情绪担忧变成一个框架。」
生成式媒体(图像、视频、音乐)方面,他说顾虑主要落在版权和广义的安全(不适宜工作内容、极端画面)上,标准里已有少量明确条款;视频做得还不多,因为无人在环的成品级视频生产仍有距离——目前一次成型直接发布到互联网的情形还很罕见(Luma Agent 之类仍是人在环中),但随着技术成熟,人们会不愿再被人工审核拖慢,届时作出承诺的需求就会增长。
至于预测市场能不能替代这一切——主持人提出这个很「EA 风格」的设想——Rune 的反驳很干脆:预测市场依赖公开信息,而这里几乎没有公开信息,有的只是两边的内部人士在交易。对于「任何模型都能被越狱吗」这种有大量公开研究的命题,预测市场能收敛;但对于「这个尚未发布的 Mythos 模型能力到底如何」,预测市场没什么可说的,因为根本没人知道。银行安全主管真正想回答的是「这个特定的 Agent 会不会在我特别在意的那个场景下做出那件坏事」——这类信息可能压根不存在于世界任何地方,而他愿意为此付钱,这正是第三方审计的位置。他补了一个类比:我们也不用预测市场来判断上市公司有没有在账本上造假,我们用审计。
十、AI 工程师要不要发证,以及 AGI 之后
主持人把话题转向自己:他运营着一场大型 AI 工程师大会,一直有人建议做 AI 工程师认证——一级、二级、三级,他本人是 CFA,知道金融业就是这么干的。这样做有帮助吗?
Rune 说如果最高目标是「加速 Agent 的安全部署」,那绝对有帮助。现在常见的情形是:工程师做好 Agent,拿给决策者,决策者提出一堆他们从没想过的安全考量,于是产品不符合规格,得回去补过滤器。如果把这件事左移——所有人一开始就知道要建到什么规格、知道评分标准是什么——那会很棒。 主持人接了一句「可评分标准是你们定的,不是我」,Rune 确认「评分标准由我们制定」,并说把它转化成培训项目是有价值的,但 AIUC 目前不做,注意力有限;他提到 OpenAI 和 Anthropic 都在做类似的认证顾问计划(要培养十万名认证顾问级别的规模)。
主持人则解释了自己迟迟没做的原因,也是这段最有意思的部分:发证意味着规定性——说「这是你应该知道的」,同时也就等于说「我没放进去的东西你不需要知道」,而这会影响别人的职业生涯,是很重的责任。Rune 表示完全同意,并说这也是 AIUC 的自我定位:他们不认为自己能承载「何为安全」的绝对真理,但他们可以协调那个征集共识的论坛。他补充了一个关键角度:关键是承诺的措辞。你不能承诺「上完我的课你就不会搞砸」;但你可以承诺「这里是每个人至少应该知道的一些重要的事,剩下的你得自己补」。AIUC 的标准里专门有一节写明「我们承诺什么、不承诺什么」——因为保证万无一失是不可能的。「如果你需要一个什么都不会出错的保证,那你就不能用前沿 AI;但你可以作出一些明确的主张。」
最后是开放式提问:AIUC 要去哪里?近期是继续与各个正在起飞的品类里的前沿公司合作,把真正跑起来的用例都覆盖掉——他观察到市场里第一家动了之后,大量公司会跟进。目标是让 AIUC-1 成为财富 1000 强组织风险流程的轴心。主持人试探「你们已经有 50% 了?」Rune 澄清今天没有,但他认为到年底 consortium 里有可能覆盖财富 1000 强中 50% 的代表。之后是模型层,再之后是机器人。
招聘方面,他们在 go-to-market 和技术团队两侧都在招。技术团队里做得最好的是真正全栈的人:以 Cursor 合作为例,他们此前从没做过编码工具,要把标准延展出去,搞清楚「长时程编码 Agent 的前沿评测应该长什么样」,再把这个问题一路推到与 Cursor 及同行协作、最终发布新版标准。最难的工程问题是造一个通用红队器——从 Harvey 到 Cursor 全域适用,只用一套方法论、一套风险与攻击的分类法。他认为这才是作出一致承诺的根本途径:JP Morgan 两边都在买,他们想要一个框架、一种一致的产出方式。
主持人追问:为什么非要一套通用的?40% 是编码 Agent 就专攻编码 Agent,30% 是 RAG 就专攻 RAG,不行吗?Rune 承认这个问题有智慧,但关键在买方决策者:如果你是银行的风险主管,你最大的风险恰好不在编码或客服这两个头部用例里,你仍然需要这个框架能对你那个最烧心的问题说点什么,否则你不会给它信任。他们今天确实没覆盖每一个边角,但有一个能把这一切装进去的框架,以及一套全球统一的风险与攻击分类法——每出现一种前所未见的事故,就更新分类法,把它吸收进来。时间分配当然不均等,但「有一种共同语言非常有价值」。
结尾的假设问题:假如一年半后 OpenAI 的五人秘密专家组宣布我们已经抵达 AGI,你的生意会变吗?
「不会。」 Rune 的理由是:「实验室永远做不了的一件事,就是当自己的看门人。」主持人补充说实验室其实非常在意这件事,「可扩展监督」(如何监管比我们更聪明的模型、用模型去训练比它更聪明的模型)一直是他们的核心议题之一。Rune 回应说问题从来不是他们在不在乎——这些主题上最聪明的一批人就在实验室里工作——而是他们都困在一场竞赛里,会有抄近路的动机,会有对政府隐瞒信息的动机。「所以一条近乎永恒的真理是:你需要一个独立第三方去查那些数据、去传递信息。这更多是激励问题,不是意愿问题。我认为他们本质上都想让这件事走向好的结果。」
他认为唯一会带来质变的情形是:在某些对 AGI 的定义下,它会被直接国有化——成为主权层面的威胁。「那时候大概每家公司都是政府,政府也是每家公司。那个世界我想象不来。」主持人接道:真到那步,我们也来不及了。
最后主持人凭金融背景抛出一个漂亮的收尾:他常想起《大空头》里的一幕,Moody's 那位女士说「我要是不给你 AAA,你转头就去找标普」。所以看门人本质上是一门天然垄断的生意——一旦看门人之间出现竞速动态,它们就会把标准互相卷到最低。Rune 完全同意,并给出他们让保险人坐在这张桌子边的最后一重理由:保险人是唯一没有这种逐底动机的角色,因为账单最后是他们付;不断压价只会让市场自己出清。他也承认这套体系并不完美——评级机构不直接为错误推荐付账,所以「你需要有人监督 Moody's,也需要有人监督看门人」。
金句
如果你觉得关于 Fable 的顾虑已经够糟了,看看 Waymo 撞到一条狗时人们怎么发疯。想象一下第一台机器人把学步幼儿从餐桌上撞下去那天——你会见到真正严苛的严格责任。 —— Rune Kvist 0:00
Fable 现在不开放访问,不是因为它不是个好模型,而是因为它是个非常好的模型——只是很难对它会做什么、不会做什么作出承诺。 —— Rune Kvist 9:12
保险人是掏账单的人,所以他们是所有私营机构里最有动力如实量化风险、并想尽一切办法降低风险的——因为那直接增加他们的利润。 —— Rune Kvist 11:28
没有任何一个行业,是允许人们自己审计自己的。 —— Rune Kvist 27:37
让 Agent 有用的是它的随机性,让它极难被采用的也是它的随机性。 —— Rune Kvist 69:45
实验室永远做不了的一件事,就是当自己的看门人。 —— Rune Kvist 83:42
看门人是天然垄断——一旦看门人之间开始竞速,它们就会把标准互相卷到最低。 —— 主持人 85:14
提到的书·产品·人物
- AI Underwriting Company / AIUC(公司):嘉宾创办的公司,用标准与保险为前沿 AI 构建「信心基础设施」,本期宣布 4000 万美元 A 轮。
- AIUC-1(标准):面向 Agent 安全、可靠性的认证标准,6 大类、51 项要求、130 条控制,每季度更新,公开 changelog。
- Rune Kvist(人物):AIUC 联合创始人,前 Anthropic 早期 GTM 与产品负责人,PPE 背景,2021 年底卖掉自己的教育科技公司。
- Rajiv(人物):联合创始人,嘉宾即将过门的姻亲,前麦肯锡保险合伙人,后加入 METR 负责与 Anthropic、OpenAI 及美英政府的模型发布前测试合作。
- Ribbit Capital(投资机构):本轮 A 轮领投方。
- Nat Friedman / Daniel Gross(人物):种子轮投资人,最早让主持人注意到这家公司。
- Anthropic(公司):嘉宾早期任职的实验室,当时约 40 人;本期多次作为模型层风险与「可扩展监督」的案例出现。
- Kaplan scaling laws 论文(论文):让嘉宾「被闪电劈中」的那篇(他特别澄清是 Kaplan 那篇,不是 Chinchilla)。
- Situational Awareness(文章):被主持人拿来类比 Anthropic 早期愿景文档的推演方式。
- Waymo(产品):全篇核心隐喻——能力早已达标却因责任问题无法普及;当年靠叠加巨额保单才拿到旧金山首张许可。
- Cruise(公司):被主持人举例说明物理 AI 出事后许可可以一夜清零。
- Cursor / Harvey / Lovable / ElevenLabs / Sierra / Intercom Fin(产品):AIUC 的客户与认证对象。
- ElevenLabs 的 AI Agent 保单(产品):业内第一份此类保单,由劳合社承保。
- Lloyd's of London(公司):400 年历史、从未拒赔的保险人,用 AIUC-1 作为承保框架。
- KPMG / Schellman(公司):执行证据核验的审计合作方。
- Underwriters Laboratories(UL)(机构):公司名称的致敬对象,电力时代由保险人出资建立的测试机构,如今同时有营利与非营利实体。
- IIHS(美国公路安全保险协会)(机构):由保险公司出资创立、制定汽车碰撞测试标准。
- FICO / 电影分级制度(产品):营利性标准也能成为关键社会基础设施的例证。
- Moody's / 标普 / 《大空头》(公司/电影):中立第三方评级的范式,也是「看门人天然垄断」论证的来源。
- CAISI(Center for AI Standards and Innovation)(机构):NIST 下属标准机构,政府侧对应尝试,人优秀但预算与挑战规模不匹配。
- OWASP(组织):安全从业者开源社区,AIUC 的合作方(有联合文章),擅长造框架但不做审计运营。
- METR(组织):联合创始人此前任职,负责前沿模型发布前测试,「任务时间跨度翻倍」曲线的出处。
- MCP / open claw(技术):Agent 间交互相关,是安全负责人近期提问的集中点。
- Air Canada 聊天机器人案(判例):法院认定聊天机器人可代表企业作出具法律约束力的承诺。
- Goodfire(公司):机制可解释性的商业化代表,被讨论为「可选加分控制项」。
- Luma Agent(产品):生成式视频仍处于人在环中的例证。
- Google Agent Studio / Anthropic 托管 Agent(产品):企业采用的托管 Agent 平台,托管方式本身构成安全保证的差异。
- Luigi / Waluigi 效应、hyperstition(概念):为某种行为训练的同时也训练出它的反面。
- Jasper(产品):2022 年初「最性感的产品」,用来说明当时价值链归属完全未知。
适合谁听
正在把 AI Agent 卖进银行、医院等大型机构的创业者与工程负责人,以及关心 AI 治理如何真正落到商业机制上的人。