← 顶级AI播客总结
The Diary Of A CEO

他为示警放弃200万美元:超级智能可能在2030年前接管世界

He Risked Everything To Warn You: No One Is Ready For What's Coming, And The AI Companies Know It!
节目时长 121 分钟 阅读约 19 分钟
▶ 在 YouTube 收看原片
他为示警放弃200万美元:超级智能可能在2030年前接管世界 插画

前OpenAI预测研究员Daniel Kokotajlo拆解AI公司的真实计划:先让AI自动化自身研究、引爆智能爆炸,再席卷整个经济,而人类"还在方向盘前睡觉"。

核心要点

  • 70%出大事:Kokotajlo判断按当前默认路径,约有70%概率"事情会非常糟糕、类似人类灭绝",但他强调这是"某种巨大灾难"的总概率,不完全等于字面意义的灭绝。
  • 60倍增速:Anthropic去年此时年营收约10亿美元,现在约600亿美元,一年60倍增长,按此推算到2030年前后可能"相当于整个经济体量"。
  • 先自动化自己:公司当前重点是自动化编程,下一步自动化整个研究流程(出想法、做实验、写结论),目标是让AI army替代人类员工、造出更强的AI,形成智能爆炸。
  • 200万美元的代价:辞职后他拒签"不诋毁+保密"条款,宁可放弃占净资产80%的约200万美元股权,事件在网络发酵后OpenAI才收回要求,Sam Altman称对此"感到尴尬",但Kokotajlo不相信他事先不知情。
  • 权力集中风险:即便AI完全可控,"谁控制AI"仍是问题——少数公司+总统可能成为寡头或独裁者,Dario所说的"数据中心里的天才之国"实为"天才军队",都是同一模型的副本,只听公司命令。
  • 中位数2029:他个人对超级智能到来的50%时间点估计为2029年(可能提前到2028),而Anthropic和OpenAI内部的人反而催他"把时间线再缩短回2027"。
  • 黑箱大脑:现代AI不是可读的代码,而是约10万亿参数的神经网络(2020年才1750亿),无法直接看清它"在想什么",这正是失控风险的核心难点。
他为示警放弃200万美元:超级智能可能在2030年前接管世界 信息图
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

一、他是谁:一个"AI预测员"的内部视角与幻灭

Kokotajlo的工作是"AI forecasting"——如同对冲基金分析师预测未来几年特斯拉销量或电价,他专门预测AI能力的发展轨迹。2022年他加入OpenAI,除了做内部低配版的情景推演,还参与危险能力评估(cyber、说服力、情境意识),并短暂在能力团队做过强化学习造agent的工作。

他讲述了自己"逐渐幻灭"的过程。OpenAI、Anthropic、DeepMind都有相似的创始叙事:"这些风险是真的,但我们想过了,会负责任地处理,所以必须由我们领先。"但在公司内部,他越来越觉得这些是"事后合理化",用来为正在做的事辩护,而非真正指导行为——"当动真格时,他们会跟随激励,而不是做真正好的事。"

他特别澄清,驱动这些公司的不是"商业动机",而是"逐权动机"(power seeking)。他引用Musk诉OpenAI案中曝光的邮件:早在2017年,OpenAI创始人就在讨论"我们创立OpenAI,是因为担心Google的Demis会用AGI成为独裁者"。这说明从一开始就"不只是钱的问题"——这些CEO真心害怕对手先到达终点后成为独裁者,彼此不信任,因此拼命抢跑。

主持人追问Sam Altman,Kokotajlo的回应很直接:"别关注叙事……应该看行动,而不是听他们说什么。"他描述了亲历ChatGPT发布时公司的变化:Ilya Sutskever在全员会上说"世界开始关注了,你们每个人接下来一年会成为每场派对上最受欢迎的人,别让它冲昏头,专注使命——要造AGI"。讽刺的是,随着公司翻倍再翻倍地扩张,大量被高薪吸引来的新人并未思考过超级智能的深层含义,关于超级智能的内部讨论反而减少了。

二、200万美元的抉择

这是本期最具戏剧性的段落。Kokotajlo 2024年辞职、开完欢送会后,收到离职文件,其中包含一条"不得再批评公司"的条款,外加一条"不得向任何人透露此事"的保密条款。他觉得这对一个"为全人类利益"的非营利组织来说"很讽刺",于是拒绝签字。

代价是:不签字就拿不到股权。他和妻子纠结了一两个月、咨询了律师,最终决定拒签——这意味着放弃约200万美元,占当时净资产的80%。结果出乎意料:消息在网上引爆,公司员工在Slack里追问领导层"为什么要收回我们的股权",因为此前多数员工并不知情。舆论压力下OpenAI收回要求,让他保住了股权,Sam Altman公开表示"对自己没意识到这条款感到尴尬"。主持人问他信不信,Kokotajlo直言:"不信,我觉得他很可能知道;就算他不知道,他身边的人比如首席律师也知道。"

他解释拒签的理由很朴素:"钱是好东西,但不是唯一的东西……有时候为原则站出来是值得的。"

三、公司的真实计划:先自动化自己

Kokotajlo反复强调,理解风险的关键是理解公司"计划做的事情序列"。第一步:自动化编程——把AI做大、训练更久,专门训练它自主写代码改代码,因为这能让公司自己跑得更快。第二步:自动化研究流程的其余部分——出想法、分析实验、沟通结果,让AI能自主完成整个研究。目标是让公司"不再需要人类员工",只靠一支AI大军自主研究、造出更好的AI、再让新AI去造更好的AI。

他判断这"极其危险",且本质是一次"权力攫取":一旦成功,这些公司就坐拥一支超人AI大军,对经济中所有其他行为者拥有巨大杠杆;若与总统达成安排、整合进军事,就会给美国对其他国家的"硬实力"压制。

一个让他不安的变化是:《AI 2027》发布时,业内朋友普遍认为他的时间线"太短",觉得递归自我改进、超级智能等里程碑要比2027年更晚;而现在变成"五五开",尤其是Anthropic和OpenAI的人常说"2027基本就是会发生的,跟你写的一样",甚至催他"把时间线缩短回2027或2028"。他自己发布后本已把50%时间点调到2028、再调到2030,但公司内部的人认为这太保守。

四、AI是什么:一个我们看不懂的大脑

主持人请他用外行话解释。Kokotajlo说,关键要理解现代AI"不是通常意义上的软件"——不是工程师写下"用户问X就做Y"这样的代码行,而是一个神经网络。他用大脑类比:大脑是一堆互相放电的神经元,带来成功(多巴胺)的放电模式被强化,带来失败(碰热炉子)的被反强化。人工神经网络类似,起初是约10万亿个随机生成的参数("一团缠绕的意大利面"),完全无用;然后先做预训练(pre-training),喂海量互联网文本玩"预测下一个词"的游戏,根据准确度做正负强化。

主持人接了个很好的类比:神经科学家告诉他婴幼儿的神经连接是成人的两倍,通过强化被"修剪"。Kokotajlo确认AI也是"修剪+强化"并存。预训练之后,公司再用成千上万甚至数百万道编程题训练它(给一个虚拟电脑、一个代码库,让它写、改、运行、上网,根据成败强化),这就是AI现在编程如此强的原因。

关于"更大":2020年约1750亿参数,现在约10万亿,六年涨了约两个数量级(100倍)。除了变大,算法本身也在改进(改结构、改强化算法、改训练数据)。他用"飞机之于鸟"来类比"人工大脑之于大脑"——受生物启发,但不等同:Transformer架构不是循环的(信息单向流动),反向传播也不同于人脑学习。这个类比也帮他回答"AI有创造力吗"——创造力是用产出来评判的,与其纠结"是不是真的创造力",不如看它实际完成了多少事。

五、就业冲击:为何会突然到来

主持人指出目前美国失业率4.2%、英国约5%且上升,有人开始说"我早说了不会有事"。Kokotajlo反驳:没有人(至少他们没有)说过"现在就会有大规模失业"。在《AI 2027》里,大规模失业要到2028或2029年、在超级智能出现之后才发生——因为公司的策略不是"第一步就造成失业",而是"第一步自动化自己、第二步递归自我改进达到超级智能、第三步才扩展进经济、自动化一切"。

他认为这对人类"很不幸":本来人们或许希望,如果自动化浪潮缓慢扫过经济,大家会警觉、会要求监管;但公司的策略是"先拿到超级智能,再做大规模自动化",等真正开始时一切已经极快、AI已极强。他还预测失业会"突然"到来,因为智能爆炸的动力学——公司先自动化自身研究,AI会在AI研究上远超人类,作为副作用也会在很多其他领域远超人类,然后像"海浪一样"砸穿经济。

关于"哪些工作能幸存",他说这"是政治问题而非技术问题":技术上AI能做所有工作,问题是"允许它做哪些"。可能受法律保护的包括法官(可能被法律要求必须是人类),或人们出于情感偏好保留的岗位(比如"机器人保姆"再好,很多人也宁愿要真人)。至于"会像工业革命一样创造新工作"的论点,他指出破绽:过去的技术只自动化了部分任务,而这次是"一切都被自动化"——你转去的任何新工作,AI也能转过去,而且一开始就比你强。他坦率地说:播客主播大概率保不住。

六、CEO心理与"按钮"思想实验

主持人转述一位朋友的说法:AI CEO们把灭绝概率估在约7%(低于10%),并类比"桌上100个按钮、只要1个会毁灭世界你敢按吗"。Kokotajlo确认他在Daily Show说过约70%概率"事情会非常糟糕",但澄清这不完全等于字面灭绝。

关于CEO是否真信有灭绝风险,他说"是的",但关键要理解"合理化"(rationalization):"人们会相信他们需要相信的东西,好让自己觉得自己是好人、可以继续做在做的事。"每个CEO都想"不能让对方先到",于是都说服自己"大概率没事,而且该由我来掌舵"。他认为Anthropic和Dario在过去一年更愿意做"损害自身利益"的事——最典型的是Department of War(战争部)与Anthropic的争执:Anthropic本可签合同却拒绝,为此损失了大量金钱和权力。但他强调,重点不该是"选一个最不坏的CEO",而是"没有人应该被托付这么大的权力"。

主持人后来抛出Plan S的按钮实验:如果按下就永久关闭所有前沿AI训练、永不再有。Kokotajlo挣扎良久。他说如果是临时关闭,会毫不犹豫地按("文明还没准备好");但"永久"让他犹豫。经过长时间思考,他说"我大概不会按,但非常纠结"——理由是他仍抱有实现更好结局(类似Plan A)的希望,而且如果人类永远不造强AI,可能几百年后也会因核战或大流行"作为文明而死"。但当他说出"为后代和未来数十亿人的利益值得冒当前风险"时,主持人说"这种叙事我听过了",他随即自我修正:"也许应该优先考虑当下的人……当下的人绝对不想玩这场赌博。"

七、AI 2040 Plan A:一条更好的路

团队最新作品《AI 2040 Plan A》不是预测,而是"建议"——在这个情景里超级智能被推迟到2040年,因为人为放慢。他们还做了对比性的迷你情景:Plan D(基本等于AI 2027的竞赛延续,他认为这最可能发生)、Plan C(放慢一点、押注对齐研究并侥幸成功)、Plan B(对中国更激进、搞破坏或网络攻击以争取时间)、Plan A(国内监管+国际协议继续建设但方式更好)、Plan S(Shut it all down,全面关停)。他个人推荐Plan A,同情Plan S,但预测默认会走向Plan D。

Plan A的关键设计:2029年(智能爆炸的"最后一刻"之前)政府介入,先临时"关停"——具体是允许推理(inference,用现有AI服务客户)但禁止训练(training,开发新AI),中美互派检查员到对方数据中心核查。约半年到一年内建成新的"透明数据中心",恢复训练。核心四原则:(1)放慢速度;(2)彻底的研究透明(training数据中心必须公开架构和训练配方,即"开放科学",以便科学界共同攻克对齐、避免让有偏见的公司自证安全);(3)避免权力集中(让多国多公司都有相近的先进能力、广泛扩散,而非单一超级项目);(4)可逆性(新数据中心要建成"一旦协议破裂、各方重新抢跑就能被摧毁"的形态,退回原点)。

他坦承透明度会"去除竞争优势"——OpenAI、Anthropic会不喜欢,估值会受损,因为技术会被"商品化"、后来者能追上,但这"对人类是好的,只是对这几家公司的利润不好",且对落后的公司反而是利好。这套方案会让AI在整个2030年代缓慢、透明、安全地推进:到2031年约1/5认知劳动由AI完成,2033年60万个AI以100倍速运行,2035年达到"顶级专家级AI"(而非无限超级智能,因为安全论证不足以支持更进一步),2040年才在对齐取得robust进展后"松开刹车"、让AI变得远超人类——这就是"AI 2040"名字的由来。

八、公民红利、转型后的世界与个人抉择

在AI接管工作的世界里,Kokotajlo提出"公民红利"(citizens dividend):设立一个机构向机器人公司和算力公司出售许可证赚取利润,公民持有该机构的股份。起步约每人每年2.5万美元,最终(计入通胀)约每人每年1000万美元。他强调工作重要不只因为收入,还因为"权力"——今天普通人有政治权力部分源于经济权力(可以罢工,独裁者屠杀某群体是有成本的因为会损失税收),一旦只有AI公司和机器人公司在缴税,政府就没动力在乎普通人。因此失业不仅是失去收入,也是失去政治权力,必须靠监管(保证AI是"诚实、求真、无政治议程"的,避免民众被AI媒体操纵、被暗中偏向的AI顾问引导投票)来对冲。

他描绘了转型后的图景:保留地球约99%作为自然/历史保护区,划出特别经济区让机器人"放飞"(挖矿、建厂),数据中心建在海上(后期建在太空更好);愿意的人可上传大脑或移居太空,多数人仍住地球。他还讨论了"测谎仪"作为一个例子——顶级专家级AI思考多年后可能发明真正有效的测谎仪,"用在权贵身上"是好事(候选人可自证清白),"被权贵用来"则可能催生新型极权(逼下属测谎表忠诚)。他把这段称为"真相在地球降临"。

个人层面,主持人注意到问及孩子时他"神情明显变了"。Kokotajlo有两个孩子,最大的女儿六岁。他坦言"这事一想到孩子就很难过"——生孩子很大程度是对未来的希望,而AI让这些梦想岌岌可危。他曾对妻子说"别再要孩子了,太不确定",但因妻子难以接受(老大没有兄弟姐妹)最终妥协:"我们已经有一个了,会没事的,就算不好,大家也在同一条船上。"

对于"能做什么",他建议:有才能或热情的人可直接参与(政治倡导、技术研究、造有用工具);不想换职业的人就多关注、多和人讨论、给议员写信——核心问题是"人们还没认真对待",只要更多人觉醒,就更可能在为时已晚前做出好的监管。投票上,"去问候选人对AI的看法,逼他们表态,然后投给立场更好的人"。他自己的定位是"站在中间":不去AI公司帮它们加速,也不抵制AI(AI Futures Project日常大量用AI),而是"面向公众、倡导我目前认为的出路"。当被问"是不是太晚了",他答:"不,如果我觉得太晚了,我就不会在这儿,我会和家人在一起。"

金句

AI行业里可怕的公开秘密是:我们可能最终造出一个新物种,由它来统治世界,而这件事有70%的概率会朝着类似人类灭绝的方向发展。 —— Daniel Kokotajlo 0:00
别关注那些叙事……你应该看一个人的行动,而不是听他说什么。 —— Daniel Kokotajlo 13:04
与其说是"数据中心里的天才之国",更准确的说法是"数据中心里的天才军队"——它们都是同一个大模型的副本,都听公司的命令。 —— Daniel Kokotajlo 6:57
这就像我们亲手挑选了一个新物种,等它不再需要我们时就会把我们淘汰掉——我觉得这就是默认的轨迹。 —— Daniel Kokotajlo 70:40
如果我有一天能对历史施加哪怕一点点影响,你就应该拼尽全力把未来引向更好的方向。 —— Daniel Kokotajlo 69:09
有些听起来像科幻的事,最后真的会变成现实……人们该停止纠结什么听起来像不像科幻,而去认真看这项技术真正所处的趋势。 —— Daniel Kokotajlo [117:31]

提到的书·产品·人物

适合谁听

关注AI安全、超级智能时间线与就业冲击的从业者、投资人和政策关注者,尤其是想听到行业内部人士"把不能说的话说出来"的深度倾听者。

← 返回全部观看原片 ↗