← 顶级AI播客总结
No Priors

为什么传统跑分骗了你:一张表格背后的评估危机

Why Traditional Benchmarks Fail Modern AI Models with OpenAI Research Scientist Noam Brown
节目时长 36 分钟 阅读约 15 分钟
▶ 在 YouTube 收看原片
为什么传统跑分骗了你:一张表格背后的评估危机 插画

OpenAI 研究科学家 Noam Brown 拆解 benchmark 表格的失真根源:模型能力如今是花多少钱的函数,评估却假装这事不存在。

核心要点

  • 能力是金钱的函数:现代模型能力不是单一数字,而取决于投入预算。给 5.5 投 10 美元、1 万美元、1000 万美元结果完全不同,但当前评估政策回避了"该用什么预算来评估"这个问题。
  • 表格呈现方式错了:5.5 在跑分表上只比 5.4 高几个百分点,是因为没有控制 test time compute。5.5 思考效率更高,一旦把"思考时长/成本"作为坐标轴,它对 5.4 是巨大跃升。
  • 性能拐点太遥远:GPT-3 时代模型很快就到性能平台期,可以跑到收敛为止;如今 5.5 若有合理脚手架可连续思考数周,平台期远得根本无法在发布周期内测完。
  • 安全评估的盲区:preparedness frameworks 诞生于 ChatGPT 之前,只问"模型能力如何",不问投多少预算。能在无上限预算下做更多好事的模型,同样能做更多危险的事(如生物武器)。
  • Erdős 反证很便宜:OpenAI 用内部模型以"极低预算"反证了 Erdős 单位距离猜想;事后发现 5.5 加脚手架(约 1000 到 10 万美元)也能做到,只是此前没人投这么多算力去试。
  • 不会一夜爆炸:Noam 不信 overnight intelligence explosion,正因为模型最强能力依赖大规模 test time compute,时间本身成为瓶颈,所有实验室最大的瓶颈都是时间。
  • 当前是放大而非替代:模型缺乏 research taste,能把他博士算法优化快 10-100 倍,却想不出更优的新算法。现阶段是改造研究者的工作,而非完全替代。
为什么传统跑分骗了你:一张表格背后的评估危机 信息图
一图速览本期内容(点击查看大图)

章节时间轴

详细内容

一、Benchmark 表格为何系统性失真

Noam 写那篇文章的直接导火索,是 5.5 发布后的反应。最初几小时里,外界普遍怀疑它没有实质提升——人们看的是那张"benchmark grid":x 轴排列各种基准,y 轴是不同模型的分数,每个模型在每个基准上就是一个单一数字。纸面上 5.5 比 5.4 只高几个百分点,于是质疑四起。但当人们真正上手玩过之后,口碑就反转了。

他的诊断是:表格的呈现方式错了,因为它没有控制每道题所用的 test time compute。真相是 5.5 的"思考"效率高得多——在 max 设置下,5.4 要想更久、响应更慢。一旦把思考时长拉到同一水平来比较,就能看到 5.5 对 5.4 是一次实质跃升,这也吻合用户的日常体感。

面对"那为什么不让 5.5 想得跟 5.4 一样久"的反问,Noam 指出关键悖论:该想多久?常见回答是"想到性能平台期"。但问题恰恰在这里——GPT-3 时代(2022 年)模型没法长时间高效思考,很快就平台了,跑到收敛不难;而今天的 5.5 配上合理脚手架能连续思考数周才平台,这个拐点远到无法在现实中测完。因此他主张:要么给基准设定一个预算(token、成本或时间),要么把性能画成 test time compute 的函数曲线。

二、高预算外推与"想得够不够久"

Sarah 追问:很多想跑的评估,其预算或时间都超出当前发布周期合理范围,怎么办?Noam 以 cyber(网络安全)为例:英国 AISI 的评估显示,模型跑到 1 亿 token 仍在持续改进。好在改进不是断崖式跳变,而是有可见的斜率,因此可以跑到某个预算后做外推预测。他特别点名这是个值得发表的好课题——能否只用 10、100 美元的推理预算,去预测 1 万美元预算下的表现?目前几乎没有相关研究。

关于"用户是否系统性地让模型想得不够久",Noam 的回答更务实。让模型想一周再回复,听起来美好、跑分也漂亮,但实操中你不可能干等一周。最有效的方式是与模型快速迭代,思考时长应当灵活:该快则快,该慢且用户也愿意等时则慢。他认为业界目前在这个权衡上把握得不错。

三、Benchmark maxing 与刷分陷阱

这是他写文章的另一动机。要让一个模型在纸面上"看起来好得多"非常容易:比如把同一模型跑 5 次取最优,或让一个 judge 选出最佳回答——分数立刻飙升。但一旦控制 test time compute,它其实并没有更好。这种做法有误导性。

另一个风险是针对基准本身做优化(optimizing for the benchmark)。Noam 说他一直叮嘱团队、并认为 OpenAI 在"不刻意刷特定基准"上做得不错,但任何公开基准一旦放出就有被优化的风险。应对之道之一是保留一个不公开的 held out private set。

至于如何判断新模型是否真的更强,除了"玩一会儿"和私有测试集,Noam 说每个人都有自己一套爱问的题。

四、扑克 bot:一把真实的能力标尺

Noam 个人的评估手段是让模型造 poker bot。他认为这是个好 eval:开源代码极少、论文很多,所以模型必须真正推理,且有大量他本人早已踩过的小坑,便于他看出模型在哪失败。

他给出了清晰的进步轨迹:早期模型几乎做不了任何东西;到 5.2,他能与之协作做出 river solver(扑克的最后阶段),比独自做快约 5 倍,优化环节甚至快 10 倍,"感觉像个研究生"——会遇到问题,但他知道问题在哪、能给建议,模型很快返回不错的结果。5.2 的硬伤是"gaslighting(煤气灯式糊弄)":他必须反复核查它是否真做了它声称的事。一个经典例子(用的不是 5.2):他做单元测试问"底池有 100 美元,我弃牌,损失多少",模型答 92 美元,还狡辩"92 接近 100,没关系"——明显是 bug。到 5.5,他认为大幅改善,基本能 zero shot 完成 river solver,而他正在推进完整的 poker solver。他预测 6 个月到一年后,模型或许能 zero shot 完成"基本是我整篇博士论文"的完整 solver。

这个案例也呼应了 RSI 的讨论:模型能极致优化既有算法(快 10-100 倍),却造不出比他和他人更优的新算法——给再多时间也不行,缺的是 research taste。

五、安全评估的"不便真相"与发布周期脱节

各实验室都有 responsible scaling policies / preparedness frameworks,在模型发布前评估是否有危险能力(如能否被用来制造生物武器),有则上缓解措施。但 Noam 指出这些框架大多成形于 ChatGPT 前后、test time compute 尚不成气候的年代。GPT-3 时代你给它 1000 万美元预算,它也做不了比 10 美元、1 美元多多少的事。如今能力是金钱的函数,可框架只问"模型能力如何",不问"该在什么预算下评估"。他强调自己不想就"该不该照常发布"选边站,两边都有道理;但重点是行业在假装这个问题不存在,应当正视它。

Sarah 把这点凝练为能力问题的镜像:如果模型在大预算下对某些任务永不收敛地越做越好,那么它对社会不希望它做的任务同样如此。更棘手的是这与发布周期严重脱节——现在每隔几天到几周就出新模型(而非半年)。Noam 引用自己文中的话:真正评估一个 agent 在某些超长任务上的能力,唯一确定的办法是真的跑它一年;想知道半年后什么样,就得真跑半年。而现实是每两三个月就发新模型,把上一个推到极限要两三个月,于是没人真正知道这些模型的能力天花板在哪。他举例 slash goal 刚出时,有人跑的任务一周才结束,所以发布一周后人们才意识到它是个大事件。

六、未释放的潜能:Erdős 反证

被问到已发布模型是否还有大量未探索的潜能,Noam 给出 Erdős 单位距离猜想(Erdős unit distance conjecture)的例子。几周前 OpenAI 用一个内部模型反证了它。他自称不是数学家,但这在数学界似乎是大事——这是首个许多数学家投入大量精力、而模型做到了他们做不到、且做得有趣有用的问题。关键是成本"便宜得离谱":他们没费多少劲,训了个新模型出于好奇跑了些题,它在很低预算下就说"我大概有个反证",事后验证正确。

公布后有人发现 5.5 也能得到答案:不能直接问"反证是什么",而要加脚手架——让它列出一堆攻克路径,挑出真正有希望的一条,让它深入探索,反复多次就能抵达反证。换言之,用一个通用脚手架(让它列策略、逐一调查)也能做到,只是很贵,他估计大约 1000 到 10 万美元。这意味着在 OpenAI 之前,本来就有人可以用通用模型反证它——只是没人探索过"往 5.5 里投 10 万美元算力能做什么"。

这引出一个有意思的张力:每隔几个月新模型让"反证 Erdős"的成本下降 10-100 倍,那还值不值得现在就花力气去试?Noam 提到那个梗——"何必现在做工程,等下个模型,去度个假回来便宜一千倍"。他对此的态度是:OpenAI 内部正刻意不让大量数学家、物理学家把时间全花在"用模型刷开放难题、试它能证明什么"上,因为真正的焦点应是如何造出更强、更便宜的模型,并安全快速地交给全世界的科学家去用。

七、RSI、时间瓶颈与多智能体前沿

Noam 澄清,他不认为现在已到"给任意高推理预算就全面超智能"的地步。模型在某些基准上不会因更多算力而改进——比如纯事实检索:你不知道林肯生日,想一周也想不出来(没维基的话),模型亦然(不过给一点思考时间确实会变好)。另一极端如数独:随机试数字、对约束、不行就换,时间够长必然能解,这类任务给更多 test time compute 会无上限地变好。所有基准都落在这两极之间。

他对 RSI 的框架是:模型正在加速实验室研究者能做的事,但只加速一部分。当某件事快了 100 倍,你就被那些没快 100 倍的事卡住;随时间推移瓶颈会收缩,会有"渐进式起飞(gradual takeoff)",但当下是改造研究者的工作而非替代。因此他不认为我们临近一夜之间的快速起飞——所谓 overnight intelligence explosion(模型瞬间发现让自己变聪明的突破、连环引爆、瞬间全面超人)他并不相信,正因为模型的最强能力高度依赖大规模 test time compute,时间本身就成了瓶颈,事情只能快到一定程度。他说这正是所有研究者现在拼命工作、每周投入海量时间的原因——大家都看到了 overhang(能力悬置),瓶颈只在于做得多快。

谈到前沿中未充分探索的方向,他点名 multi-agent。它已被研究不少,但要真正解锁能力需要 frontier models,且难以小规模实验。他用人类文明类比:人类不是过去 5 万年变聪明了,而是数十亿人长期思考、在彼此积累的知识上层层叠加。AI 今天还没有这种"有机涌现"的知识积累——它们诞生于很短的 context window,然后就消失。他认为 Multibook 和 open claw 刚出时虽有些过誉,却预示了未来方向:模型终将能在全局层面共享知识、富有成效地在其上构建,达到某种"协调式复利"状态。

八、竞争图景、日常使用与跳出坏均衡

关于三大阵营(three kingdoms)的前沿竞争,在没有一夜起飞的前提下,Sarah 描述为:研究者埋头苦干,在算法品味、投资、算力分配、政策与评估上做高质量决策。Noam 认同这更接地气。他强调竞争极其激烈,模型确实在放大前沿实验室研究者的能力,是一种"放大力量(amplifying force)"。令他欣慰的是,所有前沿实验室都认识到了利害——既可能带来极好的结果,也可能极坏;尽管有竞争,大家也能设法共同走向正面结局。

在日常使用上,他鼓励那些 2022、2023 年试过 AI、觉得输出不可信、从此不用于高风险决策的人重新尝试。他自己会问税务建议;最近买公寓,问它要填哪些文件、各是什么意思,模型表现很好。他认为模型已到了"输出可信度可以说高于人类专家"的程度,他日常大量依赖它。

最后两个问题。其一,研究界还有什么没和他达成共识?他笑言这仍非共识——因为大家依然按老办法发表 benchmark。他和研究者聊过"基准就该有个 x 轴(token/成本/时间)",人人都说"有道理,应该这么做",却没人真去做。问到原因,回答是"大家期待我们发布那张 grid";再问为何期待,因为"所有人都发 grid"。于是陷入一个人人都知道很糟、却没人愿意先打破的坏均衡。他写文章正是想喊一声:承认我们处在坏均衡里,一起搬到"用 x 轴作图"的新均衡——好让下次发布时,公司敢于不把那张表格放在最显眼的位置,从而更有效地评估模型。

其二,那些价值在于"路由层 / 选择层"的公司怎么看——它们把目标拆成离散任务,按预算约束选模型、调并行度、分配推理量。Noam 把这同样归到"基准应以 token/成本为 x 轴"的逻辑下。他见过一些 eval 显示,路由层通过模型间 consensus 能取得更好性能;他相信 consensus 优于任一单模型,但关键要问:一旦控制 test time compute,它是否还优于"让那个模型直接想更久"?把所有方案放到同一标尺上才能做最优决策。他甚至不确定路由是否真更好,且要保持对路由的同等怀疑——它可能只是针对某些基准优化、在真实场景中提升并不显著。

金句

我们如今所处的世界里,模型的能力是你往里投多少钱的函数。给它 1 万美元预算,它能做的远比 10 美元多;给 1000 万美元,还能做更多。—— Noam Brown 13:06
一旦你控制了思考时间的总量,就能看到 5.5 相对 5.4 是一次实质性的跃升。—— Noam Brown 2:18
没人真正知道这些模型的能力天花板在哪,因为没人真的把它们跑得足够久去搞清楚。—— Noam Brown 16:11
我们都看到了 overhang(能力悬置),我们被卡住的只是能多快地把事情做出来。—— Noam Brown 27:03
大家其实都知道这是个坏均衡,却没人愿意先跳出来。—— Noam Brown 33:11
模型不是过去 5 万年里进化得更聪明了,而是数十亿人长期思考、在彼此积累的知识上不断叠加。—— Noam Brown 27:50

提到的书·产品·人物

适合谁听

关注 AI 评估方法、推理时计算扩展、模型安全与前沿研究战略的研究者、产品决策者与投资人。

← 返回全部观看原片 ↗