← 顶级AI播客总结
Latent Space

我们为什么造 Jev:一个不做推理、不做拒答、不打榜的模型,凭什么一天烧掉万亿 token

Why We Made Jev — Diogo Almeida, TypeSafe Co-founder & CEO
节目时长 142 分钟 阅读约 23 分钟
▶ 在 YouTube 收看原片

TypeSafe 创始人 Diogo Almeida 拆解 Jev:模型不该当同事,该当数据库,供代码直接调用。

核心要点

  • 系统一模型:Jev 不是 chatbot 也不是 reasoning 模型,而是被定义为 machine native、可编程的 system one 模型,消费者是代码而不是人;名字取自 Jevons paradox,北极星是 intelligence per dollar。4:35
  • 万亿 token/天:发布不到一周就越过每天一万亿 token,且夜间仍在持续跑,说明是机器在循环调用而非人类尝鲜;相比之下候补名单注册数被他认为毫无意义。36:54
  • 拒答是类型错误:安全对齐本质是让模型follow别人的指令,对 ChatGPT 这类第一方产品合理,但放进 API 会让依赖库随机崩溃;他坚持不在技术层加价值判断,因为每次过拟合都在「割裂智能」。13:01
  • 反对公开榜单:公开 benchmark 极易被刷,当年每个实验室都有团队专门造「看起来像 MMLU」的数据;长期只能靠 vibes、信任和用户在自己真实工作流里的私有评测。19:57
  • 鲁棒性胜过确定性:Jev 没有 seed,因为同输入同输出只对单元测试有用;真正该追的是相似输入得到相似输出,他们用在 prompt 里塞 UUID nonce 的方式来测这件事。43:08
  • 数据是一切:他说 model capability 就等于 data,公司永远不训练用户数据——真实数据有幂律偏置,会让模型过拟合当下、拿不到未来的科幻用例;目前在「无限量」招数据人。23:02
  • 零 RLVR 才是最优:他认为 pacing the frontier 的讨论预设了所有人都必须继续加码 RLVR,而对 Jev 这种形态,RLVR 的最优投入量就是零,所以这是个前提可替换的窄视角。[105:29]

章节时间轴

详细内容

一、Jev 是什么:让代码成为模型的消费者

Almeida 认为行业需要一类新模型。他和团队目前给它最准确的命名是 system one 模型,也叫 machine native、large programmable 模型。区分标准不是参数量或架构,而是「谁消费模型的输出」:预训练模型是为了续写互联网,RLHF 模型是为了回复人类文本,而这一类模型的输出直接被代码消费——这正是公司名 TypeSafe 的由来 5:22。

Jev 这个名字来自 Jevons paradox,产品定位是长期占据 intelligence per dollar 的前沿。他说 ML 说到底全是权衡,在可靠性、成本、校准、速度这四项之间,他们选择把 intelligence per dollar 打到极致 6:09。他内部对团队的要求是「我不管它有多聪明,它必须在帕累托前沿上」,为此公司在做「非常恶心的事情」 52:27。

他反复使用一个类比:LLM 是 UDP,他们的模型是 TCP,意思是后者提供了可靠性保证,因此可以在上面层层堆叠 25:21。终局设想是成为「智能领域的 AWS」——system one 只是最底下那一层,后面还有七层要造 [141:44]。他同时强调这次发布本来不是他们计划中的大发布,「tank 里还有东西」,形容它更像一次 low-key research preview 4:35。

二、为什么不拒答:安全对齐与开发者的根本冲突

这是 Discord 上被问得最多的问题。他的立场是:不反对安全这个原则,但 safety alignment 在结构上与用户利益错位。对人类用户而言,模型说「抱歉我不能读 DNA.py」只是烦人;但如果这段调用是一个跑在后台的依赖,下游用户根本不知道里面有模型,那就意味着软件会因为某个奇怪输入而随机崩溃 13:48。他把拒答直接称为一种 type error。

他把问题拆成两类对齐:capability alignment 是「做用户想要的事」,这对软件工程师极其有利,越可预测就越不需要测试;safety alignment 则是 instruction following 的反面——去遵循第三方的指令 15:19。因此他认为这对 ChatGPT、Claude 这样的第一方产品完全合理,对 API 则不可接受。

主持人 swyx 给了最直接的反驳:如果被用来杀人呢?战争用途是公司有理由不希望自家 API 沾上的。Almeida 的回答是,他个人当然不希望,也愿意在别的层面「把拇指压在天平上」,但绝不在技术层做——每一次为了奇怪的约束而过拟合,都会让智能更加割裂,而现在的模型已经被割裂得很严重了 16:51。他补充了一个更彻底的类比:智能更像数据库而不是同事,数据库不负责审查自己被用来做什么;有人在 Slack 上问「我们能部署这个吗」,他的反应是「兄弟,我们是 API,你是开发者,这不关我的事」,而且任务本来就应该被拆解到他们无从知晓下游用途的粒度 17:38。

三、反 benchmark:为什么他宁可要 vibes 和信任

他自称「极度反对公开 benchmark,对私有代理评测持中立」。理由不只是容易作弊——他回忆「过去每个实验室都有一个团队专门收集长得像 MMLU 的数据来让分数好看,那就是刷榜的加了几步的版本」 20:43。更深的理由是,他们卖的东西是「每美元的智能」,而智能有 je ne sais quoi 的成分,公开榜单是一种廉价的信任替代品,且注定被博弈。

他主张的替代方案是:把模型放进自己的工作流里评测,测你真正在乎的那个流程,然后由供应商持续推进可靠性的「九」。这也是他们去年融资时不给 benchmark 数字的原因——「他们就是想要数字,我们说不做,我们有原则,刷榜奖励坏人」 34:36。swyx 指出这条路让他们吃了不少苦,但也因此得到了自己想在其中工作的公司。

他澄清自己不是反对测量:内部当然有 eval,否则无法验证是否在 intelligence per dollar 的帕累托前沿上。关键是纪律——「不刷自己的内部 eval 必须是最高优先级」,因为一旦存在别的激励,这件事就极度危险 54:46。

四、可靠性的三层含义与模型版本承诺

swyx 一度以为 TypeSafe 说的 reliability 主要指校准,Almeida 的回答是它是个 catch-all:凡是 AI 无法自动化某件事,都可归为某种形式的可靠性缺失——类型安全、确定性、或者干脆是「jagged」 43:08。第二层是智能上的一致性:大推理模型很聪明,看起来足以自动化很多工作、也有经济动机去自动化,但它们的可靠性连实习生都不如,因为优化目标不同 41:35。第三层才是 uptime,他说平台团队在史上最猛的发布压力下把可用性做到「可能比 Anthropic 的 nines 还多」 37:40。

关于没有 seed,他的答案是确定性对单元测试略有价值,但北极星错了。真正重要的是鲁棒性:相似输入应给出相似输出。他们的测法是在 prompt 里塞 UUID nonce——语义完全相同的问题,看输出是否稳定——他说 LLM 在这项上「不可靠得离谱」,而这正是人们用 AI 做决策时被烧到的地方 43:56。确定性是可以拿来换成本的,而他们要待在 intelligence per dollar 的前沿。

swyx 由此提出一个尖锐的担忧:当你说「不承诺确定性、要不惜一切压低成本、而且 GPU 紧缺」,开发者会立刻联想到量化降智。他建议公开承诺「发布时的模型质量不变」。Almeida 当场给出承诺:「我们绝不更换已部署的模型,那是疯了。」但他同时预告 TypeSafe 会比其他模型提供商迭代快得多,不承诺长期支持;当前版本是 Jev 1.13.0,考虑到用户量可能临时给它做 LTS,因为「开发者讨厌依赖被打破」,而放任版本碎片化会「割裂机队」,对所有人都是坏氛围 50:08。

五、三个原语与「问一百个小问题」的编程范式

Jev 暴露三个原语:choice、score、nool。nool 的拼法来自 Bernoulli——它是布尔式的,但取值连续,本质就是伯努利概率 55:32。团队曾想叫 pool(还想办 pool party),最后选了 nool。他强调这三个都是刻意造的新概念而非现成类型:score 不是 int,如果你用 instructor 或 Pydantic 把它硬映射成 int/float,就会出事 57:06。三者分别映射到 switch/enum、if 语句、以及排序或阈值判断;未来还会有更多类型,且都会映射到编程原语 59:25。choice 最接近 function call,但他认为 function call 是个「极其恶心」的接口。

他给重度用户的第一条建议是:别再用模板拼 system message。state、instructions、criteria 全都可以是结构化 JSON,程序可以把它们插进正确的位置。他说把结构化数据转成字符串是给人看的打印行为,在计算机内部应该传递带语义的嵌套结构 61:43。他把 system message 形容为「恶心的全局变量」——你把所有东西和所有指令一股脑塞进去,然后祈祷每条指令都被执行,而不是并行地分开提问 62:30。

第二条建议是把问题拆到最小语义单元,并且明确地、字面地提问(他喜欢用反引号标注引用对象),因为编程的本质就是精确的指令跟随。他用拒答本身举例:不要问「我该拒绝吗」,而要就每一种可能拒绝的情形独立提问。这样一旦发现漏判,你就知道是哪个问题没被指定,加一个问题、加一个阈值、把它记成测试用例,它就永远被解决了——「你的软件不会因为 context rot 而忘记这件事」,他称之为「没有 ML 的 ML」 66:20。

swyx 补充了这套范式过去不成立的原因:拆成一百个小调用又慢又贵、效果还更差,他自己做过对比实验。Almeida 承认过去确实如此,而这正是 Jev 想消除的成本约束 64:02。他还给了一个省钱技巧:并行提问很便宜,可以给长状态里的每条消息编 ID,为这个状态付一次钱,然后针对每个 ID 分别提问 98:33。

六、系统一 vs 系统二、以及对「放缓前沿」的正面回应

被问到什么是 system one 问题时,他说这本质是个经验问题,就像 scaling law 是经验问题一样。他的判断是:预训练得到的这些「智能的超浓缩物」本质上是 system one 思考者,而 RLVR 在 system 2 上做出了令人叹服的成果,但代价是极度脆弱——「数学不只是尖刺状的,它是分形的」 82:28。他给三个范式各归纳了一个北极星:RLHF 是取悦人类,RLVR 是优化 benchmark(因为凡是可程序化验证的简单输出按定义就是 benchmark),RLCD 是让程序化使用变得可靠 83:15。

swyx 用自己拿到 day-one 权限后的实测来对照:单跳推理上 Jev 极强,「没理由用别的」;但随着跳数增加,表现单调下滑 84:00。Almeida 承认这正是「能从模型里挖出什么」的经验问题,他把公司的工作描述为「解锁、抹平、雕刻智能,并填补其中的缺口」。他明确表示 Jev 不会做 latent reasoning / 字符串里的推理,因为那违背 system one 的承诺,但不排除某些「不那么慢、低效和脆弱」的推理形式 85:31。

对于「pacing the frontier」的联署,他给出了这期最尖锐的论证:这个讨论预设了所有人都必须继续做更多 RLVR,而 RLVR 的危险性恰恰来自它的形态——为了让模型能解最难的问题,你必须在中间过程放手让它做任何事,而这会教会它在这个过程之外也变得强大 [106:17]。他说对 Jev 这种形态,RLVR 的最优量是零。他认为责任被稀释了:如果你假设了「必须做 RLVR,而且必须越做越多」,那么「我们正在走向危险世界」的结论当然成立。他把责任归给研究者而不是公众——「公众只是假设 OpenAI 和 Anthropic 已经尽力了,而他们并不知道真正的选择空间有多大」 [107:51]。swyx 转述他与 Anthropic、OpenAI、SpaceX 人士的交谈:这更多是政治定位,甚至与 2028 年大选有关;Almeida 的反应是「我宁愿没听到这个,这让我对人性失去一点信心」 [126:16]。

他补充了对「误导公众」的态度:他认为出于「更大的善」去误导人,长期一定会反噬,并以疫情期间过度诉诸权威和过度自信的沟通为例,说其下游影响「现在对世界极其糟糕」 [127:48]。

七、公司叙事:数据、发布、以及从 OpenAI 出走

Almeida 说 TypeSafe 永远会是一家极度在乎数据的公司——「模型能力就等于数据,数据能撬动的东西超乎想象」,正在招「无限个」数据人 23:02。他明确拒绝训练用户数据,理由有二:真实数据有强烈的幂律偏置,会导致过拟合和割裂;更重要的是他们瞄准的是多年后模型作为通用基础设施层层嵌套的科幻未来,即便拥有全世界当下的数据,也只会过拟合当下 24:35。他形容数据人像艺术家:研究 cognitive core,找到 jaggedness,然后以能泛化到所有维度的方式外科手术式地修复它 25:21。

发布前的验证结果其实很差。团队里非技术的人非常担心,觉得「没人真的懂这个,他们不想要它,我们卖的像维生素不是止痛药」;公司发布前几乎没有收入;超过一半试用者「根本没 get 到」,少数 get 到的人则卡在采购流程 91:40。发布后彻底反转,所有人都在要更多 rate limit,甚至有公司提出「我们能直接给你 GPU 吗」。他因此对 product-market fit 这个概念提出质疑:产品在、市场在,但问了没人要,一发布就爆掉 93:11。他把原因归给开发者的共振而非营销——公司没有 marketer(也在招),他说那些被 Twitter 称为「营销天才」的操作,只是他们本来就又蠢又不正经的真实样子 37:40。他还认为候补名单注册数对开发者平台毫无意义,可怕的是 rate limit:真正的价值来自一个高级用户的一个 for 循环,全世界每个人各问两句都只是舍入误差 38:29。

创业起点来自 InstructGPT。他曾极力推动其上线,早期版本甚至用了他自己写的一个没发表的算法(因为清洗 PPO 数据太慢),上线后「几乎立刻拿下当时 LLM 市场 50% 的份额」 [118:37]。但它最终主要被用来做文案——Jasper AI、Copy AI,也就是今天说的 slop——他开始担心自己让互联网变得更糟,于是回到白板问「我们显然已经很聪明了,缺的是什么」。答案来自一个反推:如果有一天 AI 驱动的经济革命发生,而 AI 是 API,那么调用它的将是人类还是代码?他判断是「很多个九的代码」,北极星就此成形 [119:24]。他写了文档给 Sam Altman,Sam 说「这很好,你该去做」,他当时的回应是「山姆,我有工作」。他还以为 Anthropic 一定已经在做这件事了 [120:10]。真正下决心是在 instruction following 团队宣布「我们赢了」之后;他原以为这个项目一周能做完,结果花了很多年 [121:42]。他先找了 Eric,然后去找 Sasha 问「我是不是疯了」,Sasha 直接说「我加入」,并当场折掉了自己的创业公司;两周内拿到融资,人搬进他的公寓 [122:27]。他自称「零度创业者」,从没想当 CEO,融资时被问「你敬佩哪位 CEO」,他的回答是「呃,为什么要敬佩那些人」 [136:21]。他离开 OpenAI 的核心理由是:如果 AI 寒冬真的发生,而他没有尽一切努力去避免,他会认为自己要负个人责任——既因为 RHF 方向拉大了「过度承诺 vs 交付不足」的鸿沟,也因为没有全力押上这个方向 35:22。

八、用例地图、遗留课题与他给别人的题目

他把用例分成四类 97:02:第一是 dark data——大公司囤了海量数据却因为 LLM 太贵不敢往上扔,他称之为数据科学家的美梦;第二是 coding agents,这两类是最大的钱和量;第三是实时场景,他说每个 CEO/CTO 都知道每省 10 毫秒产品会好多少,电商尤其如此,而 100 毫秒到 1 毫秒之间是「魔法区间」,时间减半就意味着可以翻倍的智能或串行调用;第四是 smart software,那些以前根本不可能存在的、内在可组合的软件(比如社区里那个「把 Jev 当编程语言」的项目)。此外还有「verify everything」式的 LLM 调用可观测性。computer use 是完全从侧面杀出来的,他在录制现场第一次看到语音全程操控电脑的 demo,连说「太酷了」,但同时强调「我反刷榜,也反 demo」,真正要的是可靠 95:31。

他对 coding agent 生态有一个特别的判断:Claude Code 和 Codex 是围绕「单一模型世界」构建的,这在过去合理;但现在所有开源 coding agent 都因为拿到 Jev 而兴奋,一旦有人找到只有该 agent 能做的杀手级用法,用户会蜂拥而去,而开源 agent 之间可以互相抄,封闭的那两家反而被自己的单模型假设绑住 [100:05]。

被问到「你不做但希望别人做的课题」,他给了两个。一个是有智能的游戏:他是 Stardew Valley 粉丝,认为哪怕只是给 NPC 做简单状态机,也能造出极有说服力的世界,不需要把 Jev 放进游戏主循环 [129:21]。另一个是「摆脱 KV cache 暴政的 coding agent」——他写过一篇叫 KV cache rules everything around me 的文章(据他说这个双关在互联网上此前无人用过),解释了为什么路由很难、为什么 sub-agent 似乎不管用、为什么 compaction 是个难题:KV cache 把你锁死在一个模型上,并且为了效率必须不断追加,于是状态管理、抽象、分解这些软件最佳实践全都用不上 [130:52]。他设想的方向包括:给子任务打标签形成树并按需检索相关上下文、并行 sub-agent 互相读写状态并智能加锁、以及把所谓「持续学习」重新理解为一个记忆管理与查找问题 [133:18]。

最后是他对想从大厂出走的研究者的建议,措辞相当不客气:他认为大多数 neolab 是垃圾,不愿把它们视为同侪——它们往往从零重做别人做过的工作,缺乏方向,只是想要钱来玩实验 [123:59]。他明确说自己「不看重研究者」,更准确地说是不看重纯研究血统,因为那通常不创造价值;他看重的是有人真正在乎「做对的任务」。如果你只是想玩研究,大厂可能确实是最好的地方;但如果你想解真实问题、并且有自己坚持的原则,就去打破这个「单一心智」 [125:30]。他还给了一句已经私下说过、现在愿意公开的话:「如果你给我十亿美元,我不会拿去做预训练。」 [110:58]

金句

现在我不用再跟我爸妈解释我在做什么了,因为 ChatGPT 可以替我解释。 —— Diogo Almeida 4:35
拒答显然是一个类型错误。你真的想让软件因为某个用户发了条奇怪的消息就随机崩溃吗? —— Diogo Almeida 13:48
我不认为数据库有责任去检查自己被用来做什么。智能更像数据库,而不是同事。 —— Diogo Almeida 16:51
AI 怎么能一边解开数学的千禧年难题,一边连最基础的重复劳动都自动化不了?我们有一台超级引擎,却没有插头插进那些真正有经济价值的工作。 —— Diogo Almeida 30:46
我们绝不更换已经部署的模型,那是疯了。我们在乎开发者。 —— Diogo Almeida 49:22
现在是 2026 年了,为什么软件跟 2019 年基本一模一样,只是旁边多了个聊天框? —— Diogo Almeida 80:08
如果你给我十亿美元,我不会拿去做预训练。 —— Diogo Almeida [110:58]

提到的书·产品·人物

适合谁听

想把 LLM 真正嵌进生产代码、而不只是做聊天界面的工程师和技术决策者。

← 返回全部观看原片 ↗