核心要点
- 80/90 与 10/20:Jeff 判断企业内部绝大多数 token(80~90%)会跑在开源模型上,但只占 10~20% 的支出;最难的任务仍留给前沿实验室,中间大量问题由开闭源协作完成 17:41
- AT&T 迁了 40%:The Information 报道 AT&T 已将 40% 的 token 消耗转到开源模型,目前以美欧模型为主、同时在评估中国模型;主要工作负载是编程 agent 2:18
- 两个拐点,150 倍:Ollama 云上人均周 token 年初被编程 agent(Kimi、GLM、MiniMax)拉起第一波,四月被 OpenClaw 引爆第二波(约 5 倍),上下文从 128K 跃到百万级;云端整体自年初增长约 150 倍 3:51
- 云端几乎全是中国模型:本地运行的模型美中欧基本三分、势均力敌,但云托管的编程 agent token「几乎 100% 是中国模型」——结论是美国实验室需要拿出更多大模型,Nemotron Ultra 是第一波回应 23:01
- 安全是唯一阻塞点:AT&T 那篇文章里,采用开源模型的障碍主要集中在安全与合规;Jeff 的经验是「只要安全问题解决了,采用中国实验室的模型对绝大多数客户完全可以接受」 6:56
- Flash 级模型带回「无限 token」:DeepSeek Flash 这类超低单 token 成本、也低单任务成本的模型,能干好 80% 的任务,是 Ollama 云上增长最快的部分;它们让人重新不必计算用量 29:11
- 两周做出第一版:此前两年反复过度设计,最后在多伦多的房间里推倒重来,给自己两周发第一版 Ollama,正好撞上 Llama 2 发布——「之前两年是把客户和产品想太多,却什么都没发出去」 43:46
章节时间轴
- 0:45 嘉宾与数据位置 — Ollama:900 万开发者、17.8 万 star、85% 财富 500 强;同时看得到本地与云端的真实使用。
- 1:32 开源模型的转向 — 企业侧明显向开源迁移,来源是中美模型混合,主要由编程 agent 与 OpenClaw、Hermes 这类 AI 助理驱动。
- 2:18 成本是入口,控制是北极星 — 成本是开源能立刻解决的最大痛点,但企业真正想要的是控制与定制;AT&T 已迁 40%。
- 3:04 人均 token 的两个拐点 — 年初编程 agent,四月 OpenClaw;上下文 128K → 百万级;云端整体 150 倍。
- 5:25 微调会不会又是白费功夫 — 开源发布节奏在加快(一个夏天三代 DeepSeek Flash),追新更难,但工具链也在变好。
- 6:10 前沿放慢,开源逼近 — 前沿实验室因对齐与围堵问题可能放慢,开源持续变强;GLM-5.3 的网络安全能力被点名。
- 7:42 开源的杀手级场景:安全测试 — 让 Claude 给自己的产品做渗透测试基本会被拒绝,而 Hugging Face 上有专门的安全研究模型。
- 8:28 Day-0 发布的 playbook — 推理引擎适配(常需数周)、harness 准备、硬件与供应商协同,多数事情在发布前 24 小时才凑齐,「基本是一场救火」。
- 11:31 Ollama 就是那层操作系统 — 下接驱动与推理层、上接应用运行时,把任意 harness 匹配任意模型是个组合爆炸问题。
- 13:03 五层蛋糕与被隐藏的层 — Jensen 的应用/模型/基建/芯片/能源五层;开源世界的「模型层」内部还藏着更多可拆解的层。
- 13:49 知识、协调、执行 — 引用 Anthropic 平台团队的三大问题,并预测每一层都会长出 best-of-breed 公司。
- 15:19 token 过剩之后的新稀缺 — 稀缺不再是 token,而是 token 之上的编排能力。
- 16:06 锁定还成立吗 — 编程 agent 变强后,「维护高质量软件太难」这条护城河正在消失;memory 之类有状态的东西留在模型之外。
- 17:41 开闭源的稳态比例 — 80~90% 的 token 对 10~20% 的支出;路由器把最难的调度交给前沿模型。
- 19:59 合伙人与律师助理 — 人类组织与 AWS/DynamoDB + Postgres 的历史类比。
- 20:45 本地模型的回归 — 这代硬件跑 20B~40B(有时到 128B)非常好;Qwen 38B 在编程基准上已被认为接近 Opus 4.6。
- 23:47 DGX Spark 与桌面复兴 — 128 GB 统一内存、可通过高速互联堆叠成桌面小机架;银行与工业客户桌上本来就有成千上万块工作站 GPU。
- 26:52 GPU 市场 — 价格与供需波动剧烈,创业公司很难直接拿到 B200/B300;OpenRouter、Ollama、OpenCode 这类产品让开发者绕开 24 个月的采购预测。
- 29:11 给缺钱创业者的建议 — 押 Flash 级模型:超低单 token 与单任务成本,好到能覆盖 80% 的任务。
- 31:31 God model 还是编排 — 目前看是后者胜出:任务分解带来可复现、可信赖、成本可行。
- 33:02 开源会出现 god tier 模型吗 — Z.ai/GLM 在部分任务上已是前沿,Kimi 在 Web 开发上一度最强,「从追赶差距变成正面对撞」。
- 33:48 地缘政治与「满洲候选人」 — 客户分两类:只在乎在哪里运行,和在乎模型来自哪里;供应链投毒不是新问题,但模型更不透明。
- 36:04 Ollama 的起源 — Docker Desktop 出身,2021 年以「Kubernetes 版 Docker Desktop」进 YC。
- 40:42 荒野两年 — 看不到北极星比看到难题更可怕;十几人的团队陪着熬过多次转向。
- 42:14 两周发第一版 — 在多伦多推倒重来,两周后正撞上 Llama 2 发布。
- 46:49 商业化为何等了两年 — 等开源模型在产品层面真正达到 PMF;最大风险是把用户当成「互联网上的一团人」。
- 49:53 为什么二次创业还进 YC — 创业很孤独;不重复上一代的错误,比学会做对的事同样重要。
- 52:59 DevOps 时代失效的旧经验 — 「在别人之上做一层很脆弱」在 AI 世界不成立;LLM 的不确定性是特性不是缺陷。
- 55:20 策展成为新的稀缺 — 在模型、推理、云服务、harness 都过剩之后,把它们拼成「能用」才是价值所在。
详细内容
一、企业为什么转向开源:成本是入口,控制是目的
Jeff 的开场判断是:他看到的最大变化是企业向开源模型的转移,来源是美国和中国模型的混合,主要驱动力是编程 agent,其次是 OpenClaw、Hermes 这类协同工作型的 AI 助理。
问到是不是纯粹为了省钱,他的回答分两层:成本确实是开源能立刻解决的最大痛点,但每家企业真正的北极星是拿到对 AI 的更好控制、并按自己的业务做定制。成本是短期能解的问题,而解决它之后,才谈得上为独特场景改造模型。
具体案例是 AT&T:据 The Information 的报道,它已经把 40% 的 token 消耗迁到了开源模型,目前以美国和欧洲的模型为主,同时也在评估中国模型。工作负载主要是编程 agent。
Ollama 云上还有一个反直觉的地域数据:使用开源模型 token 的企业遍布全球,美国和德国是两个大来源,而云上被调用的模型目前以中国来源为主。
二、两个拐点:编程 agent 和 OpenClaw
节目里展示的那张图是人均(而非总量)曲线:Ollama 云上每个开发者每周消耗多少 token。它有两个明显的拐点。
第一个在年初,由编程 agent 拉动。Jeff 的说法很直接:随着 Kimi、GLM 系列、MiniMax 的发布,我们终于有了跑得动 coding agent 的开源模型。
第二个在四月,由 OpenClaw 引爆,随后是 Hermes 项目。它的意义在于把长时程自动化交给了非开发者——财务、客服、市场、销售也能把一个难题丢给开源模型让它自己跑完,而这个过程(判断该用什么工具、去取什么数据)极其消耗 token。与此同时,开源模型的上下文窗口从 128K 跳到了百万级以上。
量级上:OpenClaw 那一跳大约是 5 倍(此前人均约 1500 万 token 量级);总量上整体在 10~20 倍甚至更多,而 Ollama 云自年初起增长了约 150 倍。
Jeff 强调了一个容易被忽略的结构变化:2024~2025 年,被大规模服务的开源模型大多是定制模型——你拿 DeepSeek 或 Kimi 这类现成模型,为自己的场景微调(Cursor 就是著名例子),然后规模化提供服务。而开箱即用的开源模型被大规模服务,是今年年初才真正起飞的。
主持人追问微调的周期性:2024 年初大家热衷训自己的模型,然后热度退去(「下一个模型一发布,你的努力就被踩平了」),现在似乎又回来了——这是又一个循环还是这次会留下?Jeff 的回答是双向的:开源侧的发布节奏在加快(「光这个夏天我们就见了三代 DeepSeek Flash」,而过去是六个月一代),这让自己训模型更难跟上;但另一方面,工具链在变好,想微调的团队有能力持续跟进。
三、开源的杀手级场景:安全测试
一个有意思的细节:主持人指出,Hugging Face 当初甚至必须用开放权重模型才能检测到那次来自前沿模型的入侵。
Jeff 说他们最常被问的问题之一是「哪些场景下开源模型相对闭源前沿模型有压倒性优势」,而安全测试是其中最关键的一个。原因很实际:你让 Claude 给你的产品做渗透测试,它基本上会拒绝。而在 Hugging Face 上,你能找到被专门「解除限制」(obliterated)的安全研究模型;即便是开箱即用的开源模型,它们虽然也带安全训练,但更能区分你是出于正当用途还是恶意用途。
同一逻辑也解释了企业侧的阻塞点。Jeff 说,AT&T 那篇文章里采用开源模型的障碍主要集中在安全与合规上;而他们与欧美客户打交道的经验是:只要安全问题能被解决,采用中国来源实验室的模型对绝大多数客户完全在可选范围之内。他把这看作安全与治理领域创业公司的巨大机会,并特别点名 GLM-5.3 发布时展现的网络安全能力「极其可观」。
背景是前沿实验室这一侧:AI 安全正成为越来越大的问题,前沿很可能为了解决对齐与围堵问题而放慢,而开放权重模型仍在持续变强。
四、Ollama 的角色:开源世界的操作系统
因为是模型的关键分发渠道,模型开发方通常会在正式发布前联系 Ollama 协调 day-0 上线。Jeff 描述了他们总结出的一套 playbook,包含三件事:
1. 推理引擎支持:确保模型在主流推理引擎里跑得快、跑得准、与参考实现一致——这通常是一个数周的过程。
2. harness 与场景:新模型往往带来新能力。他举了当天早上的例子:DeepSeek 发布了自己第一个大型多模态模型(此前只有较小的 OCR 模型),同时改动了 DeepSeek harness 以支持这项能力。所以第二步是确保 harness 准备好、能有效驱动这个模型。现在有很多优秀的开源 harness——Codex 的 harness 是开源的,OpenCode 也是 Ollama 用户最常用的之一。
3. 硬件与供应商:与推理服务商、NVIDIA、Apple 芯片栈协作,确保模型跑得够快——「模型很强但很慢,体验就不好」。
麻烦在于时机:你运气好才能提前几周拿到模型,大量工作是在发布前 24 小时凑齐的,基本上是一场救火。
主持人给出的类比是操作系统:向下要紧密集成驱动和硬件,向上要保证应用层调好。Jeff 接受这个「有点陈词滥调但确实贴切」的比喻,并指出真正的难点是组合爆炸——要有一个通用运行时,能把任意 harness 匹配到任意模型。
他还纠正了一个关于团队背景的想象:Ollama 的人大多不是 AI 研究者出身,而是来自 VMware、Docker 和网络公司。他们的判断是——经典的计算问题正在推理这块土地上重新发明自己,而这正是他们擅长的地方。最终一切归结为开发者体验:当开发者调用 API 拿到 token,中间到底发生了什么。
Jeff 引用了黄仁勋常说的五层蛋糕:应用、模型、基础设施与推理、芯片、能源——前沿实验室在 day-0 就把这五层都给开发者备好了,而这正是 Ollama 想为开源模型复现的(当然不可能自己做每一层,但可以做编排)。他随即补充:开源世界的层数可能不止五层,「模型层」内部本身就很厚——有模型权重,也有各个模型独特擅长的编排组件,还有开发者 API 层;模型与应用之间藏着大量今天被五层蛋糕遮住的机会。
那些隐藏层会不会被拆分成独立公司?Jeff 引用了 Anthropic 平台团队讲过的三件事:knowledge(如何把公司数据与上下文接到模型)、coordination(一次请求会分裂出一堆子 agent,有的在云上有的在本地,需要协调)、execution(沙箱;随着 agent 越来越多迁到云上,这是个巨大的算力问题)。他的历史类比是云计算:最初一代产品(Heroku、Google App Engine)是打包在一起的,但开发者最终偏好的是每个问题上的 best-of-breed 产品。主持人补了一句时代注解:前沿实验室希望你完整待在它们托管 agent、上下文和记忆的围墙花园里,而「little tech」和开源开发者不想被关起来,最后大概率是两者的混合。
Jeff 由此提出本期最凝练的一句结构判断:开源 token 已经过剩,几十家供应商都能提供;新的稀缺在 token 之上——如何把一个 agent 从 A 编排到 B。 这些是极难的系统与工程问题,单个开发者不可能自己造齐所有层。
主持人抛出反向可能:既然编程 agent 越来越强、而「维护高质量、经过良好测试、真正满足用户需求的软件太难」正是过去护城河的来源,那么护城河会不会消失?——你可能只需要一个 cron 跑一个 markdown 文件加一点 TypeScript,今天用 OpenAI 的记忆系统,明天让 agent 通过 MCP 持续同步到你自己的记忆系统,锁定就不存在了。
Jeff 同意大方向,但给出了一条边界:今天 harness 里的很多部分会下沉进模型;而当核心循环下沉之后,反而会有一些东西浮出来,memory 就是典型。他的判断准则很清晰:只要是有状态的问题(涉及存储),最终就进不了模型——因为模型训练完就固定了,即便现在训练周期已经缩短到月级,也仍然跟不上最新数据。同类还有凭证管理、安全与合规工具——开源模型不像闭源供应商那样自带全套安全工具,而这对企业采用至关重要。
五、稳态:80~90% 的 token,10~20% 的钱
被问到企业在闭源前沿与开源之间的最终平衡,Jeff 给了本期最被引用的数字:
企业内部绝大多数 token 会是开源模型,称之为 80~90%。但这不意味着 89% 的预算会流向开源。
事实上他认为开源社区做得最好的一件事正是把成本压下来,所以你可能只在开源上花掉 10~20% 的钱,却跑掉绝大多数的 token。这带来的连锁效应是:你不再需要限制团队的 token 使用权,反而会不断放开——token 的丰裕本身会解锁一大批新场景。
最难的任务仍然留给前沿实验室(最好的研究者在那里),中间是一大片开闭源协作的地带。主持人指出其中的张力:模型越强,你越想让最聪明的模型来决定什么时候调用开源模型,但拥有模型的实验室大概不希望你这么做。Jeff 的回答是把决定权交给客户:如果客户想要一个路由器,把调度和更难的编排交给前沿模型,那就这样;大量「行项目」式的工作可以交给开源模型。他提到 Sakana AI 和 OpenRouter 都有把两者结合的项目,效果很好。
节目给了两个类比:律师事务所里合伙人把活分给助理;以及云计算历史上 AWS 的 DynamoDB(自有的规模化数据库)与 Postgres 并存——客户最终用的是两者的组合。主持人还联想到 Apple Silicon 里针对图像与音频的专用加速器,以及更早 PC 时代独立的声卡和显卡。
六、本地:桌面复兴与硬件的追赶
Ollama 同时握有云端和本地两块业务,Jeff 对本地的判断同样是「混合」:简单任务在本地跑,延迟更低、单 token 成本更低(代价是前期买硬件),与云端模型配合使用。
令他兴奋的是这一代硬件跑 200 亿到 400 亿参数区间的模型有多好,有时能到 1280 亿。主持人提到「Qwen 38B 在编程上已经和 Opus 4.6 相当」,Jeff 说基准数据是这么显示的,而你只需要买商店里第二低配内存的 MacBook 就能跑。
使用分布上:本地跑的模型里,美国、欧洲和中国来源的模型是一个相当均衡的混合——除了 Llama 系列,还有 DeepMind 的 Gemma。但按场景看,编程 agent 绝大多数还是要靠大型云端模型(解决真正困难的问题、写代码写测试),而文档处理这类端到端难度较低的工作流在本地跑得极好。于是形成混合执行模型:简单任务本地跑,路由器判断什么时候必须上云。对客户的意义是成本进一步下降——不只因为开源模型云上更便宜,还因为你可以在本来就要买的硬件上近乎免费地跑它们。
而云端编程 agent 那张图给出了本期最尖锐的对比:本地是中美模型势均力敌,云托管则几乎 100% 是中国模型。主持人的结论直白:「基本上我们需要更多美国实验室做大模型。」Jeff 认为 Nemotron Ultra 的发布是这一波的开始。他顺带称赞了 NVIDIA 的定位:它的护城河不是去做新软件生意或卖 token,而是大量开源、扶持生态,反过来让自己在硬件上保持领先。
硬件话题落到 DGX Spark / DGX Station:桌上一台 GB300。Jeff 说 Ollama 是最早拿到 DGX Spark 的一批(与 Elon 等一起,在 GTC 上)——128 GB 统一内存,覆盖 20B 到 120B 的模型区间;而且这些机器有很快的网络互联,可以像迷你数据中心机架一样堆叠,跑 400B 模型完全可行(主持人补充说人们早就用 Mac mini 这么干,「现在这是它的量产版」)。价格上,主持人猜测「二三十万美元能很慢地跑一个前沿模型」,Jeff 说实际比这更有竞争力:你能以离经典工作站电脑不远的价位,高速地跑不止一个前沿模型。他补充了一个被忽视的存量事实:银行和工业客户的每一个工程师桌上本来就有 NVIDIA 工作站 GPU,有的公司数以万计(原本是给 CAD 用的 RTX A6000 那一代),而这只是下一代的开始。
Jeff 认为这会是「个人桌面的一次文艺复兴」,Apple 与 NVIDIA 都在这条路上;Apple 侧的 MLX 项目已经相当成熟。而 Ollama 自己的路线是一个回环:从本地出发 → 编程 agent 的需求把它带到云上 → 硬件追上来之后再回到本地。他给出的具体愿景是速度:当你桌上有一块 GB300,你想要的是最快的编程循环——快到像跑测试、像在编辑器里改代码那样即时,就像当年 GitHub Copilot 在一百毫秒内弹出补全的体验,那种体验会回到桌面上。
GPU 市场方面,Jeff 说价格变化极快、供需波动极大,创业公司想拿到最新的 B200/B300 非常困难。Ollama 靠与多家供应商合作把算力拼起来才跟得上需求,但这背后是大量工作:哪个模型跑在哪里、要多快、在哪个区域、客户延迟多少。而 OpenRouter、Ollama、OpenCode 这类产品对终端开发者的价值就是——不用去谈 B200 的价格,也不用为了拿到 GPU 而做 24 个月的用量预测。
七、Flash 级模型与「无限 token」的回归
被问到「一个刚起步、没融多少钱、想尽可能便宜地烧 token 的创始人该怎么办」,Jeff 的答案是押注一类新模型:DeepSeek Flash 这样的超低成本模型。
他强调了两个指标而非一个:不只是每 token 成本极低,每任务成本也低——后者是很重要的度量。这类模型在他看来会是第一批带回「无限 token」体感的:「我们都记得 ChatGPT,你根本不用去想自己用了多少 token,每天就是用。」他认为我们最终会回到那里,但这需要在模型和架构层面为高吞吐 token 使用做大量定制训练。
他把今年的路线分成两段:上半年的目标是让开源模型追上前沿智能——现在差距可能不到三个月;下一个要解决的问题是极致效率。 他举了 GPT Luna 这类模型价格效率带来的采用爆发作为参照,认为开源侧正在发生同样的事:回到 Ollama 云上的模型家族分布图,增长最快的明确是 DeepSeek 系列,主要由 DeepSeek Flash 拉动。 这类「好到能覆盖 80% 任务、极快、极便宜」的 flash 模型,正是那些高消耗场景的前提。
更进一步,这与前面的编排层呼应:把多个 flash 模型串起来协作,可以拿到大模型才有的效果。所以便宜模型的意义不只是可及和快,而是可以链式组合,用编排解决新问题——他认为这对新创业公司、现有推理服务商和做工作流的大公司都是激动人心的领域。
主持人由此回顾了 AGI 的老辩论:很多研究者曾认为最终会有一个包办一切的 god model,但目前看并没有走向那里。除非你真的要去黑 NSA,多数场景下,任务分解带来的是可复现、可信赖、且成本可承受的方案。Jeff 的补充判断是:对多数客户场景,模型达到某个「足够好」的水平后,他们就会一直用这个水平的智能——模型会更快、架构更好、有新能力,但他们不必去够 god model。当然,最强模型仍会解锁一些场景,「有时候也挺吓人」。
那开源会不会出现 god tier 模型?他认为有可能,并指出 Z.ai / GLM 在部分任务上已经是前沿,而 Kimi 在 Web 开发上一度成为最好的模型、在市场上掀起冲击波。他给出的判断是:现在越来越不像是「有个差距」,而更像是正面对撞的头对头竞争。
八、地缘政治与「满洲候选人」问题
被问到敏感的地缘政治,Jeff 的答案有层次。他说客户其实分成两类:一类不太在乎模型来自哪里,只在乎它在哪里运行、怎么运行、是否在安全环境里;但每有一个这样的客户,就有另一个说「我非常在乎模型来自哪里」。而后者的理由不只是安全——还包括模型「怎么说话」:模型会经历不同阶段,有时听起来更机械、有时更友好,这些也重要。
他认为最高优先级是端到端搞清楚数据从哪来,并称赞 Nemotron 系列的一个优点是可以回溯是什么造就了这个模型。这在关键任务上尤其要紧——他举了一个真实例子:有人发帖讲 Llama 在为芬兰一座电厂的分析系统检测电涌,以确保供电不中断。
主持人直球提问:即便中国模型托管在美国,怎么确保它没有被「安放后门」(主持人称之为「满洲候选人问题」)?Jeff 说他想不起来有已知案例,「如果有我应该会听说」。他给出的框架是把它归入既有问题:媒体报道里很少提及的是,那些财富 500 强企业的 IT 和安全团队对这类事早就习以为常——开源软件时代,一个普通应用有成千上万个依赖,任何一个依赖出问题都足以危及整个应用。供应链投毒已经存在几十年,在这个意义上并不新鲜。 差别在于模型更不透明——你没法像看代码那样挖进去(主持人插话:而且它是确定性的)。他的结论是:只要用安全检查妥善筛查模型,客户反馈是这个问题大体可解。
九、Ollama 的创业史:荒野两年,两周破局
Jeff 和联合创始人 Michael(大学室友,滑铁卢大学,也是他上一家公司的联合创始人)此前在 Docker 做 Docker Desktop,因此非常理解什么是好的开发者体验。但他坦言:公司最初几年真正在做的事,是给这块「为开发者设计优秀体验」的肌肉寻找正确的问题。
他们 2021 年冬季批次进 YC 时的想法完全不同——主持人还记得申请表上写的是「Kubernetes 版的 Kitematic / Docker Desktop」。Jeff 复盘说,这是二次创业者的典型陷阱:在很多方面把想法过度设计了。 他们 2021 年做完 YC,而 Ollama 直到 2023 年 7 月才发布——中间隔着一轮 A 轮和一段漫长的寻找。事后看,一路试错和转向反而是好事,因为恰好赶上了 Llama 发布、开源模型时代开启。
(关于名字:主持人猜是从 Llama 模型来的,Jeff 说不完全是——「llama」在他们的体感里就代表开源模型(比如 LocalLLaMA 那个 subreddit),加上「LLM + 动物」的构词,以及他们觉得有个可以配脸的角色形象很重要。主持人抱怨他至今没采纳「在 Ollama 活动上牵真羊驼来」的建议。)
融资故事也很反直觉:他们 2022 年就与 Benchmark 合作——「上古时代,ChatGPT 之前」。当时的 pitch 重心是「我们要做出色的开发者体验、解决安全问题」,而真正起作用的是人:Benchmark 的合伙人 Peter 正是 Docker 的 A 轮投资人。Jeff 说得很坦白:「为 Kubernetes 解决 SSO 是个真问题,但那并不是我们的热情所在。我们很幸运找到了一个能看见我们代表什么、想做什么,而不是只看我们当下在解决哪个问题的合伙人。」
关于「荒野期」的心理,Jeff 的描述是本期最真诚的一段:吓人的不是没上头条、产品没起飞,而是反复和用户通话却始终没有「咔哒」一声对上——你不知道自己是否真的在为某个人解决问题。「客户通常是很好的北极星,但看不到北极星才是最可怕的,因为你往往知道自己想解决什么类型的问题,只是还没找到那个问题。」 更沉重的是当时团队已经十几个人;他很感谢团队在多次换方向时留了下来。有一次从未公开讲过的转向是:从「Kubernetes 的安全」转到「开发者桌面端的安全」——后来正是把这个形态迁移到了模型上。
破局的时刻发生在多伦多(当时团队分布在多伦多和 Palo Alto,现在主要在 Palo Alto)。他们坐在一个房间里问:「把一切都扔掉。如果我们现在才刚加入、从零开始,会做什么?」 当时他们看到两个问题:一是能不能做一个网关,无缝访问和托管任意模型——「当时我们把它想成 LLM 界的 Segment」(主持人评价这就是今天的 router 概念,机会巨大,而且才刚开始);二是——「我们是一群前 VMware、前 Docker 的人,我们知道怎么把东西跑起来,那就去帮别人把开源模型跑起来吧。」
Jeff 说他真希望更早做这件事:认真自省团队的构成(安全的团队和销售方式与开发者工具完全不同)。结论是「就试试这个吧」,并给自己两周发出第一版 Ollama——两周结束时 Llama 2 恰好发布,他们说「就现在上」。
两周内完成了从想法到发布、到获得比过去所有产品都多的用户;而在那之前,是两年对客户和产品的过度思考,什么都没发出去。
主持人回忆自己最早是在 Reddit 的 LocalLLaMA 版块看到 Ollama、大家赞不绝口,后来才知道是 YC 公司(因为公司在内部系统里是另一个名字)。Ollama 也是最快冲到 10 万 GitHub star 的项目之一——Jeff 记不清具体多快,但比 Docker 和 Kubernetes 快得多。他形容那种作为创始人的状态是「难以置信,因为你没法完全解释为什么」,并称这是对 product-market fit 最好的诠释。
主持人给出的对照最有画面感:从 Reddit 上自己攒机的爱好者,到 85% 的财富 500 强,只用了大约两年——PC 时代花了十年才走完的「家酿计算机俱乐部 → 广泛采用」,这次是 12 到 18 个月。
Jeff 认为原因有两条,且第二条是关键:开源模型免费、能在任何地方运行——这对财富 500 强的 IT 开发团队极其重要,因为他们不需要申请许可就能用。 于是对爱好者友好的东西迅速平移到了企业开发者手上。他拿数据库做对比:MongoDB 也走过从开发者到企业的路径,但因为 LLM 是无状态的,这次迁移容易得多。而一旦要上云,变量就多了:经济账、安全、模型跑在哪里。
商业化为什么等了两年? Jeff 说他们一直看到两条路:一条是隐私优先的 AI 产品(Ollama 的开源形态就是从这里开始的);但他们始终觉得,开源模型当时还没有达到闭源模型那种「产品级的 PMF」——比如 Llama 模型刚出来时你还不能立刻用它做 tool calling,很多场景仍然只能留给前沿模型。他们在哲学上希望等到那一刻发生时正好在场,而这一刻在今年到来了:编程 agent 成为 AI 消耗最大的场景,而开源模型终于能承接它。 「本地」虽然重要,但从来不是完整的故事,完整的问题是:如何用开源模型解决最难的问题。
他也诚实地讲了等待的风险:如果不小心,你会养出一种不把商业化当回事的文化——这是 Docker 时代的伤疤,团队因此有所警惕。另一个更重要的风险是:开源项目一旦起飞,最大的危险是把你的用户和客户看成「互联网上的一团人」。这是很危险的思维方式,因为你需要见到他们、搞清他们的需求、他们在做什么、六个月后想做什么、他们的故事是什么。「这是我希望过去几年多做一些的事,我们现在正在大量补课。」
关于为什么二次创业还要进 YC:他说他们当时来回犹豫了很久,「其实不该犹豫」。理由是创业非常孤独——即便有很好的联合创始人(Michael 是他上一家公司的联合创始人、大学室友)依然孤独。哪怕是在疫情期间远程做的,每周和 Jared 以及另外五组创始人聊天也真的让人没那么孤单;后来搬到湾区,网络的价值更是巨大。另一个理由是:有很多错误你其实可以不必重犯。 他至今仍与 Docker 的创始人(也是 Ollama 的投资人)保持联系,讨论上一代公司踩过的坑,以及——更重要的——什么是真正奏效过的。
由此引出主持人一段给年轻人的建议:如果你从没在一个「把真正出色的技术交付给大量用户、有清晰 PMF」的团队里待过,哪怕只待一个月、三个月,也去待一次。因为你会知道「好」长什么样:bug 数据库长什么样、怎么发版、质量标准在哪、彼此要求的下限在哪。见过一次,成功概率会成倍提高。
十、上一代 DevOps 经验里失效的部分
最后一段是 Jeff 认为在 AI 世界不再成立的旧规则:
- 「在别人之上做一层很脆弱」:上一代有一类叫 PaaS 的公司(Heroku 是典型,Docker 最初也是 PaaS),当时的共识是——作为创业公司,如果你是别人之上的一层,你处境危险。「在 AI 世界这完全不成立,事实上往栈上走有时反而更好,因为你离客户更近。」
- 「系统必须完全确定":在系统世界里,你希望一切都按设计运行、被测试、被验证;而 LLM 按定义不是这样——这是特性而不是缺陷。
- 人员配置的常识:AI 让一些过去必须重配人手的问题不再需要那么多人(比如客服流水线);同时也带来全新课题——「当没有任何一个工程师完全清楚所有代码是怎么工作的时候,你要如何交付一个云服务?」 这在今天显然已经是事实。
Jeff 说,从 2000 年代的基础设施 1.0,到 2010 年代的云,再到今天的 AI,有很多规则会被打破。但也有必须保留的:他提到团队里来自 VMware、Nicira 的资深工程师带来的肌肉记忆——「当有人爱上你的软件并连续用了两年,它还能不能好好工作?」 在 AI 给了你这么大力量的时候,价值观和标准反而更重要,因为 AI 能帮你写,但不会替你负责。
主持人最后指出 Ollama 对生态两侧的价值:终端用户拿到的是干净的 token、合理的 API;而另一侧,如果没有这一层,你会撞上底层推理服务商各种没有文档的怪异错误(某个参数写法不对、或者它其实期待 JSON),「agent 大概能自己摸出来,但在那之前你要撞墙好几个小时」。Jeff 顺势给出全场收束:开源模型领域最大的机会之一是「策展」——把碎片化的模型、推理技术、云服务和 harness 拼成一个真正能用的东西。当模型和供应商都过剩时,把它们整合成可用之物,就成了新的稀缺。 OpenRouter 在模型选择上、OpenCode 在 harness 上都是这样的例子。
金句
成本是开源模型能切入解决的最大痛点,但每家企业的北极星是拿到对 AI 的控制权并为自己定制。 —— Jeffrey Morgan 2:18
企业内部绝大多数 token 会是开源模型,八九成。但这不意味着八九成的预算会流向开源。 —— Jeffrey Morgan 17:41
你让 Claude 给你的产品做渗透测试,它基本上会拒绝。 —— 主持人 7:42
开源 token 已经过剩,新的稀缺在 token 之上:你怎么把一个 agent 从 A 编排到 B。 —— Jeffrey Morgan 15:19
看不到北极星比看到难题更可怕——你往往知道自己想解决哪一类问题,只是还没找到那个问题。 —— Jeffrey Morgan 40:42
两周里完成了从想法到发布、到用户超过我们过去所有产品;而在那之前,是两年的过度思考,什么都没发出去。 —— Jeffrey Morgan 43:46
现在不再是「有个差距」,而是正面对撞的竞争。 —— Jeffrey Morgan 33:02
提到的书·产品·人物
- Jeffrey Morgan(人物):Ollama 联合创始人兼 CEO,前 Docker Desktop 打造者,本期嘉宾。
- Ollama(产品):本地与云端运行开源模型的入口,900 万开发者、17.8 万 GitHub star、85% 财富 500 强渗透率。
- AT&T(公司):据 The Information 报道已将 40% 的 token 消耗迁至开源模型。
- OpenClaw / Hermes(产品):四月引爆第二个 token 拐点,把长时程自动化带给非开发者。
- Kimi / GLM / MiniMax / DeepSeek(模型):让开源模型第一次跑得动编程 agent 的一批中国模型;DeepSeek 是 Ollama 云上增长最快的家族。
- DeepSeek Flash(模型):超低单 token 与单任务成本,一个夏天迭代三代,Jeff 给缺钱创业者的首选。
- GLM-5.3 / Z.ai(模型/公司):网络安全能力被点名,部分任务已达前沿。
- Qwen 38B(模型):基准显示编程能力接近 Opus 4.6,可在次低配 MacBook 上运行。
- Gemma / Llama(模型):本地场景的常用选择;Llama 被用于芬兰某电厂的电涌检测。
- Nemotron Ultra(模型):美国实验室补上大型开源模型的第一波,可回溯训练来源。
- NVIDIA / DGX Spark / DGX Station / GB300 / B200 / B300(公司与硬件):桌面级 128 GB 统一内存、可堆叠成小机架;GPU 供需波动剧烈。
- Apple Silicon / MLX / Mac Studio(平台):与 NVIDIA 方案在测试中「非常有竞争力」。
- OpenRouter / OpenCode / Codex harness(产品):让开发者不必自己谈 GPU 价格、不必为每个模型换 harness。
- Sakana AI(公司):开闭源模型协作路由的实践者之一。
- Anthropic 平台团队(团队):提出 knowledge / coordination / execution 三大问题。
- Docker / Docker Desktop / Kubernetes / Heroku / Google App Engine / VMware / Nicira(公司与产品):团队出身与上一代 PaaS 经验的参照系。
- Benchmark / Peter(投资方/人物):2022 年(ChatGPT 之前)投资 Ollama,此前是 Docker 的 A 轮投资人。
- MongoDB(公司):从开发者走向企业的历史类比。
- LocalLLaMA subreddit(社区):Ollama 早期口碑的发源地,也是「llama 即开源模型」这一语感的来源。
- Hugging Face(公司):被提及需用开放权重模型才检测出前沿模型发起的入侵。
- Y Combinator / Jared(机构/人物):Ollama 2021 冬季批次,Jeff 认为二次创业进 YC 是「本该毫不犹豫」的决定。
适合谁听
正在权衡开闭源模型预算的技术决策者、做推理/编排/本地部署的创业者,以及想听一个「荒野两年、两周破局」创业故事的人。