← 顶级AI播客总结
Lightcone Podcast

开源模型改写 AI 的经济学:Ollama CEO 眼中的 token 流向

Open Models Change The Economics of AI
节目时长 57 分钟 阅读约 34 分钟
▶ 在 YouTube 收看原片

企业 80~90% 的 token 会跑在开源模型上,但只占 10~20% 的花费;云端编程 agent 的开源 token 今天几乎全是中国模型。

核心要点

  • 80/90 与 10/20:Jeff 判断企业内部绝大多数 token(80~90%)会跑在开源模型上,但只占 10~20% 的支出;最难的任务仍留给前沿实验室,中间大量问题由开闭源协作完成 17:41
  • AT&T 迁了 40%:The Information 报道 AT&T 已将 40% 的 token 消耗转到开源模型,目前以美欧模型为主、同时在评估中国模型;主要工作负载是编程 agent 2:18
  • 两个拐点,150 倍:Ollama 云上人均周 token 年初被编程 agent(Kimi、GLM、MiniMax)拉起第一波,四月被 OpenClaw 引爆第二波(约 5 倍),上下文从 128K 跃到百万级;云端整体自年初增长约 150 倍 3:51
  • 云端几乎全是中国模型:本地运行的模型美中欧基本三分、势均力敌,但云托管的编程 agent token「几乎 100% 是中国模型」——结论是美国实验室需要拿出更多大模型,Nemotron Ultra 是第一波回应 23:01
  • 安全是唯一阻塞点:AT&T 那篇文章里,采用开源模型的障碍主要集中在安全与合规;Jeff 的经验是「只要安全问题解决了,采用中国实验室的模型对绝大多数客户完全可以接受」 6:56
  • Flash 级模型带回「无限 token」:DeepSeek Flash 这类超低单 token 成本、也低单任务成本的模型,能干好 80% 的任务,是 Ollama 云上增长最快的部分;它们让人重新不必计算用量 29:11
  • 两周做出第一版:此前两年反复过度设计,最后在多伦多的房间里推倒重来,给自己两周发第一版 Ollama,正好撞上 Llama 2 发布——「之前两年是把客户和产品想太多,却什么都没发出去」 43:46

章节时间轴

详细内容

一、企业为什么转向开源:成本是入口,控制是目的

Jeff 的开场判断是:他看到的最大变化是企业向开源模型的转移,来源是美国和中国模型的混合,主要驱动力是编程 agent,其次是 OpenClaw、Hermes 这类协同工作型的 AI 助理。

问到是不是纯粹为了省钱,他的回答分两层:成本确实是开源能立刻解决的最大痛点,但每家企业真正的北极星是拿到对 AI 的更好控制、并按自己的业务做定制。成本是短期能解的问题,而解决它之后,才谈得上为独特场景改造模型。

具体案例是 AT&T:据 The Information 的报道,它已经把 40% 的 token 消耗迁到了开源模型,目前以美国和欧洲的模型为主,同时也在评估中国模型。工作负载主要是编程 agent。

Ollama 云上还有一个反直觉的地域数据:使用开源模型 token 的企业遍布全球,美国和德国是两个大来源,而云上被调用的模型目前以中国来源为主。

二、两个拐点:编程 agent 和 OpenClaw

节目里展示的那张图是人均(而非总量)曲线:Ollama 云上每个开发者每周消耗多少 token。它有两个明显的拐点。

第一个在年初,由编程 agent 拉动。Jeff 的说法很直接:随着 Kimi、GLM 系列、MiniMax 的发布,我们终于有了跑得动 coding agent 的开源模型。

第二个在四月,由 OpenClaw 引爆,随后是 Hermes 项目。它的意义在于把长时程自动化交给了非开发者——财务、客服、市场、销售也能把一个难题丢给开源模型让它自己跑完,而这个过程(判断该用什么工具、去取什么数据)极其消耗 token。与此同时,开源模型的上下文窗口从 128K 跳到了百万级以上。

量级上:OpenClaw 那一跳大约是 5 倍(此前人均约 1500 万 token 量级);总量上整体在 10~20 倍甚至更多,而 Ollama 云自年初起增长了约 150 倍。

Jeff 强调了一个容易被忽略的结构变化:2024~2025 年,被大规模服务的开源模型大多是定制模型——你拿 DeepSeek 或 Kimi 这类现成模型,为自己的场景微调(Cursor 就是著名例子),然后规模化提供服务。而开箱即用的开源模型被大规模服务,是今年年初才真正起飞的。

主持人追问微调的周期性:2024 年初大家热衷训自己的模型,然后热度退去(「下一个模型一发布,你的努力就被踩平了」),现在似乎又回来了——这是又一个循环还是这次会留下?Jeff 的回答是双向的:开源侧的发布节奏在加快(「光这个夏天我们就见了三代 DeepSeek Flash」,而过去是六个月一代),这让自己训模型更难跟上;但另一方面,工具链在变好,想微调的团队有能力持续跟进。

三、开源的杀手级场景:安全测试

一个有意思的细节:主持人指出,Hugging Face 当初甚至必须用开放权重模型才能检测到那次来自前沿模型的入侵。

Jeff 说他们最常被问的问题之一是「哪些场景下开源模型相对闭源前沿模型有压倒性优势」,而安全测试是其中最关键的一个。原因很实际:你让 Claude 给你的产品做渗透测试,它基本上会拒绝。而在 Hugging Face 上,你能找到被专门「解除限制」(obliterated)的安全研究模型;即便是开箱即用的开源模型,它们虽然也带安全训练,但更能区分你是出于正当用途还是恶意用途。

同一逻辑也解释了企业侧的阻塞点。Jeff 说,AT&T 那篇文章里采用开源模型的障碍主要集中在安全与合规上;而他们与欧美客户打交道的经验是:只要安全问题能被解决,采用中国来源实验室的模型对绝大多数客户完全在可选范围之内。他把这看作安全与治理领域创业公司的巨大机会,并特别点名 GLM-5.3 发布时展现的网络安全能力「极其可观」。

背景是前沿实验室这一侧:AI 安全正成为越来越大的问题,前沿很可能为了解决对齐与围堵问题而放慢,而开放权重模型仍在持续变强。

四、Ollama 的角色:开源世界的操作系统

因为是模型的关键分发渠道,模型开发方通常会在正式发布前联系 Ollama 协调 day-0 上线。Jeff 描述了他们总结出的一套 playbook,包含三件事:

1. 推理引擎支持:确保模型在主流推理引擎里跑得快、跑得准、与参考实现一致——这通常是一个数周的过程。

2. harness 与场景:新模型往往带来新能力。他举了当天早上的例子:DeepSeek 发布了自己第一个大型多模态模型(此前只有较小的 OCR 模型),同时改动了 DeepSeek harness 以支持这项能力。所以第二步是确保 harness 准备好、能有效驱动这个模型。现在有很多优秀的开源 harness——Codex 的 harness 是开源的,OpenCode 也是 Ollama 用户最常用的之一。

3. 硬件与供应商:与推理服务商、NVIDIA、Apple 芯片栈协作,确保模型跑得够快——「模型很强但很慢,体验就不好」。

麻烦在于时机:你运气好才能提前几周拿到模型,大量工作是在发布前 24 小时凑齐的,基本上是一场救火。

主持人给出的类比是操作系统:向下要紧密集成驱动和硬件,向上要保证应用层调好。Jeff 接受这个「有点陈词滥调但确实贴切」的比喻,并指出真正的难点是组合爆炸——要有一个通用运行时,能把任意 harness 匹配到任意模型。

他还纠正了一个关于团队背景的想象:Ollama 的人大多不是 AI 研究者出身,而是来自 VMware、Docker 和网络公司。他们的判断是——经典的计算问题正在推理这块土地上重新发明自己,而这正是他们擅长的地方。最终一切归结为开发者体验:当开发者调用 API 拿到 token,中间到底发生了什么。

Jeff 引用了黄仁勋常说的五层蛋糕:应用、模型、基础设施与推理、芯片、能源——前沿实验室在 day-0 就把这五层都给开发者备好了,而这正是 Ollama 想为开源模型复现的(当然不可能自己做每一层,但可以做编排)。他随即补充:开源世界的层数可能不止五层,「模型层」内部本身就很厚——有模型权重,也有各个模型独特擅长的编排组件,还有开发者 API 层;模型与应用之间藏着大量今天被五层蛋糕遮住的机会。

那些隐藏层会不会被拆分成独立公司?Jeff 引用了 Anthropic 平台团队讲过的三件事:knowledge(如何把公司数据与上下文接到模型)、coordination(一次请求会分裂出一堆子 agent,有的在云上有的在本地,需要协调)、execution(沙箱;随着 agent 越来越多迁到云上,这是个巨大的算力问题)。他的历史类比是云计算:最初一代产品(Heroku、Google App Engine)是打包在一起的,但开发者最终偏好的是每个问题上的 best-of-breed 产品。主持人补了一句时代注解:前沿实验室希望你完整待在它们托管 agent、上下文和记忆的围墙花园里,而「little tech」和开源开发者不想被关起来,最后大概率是两者的混合。

Jeff 由此提出本期最凝练的一句结构判断:开源 token 已经过剩,几十家供应商都能提供;新的稀缺在 token 之上——如何把一个 agent 从 A 编排到 B。 这些是极难的系统与工程问题,单个开发者不可能自己造齐所有层。

主持人抛出反向可能:既然编程 agent 越来越强、而「维护高质量、经过良好测试、真正满足用户需求的软件太难」正是过去护城河的来源,那么护城河会不会消失?——你可能只需要一个 cron 跑一个 markdown 文件加一点 TypeScript,今天用 OpenAI 的记忆系统,明天让 agent 通过 MCP 持续同步到你自己的记忆系统,锁定就不存在了。

Jeff 同意大方向,但给出了一条边界:今天 harness 里的很多部分会下沉进模型;而当核心循环下沉之后,反而会有一些东西浮出来,memory 就是典型。他的判断准则很清晰:只要是有状态的问题(涉及存储),最终就进不了模型——因为模型训练完就固定了,即便现在训练周期已经缩短到月级,也仍然跟不上最新数据。同类还有凭证管理、安全与合规工具——开源模型不像闭源供应商那样自带全套安全工具,而这对企业采用至关重要。

五、稳态:80~90% 的 token,10~20% 的钱

被问到企业在闭源前沿与开源之间的最终平衡,Jeff 给了本期最被引用的数字:

企业内部绝大多数 token 会是开源模型,称之为 80~90%。但这不意味着 89% 的预算会流向开源。

事实上他认为开源社区做得最好的一件事正是把成本压下来,所以你可能只在开源上花掉 10~20% 的钱,却跑掉绝大多数的 token。这带来的连锁效应是:你不再需要限制团队的 token 使用权,反而会不断放开——token 的丰裕本身会解锁一大批新场景。

最难的任务仍然留给前沿实验室(最好的研究者在那里),中间是一大片开闭源协作的地带。主持人指出其中的张力:模型越强,你越想让最聪明的模型来决定什么时候调用开源模型,但拥有模型的实验室大概不希望你这么做。Jeff 的回答是把决定权交给客户:如果客户想要一个路由器,把调度和更难的编排交给前沿模型,那就这样;大量「行项目」式的工作可以交给开源模型。他提到 Sakana AI 和 OpenRouter 都有把两者结合的项目,效果很好。

节目给了两个类比:律师事务所里合伙人把活分给助理;以及云计算历史上 AWS 的 DynamoDB(自有的规模化数据库)与 Postgres 并存——客户最终用的是两者的组合。主持人还联想到 Apple Silicon 里针对图像与音频的专用加速器,以及更早 PC 时代独立的声卡和显卡。

六、本地:桌面复兴与硬件的追赶

Ollama 同时握有云端和本地两块业务,Jeff 对本地的判断同样是「混合」:简单任务在本地跑,延迟更低、单 token 成本更低(代价是前期买硬件),与云端模型配合使用。

令他兴奋的是这一代硬件跑 200 亿到 400 亿参数区间的模型有多好,有时能到 1280 亿。主持人提到「Qwen 38B 在编程上已经和 Opus 4.6 相当」,Jeff 说基准数据是这么显示的,而你只需要买商店里第二低配内存的 MacBook 就能跑。

使用分布上:本地跑的模型里,美国、欧洲和中国来源的模型是一个相当均衡的混合——除了 Llama 系列,还有 DeepMind 的 Gemma。但按场景看,编程 agent 绝大多数还是要靠大型云端模型(解决真正困难的问题、写代码写测试),而文档处理这类端到端难度较低的工作流在本地跑得极好。于是形成混合执行模型:简单任务本地跑,路由器判断什么时候必须上云。对客户的意义是成本进一步下降——不只因为开源模型云上更便宜,还因为你可以在本来就要买的硬件上近乎免费地跑它们。

而云端编程 agent 那张图给出了本期最尖锐的对比:本地是中美模型势均力敌,云托管则几乎 100% 是中国模型。主持人的结论直白:「基本上我们需要更多美国实验室做大模型。」Jeff 认为 Nemotron Ultra 的发布是这一波的开始。他顺带称赞了 NVIDIA 的定位:它的护城河不是去做新软件生意或卖 token,而是大量开源、扶持生态,反过来让自己在硬件上保持领先。

硬件话题落到 DGX Spark / DGX Station:桌上一台 GB300。Jeff 说 Ollama 是最早拿到 DGX Spark 的一批(与 Elon 等一起,在 GTC 上)——128 GB 统一内存,覆盖 20B 到 120B 的模型区间;而且这些机器有很快的网络互联,可以像迷你数据中心机架一样堆叠,跑 400B 模型完全可行(主持人补充说人们早就用 Mac mini 这么干,「现在这是它的量产版」)。价格上,主持人猜测「二三十万美元能很慢地跑一个前沿模型」,Jeff 说实际比这更有竞争力:你能以离经典工作站电脑不远的价位,高速地跑不止一个前沿模型。他补充了一个被忽视的存量事实:银行和工业客户的每一个工程师桌上本来就有 NVIDIA 工作站 GPU,有的公司数以万计(原本是给 CAD 用的 RTX A6000 那一代),而这只是下一代的开始。

Jeff 认为这会是「个人桌面的一次文艺复兴」,Apple 与 NVIDIA 都在这条路上;Apple 侧的 MLX 项目已经相当成熟。而 Ollama 自己的路线是一个回环:从本地出发 → 编程 agent 的需求把它带到云上 → 硬件追上来之后再回到本地。他给出的具体愿景是速度:当你桌上有一块 GB300,你想要的是最快的编程循环——快到像跑测试、像在编辑器里改代码那样即时,就像当年 GitHub Copilot 在一百毫秒内弹出补全的体验,那种体验会回到桌面上。

GPU 市场方面,Jeff 说价格变化极快、供需波动极大,创业公司想拿到最新的 B200/B300 非常困难。Ollama 靠与多家供应商合作把算力拼起来才跟得上需求,但这背后是大量工作:哪个模型跑在哪里、要多快、在哪个区域、客户延迟多少。而 OpenRouter、Ollama、OpenCode 这类产品对终端开发者的价值就是——不用去谈 B200 的价格,也不用为了拿到 GPU 而做 24 个月的用量预测。

七、Flash 级模型与「无限 token」的回归

被问到「一个刚起步、没融多少钱、想尽可能便宜地烧 token 的创始人该怎么办」,Jeff 的答案是押注一类新模型:DeepSeek Flash 这样的超低成本模型。

他强调了两个指标而非一个:不只是每 token 成本极低,每任务成本也低——后者是很重要的度量。这类模型在他看来会是第一批带回「无限 token」体感的:「我们都记得 ChatGPT,你根本不用去想自己用了多少 token,每天就是用。」他认为我们最终会回到那里,但这需要在模型和架构层面为高吞吐 token 使用做大量定制训练。

他把今年的路线分成两段:上半年的目标是让开源模型追上前沿智能——现在差距可能不到三个月;下一个要解决的问题是极致效率。 他举了 GPT Luna 这类模型价格效率带来的采用爆发作为参照,认为开源侧正在发生同样的事:回到 Ollama 云上的模型家族分布图,增长最快的明确是 DeepSeek 系列,主要由 DeepSeek Flash 拉动。 这类「好到能覆盖 80% 任务、极快、极便宜」的 flash 模型,正是那些高消耗场景的前提。

更进一步,这与前面的编排层呼应:把多个 flash 模型串起来协作,可以拿到大模型才有的效果。所以便宜模型的意义不只是可及和快,而是可以链式组合,用编排解决新问题——他认为这对新创业公司、现有推理服务商和做工作流的大公司都是激动人心的领域。

主持人由此回顾了 AGI 的老辩论:很多研究者曾认为最终会有一个包办一切的 god model,但目前看并没有走向那里。除非你真的要去黑 NSA,多数场景下,任务分解带来的是可复现、可信赖、且成本可承受的方案。Jeff 的补充判断是:对多数客户场景,模型达到某个「足够好」的水平后,他们就会一直用这个水平的智能——模型会更快、架构更好、有新能力,但他们不必去够 god model。当然,最强模型仍会解锁一些场景,「有时候也挺吓人」。

那开源会不会出现 god tier 模型?他认为有可能,并指出 Z.ai / GLM 在部分任务上已经是前沿,而 Kimi 在 Web 开发上一度成为最好的模型、在市场上掀起冲击波。他给出的判断是:现在越来越不像是「有个差距」,而更像是正面对撞的头对头竞争。

八、地缘政治与「满洲候选人」问题

被问到敏感的地缘政治,Jeff 的答案有层次。他说客户其实分成两类:一类不太在乎模型来自哪里,只在乎它在哪里运行、怎么运行、是否在安全环境里;但每有一个这样的客户,就有另一个说「我非常在乎模型来自哪里」。而后者的理由不只是安全——还包括模型「怎么说话」:模型会经历不同阶段,有时听起来更机械、有时更友好,这些也重要。

他认为最高优先级是端到端搞清楚数据从哪来,并称赞 Nemotron 系列的一个优点是可以回溯是什么造就了这个模型。这在关键任务上尤其要紧——他举了一个真实例子:有人发帖讲 Llama 在为芬兰一座电厂的分析系统检测电涌,以确保供电不中断。

主持人直球提问:即便中国模型托管在美国,怎么确保它没有被「安放后门」(主持人称之为「满洲候选人问题」)?Jeff 说他想不起来有已知案例,「如果有我应该会听说」。他给出的框架是把它归入既有问题:媒体报道里很少提及的是,那些财富 500 强企业的 IT 和安全团队对这类事早就习以为常——开源软件时代,一个普通应用有成千上万个依赖,任何一个依赖出问题都足以危及整个应用。供应链投毒已经存在几十年,在这个意义上并不新鲜。 差别在于模型更不透明——你没法像看代码那样挖进去(主持人插话:而且它是确定性的)。他的结论是:只要用安全检查妥善筛查模型,客户反馈是这个问题大体可解。

九、Ollama 的创业史:荒野两年,两周破局

Jeff 和联合创始人 Michael(大学室友,滑铁卢大学,也是他上一家公司的联合创始人)此前在 Docker 做 Docker Desktop,因此非常理解什么是好的开发者体验。但他坦言:公司最初几年真正在做的事,是给这块「为开发者设计优秀体验」的肌肉寻找正确的问题。

他们 2021 年冬季批次进 YC 时的想法完全不同——主持人还记得申请表上写的是「Kubernetes 版的 Kitematic / Docker Desktop」。Jeff 复盘说,这是二次创业者的典型陷阱:在很多方面把想法过度设计了。 他们 2021 年做完 YC,而 Ollama 直到 2023 年 7 月才发布——中间隔着一轮 A 轮和一段漫长的寻找。事后看,一路试错和转向反而是好事,因为恰好赶上了 Llama 发布、开源模型时代开启。

(关于名字:主持人猜是从 Llama 模型来的,Jeff 说不完全是——「llama」在他们的体感里就代表开源模型(比如 LocalLLaMA 那个 subreddit),加上「LLM + 动物」的构词,以及他们觉得有个可以配脸的角色形象很重要。主持人抱怨他至今没采纳「在 Ollama 活动上牵真羊驼来」的建议。)

融资故事也很反直觉:他们 2022 年就与 Benchmark 合作——「上古时代,ChatGPT 之前」。当时的 pitch 重心是「我们要做出色的开发者体验、解决安全问题」,而真正起作用的是人:Benchmark 的合伙人 Peter 正是 Docker 的 A 轮投资人。Jeff 说得很坦白:「为 Kubernetes 解决 SSO 是个真问题,但那并不是我们的热情所在。我们很幸运找到了一个能看见我们代表什么、想做什么,而不是只看我们当下在解决哪个问题的合伙人。」

关于「荒野期」的心理,Jeff 的描述是本期最真诚的一段:吓人的不是没上头条、产品没起飞,而是反复和用户通话却始终没有「咔哒」一声对上——你不知道自己是否真的在为某个人解决问题。「客户通常是很好的北极星,但看不到北极星才是最可怕的,因为你往往知道自己想解决什么类型的问题,只是还没找到那个问题。」 更沉重的是当时团队已经十几个人;他很感谢团队在多次换方向时留了下来。有一次从未公开讲过的转向是:从「Kubernetes 的安全」转到「开发者桌面端的安全」——后来正是把这个形态迁移到了模型上。

破局的时刻发生在多伦多(当时团队分布在多伦多和 Palo Alto,现在主要在 Palo Alto)。他们坐在一个房间里问:「把一切都扔掉。如果我们现在才刚加入、从零开始,会做什么?」 当时他们看到两个问题:一是能不能做一个网关,无缝访问和托管任意模型——「当时我们把它想成 LLM 界的 Segment」(主持人评价这就是今天的 router 概念,机会巨大,而且才刚开始);二是——「我们是一群前 VMware、前 Docker 的人,我们知道怎么把东西跑起来,那就去帮别人把开源模型跑起来吧。」

Jeff 说他真希望更早做这件事:认真自省团队的构成(安全的团队和销售方式与开发者工具完全不同)。结论是「就试试这个吧」,并给自己两周发出第一版 Ollama——两周结束时 Llama 2 恰好发布,他们说「就现在上」。

两周内完成了从想法到发布、到获得比过去所有产品都多的用户;而在那之前,是两年对客户和产品的过度思考,什么都没发出去。

主持人回忆自己最早是在 Reddit 的 LocalLLaMA 版块看到 Ollama、大家赞不绝口,后来才知道是 YC 公司(因为公司在内部系统里是另一个名字)。Ollama 也是最快冲到 10 万 GitHub star 的项目之一——Jeff 记不清具体多快,但比 Docker 和 Kubernetes 快得多。他形容那种作为创始人的状态是「难以置信,因为你没法完全解释为什么」,并称这是对 product-market fit 最好的诠释。

主持人给出的对照最有画面感:从 Reddit 上自己攒机的爱好者,到 85% 的财富 500 强,只用了大约两年——PC 时代花了十年才走完的「家酿计算机俱乐部 → 广泛采用」,这次是 12 到 18 个月。

Jeff 认为原因有两条,且第二条是关键:开源模型免费、能在任何地方运行——这对财富 500 强的 IT 开发团队极其重要,因为他们不需要申请许可就能用。 于是对爱好者友好的东西迅速平移到了企业开发者手上。他拿数据库做对比:MongoDB 也走过从开发者到企业的路径,但因为 LLM 是无状态的,这次迁移容易得多。而一旦要上云,变量就多了:经济账、安全、模型跑在哪里。

商业化为什么等了两年? Jeff 说他们一直看到两条路:一条是隐私优先的 AI 产品(Ollama 的开源形态就是从这里开始的);但他们始终觉得,开源模型当时还没有达到闭源模型那种「产品级的 PMF」——比如 Llama 模型刚出来时你还不能立刻用它做 tool calling,很多场景仍然只能留给前沿模型。他们在哲学上希望等到那一刻发生时正好在场,而这一刻在今年到来了:编程 agent 成为 AI 消耗最大的场景,而开源模型终于能承接它。 「本地」虽然重要,但从来不是完整的故事,完整的问题是:如何用开源模型解决最难的问题。

他也诚实地讲了等待的风险:如果不小心,你会养出一种不把商业化当回事的文化——这是 Docker 时代的伤疤,团队因此有所警惕。另一个更重要的风险是:开源项目一旦起飞,最大的危险是把你的用户和客户看成「互联网上的一团人」。这是很危险的思维方式,因为你需要见到他们、搞清他们的需求、他们在做什么、六个月后想做什么、他们的故事是什么。「这是我希望过去几年多做一些的事,我们现在正在大量补课。」

关于为什么二次创业还要进 YC:他说他们当时来回犹豫了很久,「其实不该犹豫」。理由是创业非常孤独——即便有很好的联合创始人(Michael 是他上一家公司的联合创始人、大学室友)依然孤独。哪怕是在疫情期间远程做的,每周和 Jared 以及另外五组创始人聊天也真的让人没那么孤单;后来搬到湾区,网络的价值更是巨大。另一个理由是:有很多错误你其实可以不必重犯。 他至今仍与 Docker 的创始人(也是 Ollama 的投资人)保持联系,讨论上一代公司踩过的坑,以及——更重要的——什么是真正奏效过的。

由此引出主持人一段给年轻人的建议:如果你从没在一个「把真正出色的技术交付给大量用户、有清晰 PMF」的团队里待过,哪怕只待一个月、三个月,也去待一次。因为你会知道「好」长什么样:bug 数据库长什么样、怎么发版、质量标准在哪、彼此要求的下限在哪。见过一次,成功概率会成倍提高。

十、上一代 DevOps 经验里失效的部分

最后一段是 Jeff 认为在 AI 世界不再成立的旧规则:

Jeff 说,从 2000 年代的基础设施 1.0,到 2010 年代的云,再到今天的 AI,有很多规则会被打破。但也有必须保留的:他提到团队里来自 VMware、Nicira 的资深工程师带来的肌肉记忆——「当有人爱上你的软件并连续用了两年,它还能不能好好工作?」 在 AI 给了你这么大力量的时候,价值观和标准反而更重要,因为 AI 能帮你写,但不会替你负责。

主持人最后指出 Ollama 对生态两侧的价值:终端用户拿到的是干净的 token、合理的 API;而另一侧,如果没有这一层,你会撞上底层推理服务商各种没有文档的怪异错误(某个参数写法不对、或者它其实期待 JSON),「agent 大概能自己摸出来,但在那之前你要撞墙好几个小时」。Jeff 顺势给出全场收束:开源模型领域最大的机会之一是「策展」——把碎片化的模型、推理技术、云服务和 harness 拼成一个真正能用的东西。当模型和供应商都过剩时,把它们整合成可用之物,就成了新的稀缺。 OpenRouter 在模型选择上、OpenCode 在 harness 上都是这样的例子。

金句

成本是开源模型能切入解决的最大痛点,但每家企业的北极星是拿到对 AI 的控制权并为自己定制。 —— Jeffrey Morgan 2:18
企业内部绝大多数 token 会是开源模型,八九成。但这不意味着八九成的预算会流向开源。 —— Jeffrey Morgan 17:41
你让 Claude 给你的产品做渗透测试,它基本上会拒绝。 —— 主持人 7:42
开源 token 已经过剩,新的稀缺在 token 之上:你怎么把一个 agent 从 A 编排到 B。 —— Jeffrey Morgan 15:19
看不到北极星比看到难题更可怕——你往往知道自己想解决哪一类问题,只是还没找到那个问题。 —— Jeffrey Morgan 40:42
两周里完成了从想法到发布、到用户超过我们过去所有产品;而在那之前,是两年的过度思考,什么都没发出去。 —— Jeffrey Morgan 43:46
现在不再是「有个差距」,而是正面对撞的竞争。 —— Jeffrey Morgan 33:02

提到的书·产品·人物

适合谁听

正在权衡开闭源模型预算的技术决策者、做推理/编排/本地部署的创业者,以及想听一个「荒野两年、两周破局」创业故事的人。

← 返回全部观看原片 ↗