ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.167
第 167 期 · 思维模型 · 收录于 2026 年 8 月 15 日

持续学习时代8预测

D
Dwarkesh · Dwarkesh Podcast
视频 8:29 原文约 1.0 万字 预计阅读 7 分钟 来源视频 ↗ 中英对照全文
TL;DR · 三句话
  1. 靠 markdown 文件在会话之间传经验,是学不会吹萨克斯的——AI 要真正胜任一整份工作,经验必须进权重,而不是留在笔记里。 → 详细
  2. 持续学习会给 AI 实验室长出它们今天最缺的护城河:模型越用越懂你,换模型 = 辞掉一个攒了几个月公司上下文的老员工、换个从头带的实习生,切换成本一上来,利润率就上来了。 → 详细
  3. 规则、对齐、发布节奏、企业采购、算力经济账,全部要重写——而且这盘账系统性地偏向「已经领先的大厂 + 用量大的大组织」。 → 详细
01

前提:萨克斯学生寓言——为什么「写笔记」替代不了「进大脑」

  • Dwarkesh 的原比方:一个从没碰过萨克斯的学生进琴房,吹砸了,把问题记成笔记;门外下一个学生读完笔记再进去,同样从零开始,同样吹砸,再往笔记上加。门外排着无穷多个这样的学生。他的判断是:「我不认为存在任何一套他们能互相传递的文字,能让后面某个学生第一次上手就把萨克斯吹好。」 → 详细
  • 落到 AI 上:只要 AI 还只能靠会话之间写 markdown 文件传经验,它就不可能像人一样胜任一整份工作。到某个点,经验必须真的进大脑(权重)——这是下面 8 条预测共同的地基。 → 详细
02

预测一:「先训练、后部署」的监管假设会失效

  • 现有方案都假设「训完 → 上线」,只要上线前跑一批检查就能挡住网络攻击等风险;可模型如果每天都在被当天数百万次会话更新,这个检查点就不存在了。 → 详细
  • 他的替代建议:按月或按季度做风险检查,别去挑「训完之后、上线之前」那个特殊时刻。也因此他反对现在锁死安全监管体制——「我们根本不知道一年之后要面对的是什么样的技术」。 → 详细
03

预测二:对齐研究要从「冻结权重」整体搬家到「持续更新的权重」

  • 今天的对齐(alignment)研究几乎只问一件事:一组被冻结的权重部署时怎么行为良好;没人研究权重一直在变时,怎么保证不被越狱、不变成欺骗性或邪恶人格。 → 详细
  • 新攻击面:AI 若把各用户学到的东西汇总回基础模型,怎么防注入后门。他说这更像人类的对齐问题——孩子出门学新东西、有时被疯狂意识形态一击命中,你只能事先给足常识和基本价值观。 → 详细
04

预测三:AI 心智的多样性会变高

  • 现状是「称得上有影响力的 AI 心智不到五个」,且彼此相当相似(都在差不多的数据上训出来)。持续学习让经验在不同公司、甚至同一模型的不同实例之间分化,他认为这是净收益:好过今天的「模式坍缩(mode collapse,各家输出越来越趋同)」,也好过最后只剩一个铁板一块、相当无聊的独一霸主(singleton)。 → 详细
05

预测四:部署即训练 → 领先者的回报开始「加速」而不只是「保持」

  • 逻辑链条很短但很硬:你有最好的模型 → 更多人拿它去做更复杂、更有用的工作 → 这些反馈能被整合进模型、超越单次会话窗口 → 你的模型变得更聪明 → 更多人来用。今天的领先只是静态优势,持续学习把它变成自我加速的复利→ 详细
  • 对竞争格局的含义:市场份额不再只是收入,而是训练燃料。谁拿到高价值场景的真实使用量,谁就在给自己的下一代模型喂饭——这跟"用户越多、数据越多、产品越好"的经典飞轮不同,因为这里学到的是能力而不只是偏好。 → 详细
06

预测五:实验室会被迫把最强模型更早放出来

  • 具体案例:据报道 Anthropic 从二月起内部使用 Mythos,直到六月才交付公众——四个月的内外部时间差。在持续学习体制下,这种事做不了:那等于白白让掉四个月的部署学习→ 详细
  • 反直觉的推论:一个在发布当天比你差的竞争对手,最后会拿到更聪明的模型,因为它更早开始吃真实世界的经验。"先发布一个还不够好的东西"从战术选择变成了结构性必需。 → 详细
07

预测六:持续学习 = AI 实验室今天最缺的那条护城河(本篇最核心的商业判断)

  • 起点是那个人人都在问的问题:AI 实验室到底怎么赚钱? Dwarkesh 说他自己也一直在问,请 Dario Amodei 上播客时当面问过。Dario 的答案是云服务商类比:云厂商提供的很多服务同质化,照样赚高利润率——看亚马逊和谷歌的季度财报就知道,他们过得挺好。 → 详细
  • 但 Dwarkesh 指出这个类比今天是瘸的:云的高毛利来自迁移成本极高,而 AI 模型目前根本没有切换成本——"没有任何东西拦着我先用 Codex 起一个软件仓库,然后换 Cursor 接着做,最后再用 Claude Code 收尾"。这正是当下 AI 应用层利润率存疑的根子。 → 详细
  • 持续学习恰好补上这块空缺:模型随交互变好之后,换 AI = 辞掉一个已经积累了好几个月贵公司上下文的员工,再换上一个非常新、非常没经验、你还得从头带起的实习生。这个比方是全篇最有杀伤力的一句——它把"切换成本"从技术迁移成本变成了人力资产损失→ 详细
  • 结论直白:一旦有了这种锁定(lock-in),模型提供方就能要求相当丰厚的利润率。换句话说,云类比要成立,前提正是持续学习先跑通。 → 详细
08

预测七:企业想躲锁定,但会被胡萝卜加大棒两头夹

  • 企业当然看得穿这个套路、会设法避免被锁定。但真实选择往往是二选一:要么被某家模型提供方锁定,要么放弃"模型会为你越用越好"这个超级有价值的特性→ 详细
  • 胡萝卜:如果真实使用成为模型变强的主要途径,实验室会补贴那些允许拿会话去训练的用户和企业——"这件事其实已经在发生了,你看看那些面向编程产品新用户的优惠方案",逻辑跟谷歌白送搜索一样。 → 详细
  • 大棒:拒绝让厂商拿你的会话做训练的企业,可能就用不上最好的模型。他也诚实承认自己略过了一个技术难点——给单个用户更新一份权重,和把这些不同的权重分叉(weight fork)合并回主模型是两码事,后者更难,但"假以时日也会被解决"。 → 详细
09

预测八:推理侧也会出现规模经济,个性化权重的经济账偏向大组织

  • 训练侧的规模经济早已存在——昂贵的训练成本摊薄到更多用户身上,证据是各家实验室的收入增长远快于算力增长(这是一条很好用的财务观察指标)。 → 详细
  • 新出现的是推理侧的规模经济,来自批处理(batching,把很多请求攒成一批一起算)。前提条件很关键:如果每家公司的专属信息必须走完整权重更新、而不是待在低秩适配器(LoRA 这类只改一小撮参数的轻量微调)里,批处理的优势就非常大。 → 详细
  • 硬数字:粗略估算,像 DeepSeek V3 这样的稀疏模型,最优推理批大小是同时生成 2,400 条以上序列;达不到就是在浪费算力(细节见他和 Reiner Pope 那期讲推理经济学的节目)。 → 详细
  • 结论是分配性的:一家有大量员工和 agent 同时干活的大公司能高效服务自己那份权重分叉;而批大小只有 1 的个人用户,算力效率可能差上两个数量级以上。所以"服务个性化权重"的经济账强烈偏向大型组织——个人和小团队大概率享受不到同等成本的私有化模型。 → 详细
10

收尾:最重要的变化,恰恰是最难预料的那些

  • 他自己给这篇文章的免责声明:等持续学习真正跑通那天,改变的事情远不止这 8 条,而且最重要的那些变化多半正是事先最难预料的——但上面这些"即便在今天看来也已经相当清楚了"。 → 详细

(本期无)——这是一期约 8 分半的短论文朗读,无嘉宾、无问答环节。结尾一句:这是他对同名博客的朗读,原文发在自己网站上。 → 详细

🎯 于你何益 为你定制 · 非通用结论

一、All in AI 投资线:这篇是一份「AI 实验室凭什么值钱」的完整论证(本期最高相关)

他是怎么讲的:Dwarkesh 把"AI 实验室怎么赚钱"这个问题按住不放,先复述 Dario Amodei 的云服务商类比(同质化服务照样赚高毛利),再当场指出这个类比今天是瘸的——云的高毛利来自迁移成本,而 AI 模型现在切换成本是零:"没有任何东西拦着我先用 Codex 起一个仓库、换 Cursor 接着做、再用 Claude Code 收尾。"然后他给出补丁:持续学习一旦跑通,切换 = 辞掉一个攒了几个月公司上下文的老员工换个新实习生,锁定成真,"模型提供方就能要求相当丰厚的利润率"→ 详细

你可以怎么用:这直接给你 StockHelp 的 AI 产业链选股逻辑装了一个可证伪的判断闸门——AI 应用层/模型层公司的高估值,本质上是在给"未来会有护城河"付钱,而护城河的先行指标就是"持续学习有没有落地"。你可以把它拆成三个可观察的信号放进看板的定性栏:① 该公司的产品有没有开始出现跨会话的记忆/个性化权重(不是 prompt 里塞上下文那种假记忆);② 有没有出现用数据换最优模型准入的商业条款(补贴愿意贡献会话的企业,或对拒绝训练的企业限制最强模型);③ 收入增速 vs 算力/资本开支(capex)增速的剪刀差——他明说训练侧规模经济的实证就是"实验室的收入增长远快于算力增长",这条正好是你财报季能算的比率,可以加进 StockHelp 的基本面栏。信号没出现之前,模型层公司的高毛利假设就还只是叙事。

顺带一条估值影响:预测四(部署即训练 → 领先回报加速)和预测八(推理批处理规模经济偏向大组织)指向同一个方向:赢家通吃、且赢家是大的那个。这对"找被低估的挑战者"这类价值投资本能是个提醒——在这条赛道上,"便宜的二线"可能不是折价,而是结构性劣势的定价→ 详细

二、Codex Holdwell ERP work:萨克斯寓言是你那套三驾马车的一面镜子(且是刺眼的那种)

镜子在哪:你的 product-manager / ux-designer / tech-lead 三驾马车 + 碰撞协议,会话之间靠什么传经验?靠仓库里的知识库文件、协议文档、上一轮的产出——这就是 Dwarkesh 说的那群在琴房外互相写笔记的萨克斯学生。他的判断很不客气:不存在任何一套文字,能让下一个学生第一次上手就吹好。 → 详细

你可以怎么用(务实版,不是等技术):既然经验进不了权重是当下的硬约束,那正确的应对不是把知识库写得更长,而是把"必须靠经验才能做对的事"和"能靠文字传对的事"分开。文字擅长传递的是约束和判定标准(什么算合格的 PRD、碰撞协议哪一步不许跳、哪些字段跨线必须对齐),不擅长传递的是手感(这个需求该不该做、这版交互别扭在哪)。所以:① 知识库优先写"判定标准 + 反例"而不是"最佳实践叙述"——反例是文字唯一能高保真传递的经验形态;② 你痛点清单里的产出可观测/可验证在这个框架下不是锦上添花,而是替代品:agent 学不会,那就让每一轮的产出可被自动判定,用"外部检查"补"内部经验"的缺口;③ 真人评审意见回炉的闭环同理——那是唯一真正把经验注回系统的通道,只不过注入的是你的大脑和文档,不是模型权重,所以更要防止它漏掉。

顺带:预测二(权重一直在变时怎么防越狱/防注入)如果哪天落到企业级 agent 上,会直接变成 ERP 这类系统的采购安全条款——"这个 agent 会不会被某个业务员的错误操作教坏",是你早晚要在需求文档里回答的问题。 → 详细

三、职业视野缺口:预测七描述的正是 PM 未来要拍板的一道新采购题

  • 预测七的两难——要么被模型提供方锁定,要么放弃"模型为你越用越好"——落到你身上就是一道具体的 PM 决策:Holdwell 要不要让 AI 厂商拿公司的真实业务会话去训练?换来的是更强模型和补贴,赔上的是数据主权和切换自由。这题今天还是隐性的(大家只在意价格和效果),持续学习一落地就会变成显性条款。提前想清楚公司的底线在哪,是个不太有人抢的视野优势→ 详细
  • 预测五(内外部时间差被压缩)对你是好消息:前沿实验室会被迫更早把最强模型放出来,这意味着你和前沿公司的 PM 之间"能用到什么工具"的时间差会缩小——你的视野缺口更多要靠"人家怎么用"而不是"人家用什么"来补。 → 详细

四、onehuman_company:这篇能直接变成一个「验证体」选题(过弹药库闸门)

  • 弹药是现成的:"大佬说 markdown 传不了经验,我拿 drizzle tech 实测了"——你的 9+1 Agent 体系正好是一个跑了很久的、纯靠文件传经验的真实样本。可写的实测点:哪些经验靠文档确实传住了(约束类),哪些反复教反复忘(手感类),你为此加过什么补丁、翻过什么车、花了多少 token 成本。 → 详细
  • 过闸门检查:删掉你的判断和实测之后还剩什么?只剩"Dwarkesh 说了 8 条预测"——那不成立。所以这篇的正确用法是只借萨克斯那个比方当钩子,主体必须是你自己的翻车记录,标题和封面前置到"我给 AI 员工写了 N 个月的交接文档,结论是……"这种可抄物上。单纯转述 8 条预测的观点短评,不建议发。

五、其余项目:诚实略过

  • app_incubator / Personal Thinking / Chief of Staff / 小红书家居号:本期没有可直接对上的东西,不硬掰。唯一沾边的一点是萨克斯寓言对任何"靠文档给 agent 传经验"的系统都成立,但那已经在第二条里说完了。

所以呢

一句话:这 8 条预测的共同底色是——"经验进权重"这件事一旦发生,AI 行业的钱、权、风险会同时向"已经领先的大厂 + 用量大的大组织"重新分配。对你的三个动作是:投资上把"持续学习落地信号"当成给 AI 公司高估值付钱的前置闸门(并把收入/算力增速剪刀差算进 StockHelp);工作上认清 agent 现阶段学不会手感,把力气花在判定标准、反例和可验证产出上;内容上别转述预测,用你自己那份"给 AI 员工写交接文档"的翻车实录去接这个钩子。

接着读