ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.58
第 58 期 · AGENT 工程 · 收录于 2026 年 8 月 15 日

记忆与持续学习

E
Engram · Sequoia Capital
视频 44:48 原文约 4.7 万字 预计阅读 28 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 37:07
TL;DR · 三句话
  1. 别再往上下文窗口塞超长 prompt、也别一味外挂 RAG——把团队知识直接"烤"进模型权重,让模型像在你公司干了几年的老员工那样懂你。 这是 Engram(一家专攻"记忆 + 持续学习"的新实验室)两位联创 Dan Biderman(神经科学/架构出身)和 Jessy Lin(应用/持续学习出身)的核心主张:瓶颈已经不是"模型不够聪明",而是"模型不懂你这套新的、不断变化的上下文"。→ 详细
  2. 回报很硬:token 消耗能砍到 1/100(少两个数量级),同样一个问题前沿模型要烧 10 万 token、训进权重后 100 token 以内就答出来,质量还能在 3–6 个月的窗口里追平甚至超过前沿模型。 做法是给每个团队训一个专属小模型(用 LoRA 等 adapter 微调 + SFT/RL/蒸馏拼起来),合作伙伴包括 Microsoft、Notion、Harvey。→ 详细
  3. 理论根子在计算神经科学:人脑记忆是"有损压缩"——只记重要的、形成模糊表征再做联想,而梯度下降能把海量信息压进极少数字(一整个 70B 模型 100GB 就"记下了整个互联网",一篇维基百科文章的 KV cache 反而要 80GB)。 Engram 想做的,就是给所有人一个"通往自己数据的神经接口"。→ 详细
01

先认识两个人和这家公司:Engram 是谁、在赌什么

  • 嘉宾:Dan Biderman 和 Jessy Lin,Engram 的两位联合创始人。Engram 是一家"neolab"(新型实验室——介于研究机构和创业公司之间),只专注两件当下 AI 研究界最热的事:memory(记忆)continual learning(持续学习,即模型上线后还能不断学新东西)。主持人(Sequoia 的 Sonya 与 Sean)说这俩是"全 AI 研究界最热的话题"。→ 详细
  • 两人分工/视角不同,本片要都听到:Dan 是神经科学 + 架构出身(2007 年在斯坦福读统计博士,后来转 AI,还在 Mosaic 干过),讲得更多的是"人脑怎么记忆、为什么权重比外置记忆强、KV cache 这头怪兽"这类底层和架构视角;Jessy 是应用 + 持续学习视角,讲得更多的是"团队场景里大家到底想让模型学会什么、怎么把研究和产品拧成一个闭环"。→ 详细
  • ⚠️ 看转写注意:自动转写的说话人标签不准,很多标着"Dan"的其实是主持人在提问。下文已按内容重新归属。
02

核心一句话:模型"一直在训练"——瓶颈不是智能,是"不懂你的新上下文"

  • Engram 官网写着一句反直觉的话:"我们不从 pre-training(预训练,模型上线前用海量公开数据学通用知识)或 post-training(后训练,上线前的对齐/微调)的视角看世界——我们的模型一直在训练。"主持人专门拿这句开场追问什么意思。→ 详细
  • Jessy 的解释:今天的模型已经聪明得不得了,但让它更有用的瓶颈不再是"原始智能",而是"它懂不懂你这套新的、不断变化的 context(上下文/背景信息)"——不管是你正做的新任务,还是某份工作里的特定背景。关键问题是:怎么把这些东西"刻进权重",刻得像 pre/post-training 把知识刻进去那样深?→ 详细
  • 一句概括:"memory 和 continual learning 是一枚硬币的两面"——怎么让模型学到新东西、并把它深深刻进权重里。→ 详细
03

三招会融合,但有一招被严重低估:把前沿实验室那套训练流水线下放到每个领域

  • Jessy:现在大家解决"让模型懂我"靠的是 context engineering(上下文工程)——写一个超长 prompt、跟模型来回聊很多轮甚至好几个小时、不断重组 context。她认为 tool use(让模型调工具)、context engineering 这些都会继续发挥作用,三招最终会融合。→ 详细
  • 但被严重低估的那一招是:前沿实验室用来把模型练得特别擅长"前沿数学/写代码"的那一整套训练 pipeline、框架、工作流,其实可以套用到每一个领域、每一种 context 上——比如一家公司内部的各种场景。这就是 Engram 要做的事。→ 详细
  • Dan 的比喻:一个人做笔记、贴便利贴(= 外置记忆)当然有价值、绝不该扔掉;但你第二天回去工作,脑子里其实已经留下了某种"记忆痕迹"和直觉。这两样东西应该结合,而现在的方案太偏"外置记忆"了。→ 详细
04

Engram 的产品/架构:给"每个团队"训一个专属模型,懂得像干了几年的老员工

  • 合作伙伴点名:Notion、Microsoft、Harvey(法律 AI)——这些都是"人们长期、大量做知识工作"的工作空间,里头积累了海量 context:既有团队过去写的文档,也有人和 agent 越来越多的互动、对话、反馈。→ 详细
  • 目标画面:不是 test time(推理时/临场)才去读读文件,而是像"一个在你公司干了好几年的员工"那样真正吃透 context——从宏观就明白"公司有这些重点项目、我们做事是这个风格、招聘流程怎么跑",然后干活跟公司里任何人一样好。→ 详细
  • 技术怎么落地(Jessy 完整列出工具箱):把知识训进权重,主要做 adapter fine-tuning(适配器微调——只训一小块"插件"参数、不动主模型),各种类型都用:LoRA(低秩适配,最常见的轻量微调法)、prefix(前缀微调)、稀疏架构——"这方面学界已经研究了几十年,工具随手可取"。再配上 SFT(supervised fine-tuning,监督微调)、RL(强化学习)、on-policy distillation(在线策略蒸馏),把这些拼成一个能持续学习的模型。难点是数据:怎么把任何一份原始文档/一次互动,转成对模型有用的训练信号。→ 详细
  • 不是赌"工具会消失"(Dan):模型始终假设"有一部分知识是外置的、有些工具现成在那儿"。真正最难的活,是搞清楚什么必须内化、什么可以外置。而且很多公司/个人有自己定制的工具和做事方式——不是每个人用的都是前沿模型训练时那套 bash CLI 工具,让模型理解你这套定制环境本身就是门课题。→ 详细
05

技术前提:需要"白盒"访问权重;任何 transformer 模型都能做

  • Dan 明确:Engram 这套做法需要对权重的"白盒访问"(white box access)——能看到、能改模型内部参数。所以可以跟拥有闭源权重的公司合作一起做,但用开源模型最省事→ 详细
  • 一句兜底:"只要是 transformer 模型,我们都能在它身上施展这套操作。"(现在主流大模型几乎都是 transformer 架构)→ 详细
06

最硬的回报:token 推理消耗砍掉两个数量级(100 倍),不是省 50%

  • 核心数字(Dan):不用反复查资料、不用反复重读文件、不用写"巨无霸般的 system prompt"——光这些就能让 token 推理消耗减少两个数量级。"不是省 50%,而是可能少用 100 倍 的 token。"→ 详细
  • 为什么能省这么多:很多东西——尤其跟人、团队、组织、优先级有关的——你根本没法在某一份文档里找全(除非把一切都规整记录在案)。这类东西模型可以通过训练隐式学会,然后 100 个 token 以内就答出来;同样的问题最好的前沿模型可能要烧 10 万个 token→ 详细
  • 质量层面的"3–6 个月领先窗口":总有一些定制化、大家刚开始探索的任务,当前一代模型还不太能完全胜任。模型迟早会擅长,但如果你能用一种"非常轻量的方式自主学习",那在这 3–6 个月里就能在能力上抢出价值。→ 详细
  • 权衡点(主持人替观众总结,Dan 认可):前期烧更多算力把"公司做事方式"学进权重 → 之后每次推理发给模型的 context 就少多了。→ 详细
07

为什么从"团队"而非"个人"切入:团队的 context 矿藏更大、更有纪律

  • Dan:个人/团队两个层级对 Engram 都行,只是从团队入手更容易——一群人在"怎么收集 context"上更有纪律,多年积累的 context 量也更大。→ 详细
  • 但"每个人的电脑、每个人的手机,总有一天都会成为我们技术的落地对象,真到那步会非常有意思"。眼下"信息的大矿藏,都在那些协作做知识工作的人组成的团队里"。→ 详细
08

"死记硬背事实"是特性还是 bug?——记忆和学习无法干净切开

  • 主持人抛出一派观点:模型在权重里死记"法国首都是巴黎"是坏事,我们更希望它抽象地学会"国家"和"首都"这些概念,而不是背一堆事实。→ 详细
  • Jessy 反驳:某种程度上你必须记住一些东西,才能把它们组合成更复杂的概念。现在真正缺的那块,是"搞清楚什么才重要到值得记住"。很多学术 benchmark 考的是"能不能学会非常具体的事实"——比如"某个非洲国家某座桥有多长"——这根本不是你希望模型分配能力去记的,人也不会把脑容量花在这上面。→ 详细
  • 人脑记忆是"有损"的(Jessy):因为智能的一部分特性,恰恰就是"压缩出重要的、把它和不重要的分开"。所以你没法像有些人想的那样把"学事实"和"学技能"干净切开——有人真把模型里的事实全剥掉只留"纯内核",结果它连基本常识都不懂、非常不自然。→ 详细
  • 为什么不能事实全靠查(Jessy):看模型怎么思考就懂——如果你为了推进思考的下一步、必须先回想起一些基本事实,"那你根本走不远"。要想得越来越深、越来越复杂,得先内化一些东西,才能组合成更抽象的概念。这正是 Engram 认为"训练很重要"的部分原因。→ 详细
09

算法 vs 数据库:深度学习把两者糅在一起,现在又在被迫分开

  • Dan 的精彩历史观:传统计算机科学里,数据库(关于世界的事实,存起来、查询)和算法(怎么高效操纵信息、sample efficient 地得答案)是自成两门课的。深度学习的"神奇/神秘"之处,是把这两样糅到了一起——以至于需要 Anthropic 那帮搞 interpretability(可解释性,研究模型内部到底在算什么)的聪明人去试着重新拆开。→ 详细
  • 现在 AI 融入经济,两者又在逐渐分开:公司精心打磨自己的 context,而通用模型对这些 context 完全是个"陌生人"、只是在上面运作。但 Dan 认为"至少得有某种节奏的收敛"——让事实、故事、细节重新揉进模型。→ 详细
  • 坏处也诚实承认:国家首都偶尔会变(不频繁),但还有很多事实时时刻刻在变,"光把它们烙进权重本身就很有挑战"。主持人收束:"真正重要的是分辨什么重要到值得记、什么不重要——这是个'假二分法'。"→ 详细
10

从"做梦"借来的灵感:缺了一个"深度内化"的阶段

  • 主持人问:你们有没有从"人怎么做梦"里借灵感(比如用在排序上)?→ 详细
  • Jessy(非常松散地借):主要是那个想法——现在好像缺了一个"阶段":你拿到一段 context,然后深深地把它内化。现在一切都发生在 test time,临场即兴思考,但走不远、一路上会犯错。关键是怎么把这些经验消化、再"喂"回模型,让你下次就做对、取得更大进展。→ 详细
  • Dan(自嘲又点睛):"说我们想造一个像'我们的梦'的 AI 听上去有点离谱,梦里没什么连贯性。" 但有意思的是:梦里我们看画面、跟自己对话、试探"在这世界、在社交情境里能做什么、不能做什么"的边界(梦严重偏向社交内容)。Engram 也一样:给模型留出时间,让它从真实互动中抽身退回来,去试探自己的能力边界——它能做什么、知道什么、多快应付那些"长尾极端情况"。→ 详细
11

"一周拿下数学奥赛"——Dan 用一个反例说明"训练这种魔法"的威力

  • Dan 的招牌例子:想象一家 AI 实验室(就说 OpenAI)要在"一周内"拿下某个数学奥林匹克竞赛。他们会去整理一份囊括所有数学教科书的目录、再让人手工标注"该看哪些章节、哪些图表"吗?还是会去收集材料、合成一批训练数据、启动一个训练任务,等五六天看它落在什么水平、再评估?→ 详细
  • 结论:对任何训练过模型的人来说,"显然有一种更高明的方式把各种想法和能力整合起来,而这种方式恰恰要用到'训练'这种魔法"。Engram 的主张是:这种魔法很大一部分,其实可以落到多得多的普通人手里——不只在数学/编程/网络安全这些高风险领域。→ 详细
12

为什么不是前沿大厂自己做?——世界观根本不同 + 激励错位

  • 主持人尖锐发问:"为什么最终拥有终端产品的不就是那些基础模型实验室?你们怎么在巨头之间立足?"→ 详细
  • Jessy:世界观不同。前沿实验室要的是"一个越来越大、各领域越来越聪明的单一模型";Engram 设想的是**"每个人都有自己的模型"。因为人们想学的很多东西要么私有**(永远不会进 post-training 数据集、不见天日),要么相互冲突(我做这任务的方式跟另一家公司/另一个人就是不一样)。→ 详细
  • 关键论点:很多这类东西很难用机器学习沿用几十年的那套工具训进去——那套靠的是"非常干净的监督信号、有 ground truth 的奖励、搭个漂亮环境训模型用工具完成编程任务"。可现实世界很多事非常含糊、很难讲清楚"到底什么样才算好",极其因人而异,跟前沿实验室的训练 pipeline 思路"相当不对路"。→ 详细
  • Dan 补充"前沿实验室的 P0":他们的最高优先级(P0)是奔向 AGI——造一个在编程/数学上极强的单一通用模型,去自动化整个经济、解决密码学/国防的长期难题。推进路径很清楚:更多 pre-training、更大模型、更多数据、更多 RL、更多推理时算力。绝大部分开销和人才都流向那里。memory 和 continual learning 他们当然也想,"但现在更多是偏产品层面的投入"。→ 详细
  • 背书:大约一个月前在 Sequoia 的活动上,Demis(Demis Hassabis,DeepMind CEO) 说得很清楚——"我们需要在这些课题(记忆/持续学习)上有新的突破"。Engram 把全部精力聚焦于此。最大的"解锁"是:能大规模地从许许多多人/组织那里学习,而不必派人去跟他们肩并肩共事。→ 详细
13

这个世界要变三样东西:突破、为每个人训小模型的基建、研究与产品拧成闭环

  • Jessy 列出三点:① 得有新的研究突破;② 得有新的基础设施——为每个人训小模型,而不是"一个大模型、一次大规模训练";③ 得有把研究和产品结合的全新方式→ 详细
  • 第三点展开(很重要):现在的范式是"研究员训好模型,'越墙扔'给产品团队,产品团队再在核心模型上写 prompt、做 context engineering 搭界面"。但在"模型一直在训练"的世界里,用户提供的输入跟"模型从什么里学习、训练信号是什么"是极其紧密绑定的,所以研究和产品之间需要一个"紧密得多的整合闭环"。→ 详细
  • 落到 Engram 自己:虽然专注攻核心研究难题(那是老本行),但同样非常在意尽快部署出去、从真实世界的反馈中学习→ 详细
14

Jessy 的动机:在"边缘地带"学——智能已不是稀缺,学新东西才是

  • 为什么做这个问题:模型已经这么聪明了,"还剩下什么?"——剩下的就是在**"边缘地带"去学**,学那些让模型真正有用的"剩余部分"。不再只关乎原始智能,而是关乎学习新东西。→ 详细
  • 它还很"根本":因为它把人带回到"模型到底凭什么这么强"这个问题。现在模型"无意中"从 pre-training 里懂了一大堆,而我们其实不真正明白为什么——"互联网就像凭空赐给我们的一份礼物",里头恰好有编程、写作等海量多元数据。破解 continual learning,就是搞清楚"到底是 pre/post-training 里的什么让模型能以神奇的涌现方式泛化",并掌控这个过程,让一家只有一批私有数据的公司也能把它学得像"法国首都""怎么写 Python"一样牢。→ 详细
15

Dan 的神经科学根子:从"意识/人类境况"到"自然的愚蠢",再到记忆

  • Dan 最早感兴趣的是意识、人类境况这类问题。他引用以色列心理学家 Amos Tversky 的名言:"他对人工智能(artificial intelligence)不感兴趣,他感兴趣的是'天然的愚蠢'(natural stupidity)。"(关于模型有没有意识,Dan 说"我觉得没有,但重要的是有聪明人在认真想"。)→ 详细
  • 从生物学看现有系统的差距:他不认为机器就该像人脑——很多事计算机做得更好(你想无损存一整套代码库,用计算机就行、根本不用 AI)。但人脑是在"信息容量约束"下进化出来的,形成的是模糊表征,这些表征之后可以被抽象、建立连接、指导你第二天的行为。"现有系统除了那个通用预训练步骤之外,基本没有这种能力。" 他想搞清楚怎么把这种能力构建进去。→ 详细
16

"苦涩的教训"与架构之争:长上下文架构没有免费午餐

  • 主持人抛"bitter lesson(苦涩的教训:长期看,靠堆算力和通用方法的路线,总会赢过靠人工设计巧思的路线)"+ 大脑多种"协处理器"的类比,问:记忆会是模型内部"涌现"出来的属性,还是需要一个独立架构?智能里我们需要的一切,是不是只要有更好的数据 + 更大算力就会自然涌现?→ 详细
  • Dan 谈替代架构:他们自己也贡献过 state space(状态空间) 那一族等架构,都是想更高效处理超长 context。但"这些方法最后都变成一种权衡,通常是 memory(这里指计算机内存,不是认知意义的记忆)和准确率之间的权衡"。Transformer 的注意力机制内存占用是随序列长度二次方增长的。→ 详细
  • 关于 sub-quadratic(次二次方):有人声称、也确实有人做到了——"一些最好的中国模型就有受 state space 启发的层,成本不是随序列二次方增长的"。但 Engram 自己实践里发现"你总是要拿准确率去换这个内存,没有免费的午餐"。→ 详细
  • Dan 的"真·bitter lesson"读法:"你要是真被苦涩的教训洗了脑,真正该想的是——我怎么烧掉更多算力,而且怎么把它烧在我以前没见过的新 context 上。" 他们不赌 AGI 方向会很快走到头,只是觉得"还有更多算力可以扩展"。金句:"光是反复重读文件是不够的——尤其对你这么特别的人,我们得为你训一个 100 万亿参数的模型才行(笑)。"→ 详细
17

大家最想让模型学会什么?——"事实 vs 技能"的区分对方法不重要

  • Jessy 观察应用层:现在大家在 app layer(应用层)花时间做的,很大一部分就是"想方设法让模型在你的具体场景里好用"。最常见的例子:"我想让模型按我的品牌风格设计我的网站"。其他还有:学会跑某个工作流、学会你写东西的特定风格——种类非常多。→ 详细
  • 再次强调:"回到'事实 vs 技能'这个区分上,其实根本没有实质区别,这些方法对这种区分是无所谓的、不挑的。"→ 详细
18

"RAG 杀手":把公司知识训成模型的本能,省掉来回反复的长链路

  • Dan 的"rag killer"说法:几乎所有应用层本质都是"一个前沿模型外面套一个循环 + 搜索工具"。客户想跟 Engram 一起做的,全是"找一种跟自己数据打交道、更快更高效更贴合上下文的方式"。诉求很统一:"把公司知识编码进某种更高效的东西,我就不用每次都检索""让模型有针对性地知道这件事该分派给谁"。→ 详细
  • 核心卖点:只要用"相当轻量的训练",这些东西就能变成模型的本能,不需要那种"牵涉很多步、来回反复的长链路"去解决。所以是个"RAG 杀手"——当然随时还能做 RAG/检索,但大家真正想要的是"跟超大规模的数据面打交道、把高度重复的事自动化掉"。→ 详细
  • RAG 的根本局限(Jessy + Dan,回应"caching 不就解决了吗"):① 联想只能发生在权重里——"我看到团队里某人在做这类研究,隐约想起还有个相关的东西你可能想了解,你压根没问过",这种联想本质不是"你让我搜这个我就搜这个";② 检索的真正难点不在'存什么、放哪儿',而在'怎么寻址、怎么查询'——你甚至知道自己要找什么吗? 而"知道该搜什么"是种直觉,应该长在权重里。当前主流是 keyword search(关键词搜索),因为它在 RL 里好扩展、向量嵌入(embeddings)那套基建上最省事,但它恰恰不知道该去哪儿找。→ 详细
19

KV cache 这头"怪兽":梯度下降能把信息压进极少数字(公司就从这儿起步)

  • Dan 揭公司起源:"这家公司很大程度上就是从我们深入研究 KV cache(键值缓存——模型处理长文本时把已算过的中间状态缓存下来、避免重算) 开始的。"→ 详细
  • 那个震撼的数字对比:光是一篇维基百科文章(比如关于 Taylor Swift 的),它的 KV cache 在 GPU 上就要占大约 80 GB 的 HBM 显存。而一整个 70B 的 LLaMA 模型,全部权重大约只 100 GB——而且这 100 GB"多少有点失真地记住了整个互联网"。→ 详细
  • 存在性证明 + 愿景:这给了一个"存在性证明"——梯度下降(gradient descent,训练模型的核心优化算法)能把海量信息压进很少的几个数字里;反观 KV cache,几十 KB 的文章就膨胀成 80 GB 的"大脑状态"。Engram 的设想:把那 80 GB 拿来离线花点算力压缩到小上一千倍,那对"怎么加载、能多快做事、表征的保真度(fidelity)"都有巨大影响。→ 详细
20

什么该内化、什么该外置?——尚未解决,但要"尽量少用启发式规则"

  • Jessy 坦承:"这是个尚未解决的问题,没人回答出来,我们都还在攻——这其实也是生物记忆的根本问题。"→ 详细
  • 她的直觉例子:你一年前住过的酒店房间号,需要内化吗?大概不用(写下来就行);你家门的密码,需要内化吗?大概在接下来几年把它"刻在某处"是有用的。→ 详细
  • 方法论原则——尽量少用启发式(heuristics):在数据上跑过滤器"这个留、那个丢"很容易,但人刷 TikTok、接触一大堆垃圾信息,大脑照样能学习、不会完全跑偏,模型也应该这样→ 详细
  • 短期最直接的痛点:让 agent 连着跑好几天的巨大推理成本——"你为什么要一遍又一遍读同样的文件?同一家公司不同的人在同样文档上一遍遍跑同样的查询,这种东西应该是模型直接就知道的,就像你问一个员工,他不会往搜索框里打'我昨天在做什么',他直接就知道。"→ 详细
21

记忆的"ChatGPT 时刻"会是什么样?——"这实习生跟昨天不一样了"

  • 主持人问:未来一两年,什么会成为记忆领域的"ChatGPT 时刻"?→ 详细
  • Jessy:第一个概念验证应该就是大家一直说的那个画面——"你有一个实习生,可以随时间教它东西,而它真的越来越强"。不管现在的 context engineering 多精巧都还做不到。那一刻大概是:"模型真的在变聪明,让你'哇'一下——它跟昨天不一样了。"→ 详细
  • Dan 提醒+点睛:"ChatGPT 当初是没人预料到的。" 他的检验例子:假设你今天辞职,唯一使命是给自己打造一个更好的模型,你 24/7 用前沿模型做 context engineering、写 skills——可作为个人你能撬动的幅度非常有限,你还不如直接等模型下一个版本。 Engram 想要的未来是:你在一件事上花的时间越多,真能转化成性能质量的提升(至少在你在意的领域)。这很难,唯一可能实现的理由是"开始扩展算力、在这些数据上训练,但关键是别把数据全毁掉"。→ 详细
22

"记忆钱包"会出现吗?——个人和工作语境不该串着记

  • 主持人提"token wallet / memory wallet"概念:每人随身带一个记忆库,走到哪家公司、哪个 app/workspace 都带着。→ 详细
  • Jessy(产品形态还没想清,但有强直觉):就算是 ChatGPT 的 memory,她也不希望它把个人语境和工作语境串起来记——反例:"它会说'你可能喜欢这套床单,因为你上周在 GPU 上训了个模型',这完全风马牛不相及。" 一方面是 memory 本身有缺陷,另一方面你确实希望不同工具/产品里的 memory 是分开的、自己能掌控。所以需要某种隔离,具体长什么样有待观察。→ 详细
  • Dan 的"终极理想":你去上班烧掉一大堆 token、创造大量价值,所有 IP 留在公司,但你学到的技能、发明的东西、做事的方式,其中一部分能"脱敏"后带走、带到下一份工作——不损害任何公司 IP。"我们生物层面现在就这么干,无非签 NDA 加道德规范。" 在数字世界这么做会"逼着每个人去推动前沿、更深地落地 AI,然后因此得到回报"。→ 详细
23

语言为什么压过了视觉?——主持人的"民科理论"与 Dan/Jessy 的回应

  • 背景:Dan 回忆 2007 年在斯坦福读统计博士时 AI"无聊透顶",全是统计学习,基本就两个领域——computer vision(视觉)和 NLP(语言)。2012 年 AlexNet 出来,视觉统治了差不多六年。主持人问:语言这条路线正在压过视觉,你们意外吗?视觉还有机会翻盘吗?→ 详细
  • Jessy:确实挺意外,但她一直对语言感兴趣("那么多复杂抽象的事都能在语言里完成")。长远看,语言和视觉会融合进一个更统一的系统,从所有模态接收输入、以抽象方式理解。→ 详细
  • Dan(反而从没对语言感兴趣):他和很多 AI 领军人物一样曾以为"得去体验世界、在其中行动,视觉 + 行动才是关键"。但 ChatGPT 时刻后他去 Mosaic 看"NLP 这边的香肠怎么做",吃惊的是:语言按理应该很难(每个词是 one-hot embedding 向量、跟任何别的词最大限度不相似,是个彻头彻尾高维、人造的空间),用比最好视觉模型大一个数量级的模型去学,居然还运转得相当好。他觉得图像/视频里还有大量"油水"可榨,两块会在不同维度持续有意思。→ 详细
  • 主持人的"民科理论"(crackpot theory,自嘲是外行瞎想):在生物层面,视觉对语言有根本性优势——眼睛处理光学数据的"比特率"比音频(声波)高好几个数量级,眼睛里在数据到大脑前就做了大量光学处理。但在计算机里一切都是电子的:声学→电信号像"升采样",光子→电子像"降采样"。所以在计算机里"视觉被减了配、语言被加了戏,所有处理站在同一起跑线",到 LLM 这层语言和视觉就差不多平起平坐,而 LLM 恰好是一种非常聪明、比起视觉更适合语言的架构→ 详细
  • Dan 的回应:我们在知识工作里做的很多事(坐电脑前读文档、写备忘录)本来就不是进化来要做的,大脑还没为这布好线,但有 LLM 替我们干还是很有用。人是重度偏视觉的(其他啮齿动物更偏嗅觉,他自己研究过)——大脑分配给视觉的"地盘"(枕叶)大概比语言区(颞叶)更多。但"某个大脑更偏某种模态,不一定意味着处理那种模态就更高效";做脑机接口(BCI)时这点很重要(怎么把信息回传给大脑)。对知识工作来说,"用文本完全没问题"。他还补刀:训 vision-language 模型时,最后往往是语言压过了里面的视觉内容。→ 详细
24

五到十年后的愿景:人人有自己的模型,Engram 是"通往数据的神经接口"

  • Jessy:想象一个世界,每个人都有自己的模型,跟别人的、跟前沿模型都很不一样,各自服务不同目的——不只是"懂你",而是"以对你个人有意义的方式帮你"(无论个人还是团队)。核心:让各种不同形态的智能无处不在。→ 详细
  • Dan 用神经科学收尾:神经科学里记忆和导航关系紧密——大脑里表征空间地标的同一批神经回路,也掌管情景记忆的某些环节。所以这家公司可以成为"所有人通往**数据层(data plane)**的那个真正的 LLM 接口",跟 Databricks、Oracle 这些伟大公司有相似之处。区别在于:这些记忆恰好是"神经记忆",用的是个性化模型,而且有上亿个——它"不是照搬文件系统的原貌,而是表征出那个文件系统的一种'大脑状态'",更高效、更具联想性。这是 Dan 的愿景。→ 详细

本片有一小段"快问快答(rapid fire,全凭记忆答)"和一个收尾问题:

  • Q:你最近一次对 AI 任何领域里的某件事感到惊讶,是什么时候?

    • Dan 先玩笑:"读到融资消息的时候(笑)。" 然后正经答:每天都有很多惊喜,"我们所有人都隐约感觉到 coding agent(写代码的 AI 智能体)的能力出现了一点变化"——不过他们之前就一直折腾这些,所以不算完全意外。→ 详细
    • Dan 说对他冲击最大的标志性事件GitHub Copilot("那对我来说就是 the main event")、ChatGPT,再后来看到 agentic(智能体)那一波。这些多少都预料到了,只是不同人对"能走多远、能撑多长时间跨度"预期不同。真正让他兴奋的是"模型本身以一种无害的方式发生改变、能即时学到新东西,而且这种学习在个人和经济层面都可行"。→ 详细
  • 收尾 Q:如果一切顺利,五到十年后世界是什么样,Engram 扮演什么角色?(答案已并入正文最后一个主题"五到十年后的愿景")——Jessy:"人人有自己的模型";Dan:"成为所有人通往数据层的神经接口,类比 Databricks/Oracle,但记忆是'神经记忆'、有上亿个、表征的是文件系统的'大脑状态'而非原貌。" 主持人评价:"用这么美的愿景收尾真好。"→ 详细

几句值得留底的金句/原话:

  • "归根到底,我们全都是 RAG、一切皆 RAG。我只内化真正重要的东西,比如……我对你的感情(开玩笑的,笑)。"——Dan 自嘲自己生活里是"坚定的 RAG 信徒"(凭记忆答不出脑区面积、说"我把它外置了")。→ 详细
  • "消耗 token 到底换来了什么?"(consuming tokens for what?)——Jessy 对"高推理成本是好事"的反问,点出"为重复劳动反复烧 token"是浪费。→ 详细

(本片未给出嘉宾个人联系方式。可记的实体:公司 Engram——专攻"记忆 + 持续学习"的 neolab;两位联创 Dan BidermanJessy Lin;公开合作伙伴 Microsoft / Notion / Harvey;访谈出品方 Sequoia Capital《Training Data》播客;视频链接见报告顶部。)

🎯 于你何益 为你定制 · 非通用结论

这期跟你最对路的是「agent 该怎么记东西」这个根本架构问题——你在 Holdwell 和 app_incubator 里都绕不开它。其余项目关联较弱,按诚实闸门只点到为止。

Holdwell ERP / app_incubator · agent 的记忆该放哪

  • 怎么做的:Engram 的反共识主张是——别再靠"把更大的 prompt 塞进上下文窗口"或"外挂 RAG(检索增强:临时去知识库捞资料再答)"来让 agent 懂你的业务,而是把团队知识直接训进模型权重,让它像干了几年的老员工一样懂你公司;代价端给了一个硬数字:推理 token 消耗砍掉两个数量级(100 倍),不是省 50%。他们点出 RAG 的结构性弱点——"来回反复的长链路",自称"RAG 杀手"。
  • 你可以怎么做:你的多-Agent PRD 工厂大概率默认走"长上下文 + 喂文档"那条路。把这期当成一次架构体检:列出你的 agent 到底需要"长期记住"什么(ERP 实体关系、过往 PRD 决策、领域术语),哪些该沉成跨线共享的结构化领域文档、哪些适合检索、哪些可固化。短期你不会去训模型,但"记忆 vs 检索 vs 长上下文"该是显式选择而非默认全塞——这正好推动你把六条产品线共用的实体口径立起来,直对你"跨线对齐"的痛点。

Personal Thinking · "记忆钱包"与个人/工作语境隔离

  • 怎么做的:嘉宾提到"记忆钱包"——个人语境和工作语境不该串着记,模型该知道什么场合调用哪部分记忆;还有那个"ChatGPT 时刻"的画面:"这实习生跟昨天不一样了"(指模型真把昨天学的内化了)。
  • 你可以怎么做:你这本第二大脑的长期目标就是"让 AI 重新发现旧笔记"。这给你一个设计提醒——未来给它接 AI 检索时按语境分区(个人思考 vs 项目工作料),别一锅烩污染信噪比;这和你一直在意的"跨主题串联但不串味"是同一件事。

投资 / StockHelp · 一条选股镜头

  • 怎么做的:他们判断"前沿大厂不会自己做这件事",理由是世界观不同 + 激励错位——大厂赌"一个超级大模型解决一切",Engram 赌"人人/每团队一个小模型"。
  • 你可以怎么做:作为价值投资者,这是一道具体的"护城河 vs 颠覆"思考题——看 AI 基础设施类标的时,问一句"这件事到底是大厂顺手就做了,还是激励/世界观决定了它们做不了、留给了新公司"。比泛泛"AI 很热"有用得多。

更深一层

  • 该反着用:Engram 服务的是"有大量 context 矿藏、还有纪律"的团队/公司;你是一人多线、精力是元约束。别幻想现在就给自己搭一套"训进权重"的记忆——对你,杠杆在"先把结构化地基和检索做对",训练那层是几年后的事。
  • 对你的镜子:他们说"智能已经不稀缺,学新东西(持续学习)才是稀缺"——这句也照你自己:你不缺聪明,缺的是把每次踩坑、每次读到的东西真正"内化"进项目和判断,而不是存进一个再也不打开的归档。

所以呢

  • 思维模型【耐用】:"记忆 vs 检索 vs 参数化"是任何 AI 系统的三选一——遇到"让 AI 懂我的 X"时先问该记进哪一层,别默认全塞上下文。
  • 思维模型【会过期】:具体的"训进权重、100x 省 token"是当下这代模型/Engram 的打法,两年内技术栈会变;记住的是"权重级记忆是一条真实路线",不是那个数字。
  • 判断更新:如果你以前默认"agent 记忆=RAG",这期至少让你知道这是个有人重金下注的开放问题,你的架构选择空间比想象大。
  • 这周一个赌注:花 30 分钟把 Holdwell/app_incubator 里 agent"该长期记住的东西"列成一张清单,每项标注当前靠"塞上下文/检索/没处理",挑出最该沉淀成跨线共享领域文档的前 3 项。
接着读