这期跟你的关系不是"泛泛的 AI 认知",而是你天天撞的那堵墙第一次被人从架构层面解释清楚。所以下面按项目写厚。
Codex Holdwell ERP work(多-Agent PRD 工厂)
「跑 20 分钟就得压上下文」是架构缺陷,不是你没调好
- 怎么做的:Jerry 给了一个非常具体的刻度——他用 Codex 大概 20 分钟就得做一次上下文压缩才能继续。关键不在这个数字,而在他把它归到哪一类:上下文内学习虽然不会遗忘、数据效率也不错,但根本不可扩展;另一条路直接改权重(微调)又撞灾难性遗忘、数据效率还极低。他对两条路的判断是"都不好解",理由很硬:大家都试过,要是好解早就被人解掉了。所以他的结论是必须换架构,而换架构历史上要五六年。
- 你可以怎么做:这条直接改变你在 harness 上该投多少工程。你的六步碰撞协议长流程一旦跑久,前面定的口径、实体定义、评审结论就开始漂——你过去大概率会把它当成"提示词还能再优化"的问题。这期告诉你:别等模型厂解决,它不在他们的路线图前排。本周就能做的一件事:挑一张你最长的 PRD 工单,记录第一次压缩发生在什么时候、压缩之后 agent 还记不记得那几条硬口径(跨线实体的定义、碰撞环节要交的三件、评审意见的归属),把每次都会丢的那几条固化成"每个环节开头必须重读的短文件",而不是指望它们留在上下文里活下来。
"失败→补进训练数据→下次做对"的循环必须回到实验室——你的等价物是 agent 定义那层口径文件
- 怎么做的:Jerry 的思想实验是,如果各家从今天起停止训新模型,模型会一年比一年更没用,因为新事件、新代码库、新工具都不在训练里;而"模型做错的任务被加进训练数据、再训一遍就做对"这个循环,只有训模型的那个实验室能跑。
- 你可以怎么做:你没法给模型补训练数据,但你有等价物——
AGENTS.md 和 .Codex/agents/*.toml 这层 agent 定义与口径文件。它就是你这套系统唯一的持续学习层。所以每次 agent 在同一个地方翻车,正确动作不是重写一遍提示词(那等于每次都从零开始),而是把这次的教训补进 agent 定义或口径文件,让下一次开局就带着它。这一层不持续喂教训,等于你的 agent 永远在"实验室之外"跑,永远学不到东西。
库里对照:v58 Engram 那期(30_sources/video-transcripts/58_Engram_记忆与持续学习/)是同一道题的另一种解法——把团队知识直接训进模型权重。放在一起读会更清楚:让 AI 记住你的东西眼下只有三条路——塞上下文(Jerry 说 20 分钟见顶)、改权重(Jerry 说撞遗忘,Engram 说能解)、外挂文件(skill / 实体库)。你能自己动的只有第三条,另外两条都是要等别人做出来的。这本身就是一条资源分配结论。
"把人从回路里拿掉出了名地难"——给你的真人评审环节撑腰
- 怎么做的:Jerry 把 AGI 定义成"无人参与就能自我改进的模型",然后老实承认:他很难找出哪怕一个任务真做到把人挤出回路;现在真正非常成功的是"人 + LLM"的混合体,没有人的 LLM 完全不行。
- 你可以怎么做:这直接支持你把真人评审做成强制确认点,而不是去追求"全自动跑完"这个虚荣指标。具体做法是把检查分成两类:机器可判的(格式齐不齐、字段有没有、实体登没登记)交给自动检查,需要判断的(这个需求该不该做、口径冲突怎么裁)明确留人、并且卡死不许绕过。你担心的"评审意见回炉会不会走形式",缺的可能不是技术手段,而是先承认后一类根本不该自动化。
app_incubator(7-Agent 造 App)
把"一天能跑几次"当成第一目标函数
- 怎么做的:Jerry 说他们的刻度是——哪怕一天只完整跑完一个实验,相比过去的任何做法就已经是不错的迭代速度;也许有一天一天十个,也许一天两百个,"从物理定律的角度看没有根本原因说不行"。他们为此在重建整个深度学习栈,逐个环节问"这一步能不能换个做法"。
- 你可以怎么做:你的 7-Agent 链路现在是按"做出对的东西"优化的,没人在盯"一天能完整跑几次"。换个目标函数试一周:量一次这条链路从需求到可运行 App 的端到端耗时,把最慢的那一环拎出来(大概率是设计稿→工程契约的人工核对),先把它砍一半——而不是先加一个新 agent。加 agent 通常会让循环更慢。
那道 60 倍的 kernel 题,帮你给 agent 的能力边界画了一条真实的线
- 怎么做的:Rohan 的 QR 竞赛给出一串很干净的数字——直接用现成库是基线,一个人加一个搜索循环能到 7 倍,而 60 倍的方案需要全世界大概三个品味最顶尖的人 + 十万美元的 coding agent 开销 + 四周。他明说今天的模型(点名了 Anthropic 的模型和 Gemini)直接拿到这道题就是解不出来,而这还只是一个问题、里面也就三个算子。
- 你可以怎么做:这是一条可以直接抄的分类法——有搜索循环 + 有可自动验证的评分函数的任务,agent 能吃掉一大块;需要品味、路径极长、中间没有信号的任务,现在砸多少钱都不行。拿它把 app_incubator 的活分一遍:能自动验证的(能不能构建、契约对不对得上、跑不跑得起来、有没有崩)统统交给 agent 循环去磨;"这个交互该不该这么设计"这类留给你自己,别浪费 token 在上面反复兜圈。你那个"把该做什么前移到 agent"的想法,能前移的其实只有前一类。
onehuman_company(一人公司 build-in-public)
"自动化 = 给每个人最大 agency"——你这个号的核心命题,被一个刚从 OpenAI 出来开 lab 的人替你说清楚了
- 怎么做的:Jerry 明确说他们不是想把人从回路里拿掉,而是让人在同样的时间里做成最多的事;比喻是走路→自行车→汽车,手工种一小块地→有机器种大得多的地。同时他们把"一个尽量用小团队做尽量多事的组织能走多远"当成公开的实验。
- 你可以怎么做:这是"一个 PM 开了家只有自己一个人类的公司"最好的理论背书,出处还足够硬。可以起一篇观点短评:一线 AI 实验室对自动化的定义,跟大众想的"取代人"是反的。但按你自己的弹药库闸门,光引用他不够——得配上你的账:9+1 Agent 让你从"走路"升到了自行车还是汽车?哪些环节其实还在靠两条腿走?把这个答案写出来,删掉它这篇就不成立,才算过闸门。
现成的验证体选题:「Jerry 说 Codex 20 分钟就要压上下文,我拿 drizzle tech 实测」
- 怎么做的:Jerry 给的是一个可复现的刻度(约 20 分钟 → 必须压缩),而且他把它定性成架构缺陷而不是用法问题——这就有了争议面,有争议才有阅读量。
- 你可以怎么做:这是标准的"大佬说 X 我试了"结构,而且你手上就有素材。做法:挑一条你真实跑过的长流程,记录从开工到第一次压缩的时间、压缩后具体丢了什么(哪条口径、哪个决定)、你用什么补丁绕过去、多花了多少钱。结论不管是"我这儿其实是 X 分钟"还是"我用 Y 办法把它推到了 Z 分钟",都是硬货——因为删掉你的实测它就不成立。这正是你 Phase 0 最缺的那类稿子。
「全队去度假,看 lab 自己能不能产出更好的东西」是可以直接抄的验收仪式
- 怎么做的:Rohan 提出用团队休假一周来检验自动化程度,Jerry 接梗说"一直延长到永久休假"。玩笑之下它是个真正的端到端验收标准——不看功能清单,看放手之后系统还产不产出。
- 你可以怎么做:给三驾马车 agent 定一个"停手 72 小时"测试:这三天你不碰它们,看能不能自己推进到可发布状态。不管结果多难看,过程本身就是一篇 build-in-public 的稿子,而且自带你最缺的"翻车"素材。顺带它还能替你回答那个悬着的产能账三选一——你会亲眼看到瓶颈到底卡在哪一驾马车上。
StockHelp / 你的价值投资
一条可用的技术护城河判据:训练成本要低于它带来的收入
- 怎么做的:Jerry 给 transformer 的最高评价不是它多聪明,而是"训练它的成本低于它带来的收入",并且强调这是机器学习的魔法、并非天经地义。他举的反例是 LSTM:技术上一样能扩,但训练贵得多、产品又不惊艳,拿不回市场回报,所以那条路注定没人投——技术优劣不是决定因素,那笔账才是。
- 你可以怎么做:这给你一个很干净的问句,可以直接加进你看 AI 相关公司的清单:这家公司的技术,单位训练/推理成本和它换回来的收入之间,差值在变宽还是变窄? 技术再先进,只要这个差值在收窄,它就是走在 LSTM 那条路上。Rohan 那句"在 Google 你不可能多花 10 倍算力换 2 倍收益,最多花 20% 预算换 2 倍"是同一笔账的工程版,可以当成判断"某项技术会不会真被部署"的粗筛。
「token 是没有黏性的」——一句话点破当前竞争格局的脆弱处
- 怎么做的:Rohan 解释大 lab 为什么做不了长线研究时给的机制是:这些公司在抢发布周期,因为 token 不具备黏性;连六个月周期的长期研究都难做。Jerry 那边的对照画面是"你看上周的发布,所有人都在发 coding agent"。
- 你可以怎么做:你找的是留存和转换成本。这期在告诉你,模型层本身的留存可能比市场以为的弱——真正的黏性更可能长在数据、工作流嵌入和分发上,而不在"模型能力领先几个月"。看 AI 公司时把它变成一个反问:如果对手明天发一个同级模型,这家的客户会不会走?走不了是因为什么?(诚实说明:这期只给判据,不涉及任何具体标的和估值,别把它外推成对某家公司的结论。)
Personal Thinking(这本第二大脑)
- 怎么做的:Jerry 的核心论断是模型的知识会过期,而补新知识的循环必须回到实验室;他真正想要的能力是"模型跟着用户学、在用户自己的数据和真实任务上学"。
- 你可以怎么做:在这个能力被造出来之前,你的第二大脑就是人肉的持续学习层——它存的恰恰是模型训练里不可能有的东西:你的项目、你的口径、你的判断、你翻过的车。这给入库 SOP 一条很实用的筛选标准:优先入库"模型不可能知道"的内容(你自己的实测数字、被否掉的方案、踩过的坑);纯公开知识让模型现场答就行,收进来反而拉低信噪比。你那个"摄入 SOP / 信噪比"的痛点,用这条能砍掉一半待办。
更深三角度
该反着用:他们的方法论是"先给架构一个足够的算力基线,否则你永远看不出它有没有用"——因为他们有 Blackwell 集群和十万美元砸四周的预算。你的稀缺资源不是算力是注意力,同一条道理反过来读就是:你在八个项目上各做"小规模验证",很可能每一个都没过基线,所以每一个都读不出信号。要么给其中一个足够的注意力基线,要么老实承认剩下那些实验的结论不作数——现在这种"每个都试一点"的状态,恰恰是他们批评的那种"在太小的规模上做了太长时间"。
和你现在做法冲突:Jerry 的立场是 harness 上的补丁救不了架构缺陷——上下文压缩、外挂记忆在他看来都是绕,真解法在架构里。而你在 Holdwell 和 app_incubator 上正在做的几乎全是绕:磨 agent 定义、磨碰撞协议、加压缩策略、补口径文件。张力是真实的:如果两三年内新架构真来了,你现在投的一部分工程会白费;如果没来,没投的人会一直被那 20 分钟卡着。这个赌得你自己下,但至少要意识到你在下注。一个可能的折中读法:投"内容型资产"(口径、实体、决策记录)比投"机制型胶水"(专门绕某个上下文限制的复杂调度)更抗架构更替,因为前者换个模型还能用,后者换了就是废件。
对你的镜子:Jerry 说他每天还是得来上班,很多事交给 Codex 做,然后一直问自己一句——"为什么这里还需要我?"这就是你该对着 9+1 Agent 和你的 PM 团队问的那句话。不是为了把自己去掉,而是因为答案会告诉你,你剩下的不公平优势到底是什么。
所以呢
- 【耐用】能力的上限由架构决定,不由参数决定。 当一个系统在同一个地方反复卡住,先问"这是不是结构缺陷",再问"是不是没调好"。这条从模型迁到组织、迁到你的 PRD 流水线都成立——你的工厂里那些反复卡住的环节,很可能也是结构的,不是执行的。
- 【耐用】你的优化算法决定了你会发现什么样的架构。 换成人话:你拿什么标准评价工作,就决定了你能想出什么样的工作。你现在拿什么当 PRD 工厂的成功指标?如果是"产出了多少份文档",你就永远想不出别的形态。
- 【耐用】判断一项技术会不会活下来,看那笔账(成本 vs 它换回来的收入),不看它多先进。
- 【会过期】20 分钟这个具体刻度、以及"没有办法把持续学习装到 transformer 上"这个论断,是 2026 年这一刻的照片。 别把它写进任何长期文档当前提,明年可能就不成立了。
- 判断更新:把"上下文长度问题会随着下一代模型自然解决"从你的默认假设里划掉。业内最有资格判断的人之一说这是架构缺陷、要换架构才解得掉,而换架构历史上要五六年。
- 这周一个赌注:挑你最长的那条 agent 流程,量一次"从开工到第一次上下文压缩"的时间,记下压缩后丢掉的东西,把丢的那几条固化成开局必读的短文件。一件事同时喂三个项目——Holdwell 的稳定性、app_incubator 的迭代速度、以及一人公司最缺的那篇验证体稿子。