while not done 的 if 循环;新做法是一大堆彼此不对话的 behavior 各自盯着状态。灵感来自七八十年代的黑板架构(blackboard architecture),或者更近的 Kafka——一堆微型 worker 通过共享状态通信。→ 详细本场没有 lightning round,也没有现场 Q&A 环节(17:34 的单人演讲,结尾直接进音乐)。收尾是一段行动号召:
演讲中未给出邮箱、社交账号或网址链接(口头提及为主),可循以下线索找到:
这一场对你来说不是"了解一个开源项目",而是一份现成的、被验证过的多-Agent 治理架构图。你手上正在跑的两条主线(ERP 的 PRD 工厂、app_incubator 的造 App 链路)遇到的痛点,和他三年撞出来的答案是同一批问题的两面。按相关度从高到低:
他们怎么做的
Yohei 的 policy 不是文档里的一条规范,是运行时拦截器:某类改动必须先提交补丁提案,改 prompt 要 human in the loop,改事实要先确认图里没有矛盾事实(t013)。Regimes 项目把这件事跑成了闭环——分类失败类型 → 只允许改对应部件 → 20 题诊断 → 50 题验证 → 准确率没升就不接受(t043、t044)。Pokémon 那 80 轮更直白:他随口说"加几张能量卡",agent 拒绝直接照办,反而报出 200 局模拟 + Wilson 分数 90 以上的验收条件(t051)。他自己点破了机制:「因为这是被强制的,我有一条 policy 写着:在接受一个改动之前,我们必须做到以下这些。」(t053)
你可以怎么做
更深一层
这场最反直觉的一点,不在"怎么造 agent",在它顺手解决了"我不知道什么没用"这个问题。Yohei 说得很坦白:YOLO 式 agent 成了就欢呼,「但我根本不知道哪些试过却没成」(t053)。你的 PRD 工厂跑了这么久,三驾马车 + 碰撞协议的哪些设计其实没起作用,你手上有证据吗?大概率没有——因为你只留下了成功路径的产出物(PRD),没留下失败路径的记录。这才是"agent 产出要可观测/可验证"的真正含义:不是缺成功证据,是缺失败证据。而失败证据只有一种办法拿到——在改动被接受之前,就强制记录它的假设和验收条件。
所以呢
挑一条产品线做实验:把这条线的碰撞关卡从流程文档搬进一个最小的 append-only 日志(哪怕就是一个 JSONL 文件),记录字段只有五个——改了什么、假设是什么、验收条件、实际结果、接受还是拒绝。跑够 10 轮,你就有了"agent 产出可验证"的第一份硬证据,也有了跟团队谈"碰撞纪律要强制"的底气。
他们怎么做的
ActiveGraph 里没有编排器。planner 这个 behavior 不是被谁调用的,是**「goal created」这个状态变化把它叫醒的**(t020);relation behavior 挂在 unblock 这条边上,研究一做完,写备忘录自动解锁(t020)。他把整个范式的转变说得很清楚:老做法是 while not done 的 if 循环,新做法是一大堆彼此不对话、只盯着状态的 behavior(t027、t028)。而且订阅条件可以是复杂的图查询,不只是"某事发生了"(t021)。
你可以怎么做
更深一层
有一条你必须提前知道的代价:他说这套东西「相当反直觉」,「我自己是绝对不会手写 ActiveGraph 代码的」(t026)。事件驱动的系统好处是解耦,坏处是没有一个地方能让你一眼看出"现在到底在跑什么"。你是单兵作战、精力是元约束——这种架构的调试成本对一个人的团队可能是致命的。他的解法是"让 AI 写",而这个解法成立有个前提:必须有极其干净的日志(t056:他的 coding agent 后来不看 session log 了,直接查数据库)。所以顺序不能反——先有可查询的结构化日志,才敢上事件驱动。反过来做会把你埋了。
所以呢
不要整体重构 app_incubator。先做一件低成本的事:给现有 7-Agent 链路加一份统一的、带类型的事件日志(谁在什么状态下做了什么、产出什么对象)。这份日志本身就有立竿见影的价值(调试、复盘、成本账),而且它是将来任何"改成订阅式"的必要前提。日志先行,架构后动。
他们怎么做的
他的 policy 分级设计很讲究:加一篇原始文章不设卡,改 prompt 要人类确认,改事实要先查有没有矛盾(t013)。同一套机制里,有的改动放行、有的必须过闸——按"改动会伤到什么"来分级,不按"改动大不大"分级。
你可以怎么做
你的 Chief of Staff 现在是"把你写过的原则放回你眼前",本质是提醒式的。本场提供了升级路径:把宪法条款从提醒变成分级 policy——低风险决策(读什么、试什么工具)直接放行;中风险(新开一个副业方向、加一条产品线)触发一次"跟已有承诺是否冲突"的检查;高风险(放弃某个项目、改变三条产品价值观的适用范围)必须走人类确认 + 记录理由。这正好对上你的"跨域守门"痛点:守门不是每件事都拦,是知道哪几件事必须拦。
再一条:他的 event log 天然支持 replay 和 rollback(t014)。你的"季度回望"缺的就是这个——回望之所以难,是因为你只能看到当下状态,看不到"三个月前我是基于什么信息做的这个决定"。把决策记成 append-only 事件(决策 + 当时的假设 + 预期结果),季度回望就从"凭记忆反思"变成"逐条对账"。
更深一层
「agent 的身份认同,就来自它自己的那份日志」(t061)这句话,反过来对着你自己念一遍才是真正的镜子。他说我们不等于自己的推理能力,我们更接近于从真实经历中沉淀出来的信念、知识和行为方式(t060)。你的第二大脑、你的宪法、你的 Chief of Staff——这三样东西加起来,本质上就是你在为自己建那份"经验式世界模型"。而它现在最大的漏洞和他一样:只记成功的、被采纳的、写成文的,不记那些试过后放弃的。你 2021 年写下三条产品价值观,中间放弃过哪些做法、为什么放弃,如果没记,你的"经验式世界模型"就只有一半。
所以呢
在 Chief of Staff 里加一类最不起眼但可能最值钱的记录:放弃日志。每次决定不做某件事时,记一行"不做什么 + 为什么 + 什么条件下会重新考虑"。半年后回看,这份清单对"该 all-in 哪个编码下注"的价值,会超过你所有的想法清单。
他们怎么做的
「当一个 claim 被创建、并且它和图里另一个 claim 相矛盾时,自动触发矛盾检测器」(t021);deep research agent 自带一张"证据从哪来、哪些互相矛盾"的图(t037);log 直接当 memory 用,不做实体抽取也在 LongMemEval 上表现不错(t032、t033)。
你可以怎么做
更深一层
ActiveGraph Lab 那一幕值得你专门想一想:它读遍所有博客 → 提新想法 → 问他批准 → 跑实验 → 写博客,甚至自己给自己装了一个 pack 并发现了作者本人不知道的性质(t046、t048)。这是"第二大脑"的下一形态——不是等你去问它,而是它主动从你的存量笔记里长出新问题来问你。你的 Personal Thinking 现在是"和 AI 对话的入口",Lab 是"AI 主动敲你门"。差别是一个订阅机制。
所以呢
给第二大脑加一个每周一次的"矛盾巡检":让 agent 扫最近新增的笔记,只输出一件事——新笔记里有哪几条跟你既有的主题骨架或原则相冲突。不给建议,只报冲突。这是信噪比最高的一种自动化。
他们怎么做的
Yohei 三年发 9 次 BabyAGI 迭代,每个项目都配一篇博客 + 一个 GitHub repo(t046),失败的也说:BabyAGI「大家都以为它能跑通,结果它根本跑不通」(t002);Pokémon 分数至今只有 27%,他照样上台讲(t052)。这就是 build-in-public 的标准姿势——公开的不是成果,是过程和失败。
你可以怎么做
三条能过你"弹药库闸门"的选题(删掉你的判断和实测就不成立的那种):
更深一层
这场对你的一人公司叙事有个更硬的支撑点:他说 LLM agent 才三年、训练数据少,而黑板架构、Kafka 这类东西讨论了几十年、全在训练数据里(t055)。翻译成你的语言——AI 更擅长做那些人类已经做了很久的事。你作为一个 PM 开一家只有自己的公司,真正的不公平优势不在于"用了多新的 AI 玩法",而在于你能不能把 AI 的活儿映射到某个已经被人类讨论了几十年的成熟范式上。这个观点本身就是一期内容。
所以呢
本期至少产出 1 篇 C 类验证体选题进 Phase 0 存稿池(你还差 ≥4 篇验证体)。选第 1 条,因为它有可抄物、有前后对比数字、且标题封面能前置——"我逼我的 AI 员工在改代码前先自证有效,结果 80% 的改动被它自己否了"。