本片无正式的 lightning round(快问快答)环节。收尾处主持人总结:"你们正在打造全世界最重要的开发者平台之一……我真心觉得很乐观——这个平台掌握在一双非常有想法、又真心在乎整个生态的手里。" 两位嘉宾致谢,全片在音乐中结束。→ 详细
本片未提及嘉宾联系方式。嘉宾:Katelyn Lesse(Anthropic 平台 · 工程)、Angela Jiang(Anthropic 平台 · 产品);主持方为 Sequoia Capital(对谈中提到 Lauren 与另一位主持人)。
相关度:极高。 你不只是这层平台的用户——你整套工作流(Holdwell PRD 工厂、app_incubator、Chief of Staff、乃至这本第二大脑的 AI 入口)就跑在这层平台上;而且你正在搭的两套多-Agent 架构,恰好就是两位嘉宾反复讲的"三层栈 + 给每个 token 一份 job"的活标本。这一期不是"顺带沾边",是给你的 agent 架构提供一手心智词汇表。下面按项目逐个对。
他们怎么做的:Anthropic 把 agent 能力叠成三层——知识(skills + memory)/ 执行(底层 harness + 托管基础设施)/ 协调(strategies = 元 harness);而协调层的灵魂是一句话——"token 不可互换,给每个 token 一份 job":出主意(advising)、执行(executing)、回顾过去会话把教训写进 memory、当裁判验收("你干得好不好?不好,重来")。Katelyn 还点破一件对你尤其重要的事:在 legal / finance 这类"错了后果很严重"的高后果领域,最该自己掌控、也最能榨出收益的,是"模型和执行之间的验证(verification)逻辑",而不是别的。
你可以怎么做(把上面翻译成你的 PRD 工厂):
execute → 裁判进来问"做好了吗?没有,重来" → 再 execute 就是一个能把活儿打回去的验证 job。把评审回炉做成一个"唯一职责是核对意见逐条落实、且有权 bounce"的 agent,而不是一个"提个建议就放行"的软环节——这正是评审从"建议"变"闭环"的机制。更深一层(镜子 / 可能的简化):Angela 那句"大家常照人类组织来想,但推到极致其实是'token has a job'"是给你的一面镜子——你的三驾马车,是"因为真实 PM 团队有这三个岗位"才这么分、还是"因为确实有三份独立的 job 需要它们"?按 job 重新收敛,很可能能砍掉一截 steering 脚手架(见下条),直接缓解你"评审不闭环、知识层薄"的结构性矛盾。
他们怎么做的:① "开放生态而非围墙花园"——不执着于跑在自家基础设施,靠 self-hosted sandbox、MCP tunnel、connectors 把别人的东西插进来;② "你有一份 spec,Claude 就能遵循它,于是你能非常自然地把一大堆东西连起来";③ 客户的神操作——"在一个 agent 上头暴露一个 MCP server,让另一个 agent 去调它的 tool",让 agent 之间更模块化、能协作。
你可以怎么做:
他们怎么做的:主持人把历史分成 token maxing(把 token 用到极致)→ token rationalization(用得合理)。Anthropic 的态度不是"叫停",而是 Katelyn 那句——"同样的成果,一种是拿 Opus 通宵蛮跑,另一种是在 strategies 上更聪明一点、用更低成本做到"。加上 Angela 的"模型已经可引导了,harness 里那些'砌墙逼它走直线'的引导脚手架,可以删掉——我们经常鼓励删"。
这对你(精力=最稀缺资源)意味着什么:
他们怎么做的:知识层 = skills + memory;Claude Tag 的魔力"不是那个 Slack 界面,而是引擎盖下的 context engineering",被 Karpathy 称作"组织级 harness"——一个主动的、always-on 的、"像同事一样搞清你所有 context"的存在。
你可以怎么做:
怎么做的:Anthropic 平台团队(Angela Jiang / Katelyn Lesse)给多-Agent 编排下了个反共识定义——"token 不可互换,给每个 token 一份 job":出主意(advising)、执行(executing)、回顾会话把教训写进 memory(reflecting)、当裁判验收("你干得好不好?不好,重来")。Angela 还点破:大家习惯照着人类组织来想 agent 分工,但推到极致其实就是"每个 token 都有一份 job"——按 job 拆往往比按岗位拆更少冗余。
你可以怎么做:这是一篇现成的 C 类验证体。候选标题:《Anthropic 说"别照人类公司搭 AI 团队",我把我的 10 个 AI 员工重排了一遍》——拿 drizzle tech 验:把 9+1 角色按"想/做/反思/验收"四种 job 重贴一遍,看能合并掉几个岗、编排后 token 账单差多少、哪里翻车,写出前后对比和你的判断(包括"哪些岗位确实该照人类组织留着"的诚实反驳)。闸门自检:删掉你的重排结果和账单数字后这篇只剩 Anthropic 转述,不成立——所以必须带实测发。可抄物:四 job 重贴清单。
怎么做的:Angela 给了条反直觉建议:现在模型已经很"可引导",harness 里那些专门"砌墙逼模型走直线"的引导脚手架可以直接删——"我们经常鼓励大家删";真正值得死磕的只有一处——高后果领域里"模型和执行之间的验证逻辑","把最后这一点点调好,能榨出巨大收益"。
你可以怎么做:这是 B 支柱(AI 员工管理)最独占的素材方向:给 drizzle tech 做一次"脚手架断舍离",记录删了哪些流程墙、返工率和 API 账单的变化,候选标题《我给 AI 员工松了一次绑:删掉一半 SOP 之后发生了什么》;同时把"唯一有权打回工作的裁判岗"写成 AI 员工的绩效制度贴——这正是 B 类"岗位说明书/返工账"的原型。可抄物:脚手架断舍离三问卡。闸门:返工数据和账单是你的,稳过。
怎么做的:他们选赛道的判据只有一句:干完一轮,你是"做完了走人",还是"太牛了、还想再多干"?只押后者(coding 式复利需求),一次性需求办完即走。
你可以怎么做:把这把尺子放进 A 类决策复盘的固定段落——第一个 App"为什么是它"就用"复利型 vs 一次性需求"讲取舍;它也是一句现成的 D 类立场句候选:"不解锁下一次使用的 AI App,不值得一个人公司做。"
这一期给你的不是灵感,是词汇表:回你的 Holdwell PRD 工厂,做两件事——① 把三驾马车按"token 的 job 类型(想/做/反思/验收)"重排一遍,顺手砍掉为老模型砌的引导脚手架;② 把真人评审回炉升级成一个"有权打回"的裁判 job,并让一个"反思 job"每轮把跨线实体/术语沉淀进共享 memory。这几下同时缓解你"评审不闭环、跨线难对齐、碰撞纪律难保真"三个结构性痛点。