这一期对你是满分相关——不是"AI 内容顺带沾边",而是造 Claude Code 的团队亲口讲他们怎么用 agent 造 agent、怎么把人移出环路、怎么给 agent 写 prompt、怎么定发布门槛。你手上正好有一个架在 Claude Code 上的多-Agent PRD 工厂 + 一整套个人技能栈,他们踩过的坑和攒下的机制,几乎可以逐条对着抄。下面按项目对。
① Holdwell ERP 多-Agent PRD 工厂(最高相关)
他们怎么做的:Anthropic 把"把人移出代码审查环路"当成一个六个多月的渐进工程,而不是一刀切——先人审一切;再逐步证明"某类改动 code review 能抓 100% 问题"才撤人;每次事故复盘把肇事 case 加进 eval 集,锁死"未来任何改动都不许在这个指标回退"(t031)。发布靠一条清晰到每个工程师都知道要冲什么的量化门槛(活跃用户数 + 留存),不达标就是不发(t022)。system prompt 反复"软化到 100% 准确":发现一条指令"90% 成立、10% 不成立"就改写,因为"这段 prompt 是 100% 的时间都喂给模型的"(t039)。
你可以怎么做:
- agent 产出的可观测/可验证 → 抄他们的"清晰门槛 + 渐进撤人"。别指望一步到位让评审全自动卡关;先给每个环节定一条可量化、agent 一眼可判的通过标准(他们用留存,你可以用"碰撞三件是否交齐 / 评审意见是否全部回炉 / 冲突项数=0"),再对"已证明 agent 能 100% 把关的那类 PRD 环节"撤掉人工复核。标准够清晰,三驾马车 agent 才知道自己在冲什么。
- 真人评审意见回炉缺闭环 → 这就是他们的 eval 集打法。每次评审挑出问题,把那个具体 case 固化成一条评测样本喂回工厂,"未来任何工厂改动都不许让这条回退"——跑一轮就自动积累出闭环证据,而不是靠人回忆"上次哪里翻车了"。
- 跨线对齐 → 用 Claude Tag 式的多人单会话收口(t021):跨产品线联动的需求放进一份会话里,各线负责人 @ 进来补自己那段,靠社交规范自然对齐,比各线各写一份再合并更省事。
- agent 定义怎么写 → 记住 Cat 的"低 cardinality"原则(t056):三驾马车每个角色的职责要和其他明确区分,否则 agent 难判断哪件事归谁;定义能精简的精简(他们连 grep/glob 都删了改用原生 bash)。写 agent 定义时少写"不许做 X"的硬禁令、多给上下文——禁令一旦和后续指令冲突,agent 会困惑"定义说这样、上层说那样"(t038)。
更深一层(镜子):他们反复强调"产品品味 > 执行力、PM 是工程+设计+PM 混合体、哪里有缺口补哪里"(t006/t079)。对你这个 8 人 PM 团队的工厂,这是一面镜子——工厂真正的价值不在"把执行自动化得多快",而在有没有把"该不该做、做什么"的判断力前移进 agent。如果工厂只是更快地产出 PRD,却没提升"选题"的判断,那就是在更高效地做可能白费的 99%。
② app_incubator(7-Agent 造 App)
他们怎么做的:workflow 的本质是"Claude 编排一整批 subagent、每个发一份很详细的 prompt",比"生成单个 subagent"高一层(t043)。file edit 工具保留纯为渲染出一个确定性的审批锚点(t056)。但 Cat 也承认模型设计/UX 品味仍是短板——能照 spec 实现,但"padding 不对、界面还不 delightful,偏套现有最佳实践"(t088)。
你可以怎么做:
- 把"该做什么"前移 → 正对 t006。你的链路别只做"设计稿→工程执行",在最前面加一个"该不该做 / 做什么"的判断环节,让 agent 先争论清楚再动工。
- 激活/首屏体验 → 记住 Cat 的失望点:delight 环节别指望 agent 一把梭。首屏、激活这类"新交互体验"恰恰是模型最弱、最容易撞上"Opus 审美"的地方(t089),这里要留人来把关、给足详细 spec。
- 设计稿即强制契约 → 和他们 file edit 的思路同源:靠一个确定性锚点让 agent 链路可审、可卡。你的"设计稿即契约"就是这个锚点,值得继续强化。
③ StockHelp / 你的价值投资实践
他们怎么做的:Cat 用 workflow 做旅行深度调研——查直飞航班、按难度筛线路、按"接近段最短"的个人偏好排序,最后得到一个"专属定制 app"(t104)。发布决策靠一条清晰的量化门槛(t022)。
你可以怎么做:
- 看板该显示什么信号 → 学他们"定一条一眼可判的清晰线"。与其堆一堆指标,不如先立一两条硬门槛(如"5 年 PE 分位 < 20% 且自由现金流为正才进候选池"),清晰到看板上一个色块就能判"被低估/别碰"。
- 个股深度调研 → Cat 那套"workflow 做深度调研"可以平移到 Phase 2/3:让 agent 拉财报、算基本面比率、找同业对比、按你的能力圈偏好排序,产出一份"专属选股简报",正是你想要的"卓越生意监控"。
更深一层(冲突,值得点出):他们的核心信条是"不要跟自己谈判、尽量有野心、默认答案别是'不'"(t098/t099)——这对做产品是对的,但对价值投资恰恰要反着用。投资的胜负手是安全边际、能力圈、别追涨杀跌,默认答案本来就该更接近"不"、更接近克制。把这两套心态摆在一起看很有意思:产品要野心,仓位要谦卑;别把"造 app 的 all-in 冲劲"误带进 StockHelp 的按钮上。
④ Personal Thinking(第二大脑)
他们怎么做的:观众专门追问"memory 要不要从文件换成 data store",Thariq 的答案是——现在 Claude Tag 的 memory 就是"每个频道一个 Markdown 文件",session 可回写主 memory,"什么才是对的 memory 方式其实挺反直觉",仍在实验、暂无定论(t109/t110)。团队记忆的用法是"把偏好写进一个持久文件、让未来每条消息自动继承"(t016)。
你可以怎么做:
- 摄入 SOP / 信噪比 → 这直接给你的第二大脑路线背书:连造 agent 的团队都还在用"markdown 文件即记忆",暂时不必纠结上数据库。你现在的"主题骨架 + 原子笔记文件"就是主流做法,先把这套跑扎实。
- 跨主题串联 → 抄"团队记忆"思路:把你的摄入偏好、WIIFM 镜头、密度梯度标准写进一个持久的 memory 文件,让每次和 AI 对话都自动继承,而不是每次重述。
⑤ Chief of Staff apps
他们怎么做的:"不要跟自己谈判"——别在脑子里预设一堆取舍、劝退自己,而是逼取舍拿证据显形:"这是真取舍,还是只是听起来合理?"(t098)
你可以怎么做:这句话几乎就是给 CoS 量身定做的守门规则。CoS 的价值本就是"把你写过的原则放回你眼前";可以加一条反自我谈判的探针——当你说"算了太麻烦 / 不值得 / 以后再说"时,CoS 反问一句"这是一个有证据的真取舍,还是你在跟自己谈判把有野心的事劝退了?"这正好补强你列的"软教练质量"痛点。
⑥ xiaohongshu_momorain(一人增长团队)
他们怎么做的:Cat 一个人用 Claude 补齐所有缺口——把发布日历、异步状态收集自动化,人只做判断(t079);发布靠"活跃 + 留存"的清晰门槛(t022);Thariq 坚持"产出必须过品牌团队极苛刻的审美,否则不做"(t003)。
你可以怎么做:
- 指标盘空着没跑 → 抄他们的"清晰门槛"。给你的家居号定一两条硬线(如"某类选题的完播率 / 隔周回访达到 X 才算值得复制的支柱"),线清晰了,指标盘才有意义、才会真的去跑。
- 一人增长团队 → 你和 Cat 的处境同构。把选题矿池、发布日历、数据收集自动化成 workflow,你只保留"判断该发什么"这一层——这正是"PM 思维这张牌"的打法。
- 封面/内容品控 → 用 Thariq 那条标准:发布前过一道"苛刻审美闸门"(可以让 de-ai-flavor + 你的封面规范当这道闸),不过关就不发。
⑦ 职业 / 本人精力(元约束)
他们怎么做的:Thariq 把失落感的解药定为"更大的野心",榜样是 Jared 手写一年 Zig、再重写 Bun 都乐在其中(t075);但两位也反复说"全是脑力活、确实累""野心抬高很累"(t004/t005)。
你可以怎么做 / 更深一层(镜子 + 冲突):
- "更大的野心"对你单兵多线是双刃剑。一方面,t006"该做什么 > 执行"给你的"该 all-in 哪个编码下注"一个清晰答案——下注点应该压在判断力和品味上,而不是执行速度(执行已经变便宜了)。
- 另一方面,Anthropic 的"尽量有野心、别跟自己谈判"是一家在扩张、不缺人手的公司的姿态;而你的元约束是"精力与聚焦是最稀缺资源"。所以这条对你要打个折反着用:不是无限扩张野心,而是用你的杠杆观(判断力 > 工时、盯那 1%)去挑一件最大的事有野心地做,其余的果断不做。把"野心"和"聚焦"这对张力摆正,才不会把自己累垮——这恰恰是你每周留一天思考要解决的问题。
One Human Company 新号(2026-07 回填)
- 怎么做的:这期是新号 C 类选题的富矿,三条最硬:① Anthropic 内部的 Claude Tag 承包了产品工程团队 65% 的产品 PR,但这份"把人移出环路"的信任是花六个多月、靠上千个 eval 一小步一小步建起来的——先人审一切,证明某类改动机器能抓 100% 问题才撤人,每次事故把肇事 case 加进 eval 集锁死回退;② 最反直觉的一条:模型越强,他们反而把 system prompt 砍掉 80%——删示例("前沿模型比我们给的示例更有创造力")、删"不许做 X"的硬禁令、把"90% 成立"的指令软化到 100% 准确;③ 联合创始人口头禅"不要跟自己谈判"——别在脑子里预设取舍劝退自己,逼取舍拿证据显形。
- 你可以怎么做:
- C 类候选(最亮):「Anthropic 说模型越强提示词该越短,我把 drizzle tech 的 agent 提示词砍了一半——翻车清单在这」——照 Cat 的"软化到 100% 准确"方法过一遍你 9+1 角色的提示词:删掉哪些示例和禁令、砍完后哪个角色立刻变笨、哪个反而更聪明,附砍前砍后的 token 成本对比;可抄物是"提示词瘦身三步自检卡"。有实测有反例,闸门稳过。
- C 类候选(第二发):「Claude Code 团队用 6 个月才敢把人撤出审查,我的一人公司多久敢?」——把"渐进撤人 + 事故进 eval 集"搬到你的造 App 管线,记录你在哪个环节第一次敢不看 agent 产出直接放行、依据是什么;这同时是 B 类的绩效考核素材。
- D 类候选:"不要跟自己谈判"天然是一句可反驳的立场句——对应你 Phase 0 最常见的自我劝退("这篇没人看吧""等管线更成熟再发");写一篇短评:一人公司最大的成本不是 API 账单,是跟自己谈判谈掉的那些没发出去的稿子。
- 和你现在做法冲突:他们的门槛是"活跃 + 留存不达标就不发",你的北极星是收藏率——方向一致,但你还没有那条"清晰到一眼可判"的线。Phase 0 就该定下来:存稿里收藏率预估逻辑说不清楚的选题,等同于"不达标不发"。