这期是少见的高浓度直击:讲话的人和你是同一个工种(PM),用的是你每天在用的工具(Claude Code、MCP、Skills),而且她正面回答了你正在动手做的那件事——PRD 到底还要不要、要成什么样。所以这段会写得比平时厚。
一、Holdwell ERP 的多-Agent PRD 工厂
① 「evals 就是新的 PRD」——你要的那个可验证抓手,可能长这个样子
- 怎么做的:她团队的口号是 evals 是新的 PRD,但真正值钱的是那套转译流程:接住一句虚的抱怨(「Claude 胡编乱造」「Claude 不听指令」)→ 追问到「哪一段?你问了什么?它回了什么?」→ 调完整轨迹分诊(是该调工具没调?还是文档找对了但引错事实?)→ 攒 30 到 40 个失败样例配上标准答案 → 进仓库,每个新版本都跑一遍。那个 JSON 案例是全片最锋利的一刀:用户口中 80% 的「模型不听话」,真相是格式写错了。她还加了一条检查:这套样例要 on distribution——既要覆盖真的会失败的情况,也要覆盖那些本来就不该失败的情况,否则你会"修"出一个矫枉过正的系统。→ 详细
- 你可以怎么做:你那条流水线现在最缺的是「真人评审意见有没有真回炉、agent 产出拿不拿得出可验证的证据」。她给的答案是:评审不该只是一份要人读的意见清单,该沉淀成一组能跑分的样例。 这周挑最近 3 份 agent 产出的 PRD,把真人评审时实际被打回的原因逐条写成可判定的检查项(比如「未引用现有实体定义」「验收条件不可测」「跨线影响未列」),凑够 20-30 条就是你的第一个评审 eval 集;每次流水线改版都整套跑一遍,分数就是你要的回炉闭环。注意她那条 on distribution:里面必须掺进几份本来就写得对的 PRD,确保你的检查不会把好东西也拦下来。
② PRD 没死,但它只该活在两个位置
- 怎么做的:她的划线极其清楚——问题已经定义清楚时,eval 就是 PRD 的速记,别写文档;PRD 只在两处非它不可:一是让一大群人对齐同一份事实来源(他们每个模型都写 PRD,但不是给研究员看的,是给工程、法务、安全这些下游看的,作用是「让一大群人朝同一个方向划船」);二是没有现成痛点的模糊机会,靠 PRD 里的「产品愿景」那部分去探索「怎么让它先在一小群人身上跑得很好」。OpenAI 那边负责 Codex 的人给出了同样的结论。→ 详细
- 你可以怎么做:给你的流水线加一道入口分诊——需求进来先判一句:这是「已经定义清楚的问题」还是「模糊机会」?前者直接走轻量模板 + 验收样例,别让三驾马车把六步碰撞协议全跑一遍;后者才值得开完整的独立初稿加碰撞。如果要分流,别按需求来源分,按问题的确定性分——后者更省你的精力。
③ 「缩短从发现问题到能动手改的距离」——这可以直接当你流水线的北极星
- 怎么做的:她把自己整份工作压缩成一句话:把用户反馈转译成研究员看得懂、也下得了手的东西,目标是缩短「发现问题」到「能动手改」之间的距离——并且她承认这是这份工作里最大、也最难的一块。→ 详细
- 你可以怎么做:你的跨线对齐难,本质上就是"下游看不懂、下不了手"。与其先补齐一整套实体字典,不如反过来从最近一次跨线扯皮开始:把那次扯皮拆成「到底是哪个词两边理解不一样」,只把那一个词写进共享定义。一次一个词,比一次一张大表更可能真的落地——她那 30-40 条样例也是这么攒起来的。
二、app_incubator(7-Agent 造 App)
① 「假设 Claude 8 出来了」——把野心变成一道能回答的题
- 怎么做的:她反复问团队的那句话是:假设 Claude 8 出来了,用户的行为会变成什么样?那这对你今天该怎么搭这个产品意味着什么?它能不能兼容到那个未来的体验? 配套姿势是:对方向很固执,对具体做法保持松弛。→ 详细
- 你可以怎么做:你的链路里最容易过期的是流程的形状(谁调谁、几个角色、什么顺序),最不容易过期的是契约(设计稿即工程契约那条)。下次改造前先问一遍这道题:如果模型再强一代,这七个角色里哪几个会自动合并?——会合并的那几个,就别再往里投工程量了,把力气加在契约和交接物上。
② 原型本身就是产出,哪怕它永远发不出去
- 怎么做的:Labs 的做法是只押「不连续的大赌注」,判断它的 10 倍、100 倍形态;跑不通的判断**「等一到两代模型之后再回头看」;而且他们明确认为原型即使没变成产品,让你学到东西这件事本身就有价值**。组织上是小组极小——「有些想法一开始只有一个工程师」,因为「大团队追模糊大想法反而更慢」。→ 详细
- 你可以怎么做:给你的孵化器加一个**「搁置架」——凡是判断对但当下跑不通的想法,别删也别硬做,写一行「等模型能做到 X 就回来」存起来,每次大版本模型更新时只花半小时扫一遍这张单子**。这是把"追不上"变成"排队等"的最省力的办法。
③ 主动性的新定义,可以直接写进你的 agent 设定
- 怎么做的:「所谓主动性,并不一定是把安排给你的事做完,而是知道什么时候该提出一个新想法。」 与之绑定的是「知道什么时候该反驳你」——她甚至用 Opus 的研究版本反过来质询团队的定价决策。她给思考搭档定的及格线是:一天下来你的想法应该变得更好了,而不是被改进了 10%。→ 详细
- 你可以怎么做:你一直想「把该做什么前移到 agent」。落地方式不是加个"建议"环节,而是给某个角色显式授权:在它认为方向错了时,有义务先输出一段反对意见再执行。同时把你自己的验收标准从「它做完了吗」换成「它有没有让我这版想法比上一版更好」。
三、One Human Company(build-in-public 那个号)
① 「公开地工作」不是发内容,是把发现过程本身摊开
- 怎么做的:Anthropic 早期有个 Slack 频道,几乎全公司在里面测 Claude 的早期版本——大家当时不叫它"用例",只是在让它改文章、想措辞。关键机制是接力变异:一个人抛想法,别人试各种变体,「大概十来次请求之后,就会冒出某个很神奇的东西,或者一个全新的用例」。她的结论是:实验并不一定总是一项个人运动。→ 详细
- 你可以怎么做:这条几乎是给你那个号写的选题公式——别只发结论,发那"十来次请求"。你的验证体选题("大佬说 X 我试了")可以直接升级成"我把这条建议在自己的 agent 上跑了十来个变体,第七个才对"。这种帖天然有可抄物、天然过得了你那道闸门(删掉你的实测就不成立),而且它比结论帖更难被别人复刻。
② 「给文化设指标」——Eric Ries 那本书里她最喜欢的那点
- 怎么做的:她说她最着迷的不是「怎么建一家伟大公司」,而是**「怎么让一支很棒的团队一直走下去」;书里最打动她的是给文化设指标**:「如果你只测营收,那你就只会朝营收去;但如果你有一些更好的指标,那才是真正能守住你在意的那些价值观的办法。」→ 详细
- 你可以怎么做:你那两个号的指标盘一直空着没跑。她这句话给了一个不那么功利的启动理由:先别急着测涨粉,测两个能守住定位的东西——比如「这周发的内容里,有几篇含真实实测/真实成本数字」和「有几篇给出了可直接抄走的东西」。这两个数比粉丝数更能保住你「决策型」「build-in-public」的人设不跑偏,而且这周就能开始记,一行字的事。
③ 一个可以直接抄的产品形态:把一本书做成一个 skill
- 怎么做的:她把《关键对话》做成了一个 skill,用来在真实冲突前问自己「我切入的颗粒度对不对」。她坦白有时候最后并没采纳 Claude 的建议,但光是拿它先把思路跑一遍就已经很值。→ 详细
- 你可以怎么做:这是一条现成的、别人还没怎么讲过的内容线——「把我读过的书做成 Agent 的一条规则」。你手里有第二大脑里那堆拆书稿,随便挑一本做成 skill、跑一次真实场景、把翻车和改进都写出来,就是一篇标准的验证体。
四、Personal Thinking(这本第二大脑)
① 「把它交出去是否存在价值的不对称」——一把可以给整个知识库用的尺子
- 怎么做的:她按场景分流:要保住判断力的事,先自己形成观点,再拿去和 Claude 打磨,并且守住自己的语感和语气;而月度业务回顾这类事,她的原话是**「『写』这个动作的价值,相比『想』这个动作是不对称地低的」**,那就整个交出去,自己退到审阅者和校验者的位置。她还把"AI 味"重新框成:重点不在谁写的,在谁验证、谁签字。→ 详细
- 你可以怎么做:给你的摄入流程加一条分流线:总结、转写、格式化——整个交出去,你只做审阅;「这条对我意味着什么」「要不要进主题骨架」——必须你先写一句自己的判断,再让 AI 补。你现在信噪比的隐患不在于 AI 写得多,而在于没有明确标出哪部分是你签字的。最小动作:在原子笔记里固定留一行「我的判断:」,那一行不许 AI 代笔。
② 深挖一两个,而不是铺开一堆
- 怎么做的:她的原话近乎坦白:「外面新出的原型和产品实在太多了,我根本追不过来,所以我给自己的取舍是:挑一两个,自己往深里钻。」 Lenny 拿读者调研印证:幸福感来自在一两件事上深挖,而不是同时铺开一堆小事——人真正高兴的时刻是终于摸出一条让 AI 切实改善生活的路,「而不是手里攥着一堆半残的、勉强能跑的破玩意儿」。→ 详细
- 你可以怎么做:这条对应你「精力与聚焦是最稀缺资源」这条元约束,几乎是原句。具体动作:给你的知识库定一条摄入配额——同一时间只允许有两条「正在深挖」的线(比如现在是 PRD 工厂 + 一人公司),其余新看到的东西一律只进待办池、不开新坑。她把这件事重新定义成一句你会喜欢的话:这是一次对自己时间和精力的产品优先级排序。
五、Chief of Staff(你的决策外脑)
- 怎么做的:她要的不是助手,是会在该反驳时反驳的搭档——「你最不想要的,就是一个只会顺着你说的 AI……就像同事一样,当我的想法还没成型时,我希望有人能顶我一下」。而她招人时真正在筛的对齐层次也很具体:不是每个细节都一致,而是「第一性原理是什么?你的前提假设是什么?」这一层对齐,这样对方才能替你兜底、或者把你的思考磨得更锋利。→ 详细
- 你可以怎么做:你那套宪法驱动的外脑,现在偏"守门"(提醒你别违背原则)。可以补一个反驳档位:当你抛出一个决定时,先强制它输出「你这个判断依赖的三条假设是什么,其中哪一条最可能是错的」。这比让它直接给建议更贴你「判断力 > 努力」的操作系统——它顶的是假设,不是结论。
六、你本人的精力与节奏
- 怎么做的:她面对的节奏是2024 全年发四个模型系列,今年光第二季度就超过了这个数。她的答案不是"更能扛",而是三条:这不是个人运动、极度当责但彼此补位(发布前夜不是 DRI 也陪着改稿)、以及那个对休假的重新定义——「重点不是你能休假、然后回来面对三倍的活儿,而是你休假的时候,能放心团队自己判断得出该做什么。」 招人上她明确偏好低 ego、以团队为导向的人,因为「这确实是可持续性里很大的一部分」。→ 详细
- 你可以怎么做:你没有团队,但你有一支 agent 舰队。把她那条休假标准翻译成你的版本:「我离开三天,这条线能不能自己判断得出该做什么?」——凡是答案为"不能"的线,说明它缺的不是人力,是写下来的判断规则。这周挑一条最耗你的线,把你脑子里那套隐性判断补成一页规则,这比多干三小时更能让你回血。
七、StockHelp / 投资(诚实说明)
- 这期几乎没有投资内容,唯一沾边的两处:一是她早年在 JP Morgan 做高收益债交易员的收获——「哪怕我是最资浅的那个、哪怕我看上去和别人不一样,最好的想法、以及对最好想法的笃定,才是最重要的」;二是那句「只测营收就只会朝营收去」。前者和价值投资里"独立判断 + 敢于持有"是同一种气质,但她讲的是职场发声、不是投资,硬对上去就成了牵强。这一节到此为止,不展开。→ 详细
该反着用
- 「实验不是个人运动」这条,你得反过来读。 她的"别人"是一整家公司的同事,你的"别人"只有 agent 和读者。所以对你来说,能复现那种"接力变异"的不是找人结对,而是把你自己的探索发出去——你的 build-in-public 号,本质上就是你一个人能造出来的那个 Slack 频道。她靠同事把想法接力变异,你只能靠评论区和自己的多轮变体。这也意味着:你发帖的动机可以从"涨粉"改成"找接力的人",那样发帖就不再是成本了。
- 「管理者必须 hands-on」对你是反向问题。 她要解决的是"当了领导就脱手",而你的问题恰恰是什么都自己下场。她那条真正对你有用的不是"多动手",而是她的执行方式:只亲自认领一到两条工作流,为的是保住手感——不是全都亲自干。把这条抄过来的正确姿势是给自己划一条线:哪一两条线必须你亲手做(那是你判断力的来源),其余允许只当审阅者。
- 「砍掉赌注很难」对她是心理关,对你是必修课。 她有一整个 Labs 可以同时押多个赌注、跑不通就等一两代模型;你的产能只够撑两条线。同样的一句"这个判断没错、只是时候没到",她的正确动作是搁置,你的正确动作是砍到只剩两个。
和你现在做法冲突
- 她说「能用 eval 说清楚的就别写 PRD」,而你正在把 PRD 的生产工业化。 你的流水线是三驾马车加六步碰撞协议——它优化的是"把文档论证得更严";她优化的是"把文档换成能跑分的样例"。这两条路不一定矛盾,但你得回答一个问题:三驾马车的产出里,有多少是"给人读的"而不是"能被判定对错的"? 她的经验是:给人读的那部分,只在跨团队对齐和模糊机会上才值得留。这个张力我不替你下结论,但它值得你在下次改版前正面回答一次。
- 她把判断力的来源指向"细节",而你的操作系统偏向"抽象"。 你信"判断力 > 努力、每周留一天思考";她信的是判断力是"大量微妙细节和经验的累积",是靠读一条条失败轨迹、盯训练数据抠出来的,连首席科学家都在看底层数据。如果你的思考日全部用来读观点、不落到自己项目的失败样本上,你练的可能是见识,不是判断力。
- 她鼓励「把野心放大到 1000 倍」,而你的元约束是精力最稀缺。 这两句话同时成立的唯一方式是她自己那句:对方向固执、对做法松弛——野心放在方向上(十年做什么),克制放在动作上(这周只做两件)。如果你把野心放在动作上,就是元约束破防。
对你的镜子
- 你一直在担心"追不上",而全球最靠近 AI 中心的产品负责人亲口说:「外面新出的原型和产品实在太多了,我根本追不过来。」 她的位置比你更能拿到信息、更有理由焦虑,但她的解法不是加速,是把"追不上"当既定事实接受下来,然后只挑一两个往深里钻。你那条"接受现实、不抗拒"的原则,在这件事上是可以直接兑现的——追不上不是你的能力问题,是这个时代的默认状态。
- 另一面镜子来自那句 80%。 一个听起来像"模型不够聪明"的抱怨,真相是格式写错了。你可以拿这把刀对着自己现在最头疼的那个问题问一遍:我一直当成"能力/资源不够"的那件事,会不会拆开来看,其实 80% 是某个具体到可笑的小问题?
所以呢
可迁移的思维模型
- 【耐用】「你没法改进你衡量不了的东西」+ on distribution:任何你想改进的东西,先想办法把它变成一组能反复跑的样例,且样例里必须掺进"本来就该通过"的正例。这条在 AI 之前就成立,在 AI 之后只会更重要。
- 【耐用】「对方向固执,对做法松弛」:野心放方向、克制放动作。这是同时容纳"想大"和"精力有限"的唯一姿势。
- 【耐用】「把这件事交出去,是否存在价值的不对称」:判断什么该全权委托给 AI 的通用尺子——写的价值远低于想的价值时,整个交出去,你只签字。
- 【耐用】「主动性 = 知道什么时候该提出一个新想法」:无论对 agent 还是对人,这个定义都比"把安排的事做完"高一个量级。
- 【会过期】「80% 的抱怨其实是 JSON 格式」:具体的失败模式一定会变(她说现在这个 eval 常年 99.9%);能留下的是那套追问方法,不是那个结论。
- 【会过期】「token maxing / 提前住进未来」:这条 alpha 是靠成本差存在的,成本一降就消失。今天值得抓紧,别当长期战略。
- 【会过期】「AI 写不好」:她明确说这不是天花板,是排期问题,而且是她团队眼下投入最大的方向之一。别把任何产品设计建立在"AI 写不好"这个假设上。
判断更新
- 你原本可能默认「PRD 工厂做得越完整越好」。这期给的更新是:完整度不是目标,可判定性才是。 一份没人能判定对错的完美 PRD,价值低于三十条能跑分的检查项。
- 你原本可能把「判断力」理解成想清楚。这期的更新是:判断力是抠出来的——她、她的首席科学家、她招的所有资深 PM,onboarding 第一课都是去读原始反馈。
这周的一个赌注
挑最近 3 份三驾马车流水线产出的 PRD,把真人评审时实际被打回的原因写成 20-30 条可判定的检查项(掺 2-3 份写得对的进去当正例),跑一次全量打分,记下分数。这就是你要的"agent 产出可观测、可验证"的第一版,也是"真人评审意见回炉闭环"的第一个数字。 一周之内能做完,而且做完之后,你的流水线第一次有了可以逐版对比的刻度。