evidence_rules.md(筛选标准、模糊情况怎么处理),第 3 步聚类时才挂 JTBD 框架(jobs to be done,「用户雇你的产品来完成什么任务」的分析框架),一路到第 8 步组装输出时才加载 output_template.md——每层指令只在被走到时进内存。 → 详细这期几乎是为你量身定制的——一位资深 PM 讲「PM 的完整 Claude 栈」,命中你手上至少五个项目。逐个对:
她怎么做的:不是靠人肉评审把关质量,而是搭了第二个 agent 专门攻击第一个——red teamer 按她配置的「对公司最重要的能力 + 边界情况」生成攻击,evaluator 按 rubric 打分,平均分不过 8 就把反馈打回生成方重改,最多 5 轮,过线才发「通过」标记。现场实测:弱 bot 第 1 轮 8.52(败在格式冲突攻击)→ 第 2 轮 9 → 第 3 轮 9.08 通过。她强调秘诀不在代码,在「让它测什么」的领域知识。
你可以怎么做:你的 PRD 工厂已有三驾马车的碰撞环节(补强/修正/第 3 案),但痛点清单里写着「碰撞协议纪律是否真执行」——她这套正好补上:给碰撞环节加「数值阈值 + 自动打回重写 + 有限迭代轮数」的对抗循环,PRD 不过线就回炉,过线才准进合成定稿。这就把纪律从口头约定变成了机械强制。她「评审配置参数 = 领域知识沉淀处」的说法也印证了你的方向:把 ERP 六条产品线的跨线联动坑这些教训写进 rubric,评审就越用越懂你的域。
她怎么做的:她的 chief of staff 不是靠喂原则,而是靠被动摄入安静长大——每份会议转写自动提取入库,按人建画像(沟通风格、动机、什么招管用),关系质量随时间评成盟友/中立/摩擦五档,还存政治格局和长期模式。于是它能主动说「把这个人发展成盟友」「这事敏感,先知会某某」。刻意放本地:离职时笔记本一交,数据不带走。
你可以怎么做:你的 CoS 强在「把你写过的原则放回你眼前」,弱在对你的日常输入几乎是瞎的——她的补法直接可抄:给 CoS 加一条自动摄入管道(比如工作会议纪要、周记、决策记录落盘即提取),让它除了原则还攒「事实层」;这样软教练的建议才能像她那样具体到人和事,而不是泛泛复述宪法。她给 agent 写的「政治问题不要粉饰」「绝不编造行动项」「别打鸡血、只给事实」这几条护栏,值得原样写进你的 CONSTITUTION 交互规则。
她怎么做的:KB 的关键设计是自动写入——转写邮件一落收件箱就触发提取入库,按文档类型定制提取规则(战略文档抽目标/指标/时间线,访谈抽带引用的观察),第一份访谈进去就能吐出「值得盯的线索」。KB 大了以后她不翻文件,直接问。
你可以怎么做:你的痛点「摄入 SOP、信噪比」她给了两个解法:①按内容类型写死提取模板(你已有 ingestion-sop,可以再细分到「视频/书/flomo 各自抽什么字段」,像她那样带引用防幻觉);②把「入库」从手动仪式变成触发式自动化——新产出落盘即提炼原子笔记草稿,你只做人工curation。她「skill 输出质量漂移就是该更新的信号、每季度回顾」的纪律,正好用在你这批 video-to-text / wiifm 技能上。
她怎么做的:她的理想态是「只要我一构建 agent,就自动触发对抗测试跑到底」;另外她用 Chrome 插件让 Claude「像真实用户一样去完成任务」,看它在哪卡壳、哪些地方困惑——既测人类体验也测 agent 可读性。
你可以怎么做:7-Agent 链路的末端加一个「对抗验收位」:按 PRD 里的验收标准写 rubric,让评估 agent 带着真实用户任务去点你造出来的 app,不过线打回——这直接顶上你「激活/首屏体验」的痛点,因为首屏正是「像真实用户一样试用」最容易暴露问题的地方。她那句「快糙猛验证用 Design、要真实反馈就造能点的 app」也是你链路的注脚。
她怎么做的:把 LinkedIn 帖子原文丢给 Claude Design,用自己产品的品牌色 design system,一次生成八张卡片的轮播图;改稿圈哪改哪、留评论 AI 执行。CEO 级 deck 一小时出稿、看不出赶工。
你可以怎么做:这就是你「封面标签激活」痛点的产能解——把家居号的视觉规范(配色/字体/版式)做成一套 design system,之后每篇笔记的封面和图卡都从同一套规范里生成,保持号的视觉一致性,单篇制图时间从小时级压到分钟级。省下的时间去跑指标盘。
StockHelp / 投资:本期无投资相关内容,唯一沾边的是她讲「CLI 还是 Streamlit 看用户是谁」——你的 StockHelp 用户就是你自己,Phase 1 维持 Streamlit 够用,不必过度打磨呈现层。仅此,不硬掰。
怎么做的:Jyothi 一个 PM 用一天时间搭出"对抗性 agent 评估器"干赢 30 个工程团队——思路来自 GAN:一个 agent 干活、另一个 red teamer 专门攻击它,"对抗方的反馈回传给生成方,直到通过标准"(她的配置:各维度平均分 >8 及格、最多 5 轮);实测那个故意造弱的客服 bot 从 8.52 分被自动改到 9.08 分过线。她点破秘诀不在系统而在"你让它测什么——配置参数里的领域知识"。
你可以怎么做:一篇很硬的 C 类——《一个 PM 靠"红队 agent"干赢 30 个工程团队,我给我的 AI 员工也配了一个》:给 drizzle tech 造 App 链路的交付节点加一个 red teamer,把你最懂的领域坑写进 rubric,交分数曲线、被攻破的真实案例、跑一轮多花多少 token。闸门自检:她的方法是公开的,你的 rubric 和分数曲线才是独家——没有就不发。可抄物:对抗评估 rubric 模板(及格线 + 轮数上限照抄她的配置)。
怎么做的:她的 skill 写法纪律——研究表明 AI 生成的 skill 文件效果不如人写的,可以让 AI 起草,但领域知识必须是你的;更新看三个参数:领域变化频率、使用频率、输出质量有没有"漂移"("以前挺好的,现在不如从前了"就是该改的信号),参考每季度一次。
你可以怎么做:这是 B 支柱"岗位说明书维护制度"的现成骨架:给每个 AI 员工的说明书标注"上次更新时间 + 漂移检查记录",哪次你偷懒让 AI 自动生成说明书然后翻了车,就是一篇现成的返工账(候选标题:《我让 AI 给 AI 员工写岗位说明书,翻车了》)。可抄物:漂移三问卡。
怎么做的:她给转型者的备考心法——"别做项目,把项目做成产品":在身边找烦到你想亲手解决的问题,做出来给真实用户用、收真实反馈、做优先级取舍,"你不是花一小时搭个东西就号称项目"。
你可以怎么做:这就是你 Phase 0 存稿期的写作口径:第一个 App 的每篇 A 类复盘,都按"真实用户 / 真实反馈 / 真实取舍"三件套写,而不是"我搭了个 demo"——这条线天然区隔于满小红书的"一小时搭个 XX"式内容,正好站住你"验证派"的位。
所以呢:本周就能做的一件事——给 PRD 工厂的碰撞环节加上「平均分阈值 + 不过线自动打回 + 最多 N 轮」的对抗循环,把你最懂的 ERP 领域坑写进 rubric;这是全片秘诀(taste 进 harness)在你地盘上的最小落地。