本期为 Claire 单人现场 build,无 lightning round。收尾要点:
诚实闸门:本期与你高度直接相关——你正在造多条 agent 流水线(PRD 工厂、造 App 链路、决策外脑、第二大脑的各类 skill),而这期视频恰好是"怎么把 agent 流水线从'一堆 skill + 祈祷'升级为'harness + 保证执行'"的现场教学。StockHelp、小红书号本期无直接关联,诚实略过。
她怎么做的:Claire 最锋利的对比是——关键流程"可以写进一个 skill,但那样你还得盯着它执行;做进 harness 里,我们知道它每一次都会发生"。她把定制提示词、产出格式、工具权限编码进 harness 的具体步骤,而不是靠模型"希望它被正确调用"。产出也是预设死的:证据 → 根因排序 → 验证建议 → 要不要指派 → 能不能修,agent 甚至被设计得敢说"我还不能修"。
你可以怎么做:你的 PRD 工厂现在是"三驾马车 + 碰撞协议"的形态,痛点恰恰是碰撞纪律靠 agent 自觉——这就是她说的 babysit 状态。解法是把碰撞协议和环节流转从提示层下沉到代码层:每个环节做成一个"run",入口收固定输入,出口强制产出固定 artifact(不齐就不放行),独立初稿环节做成像她的"I 键调查模式"一样的硬隔离(UX 与 tech 的 run 无权读对方产出,互不可见由代码保证而不是靠自觉)。另外她的 artifact store 思路正好对上你"agent 产出可观测/可验证"的痛点:让每次 run 把证据/结论写进工单目录当 source of truth,下一个环节读文件而不是读聊天记录——可核查的过程证据也就自然沉淀下来了。
她怎么做的:她不泛用 MCP——"没有让 coding agent 在一堆 trace 里到处乱逛",而是给 Sentry/Linear/Vercel/GitHub 各写一个有主见的 adapter:预先定义"排查 bug 时你需要拉什么、什么有用、什么没用"。工具的用法被场景化了:不是"这个工具一般能怎么用",而是"干这件事时具体该怎么用"。
你可以怎么做:你的造 App 链路挂着 Figma / Chrome / Notion 三个 MCP,agent 每次都在全量工具面里自己摸索——这正是她反对的形态。可以给每个环节写薄薄一层场景化 adapter:比如"从设计稿取契约"只暴露拿 design token 和组件规范的那几个调用,返回固定结构;"验收首屏"只暴露截图 + 关键元素断言。这也顺带回答了你"把'该做什么'前移到 agent"的痛点:她的答案是前移到 adapter 和 workflow 代码里,agent 拿到的不是工具箱而是操作规程。她的踩坑也要记:AI 帮你搭 harness 时会拼命把它写成纯确定性脚本、抗拒留 AI 的位置——工作流、工具、提示词插槽三样都要写得极具体才能一次到位。
她怎么做的:她给 harness 的判断标准是"同一个工作流需要同样的设置、同样的产出",并明确说非技术用例也算——按特定方式做调研、按特定方式整合文档。收尾猜想:"wrapper 其实就是 harness,这个认知会让我过去三年 vibe coding 出来的所有东西都升级一遍。"
你可以怎么做:照这个定义,你的 video-to-text、content-radar、收活归档脚本,本质都是"半个 harness"——有固定流程和产出模板,但强制力还在提示层。挑重复度最高的一条(比如摄入 SOP:转写 → 提炼原子笔记 → 更新 MOC → 登记 dashboard)按她的七步法升级:固定输入、固定 artifact、每步产出不齐不进下一步。决策外脑同理:触发词 → 读宪法 → 按固定框架产出决策简报,正是"确定性 + 非确定性混合工作流"的教科书场景。
怎么做的:Claire Vo(ChatPRD 创始人)把被讲神秘的 harness 一句话拆穿——"就是包在 AI agent 外面的一层代码,让它更好用",三要素是特定上下文、特定动作、特定产出;她 30 分钟用八来个文件现场造了一个查 bug 专用 harness。全片最锋利的对比是:关键流程"可以写进一个 skill,但那样你还得盯着它执行(babysit);做进 harness 里,我们知道它每一次都会发生"。
你可以怎么做:这是一篇现成的 C 类验证体——候选标题《Claire Vo 说"写进 skill 是祈祷,编码进步骤才是保证",我把 AI 员工最爱跳过的一步下沉试了一周》:挑 drizzle tech 流水线里你反复口头交代、agent 仍时不时跳过的一步(比如某个角色的产出格式检查),照她的四步极简版(写下工作流 → 定数据源 → 丢给 Claude Code 搭 → 真数据测试)下沉成强制步骤,记录下沉前后的返工次数和你盯梢的时间。可抄物就是那份"四步极简版"清单。自检闸门:删掉你的实测对比就只剩名词解释——所以必须带着数字发,否则不发。
怎么做的:她的"investigate-only"设计——按 I 键只调查、不许碰任何文件,agent 甚至被设计得敢说"我还不能修":面对一条影响 150 个用户的 warning,它判断信息不够、拒绝直接修,只建 Linear issue。这是把工具权限做成硬约束、而不是靠提示词恳求的结果。
你可以怎么做:这是 B 类"AI 员工管理"的独占素材——你的 9+1 角色里,评审/QA 角色有没有"只许看不许改"的硬权限?写一篇《我给 AI 员工发了"只读工牌"》:讲清没发工牌时翻过什么车(评审 agent 顺手改了代码之类)、发了之后差别多大,可抄物是一张"角色权限清单"模板。若还没翻过车,先攒案例再写——没有真实翻车记录这篇过不了闸门。
对你的镜子:她的选题自问"有什么事是我在反复、持续地做,而且 AI 能干得不错的?"——这句同样适用于选题:新号每一篇 A/B 类的源头,其实都该是这个问题的一次诚实回答,而不是"这周流行什么"。
所以呢:下一步别开新线——从 PRD 工厂里挑"独立初稿互不可见"这一个环节,照她的四步极简版(写下工作流 → 定数据源 → 丢给 Claude Code 搭 → 真数据测试)把它从提示层约定升级成带强制产出的 run,验证"编码进步骤"确实治 babysit,再决定要不要把整条工厂 harness 化。