ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.102
第 102 期 · AI 产品 · 收录于 2026 年 8 月 15 日

让Codex替我操作浏览器

CV
Claire Vo · How I AI
视频 27:41 原文约 2.6 万字 预计阅读 23 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 21:56
TL;DR · 三句话
  1. 把 browser use / computer use 想成「一个能把手放到你键盘上的虚拟同事」,装好桌面 App + Chrome 扩展就有了;Claire Vo 说这是「AI 里最能改变生活的功能之一」,用完的评价是「满分 10 分我给它 100 分」。→ 详细
  2. 对做产品的人,最实的用法是把它当 QA(质量验收)跑手:一句「测一下 onboarding 流程的易用性和移动端响应式,过程中随时截图,把发现的问题整理到 Google 表格里」,就跑出 11 个问题、含 1 个上线很久没人发现的高严重级别导航阻塞——因为它会去测失败路径,而人类只走 happy path。→ 详细
  3. 反直觉的操作要点:对前沿模型要少写 prompt——「你就直接说一句『QA 一下 onboarding 流程』,效果会比你列『把 onboarding 里这 25 项都测一遍』好得多」;而这一切的终极目标是「我人可以不在电脑前,但事情照样能办完」。→ 详细
01

开场:《看,妈,我不用手》——把 AI 想成一个能上手的虚拟同事

  • 引子来自她「最喜欢的嘉宾之一」Jessie Janes 的一句话:AI 对当妈的人特别友好,因为「妈妈们的手永远是闲不下来的。手上总有活儿要干,但嘴是闲着的」——那期讲的是用嘴跟 AI 打交道(语音聊天)的好处。→ 详细
  • 这一期正好反过来,她亲切地给它起名叫《Look, Ma, no hands(看,妈,我不用手)》,讲的是 browser use(浏览器操作,即让 AI 直接点你浏览器里的网页)和 computer use(电脑操作,即让 AI 接管鼠标键盘、操作你整台电脑)——「也就是让 AI 直接操作你的电脑、浏览网页,替你把活儿干了」。她的判断是最近这一年这两项能力「提升得非常夸张」,尤其是在 Codex 和 GPT 5.6 系列模型上。→ 详细
  • 全片最好用的一句心智模型(mental model,即你脑子里给这个东西打的比方)就是:「你可以想象成:你有一个虚拟同事,这个同事能把手放到你的键盘上,直接在你电脑上帮你干活。」她坦承「听起来是有点吓人」,但紧接着给了很高的评价——「这是 AI 里最能改变生活的功能之一。工作上肯定是革命性的,同时它还帮我省掉了大量个人生活里那些琐碎的数字杂事」,而且「我真的是每天每分钟都在用」。→ 详细
  • 全片按三类用例组织:一个面向开发者(builder)、一个提效类(productivity)、一个纯属个人娱乐(personal fun)。→ 详细
  • 前提条件她讲得很硬——这也是 How I AI 反复念的那句口头禅:「你得给 browser use 找到一个真正合适的场景。」能力已经到位了,卡住大多数人的是想不出该拿它干嘛。→ 详细
  • 结论她提前给了:「这是我最喜欢的功能,各位。如果你还没试过,尤其是没在 Codex 上试过,满分 10 分我给它 100 分。」→ 详细
02

装配清单:两个桌面 App + 一个 Chrome 扩展,以及为什么她不用 AI 原生浏览器

  • 过去一年冒出一批「AI 原生浏览器」,比如 Perplexity 的 Comet、ChatGPT 的 Atlas,但她更习惯直接在 Claude 或 Codex 里调用 browser use / computer use,而不是换一个浏览器。→ 详细
  • 为什么是 Codex 桌面 App(「或者现在大家好像都叫它 ChatGPT 桌面 App 了」)?理由很简单:「因为它操控我电脑的能力就是最强的」——能控鼠标、能控键盘,基本什么都能干。→ 详细
  • 装配就两件东西:①电脑上装桌面 App(ChatGPT 桌面 App 或 Claude 桌面 App);②Chrome 里装官方浏览器扩展(搜 Codex browser extensionClaude browser extension,「注意认准官方的那个」)。她只用 Chrome,别的浏览器行不行没试过。→ 详细
03

@browser / @chrome / @computer:三个入口,三种权限半径

  • Codex 里有三种调用方式,差别就是「让它碰多大一块地盘」:@browser 拉起 Codex 自带的侧边内置浏览器窗口(一个干净的沙盒浏览器);@chrome 通过扩展去操作你真实的那个 Chrome(因此带着你的登录态、cookie、购物车);@computer 则是接管整台电脑,鼠标键盘、任何 App 都能碰。→ 详细
  • 她的选择逻辑完全是登录态在哪就用哪个,这是很实用的一条判断规则:做 QA 时用 @browser,「因为我在旁边这个浏览器里已经登录了本地的 localhost」;买衣服时切到 @chrome,因为得用她自己 Free People 账号里的真实购物车。→ 详细
  • @browser 的一个隐性好处是可观测:「这个小浏览器窗口会自己弹出来,实时展示它在干什么。我觉得这是 Codex 特别酷的一点——它会把自己浏览的过程直接放给你看。」你不用盯,但随时能瞟一眼确认它没跑偏。→ 详细
  • 还有一条被她当兜底策略用的心得:当 MCP(Model Context Protocol,一种让 AI 调用外部工具/服务的标准接口)或插件跑不通、卡在权限上时,直接退回浏览器——「只要你的权限设置足够宽松,你就可以直接说:『你就打开我的浏览器,在浏览器里做吧。』它会做得非常非常漂亮。」换句话说,browser use 是所有集成方案的最后一道保底通路:没有 API 的地方,还有网页。→ 详细
04

builder 用例一:一句话让 agent 跑完整个 onboarding QA

  • 场景是把 browser use 和 coding agent(写代码的 AI 助手)配起来验证改动:屏幕上是 ChatPRD 的 onboarding 流程(新用户第一次进产品、一步步填资料建档案的那几屏),假设她刚对这块做了优化,想确认功能都没问题。→ 详细
  • 她点出了传统测试答不上来的那个问题:「我可以写一个 AI 最爱写的 smoke test(冒烟测试,最基础的『能不能跑起来』检查)。后端我肯定能测,前端我也能写测试。但我真正想知道的是:它好用吗?真的能用吗?」——自动化测试验的是「有没有报错」,browser use 验的是「一个真人走这一遍舒不舒服」。→ 详细
  • 她给的完整 prompt 只有两句话:「请测试一下这个 onboarding 流程的易用性和移动端响应式表现,过程中随时截图,并把发现的问题整理到一个 Google 表格里。」注意这句 prompt 里塞了三样东西——测试对象、测试维度、产出物形态。产出物形态是关键,后面第 7 节会看到它带来的复利。→ 详细
  • 提交之后 Codex 会调起内置的 browser skill,屏幕上出现一个发光的小光标自己跑到浏览器里,一步步走完 onboarding。她说的价值点很朴素:「这本来就是我自己测的方式——我会一路点过去,把所有下拉框都点一遍,再改改视口尺寸。browser use 在这种场景下最爽的一点,就是这些全都能自动完成,我往后一靠看着它跑就行。」→ 详细
05

穷举 vs happy path:AI 真正的优势是它愿意去测失败路径

  • 她对 QA 用例的核心评价只有一个词——穷举:「我特别喜欢把 browser use 用在 QA 上,是因为它比我这个人类要更穷举、更有条理。」→ 详细
  • 紧接着是一段非常诚实的自白,讲人类 QA 的默认失败模式,也就是只走 happy path(顺利路径,即一切按预期填对、点对的那条理想路线):「反正我自己做 QA 的时候,特别容易只走 happy path,就是那种:好,表单该填的我都填了,必填项都填了,点下一步,我不会累,也不会往回退。」→ 详细
  • 而 agent 的穷举清单是这样的:「它会测以团队身份注册,也会测以个人身份注册,会去填各种表单字段,还会故意去触发报错状态。」她补了一句为什么人做不到:「这些事情,换成你自己来,多半是没那个耐心、也没那个条理去一条条做的——尤其像我这样,下午写完一堆代码之后被要求手动测一遍 web app,谁受得了。」→ 详细
  • 最有说服力的一段是它真的抓到了一个陈年 bug,来龙去脉完整:「说起来有点不好意思,因为这个 onboarding 流程已经上线挺久了。它发现了一个 blocking 级别的问题:如果你在这一页什么都不选,照样能点『继续』,但页面不会往下走——因为其中有个字段是必填的,可代码里压根没写校验。」而这个 bug 长期存活的原因,正是上一条那个失败模式:「就是因为我每次都是以真人的身份来测,而我每次都会去点那些该点的必选项。」→ 详细
  • 由此得出的一句话结论,值得单独记:「让 AI 来测流程的好处就在这儿:它会把失败路径和成功路径都测一遍,能真的挖出你压根没想到的边缘 case。」人类测的是「我知道它该怎么用」,AI 测的是「它还能被怎么用坏」。→ 详细
06

移动端与响应式:它自己改视口,还会去看 accessibility 和触控区域

  • 她在同一条 prompt 里顺带要了响应式检查,跑起来没多久就看见浏览器右侧有异常,但她给了一个很诚实的悬置判断:「我挺好奇这到底是 Codex 里这个响应式浏览器本身渲染出来的假象,还是我响应式设计真的有 bug。」——用工具跑出来的结论仍然需要人复核,工具本身也可能是噪声源。→ 详细
  • 视口切换是它自己安排的,不用你指定:「它在改视口的尺寸,也就是把显示器尺寸调成笔记本那么大,接下来还会调成手机大小,这些它都会试一遍。」viewport(视口)就是网页可见区域的宽高,改它等于模拟不同尺寸的屏幕。→ 详细
  • 对照组还是她自己:「这种事我自己一般也就是草草扫一眼——把浏览器窗口拉小,随便点一点,确认能用就行了。」→ 详细
  • 而 agent 的移动端检查项列得很专业:accessibility(无障碍,即屏幕阅读器、色彩对比这类让残障用户也能用的设计)、内容溢出(文字/图片超出屏幕被切掉)、touch targets(触控区域,即按钮在手机上是不是大到手指点得中)。她的总结是:「它对『什么才算像样的移动端测试』有一套非常有条理的认知。」——这句话的分量在于:它不只是执行力强,它还带着一份你可能没有的检查清单。→ 详细
07

产出物即工单:11 个问题的表格 + 截图 + 交给 sub agents 去修

  • 跑完的结果是硬数字:一共 11 个问题,其中 1 个是高严重级别的导航阻塞(就是上一节那个「点继续走不动」的 bug)。→ 详细
  • 接下来是她整套工作流里最关键的一步,也是她「最爱让 AI 干的事之一」:让它把结果落成一份排好优先级的 Google Sheet,然后「拿这份 Google Sheet 当 tracker(跟踪表),用 sub agents(子智能体,即主 agent 派出去干具体活的分身)批量启动修复、跟踪进度」。也就是说,QA 的输出直接变成了下一段自动化的输入——发现问题和修问题被串成了一条闭环,而不是各自孤立的两次对话。→ 详细
  • 表格里到底存了什么,她讲得很具体,而且点破了为什么这个格式重要:每条问题都带 viewport、问题是什么、复现步骤、以及该怎么修——「这对 agent 来说特别有用,因为复现问题需要的信息全在里面。」这是把「给人看的 bug 报告」升级成了「给机器执行的工单」。→ 详细
  • 最后一个细节容易被忽略但很值钱:截图被直接塞进了表格里——「我可以随时对照,甚至拿来跟修完之后的效果做对比。」等于免费得到了一套修复前的基线快照(baseline),验收时不用再靠记忆比对。→ 详细
08

反直觉操作要点:对前沿模型「少写 prompt」反而更好

  • 她先说了一个更规整的做法作为铺垫:「我大概会先让它基于代码整理出一整套测试用例,然后按着这些用例一条条跑,这样我心里更有底,知道它确实覆盖全了。」——先出 test suite(测试用例集)再执行,是把「它到底测没测全」这件事变得可验证。→ 详细
  • 但紧接着她插了一条跟上面几乎相反的心得,而且是全片最反直觉的一句:「我发现对这些模型来说,prompt 写得少反而比写得多效果更好。」→ 详细
  • 具体到可以直接照抄的对比:「因为它们本身足够聪明,你就直接说一句『QA 一下 onboarding 流程』,效果会比你列『把 onboarding 里这 25 项都测一遍』好得多。所以给你个小 tip:对前沿模型要少写 prompt,让它自己动脑子定计划,想怎么干就怎么干。」道理其实和上一节是一致的——你列的那 25 项,恰恰是你自己脑子里已有的清单,而你最需要它发现的,正是不在这份清单上的东西。你写得越死,它越只能还给你你已经知道的。→ 详细
09

builder 用例二:让 agent 扮成三个 persona 去真用一遍产品

  • 这个用法的功劳她明确记给了她老公——「这个功劳得记在他头上,我老公 EJ Lawless」:他会用 Browser Use 去扮演自己产品里某个具体的 persona(用户画像,即把一类典型用户拟人化成一个有身份、有目标、有处境的虚构人物),然后以那个 persona 的口吻给反馈→ 详细
  • 她当场用 Monologue(一个语音转文字的输入工具)口述了三个 persona:①一个刚开完会的产品经理,要赶紧给某功能写一份 PRD;②一个工程师,拿着这份已写好的 PRD 把它变成技术方案、最后做出原型;③一个团队负责人,想搞清楚自己团队到底是怎么用 ChatPRD 的。→ 详细
  • 最关键的是收尾那半句约束和产出要求:「**我就给你这么多指示,别的一概不说。**你把这三个 persona 的用例和流程各走一遍,然后写一份文档,用做用户研究的口吻点评整体体验,包括哪里有摩擦、哪里让人惊喜,以及你觉得我们可以怎么改进,才能更好地服务这三类用户。」——「摩擦点 / 惊喜点 / 改进建议」这三栏就是一份现成的研究提纲,可以整段抄走。→ 详细
  • 她对这套方法的定位很克制,也很有分寸感:「我本人其实不太吃 synthetic user(合成用户,即用 AI 假装成用户来代替真实用户访谈)那一套,但这个框架我还挺喜欢。」区别在于——她不是拿 AI 编造用户的观点,而是让 AI 带着一个身份真的把产品用一遍,反馈来自实际操作而不是想象。她还点出了它的历史连续性:「我们以前写 prompt 不也老这么干嘛——『你是一个天才产品经理』『你是全世界最厉害的软件工程师』。现在我还是这一套,只不过配上了 browser use。」→ 详细
  • 执行细节值得一提:agent 会自己编出合理的输入来推进流程。走 PM 路径时它自造了一段假 prompt:「我刚开完一个客户设计会,是关于 ChatPRD 里的 decision digest 功能。这些是我们遇到的问题,这是我大概想要的东西,这里还有几个待定问题。」然后盯着 ChatPRD 生成文档——她当时的悬念是「我特别好奇它到底会不会去分析文档本身的质量」。→ 详细
10

persona 走查真正挖出了什么:一个结构性断点和一个失败态体验问题

  • 她先夸了过程本身的价值:「browser use 这种把内部思考过程摊开给你看的感觉,我真的很喜欢」——你看到的不只是结论,还有它一路上是怎么想的、在哪一步卡住的。→ 详细
  • 第一个发现是结构性的,而且是真问题:在「PM 把 PRD 交接给工程师」这一步,它报出「工程师这次接手暴露出一个结构性断点」——「你能创建一个文档,但没法在另一个会话里 @ 提及或者引用它」。她当场承认这在 ChatPRD 里确实存在,团队正在琢磨怎么做引用。有意思的是成因:「很明显这个 agent 推理下来以为这个功能应该是另一种运作方式」——agent 的预期和产品的实现不一致,这个落差本身就是一条产品反馈→ 详细
  • 她给了这类价值一个很准的名字——「新鲜眼睛」:「你会开始真正代入某个 persona 或者某类用户的心态,然后发现那些其实特别明显、但你自己怎么都绕不过弯来的摩擦点——就是那种『新鲜眼睛』才看得见的东西。当然这次是 agent 的眼睛,不好意思,我实在想不出更好的比喻了。」老团队的诅咒就是你太熟了,所以看不见;而 agent 每次都是第一次用。→ 详细
  • 第二个发现关于失败态的体验:工程师 persona 指出「加载页面特别慢,而且一片空白,界面在生成内容的时候完全没让人搞清楚到底在发生什么」。她怀疑当时可能是本地环境报了个错,但对反馈本身评价很高:「这个反馈对我来说特别有价值,因为我希望哪怕是失败状态,对用户来说也得是『说得通』的。」→ 详细
  • 她的整段总结可以当成方法卡片收着:「设定一个 persona,让它钻进你用户的脑子里——在这个场景下甚至可以说是钻进用户的身体里——然后用 browser use 走一遍你的网站,最后给你一份报告,告诉你哪儿好用、哪儿不好用。」(「钻进身体」这个说法不是修辞:它真的在动手点。)→ 详细
11

productivity 用例:LinkedIn 未读消息批量处理

  • 她的 prompt 是一套完整的分诊规则:「请用浏览器帮我过一遍最近的未读消息,把特别要紧的都回掉。跟 ChatPRD 或者播客有关的优先处理,其余的就在这儿给我留个备注,说明我该怎么回。如果只是普通的道谢消息,客气地回一句就行。」——重点是它分了三档:直接回、留备注等你决定、模板式客气回。→ 详细
  • 规模决定了必要性:「我这一天能收到好几百条。」而且这里没有别的路可走——「LinkedIn 没有官方的 MCP,也没有官方 API,所以我们这儿算是走了非官方渠道」,browser use 正是给没有接口的系统补接口→ 详细
  • 顺手一条成本心得:她这次用的是 GPT 5.6 的 high effort(高推理强度档,模型想得更久更细但更慢更贵),事后自评「其实换成 medium effort 大概就够用了,速度还会快很多……回 LinkedIn 消息我这明显是杀鸡用牛刀了」。结论是:「你完全可以按自己的需要,去调 Browser Use 的 effort 等级和智能水平。」→ 详细
  • 演示中的真实一条:Christie 是她的朋友兼前同事,消息内容是想让她跟对方 CEO 聊聊;agent 回了消息,然后继续去过未读、筛选。→ 详细
12

personal fun 用例:让它去 Free People 打折区挑满 10 件

  • prompt 里塞进了一堆只有本人才知道的约束,这正是它比筛选器强的地方:「我这周末要去夏威夷,得添几件新衣服。好消息!Free People 的打折区现在还有额外 25% off。麻烦你用 Chrome browser use 逛一逛,挑 10 件我尺码的……尺码选 M 就行。记住,我还在哺乳期,6 个月前刚生完孩子。所以挑那种穿着舒服、方便哺乳、而且适合 7 月底夏威夷天气的。我要的结果是:购物车里躺着 10 件,我可以从里面挑着买。」(外加一句「记得对你的 AI 说声谢谢」。)→ 详细
  • 它复述的任务理解相当准确:用 Chrome 挑 10 件 M 码、参与打折、透气舒适、方便哺乳的单品,加进购物车但不下单——保留最后拍板权给人,这是这类代理任务里很关键的一条止损线。→ 详细
  • 中途翻过车:「我明明说了自己是刚生完孩子没多久的妈妈,它却挑了一条超短裙」,她当场吐槽「咱们就看看 5.6 的时尚品味到底怎么样吧,有待观察」。→ 详细
  • 最终结果她验收得很满意:购物车里 10 件打折商品,全 M 码,算上额外 25%、税前一共 352 美元——一条长裙、一套裙装、宽松阔腿裤、短裤、一件背心(「太完美了」)、一件衬衫、两件开襟衬衫、一件小 V 领。→ 详细
  • 她的验收结论是「它做得真的非常非常好」,全片的收束也落在这条弧线上:「这期从把 browser use 当调试工具开始,最后落到把 browser use 当私人采购。」同一个能力,两端跨度极大。→ 详细
13

CAPTCHA 挡路,与「人机反转」

  • 购物跑到一半弹出人机验证,她的反应是全片最好笑也最有洞察的一句:「哎哟,不妙。你看,它认为我是个 agent——我确实是,抱歉了。」→ 详细
  • 由此引出她常讲的一个观念,值得记住:「有时候你得给你的 AI 当那双手。我经常跟别人讲:有时候是我们让 AI 干活,有时候反过来,是 AI 让我们干活。」她给自己的角色起了个名字——「我就是套在 ChatGPT browser use 外面的那层『人工验证』」。也就是说,人不是被完全替掉,而是被挪到了流程里机器过不去的那几个关卡上。→ 详细
14

三个零散但高频的额外用法

  • 填烦人的表单:采购流程表单、给孩子报夏令营、在古董级老网站上填一堆字段——「browser use 和 computer use 简直是救命」。→ 详细
  • 用 computer use 操作你的手机(这条最惊艳,且案例完整):Mac 上有个 iPhone 镜像功能,可以把手机界面投到电脑屏幕上,而 computer use 能操作这个镜像窗口——「所以严格来说,你的电脑可以替你用手机」。真实案例是:她人在外地,几台 Mac mini 摆在加州家里,需要远程 SSH(安全远程登录)进那几台 MacBook 去改上面跑着的 OpenClaw,但它们不在同一网络,而管理 Wi-Fi 的 App 只装在手机上。于是她打开 Codex + iPhone 镜像,让 computer use「去把家里 Wi-Fi 的设置改好、更新路由器、SSH 进我的 MacBook,弄完之后再把那些端口全部关上」。评价:「真的挺惊艳的,效果非常好。」(注意最后那句「再把端口关上」——她把安全收尾也写进了指令里。)→ 详细
  • 用 computer use 做 Google 文档和 Sheets:当 Codex 里的 MCP 和插件跑出来的结果不理想、或者卡在权限上,就直接让它开浏览器手动做——见第 3 节那条兜底策略。→ 详细
15

三个现实代价:慢、走非官方渠道、隐私安全悬而未决

  • 是她主动承认的头号缺点:「说实话 browser use 有个缺点就是慢。所以它跑的时候,我一般会在旁边开着别的东西,一边等它跑一边干点别的活。」——正确的用法是异步:发起任务、去干别的、回来收结果,而不是盯着看。→ 详细
  • 非官方渠道:LinkedIn 那类用例本质上是绕过平台没提供 API 的限制,她自己说得很直白「算是走了非官方渠道」——好用,但要知道自己站在哪儿。→ 详细
  • 隐私与安全她没有回答,而是留成了开放问题抛给观众:「你对隐私有什么疑问,对安全有什么疑问……欢迎在评论区告诉我。」考虑到这项能力的前提是把登录态、键盘鼠标、甚至整台电脑交出去,这是本片最大的一处留白。→ 详细
16

「Everything is computer」:目标是人不在电脑前,事照样办完

  • 她的收尾判断是一句口号式的话:「Everything is computer(万物皆电脑),我真心觉得这会改变我们跟数字生活打交道的方式。」→ 详细
  • 而她对 AI 的整体目标定义得非常清楚,也解释了她为什么偏爱这类功能胜过聊天:「我用 AI 的大目标就是:我人可以不在电脑前,但事情照样能办完。这样我才能安心享受我的夏威夷假期。」——注意这跟第 1 节 Jessie Janes 那句「妈妈的手闲不下来」是首尾呼应的:一个是解放嘴,一个是解放手。→ 详细

本片是 Claire Vo 的单人迷你剧集,没有嘉宾也没有 lightning round。收尾要点:

  • 号召观众在评论区分享自己怎么用 computer use / browser use,以及关于隐私安全的疑问,还有想看的其他「How I AI」选题。→ 详细

  • 赞助一:Runway(一站式图片/视频/内容生成平台,客户含 Microsoft、Robinhood、Amazon、Adobe,以及 Lionsgate、Legendary 等影视公司;runwayml.com/howiai,优惠码 howiai)。→ 详细

  • 赞助二:HyperAgent(部署常驻 agent 并投放到 Slack/Telegram/邮箱的平台,由 Airtable 原班人马打造,How I AI 听众可领 1000 美元免费推理额度;hyperagent.com/howiai)。→ 详细

  • 播客与全部往期节目:howiaipod.com;也可在 Apple Podcasts、Spotify 或常用播客 App 收听。→ 详细

  • 主持人:Claire Vo(How I AI 主持人、ChatPRD 创始人);本期 persona 用例的点子来自她先生 EJ Lawless→ 详细

🎯 于你何益 为你定制 · 非通用结论

先说相关度:这期是近期少见的高命中。 它讲的不是"AI 又多会一个技能",而是一个你每天都在解决的问题——怎么让 agent 真的碰到有登录态的真实系统,并且把它干完的活变成下一段自动化的输入。你的 app_incubator 本来就挂着 Chrome 这条线,你的 PRD 工厂正卡在"碰撞纪律难落地、产出缺闭环证据",你的一人公司账号正缺"大佬说 X 我试了"的验证体——这三处它都是正面撞上。唯一真沾不上的是 StockHelp 的投资逻辑本身(这期零投资内容),我放在最后一条里说清楚,不硬掰。

app_incubator:你缺的不是 Chrome 这个通道,是"让 agent 去当用户"这个动作

1. 把"该做什么"前移到 agent,靠的是让它扮成用户走一遍,不是问它意见

  • 怎么做的:这个玩法的功劳 Claire 明确记给了她老公 EJ Lawless——让 agent 扮成产品里一个具体角色,然后以那个角色的身份把产品真用一遍。她当场口述了三个:刚开完会要赶紧写 PRD 的产品经理、拿着写好的 PRD 要变成技术方案的工程师、想搞清楚团队到底怎么用的负责人。收尾那半句约束是精髓——「我就给你这么多指示,别的一概不说」,然后要一份用户研究口吻的文档,分「哪里有摩擦 / 哪里让人惊喜 / 你觉得可以怎么改进」三栏。→ 详细 她还特意划了条线:她本人不吃"用 AI 假装成用户"那一套,但这个框架她认——区别在于反馈来自实际动手操作,不是凭空想象→ 详细
  • 你可以怎么做:你的痛点写着"激活 / 首屏体验"和"把该做什么前移到 agent",这两条其实是一件事的两头。你的造 App 链路每次吐出的第一个能跑的版本,现在是谁在验收?加一个角色进去:造完就派一个 agent 带三个身份(第一次听说这个 App 的人 / 冲着某个具体功能来的人 / 用了三天想放弃的人)各走一遍首屏,按摩擦-惊喜-改进三栏出报告。这周就能做的一件事:把这三栏和那句"我就给你这么多指示"直接固化成链路里的一个环节,提纲不用你自己再设计一遍。

2. agent 的预期和产品实现对不上,这个落差本身就是需求

  • 怎么做的:这套走查真挖出了东西。在"产品经理把 PRD 交接给工程师"那一步,它报出一个「结构性断点」——你能创建一个文档,但没法在另一个会话里提及或引用它。Claire 当场承认确实存在,团队正在琢磨。成因很有意思:"很明显这个 agent 推理下来以为这个功能应该是另一种运作方式"。→ 详细 另一条是失败态:工程师身份那一遍抱怨"加载特别慢、一片空白、完全没让人搞清楚到底在发生什么",她的评价是"我希望哪怕是失败状态,对用户来说也得是说得通的"。→ 详细
  • 你可以怎么做:这两类问题正好卡在你 app_incubator 最薄的地方。你造出来的第一版几乎必然带着"能生成但引用不了""在加载但不告诉你"这种断点——它们不报错,所以任何自动化测试都测不出来,只有真去用的人才撞得到。动作:验收清单里加两个固定问题——「有没有哪一步你以为该这样、实际不是这样?」「所有等待和失败的状态,用户看得懂吗?」把 agent 的误解当产品反馈收下来,而不是当它笨。

3. "登录态在哪就用哪个入口",以及那条兜底策略

  • 怎么做的:三个入口的差别就是让它碰多大一块地盘:干净的沙盒浏览器 / 接管你真实的 Chrome(带着你的登录态和购物车)/ 接管整台电脑。她的选择逻辑一句话——登录态在哪就用哪个:做验收用沙盒那个,因为她已经在那儿登了本地环境;买衣服切到真 Chrome,因为要用自己账号里的真实购物车。→ 详细 还有一条被她当兜底用的心得:当外部工具接口或插件跑不通、卡在权限上,直接退回浏览器手动做——"它会做得非常非常漂亮"。→ 详细
  • 你可以怎么做:你的链路里挂着好几个外部工具通道,最脆的环节永远是权限和授权。把这条兜底写成明文规则:接口跑不通时不要停下来查文档,先让它开浏览器手动做完这一步,先拿到结果,回头再修接口。省下的是你自己排查的那半天——对精力是元约束的人,这条比什么都值钱。

Codex Holdwell ERP work:把"产出物形态"写进任务,你的评审就自动长出牙齿

1. 一句指令里塞三样东西:测什么、测哪些维度、产出成什么形状

  • 怎么做的:她给的完整指令只有两句:「测一下这个 onboarding 流程的易用性和移动端响应式表现,过程中随时截图,并把发现的问题整理到一个 Google 表格里」。→ 详细 跑完是硬数字:11 个问题、其中 1 个高严重级别的导航阻塞。→ 详细 关键在下一步——表格里每条都带视口尺寸、问题是什么、复现步骤、该怎么修,她的原话是"这对 agent 来说特别有用,因为复现问题需要的信息全在里面";截图也被直接塞进表格。→ 详细 然后她拿这张表当跟踪表,派子 agent 批量启动修复、跟踪进度——发现问题和修问题被串成一条闭环,而不是各自孤立的两次对话。→ 详细
  • 你可以怎么做:你那两个痛点——"碰撞纪律难落地"和"agent 产出缺可验证闭环"——在这里是同一个解法,而且方向不是加更多关卡。评审之所以容易走过场,是因为它的产出是给人读的意见,而不是给下一个 agent 直接领走的工单。 把评审环节的输出格式改死:每条问题必须带「在哪一步 / 什么现象 / 怎么复现 / 建议怎么改 / 严重级别」,全部落进一张表。这张表同时就是闭环证据(谁提的、改没改、什么时候关的),也是下一段自动化的输入。这周一件事:挑一单正在跑的需求,把真人评审的意见换成这张表,看回炉修复能不能直接由 agent 领走——能领走,你的评审就有牙齿了。

2. 截图就是白得的基线快照

  • 怎么做的:一个容易被忽略但很值钱的细节——截图进了表格之后,她说"我可以随时对照,甚至拿来跟修完之后的效果做对比"。→ 详细 等于免费得到一套修复前的基线。
  • 你可以怎么做:你的工厂缺的正是"证明它确实变好了"的证据。改动前后各留一组截图,验收时不靠记忆、不靠口头确认。这条便宜到没有不做的理由。

3. 它愿意去测失败路径,而你和你的团队都只走顺利路径

  • 怎么做的:她对这个用法的核心评价只有一个词——穷举,配了一段很诚实的自白:人做验收天然只走顺利那条路,该填的都填了,必填项都填了,点下一步,不会累也不会往回退。→ 详细 而 agent 会以团队身份注册一遍、以个人身份再注册一遍、填各种字段、故意去触发报错状态→ 详细 结果就是抓到了一个上线很久的阻塞级 bug:这一页什么都不选也能点"继续",但页面不往下走,因为有个必填字段代码里压根没写校验。她说这个 bug 活这么久的原因是"我每次都是以真人的身份来测,而我每次都会去点那些该点的必选项"。→ 详细 一句话结论:它会把失败路径和成功路径都测一遍→ 详细
  • 你可以怎么做:ERP 是重表单、重必填、重权限的系统,这类"填错了会怎样"的洞比消费级产品多一个数量级,而你的验收多半也是走顺利路径。动作:给评审加一个专职角色,任务只有一句——"想办法把这个功能用坏":空提交、超长输入、权限不够的账号、中途退出再回来、两个人同时改同一条。这个角色不需要懂业务,正因为不懂才有用

onehuman_company:这期至少是两篇验证体的弹药

1. "对前沿模型少写 prompt 反而更好"——这就是一道现成的验证题

  • 怎么做的:她先说了个更规整的做法当铺垫(先让它基于代码整理出一整套测试用例,再按着一条条跑,心里更有底)→ 详细,紧接着插了句几乎相反的心得,是全片最反直觉的一句:「我发现对这些模型来说,prompt 写得少反而比写得多效果更好」。可以直接照抄的对比是:直接说一句"QA 一下 onboarding 流程",效果比你列"把 onboarding 里这 25 项都测一遍"好得多。→ 详细 理由很扎心——你列的那 25 项,恰恰是你脑子里已经有的清单;而你最需要它发现的,正是不在这份清单上的东西。
  • 你可以怎么做:这条能不能过你的弹药库闸门?能——删掉你的判断和实测它就不成立了。选题形状:拿你多角色流水线里随便一个成熟环节的长 prompt,做一次 A/B——一版照旧、一版只留一句话的任务描述,同一个输入各跑三次,比产出。篇名方向:《Claire Vo 说给前沿模型少写 prompt 更好,我拿自己的多角色流水线跑了三轮》。它一箭三雕:既补上 Phase 0 存稿期缺的验证体,又真的在检验你自己方法论的假设,还天然带"可抄物"(两版 prompt 全文可以直接放出来给人抄)。这是我建议你这周动手的那件事。

2. AI 员工的成本账,她当场给了个可复用的判断

  • 怎么做的:处理 LinkedIn 消息她用的是高推理强度档,事后自评"其实换成中档大概就够用了,速度还会快很多……回 LinkedIn 消息我这明显是杀鸡用牛刀了",结论是"你完全可以按自己的需要去调 effort 等级和智能水平"。→ 详细 另一条相关的:这类能力最大的缺点是,她的应对是异步——发起任务、在旁边干别的、回来收结果,而不是盯着看。→ 详细
  • 你可以怎么做:你那本"AI 员工管理成本账"的支柱缺的就是具体数字。动作:挑一个你每周都跑的任务(一次评审,或一次选题挖掘),分别用最强档和中档各跑一次,记下耗时、花费、返工次数三个数。这就是一篇有真数字的成本账,而且是你自己的数字——别人抄不走,天然过闸门。

3. 「没有接口的地方还有网页」,这句判断本身够撑一篇观点短评

  • 怎么做的:LinkedIn 那个用例她说得很直白——"LinkedIn 没有官方的外部接口,也没有官方 API,所以我们这儿算是走了非官方渠道"。→ 详细 她那套分诊指令也很值得抄,分三档:要紧的直接回、次要的留个备注等我决定、纯道谢的客气回一句→ 详细
  • 你可以怎么做:这是一句能撑起一篇短评的判断——"所有集成方案的最后一道保底通路不是 API,是浏览器"。对一人公司尤其成立:你不可能等每个平台都来给你开接口。至于那套三档分诊,直接能搬到你自己的私信、评论、邮件上,还顺便变成一条"我怎么管我的输入"的实操内容。

xiaohongshu_momorain:档案盘了 16/218,这正是"没有接口"的典型场景

  • 怎么做的:LinkedIn 那条的本质是——在一个不给你接口的平台上做批量操作,靠的就是浏览器→ 详细 而这套能力的另一半价值是它自带一份你可能没有的检查清单:她只说了"移动端响应式",agent 自己去查了无障碍、内容溢出、触控区域,她的评价是"它对什么才算像样的移动端测试,有一套非常有条理的认知"。→ 详细
  • 你可以怎么做:你的 218 篇档案只盘了 16 篇,卡住的多半不是时间,而是"一篇一篇手动看"这个动作本身太贵。动作:用带登录态的浏览器入口跑一轮批量盘点——每篇抓标题、封面文案、互动数、发布时间,落成一张表,再让它按你的内容支柱给每篇打标。关键是别把维度列死:先只说"帮我盘一遍这些笔记,你觉得哪些维度值得记就记哪些",看它自己想到什么,再补你的——这正好是上面那条少写 prompt 的现场应用。你那个空着没跑的指标盘,第一版数据也能用同样的方式先灌起来:先有数据再谈自动化,别等接口

StockHelp:这期跟投资本身零关系,只有一条工程上的沾边——而且我劝你别用

  • 怎么做的:这类浏览器操作确实能补"没有接口的数据源",但她自己承认了两条硬伤:→ 详细,以及跑出来的结论仍需人复核(响应式那处异常,她自己都说不确定是浏览器渲染出来的假象还是真 bug)。→ 详细
  • 你可以怎么做拿它当你收盘后拉数据的主通路。看板要的是每天准点、可重复、错了能查,浏览器操作恰好三样都不占。它在这里唯一合理的位置是一次性探路:某个新指标你还不确定值不值得进看板,先用它手动抓几次看看,验证有用了再去接正经数据源。这期没有任何关于估值、生意质量、资本配置的内容,别在这条上多花时间。

更深三角度

该反着用

她说慢没关系,"它跑的时候我一般会在旁边开着别的东西,一边等它跑一边干点别的活"。→ 详细 这话在她的语境里成立,因为她的"别的活"就在同一个项目里,切换成本接近零。你不一样:你的"干点别的"通常意味着从正职切到副业、从副业切到内容号,而切换本身就是你最贵的开销。所以对你,正确的用法不是"发起后去干别的",而是把慢从等待变成隔夜——睡前发起、第二天早上收结果。慢在你这儿不该是缺点,而该是一种排期方式。

第二处要反着用的是少写 prompt。她的做法之所以成立,是因为对象是一个网页自己会说话的消费级产品——模型看一眼就知道这是注册流程、这个按钮该干嘛。你的 ERP 是内网、行业黑话、权限矩阵,模型没有任何先验。在那儿直接照搬"少写"大概率跑偏。正确的移植是分两步:先花力气让它读你的知识库、建立起对这个域的理解,然后才在具体任务上少说话。省要省在任务层,不是省在上下文层。

和你现在做法冲突

这是这期对你最有价值的一处不舒服。你的 PRD 工厂是三驾马车、一条多段碰撞流水线、每步都有硬约定——这是把清单写死做到极致。而她的结论直指相反方向:你列的清单越全,它还给你的就越只是你已经知道的东西。→ 详细 你那碰撞三件(补强/修正/第 3 案)保证了下限(不会漏掉你在意的),但它同时也可能锁死了上限——永远发现不了清单外的第四件

第二处冲突更具体:你把"碰撞协议纪律是否真执行"列为痛点,隐含的方向是加更多关卡、加更强的守门。她走的是另一条路——不加关卡,而是让产出物本身变成机器能直接领走的工单,执行点就自己长出来了。→ 详细 约束靠格式,不靠流程。 我不替你下结论,但这两条路的长期成本差得很远,值得你专门想一次。

对你的镜子

被人机验证挡住时她说的那句:「有时候是我们让 AI 干活,有时候反过来,是 AI 让我们干活——我就是套在浏览器 agent 外面的那层『人工验证』」。→ 详细 她很清醒地把自己降级成了"只在机器过不去的关卡上出现的那个人"。

对着这面镜子问一句:在你自己那座多角色工厂里,你现在扮的是哪个角色?是那层只在关卡上出现的人工验证,还是仍然在每个环节都亲手点一遍、亲眼看一遍?你写过"判断力 > 努力""杠杆 > 工时"——那么你亲手做的那些环节,有多少是真的只有你能做的判断,有多少只是你还没舍得交出去?

第二面镜子是"新鲜眼睛"那段:老团队的诅咒就是你太熟了,所以看不见→ 详细 你的 218 篇档案只盘了 16 篇、你的指标盘空着没跑、你工厂里那些"该留痕"的环节还没留痕——这些可能都不是"没时间",而是"太熟以至于不觉得需要再看一眼"。这是单兵多线最容易掉的坑:你以为你知道现状,于是省掉了确认现状那一步。


所以呢

可迁移的思维模型

  • 【耐用】你写得越死,它越只能还给你你已经知道的。 这条远不止适用于给 AI 写 prompt——委派给人也一样。你把交付标准列到 25 条,拿回来的就是那 25 条,一条不多。真正需要对方替你发现的东西,从定义上就不在你的清单里。
  • 【耐用】把产出物形态写进任务本身。 她那句指令里最值钱的不是"测什么",而是"整理到一个表格里、过程中随时截图"。一次工作能不能成为下一次的输入,取决于它落地成什么形状——这是最便宜的一次杠杆。
  • 【耐用】没有接口的地方还有网页。 所有集成方案的最后一道保底通路。对一个人扛多线的你,这条约束尤其重要:你没有资源去等平台开放。
  • 【耐用】人不是被替掉,而是被挪到机器过不去的那几个关卡上。 这是一把现成的尺子,用来判断手上哪些活该交出去、哪些必须留着。
  • 【会过期】具体的三个入口叫什么、桌面 App 加浏览器扩展怎么装、哪个模型的哪个推理档位够用——半年内一定会变,别把它们写进任何长期文档。

判断更新

你可能一直默认 agent 的瓶颈在"上下文和记忆"——它记不住、看不全。这期提示瓶颈可能已经换地方了:瓶颈是手——它够不够得着一个带着你登录态的真实系统。这一条如果成立,你评估任何 agent 方案时的第一个问题就该换成"它够不够得着",而不是"它懂不懂"。她收尾那句"我人可以不在电脑前,但事情照样能办完"→ 详细,衡量的正是这个。

这周一个赌注

做那篇少写 prompt 的实测。 挑你多角色流水线里的一个环节,把它的长 prompt 砍成一句话,同一个输入各跑三次,记录产出差异。理由是它一次打三个洞:给一人公司账号补上一篇带真数字、带可抄物的验证体;真的检验了你 PRD 工厂"清单越全越好"这个从没被验证过的假设;而且只需要一个晚上。如果结果是长 prompt 赢——那更好,你第一次有了证据,而不是只有习惯。

接着读