browser use(浏览器操作,即让 AI 直接点你浏览器里的网页)和 computer use(电脑操作,即让 AI 接管鼠标键盘、操作你整台电脑)——「也就是让 AI 直接操作你的电脑、浏览网页,替你把活儿干了」。她的判断是最近这一年这两项能力「提升得非常夸张」,尤其是在 Codex 和 GPT 5.6 系列模型上。→ 详细Codex browser extension 或 Claude browser extension,「注意认准官方的那个」)。她只用 Chrome,别的浏览器行不行没试过。→ 详细@browser 拉起 Codex 自带的侧边内置浏览器窗口(一个干净的沙盒浏览器);@chrome 通过扩展去操作你真实的那个 Chrome(因此带着你的登录态、cookie、购物车);@computer 则是接管整台电脑,鼠标键盘、任何 App 都能碰。→ 详细@browser,「因为我在旁边这个浏览器里已经登录了本地的 localhost」;买衣服时切到 @chrome,因为得用她自己 Free People 账号里的真实购物车。→ 详细@browser 的一个隐性好处是可观测:「这个小浏览器窗口会自己弹出来,实时展示它在干什么。我觉得这是 Codex 特别酷的一点——它会把自己浏览的过程直接放给你看。」你不用盯,但随时能瞟一眼确认它没跑偏。→ 详细MCP(Model Context Protocol,一种让 AI 调用外部工具/服务的标准接口)或插件跑不通、卡在权限上时,直接退回浏览器——「只要你的权限设置足够宽松,你就可以直接说:『你就打开我的浏览器,在浏览器里做吧。』它会做得非常非常漂亮。」换句话说,browser use 是所有集成方案的最后一道保底通路:没有 API 的地方,还有网页。→ 详细browser skill,屏幕上出现一个发光的小光标自己跑到浏览器里,一步步走完 onboarding。她说的价值点很朴素:「这本来就是我自己测的方式——我会一路点过去,把所有下拉框都点一遍,再改改视口尺寸。browser use 在这种场景下最爽的一点,就是这些全都能自动完成,我往后一靠看着它跑就行。」→ 详细happy path(顺利路径,即一切按预期填对、点对的那条理想路线):「反正我自己做 QA 的时候,特别容易只走 happy path,就是那种:好,表单该填的我都填了,必填项都填了,点下一步,我不会累,也不会往回退。」→ 详细viewport(视口)就是网页可见区域的宽高,改它等于模拟不同尺寸的屏幕。→ 详细accessibility(无障碍,即屏幕阅读器、色彩对比这类让残障用户也能用的设计)、内容溢出(文字/图片超出屏幕被切掉)、touch targets(触控区域,即按钮在手机上是不是大到手指点得中)。她的总结是:「它对『什么才算像样的移动端测试』有一套非常有条理的认知。」——这句话的分量在于:它不只是执行力强,它还带着一份你可能没有的检查清单。→ 详细sub agents(子智能体,即主 agent 派出去干具体活的分身)批量启动修复、跟踪进度」。也就是说,QA 的输出直接变成了下一段自动化的输入——发现问题和修问题被串成了一条闭环,而不是各自孤立的两次对话。→ 详细viewport、问题是什么、复现步骤、以及该怎么修——「这对 agent 来说特别有用,因为复现问题需要的信息全在里面。」这是把「给人看的 bug 报告」升级成了「给机器执行的工单」。→ 详细persona(用户画像,即把一类典型用户拟人化成一个有身份、有目标、有处境的虚构人物),然后以那个 persona 的口吻给反馈。→ 详细synthetic user(合成用户,即用 AI 假装成用户来代替真实用户访谈)那一套,但这个框架我还挺喜欢。」区别在于——她不是拿 AI 编造用户的观点,而是让 AI 带着一个身份真的把产品用一遍,反馈来自实际操作而不是想象。她还点出了它的历史连续性:「我们以前写 prompt 不也老这么干嘛——『你是一个天才产品经理』『你是全世界最厉害的软件工程师』。现在我还是这一套,只不过配上了 browser use。」→ 详细high effort(高推理强度档,模型想得更久更细但更慢更贵),事后自评「其实换成 medium effort 大概就够用了,速度还会快很多……回 LinkedIn 消息我这明显是杀鸡用牛刀了」。结论是:「你完全可以按自己的需要,去调 Browser Use 的 effort 等级和智能水平。」→ 详细iPhone 镜像功能,可以把手机界面投到电脑屏幕上,而 computer use 能操作这个镜像窗口——「所以严格来说,你的电脑可以替你用手机」。真实案例是:她人在外地,几台 Mac mini 摆在加州家里,需要远程 SSH(安全远程登录)进那几台 MacBook 去改上面跑着的 OpenClaw,但它们不在同一网络,而管理 Wi-Fi 的 App 只装在手机上。于是她打开 Codex + iPhone 镜像,让 computer use「去把家里 Wi-Fi 的设置改好、更新路由器、SSH 进我的 MacBook,弄完之后再把那些端口全部关上」。评价:「真的挺惊艳的,效果非常好。」(注意最后那句「再把端口关上」——她把安全收尾也写进了指令里。)→ 详细本片是 Claire Vo 的单人迷你剧集,没有嘉宾也没有 lightning round。收尾要点:
号召观众在评论区分享自己怎么用 computer use / browser use,以及关于隐私和安全的疑问,还有想看的其他「How I AI」选题。→ 详细
赞助一:Runway(一站式图片/视频/内容生成平台,客户含 Microsoft、Robinhood、Amazon、Adobe,以及 Lionsgate、Legendary 等影视公司;runwayml.com/howiai,优惠码 howiai)。→ 详细
赞助二:HyperAgent(部署常驻 agent 并投放到 Slack/Telegram/邮箱的平台,由 Airtable 原班人马打造,How I AI 听众可领 1000 美元免费推理额度;hyperagent.com/howiai)。→ 详细
播客与全部往期节目:howiaipod.com;也可在 Apple Podcasts、Spotify 或常用播客 App 收听。→ 详细
主持人:Claire Vo(How I AI 主持人、ChatPRD 创始人);本期 persona 用例的点子来自她先生 EJ Lawless。→ 详细
先说相关度:这期是近期少见的高命中。 它讲的不是"AI 又多会一个技能",而是一个你每天都在解决的问题——怎么让 agent 真的碰到有登录态的真实系统,并且把它干完的活变成下一段自动化的输入。你的 app_incubator 本来就挂着 Chrome 这条线,你的 PRD 工厂正卡在"碰撞纪律难落地、产出缺闭环证据",你的一人公司账号正缺"大佬说 X 我试了"的验证体——这三处它都是正面撞上。唯一真沾不上的是 StockHelp 的投资逻辑本身(这期零投资内容),我放在最后一条里说清楚,不硬掰。
1. 把"该做什么"前移到 agent,靠的是让它扮成用户走一遍,不是问它意见
2. agent 的预期和产品实现对不上,这个落差本身就是需求
3. "登录态在哪就用哪个入口",以及那条兜底策略
1. 一句指令里塞三样东西:测什么、测哪些维度、产出成什么形状
2. 截图就是白得的基线快照
3. 它愿意去测失败路径,而你和你的团队都只走顺利路径
1. "对前沿模型少写 prompt 反而更好"——这就是一道现成的验证题
2. AI 员工的成本账,她当场给了个可复用的判断
3. 「没有接口的地方还有网页」,这句判断本身够撑一篇观点短评
该反着用
她说慢没关系,"它跑的时候我一般会在旁边开着别的东西,一边等它跑一边干点别的活"。→ 详细 这话在她的语境里成立,因为她的"别的活"就在同一个项目里,切换成本接近零。你不一样:你的"干点别的"通常意味着从正职切到副业、从副业切到内容号,而切换本身就是你最贵的开销。所以对你,正确的用法不是"发起后去干别的",而是把慢从等待变成隔夜——睡前发起、第二天早上收结果。慢在你这儿不该是缺点,而该是一种排期方式。
第二处要反着用的是少写 prompt。她的做法之所以成立,是因为对象是一个网页自己会说话的消费级产品——模型看一眼就知道这是注册流程、这个按钮该干嘛。你的 ERP 是内网、行业黑话、权限矩阵,模型没有任何先验。在那儿直接照搬"少写"大概率跑偏。正确的移植是分两步:先花力气让它读你的知识库、建立起对这个域的理解,然后才在具体任务上少说话。省要省在任务层,不是省在上下文层。
和你现在做法冲突
这是这期对你最有价值的一处不舒服。你的 PRD 工厂是三驾马车、一条多段碰撞流水线、每步都有硬约定——这是把清单写死做到极致。而她的结论直指相反方向:你列的清单越全,它还给你的就越只是你已经知道的东西。→ 详细 你那碰撞三件(补强/修正/第 3 案)保证了下限(不会漏掉你在意的),但它同时也可能锁死了上限——永远发现不了清单外的第四件。
第二处冲突更具体:你把"碰撞协议纪律是否真执行"列为痛点,隐含的方向是加更多关卡、加更强的守门。她走的是另一条路——不加关卡,而是让产出物本身变成机器能直接领走的工单,执行点就自己长出来了。→ 详细 约束靠格式,不靠流程。 我不替你下结论,但这两条路的长期成本差得很远,值得你专门想一次。
对你的镜子
被人机验证挡住时她说的那句:「有时候是我们让 AI 干活,有时候反过来,是 AI 让我们干活——我就是套在浏览器 agent 外面的那层『人工验证』」。→ 详细 她很清醒地把自己降级成了"只在机器过不去的关卡上出现的那个人"。
对着这面镜子问一句:在你自己那座多角色工厂里,你现在扮的是哪个角色?是那层只在关卡上出现的人工验证,还是仍然在每个环节都亲手点一遍、亲眼看一遍?你写过"判断力 > 努力""杠杆 > 工时"——那么你亲手做的那些环节,有多少是真的只有你能做的判断,有多少只是你还没舍得交出去?
第二面镜子是"新鲜眼睛"那段:老团队的诅咒就是你太熟了,所以看不见。→ 详细 你的 218 篇档案只盘了 16 篇、你的指标盘空着没跑、你工厂里那些"该留痕"的环节还没留痕——这些可能都不是"没时间",而是"太熟以至于不觉得需要再看一眼"。这是单兵多线最容易掉的坑:你以为你知道现状,于是省掉了确认现状那一步。
可迁移的思维模型
判断更新
你可能一直默认 agent 的瓶颈在"上下文和记忆"——它记不住、看不全。这期提示瓶颈可能已经换地方了:瓶颈是手——它够不够得着一个带着你登录态的真实系统。这一条如果成立,你评估任何 agent 方案时的第一个问题就该换成"它够不够得着",而不是"它懂不懂"。她收尾那句"我人可以不在电脑前,但事情照样能办完"→ 详细,衡量的正是这个。
这周一个赌注
做那篇少写 prompt 的实测。 挑你多角色流水线里的一个环节,把它的长 prompt 砍成一句话,同一个输入各跑三次,记录产出差异。理由是它一次打三个洞:给一人公司账号补上一篇带真数字、带可抄物的验证体;真的检验了你 PRD 工厂"清单越全越好"这个从没被验证过的假设;而且只需要一个晚上。如果结果是长 prompt 赢——那更好,你第一次有了证据,而不是只有习惯。