ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.123
第 123 期 · AI 产品 · 收录于 2026 年 8 月 15 日

Codex与ChatGPTWork自动化

NB
Nick Baumann · How I AI
视频 41:35 原文约 4.1 万字 预计阅读 19 分钟 来源视频 ↗ 中英对照全文
TL;DR · 三句话
  1. 新语音界面不是「语音转文字」,是「口述委派」——按快捷键弹出一个能看见你屏幕的光球,它把 ChatGPT 早就有、但没人发现的几个底层能力(开新 thread、给正在跑的 thread 追加消息、thread 之间互相说话)编排起来,你说一句就能同时派出五六个后台任务。→ 详细
  2. 他每天真正在用的是手机端 ChatGPT Work + Heartbeats——把 Gmail、账单接上插件挂成定时 agent,一天自动跑两次替你盯着,有异常才推通知:「我根本没在盯我的邮箱和账单,但这些事有人替我盯着。」→ 详细
  3. 最重的一条流水线是剪视频——去公园自拍五六十个片段(大半是废镜头)一股脑拖进去,口述一遍叙事线,Codex 自己拉转写、抽帧看画面、挑最好的 take、给敏感信息打码还会自检重跑,成品前两天真发到了 Instagram。→ 详细
01

大背景:第二次「AGI 时刻」正在从工程师手里往手机上搬

  • Nick 把这几年分成两次冲击:2022–23 年 ChatGPT 是第一次——「我说点什么,它挺聪明地回我点什么」;第二次是 coding agent harness(agent 的运行外壳:给模型配上读文件、写文件、跑命令的手脚)出现——「我只交代一件事,剩下的它全都自己推演出来了。」 → 详细
  • 但第二次冲击有门槛:不是工程师、不爱折腾的人根本碰不到。他认为这三个月真正的阶跃是把 coding agent harness 和「常驻在线 agent」这两个底层能力搬到网页和手机上——本来就在用 ChatGPT app 的人(量非常大)只要切到 Work 标签页,说一句「帮我看一下我的 Gmail 和账单」,就有了自己的 agent。他判断很多人「踏进门的第一步」不是什么大场面,而是第一次收到「包裹到了」「账上有笔奇怪扣款」的推送→ 详细
02

新语音界面:一个能看见你屏幕的全局光球

  • 快捷键唤起,屏幕上弹出一个光球,不管你当前在电脑上干什么都能对它说话,它说话回你,而且看得见你的屏幕、知道你正在做什么。关键不在语音本身,而在它上面接的那层「编排」:Nick 说 ChatGPT app 里早就有一批没人发现的底层能力(primitives)——你可以让它创建 thread、可以让它给已有的 thread 发消息,thread 之间还能互相对话,「这些在 app 里不算显眼,但能力都在」。语音层把这些串起来之后,「它基本上可以替你把整个 ChatGPT 管起来」。→ 详细
  • Claire 的现场复述可以当成能力清单:快捷键唤起语音 → 管理五六个很聪明的 thread → 把任务委派出去 → 接各种插件 → 用你的浏览器 → 用 App Shot,「一种带宽极高、摩擦极低的方式,去跟一个真能把事办成的超级智能对话」。→ 详细
  • Claire 补了一句同感:大多数人不知道这类平台的「元能力」——不只是拆 sub agent,而是能开全新 thread、fork thread、翻旧数据、翻它自己的记忆,让 AI 自己判断什么时候该把任务岔出去。她自己也是误打误撞发现的:某天模型突然说「我要开一个新 thread」,她当场懵了。→ 详细
03

App Shot:连按两下 Command 的「带上下文智能截图」

  • 不管你当前开着哪个窗口,连按两下 Command,它就拍一张带上下文的智能截图,拍完可以立刻对它用 computer use(操作电脑)或 browser use(操作浏览器)。这本来是个独立的元功能,Codex 语音里已经内置——演示中他只说了句「你能看到我 Slack 里那个 offsite 吗」,它自己就拍了一张。→ 详细
04

实机演示 A:一句话把巴黎差旅订了

  • 它从 Slack 窗口读出全部要素并复述:DX 团队巴黎 offsite,8 月 26–28 日;你要周二到,正式日程周三上午开始、周五下午结束;机票酒店本周内要在 Navan 上订好。→ 详细
  • 花絮:Nick 顺口坦白巴黎 offsite 其实还没定,他是想借这段演示给团队「埋点种子」,因为 DX 团队一大半是法国人;Claire 当场对着他的 Codex 喊「把我也邀请上,安排丽思酒店、商务舱」。→ 详细
  • 他接着问「我想留到周末、能不能多待几天」,它查完日历直接给结论:offsite 之后一直到 8 月 31 号周一都空着,9 月 1 号周二返程会跟一个下午晚些时候的会撞上,最省事的方案是 8 月 31 号回。这一步走的是底层插件(plugins),不用真的跑去开网页。→ 详细
  • 他口头补齐约束:那两天请 PTO、从 SFO 出发、用 Navan、另开一个任务、挑一家价格合理且符合公司差旅政策的酒店、弄好告诉我我来点「立即预订」→ 详细
  • 最漂亮的一手是中途改口:任务已经在跑了,他说「确保它这次用我现有的 Chrome 浏览器」——语音层把这句话当消息回传给正在跑的那个任务,它回:已经改成使用你现有的 Chrome session,并且只准备选项、不做预订。→ 详细
05

实机演示 B:报销单同时在另一条线上跑

  • 他不等差旅任务跑完,直接追加第二件事:「我这儿有封 Amazon 收据,是买给 DX 团队的麦克风,你能不能另外开一个 thread 把报销搞定?」它答:任务已启动、会用你现有的 Chrome session,会找到收据、把 Navan 上的报销单准备好,但在你确认之前不会提交→ 详细
  • 两个任务同时在后台跑,他把语音静音继续录节目,Chrome 里能实时看到那个任务在筛航班。他的原话很朴素:「这类事我就是很享受『不用自己干』的感觉。」→ 详细
06

贯穿全部演示的护栏:准备到最后一步,人来按那个按钮

  • 三处出现同一个模式,值得单拎出来:差旅——「只准备选项、不做预订」;报销——「填好待提交,确认前不提交」;下单动作——「弄好了告诉我,我来点立即预订」。这不是模型的谨慎,是他明确说进 prompt 里的边界。→ 详细
07

为什么用嘴而不用手:不是省事,是换了一种委派方式

  • Claire 说很多人卡在「空白对话框综合症」——盯着输入框想「我该让这个聪明得要命的 AI 干点啥」。语音转文字这层已经是她那位老嘉宾 Hillary 说的 yappers API(话痨接口):跟 LLM 沟通带宽最高的方式就是张嘴一顿输出;而语音对语音更进一步——「如果你有幸配过助理,事情本来就是这么推进的」,一句「这个你帮我搞定一下」就完了,不用坐那儿琢磨怎么把指令写清楚。→ 详细
  • Nick 补的差异点很关键:「通常语音背后是一个能力更弱的模型」,而这个能完整委派并管理五六个独立线程。另外他觉得用语音做规划效率特别高——「口述两分钟发出去一大段,再收回来几大段文字去读,这样我很难进入心流」。→ 详细
08

暴论题:语音体验里延迟和智能哪个更重要

  • Nick 的答案有层次:自己用的时候把语音开在「高智能」档;但如果它手上有足够好的工具可以委派出去,他更在意延迟——被逼选一个,最后选延迟。→ 详细
  • Claire 下了个预测:下半年大家会越来越多地谈延迟,因为现在最能拉开差距的点就是「这些体验到底能做到多实时」——「我见过太多人因为一个转圈、因为一点延迟,就放弃了原本很棒的 AI 工作流。」→ 详细
  • Nick 顺着推了一层更狠的:现在 AI 工具的产品设计里,好多假设都建立在「一定会有延迟、一定要等」上面(所以到处是进度条、通知、异步回来看);延迟压得越小,这些假设就能一个个扔掉,新的产品形态自然冒出来。→ 详细
09

手机端 ChatGPT Work 才是他的主力

  • 「网页版的 ChatGPT Work,尤其是手机端——我主要就是在手机上用——强得离谱。」原因有三:一是它本质就是 Codex 那套 harness,带非常出色的 compaction(上下文压缩,即对话变长时自动把前文压成摘要,不至于失忆);二是插件已经连好了,Gmail、Google Calendar 之类你连过一次就一直在;三是这一整套在手机上都能用。→ 详细
10

Heartbeats:把 agent 从「你叫它才动」改成「常驻在那儿盯着」

  • Heartbeats 就是把一段自动化挂成定时心跳、让它按节奏自己跑,跑完有值得说的才通知你。Nick 的原话:「你可以把这些自动化做成 heartbeats,直接就跑在那儿。像我一天会收到好几次通知,比如『嘿,我看到一封邮件说你买了这个东西,你确定是你买的吗?』或者『嘿,这个包裹要到了,记得取一下』。我根本没在盯我的邮箱和账单,但这些事有人替我盯着。这体验真的很神奇。→ 详细
  • 它的搭法低得出奇——不用写代码、不用配服务器:装两个插件(Gmail + 财务),切到 Work 标签页说一句「帮我盯着这两个,有什么值得注意的、或者哪里出岔子了就告诉我」,就有了一个一天跑两次的 agent。Nick 认为这种「小事」的第一次通知,才是普通人真正踏进 agent 世界的门槛。→ 详细
  • 第二个用法藏在剪视频那段里,价值更高:他把一个已经做好的 skill 挂到 heartbeat 上,让 Codex 在后台自动帮他搜房源——这条视频的收尾就是讲这个。也就是说 heartbeat 不只挂「监控类」任务,任何你已经沉淀成 skill/plugin 的重复动作,都可以挂上去变成常驻→ 详细
  • 值得记的是这套东西的组合逻辑:插件负责「能接到什么」,skill/plugin 负责「怎么做才对」,heartbeat 负责「什么时候自己跑」,手机通知负责「什么时候找你」——四件东西凑齐,一个不需要你记得的助理就成立了。→ 详细
11

ChatGPT Sites:网页可以直接 deploy 到 chatgpt.site 上

  • 给技术观众的 10 秒版解释:支持 SQL 数据库、有 S3 存储可以放文件,甚至能配环境变量;给非技术观众的版本:它本质上就是一个能存东西的网站→ 详细
  • 权限是它最被低估的一点:可以按邮箱做过滤——完全私有、只给几个指定邮箱、或者完全公开,全看你。分享方式就是点「分享」填邮箱;对方用 ChatGPT 账号登录就能看。所以 Claire 那句形容很准:「可以分享给任何人,或者谁都不分享。」→ 详细
12

现场建站演示:从口述到上线,全程没碰键盘

  • Nick 口述需求:把 Claire 的 How I AI 频道里所有视频中最好的技巧汇总成一个站,能方便筛选,还能直接点链接跳到视频里对应的时间点→ 详细
  • Claire 现场追加需求,也是纯口述:按 How I AI 品牌来(经典 AI 蓝紫 blurple + 黑白),按「用了哪个 AI 工具」分一层,再按职能分一层(设计师/工程师/个人效率),剩下的「我就期待你能做出什么来了」。→ 详细
  • 发布策略也是一句话交代的,很值得抄:「先私有部署,等它好了我们看一眼,如果效果不错再从那儿公开发布。」→ 详细
  • 十几分钟后站真出来了,配色「黑色、紫色配白色,跟我说的一模一样」。他还提了句这一整期节目全程没碰键盘(look no hands),中间也确实出过状况。→ 详细
  • 限制也当场露出来了:use cases 那一块出了 bug,同一期节目重复出现了好几次;两人现场想到的下一步是「让每个片段配不同封面图,甚至用 image gen 生成专属封面」。一次成型不等于一次做对。→ 详细
13

用一个手机 thread「养」一个网站

  • 他自己那个站是聚合「大家怎么用 Codex/ChatGPT」的优质推文,做法是让 ChatGPT app 用自带的 in-app 浏览器在 Twitter 上刷了几小时,把链接嵌进来、每条加一点描述。→ 详细
  • 日常维护更省:工作手机上常年留着一个 thread 专门管这个站,看到喜欢的内容就把链接丢进去说一句「加上」;prompts 页签同理,想到一个点子就对着手机口述一段,让它加上去。站点的编辑和 deploy 全都在手机上的 ChatGPT Work 里完成。→ 详细
14

两个被低估的「人机之间」用法

  • 两个人一起对着 ChatGPT 说话:Claire 的妈妈卡在一件行政流程上急得不行,她在电脑上开语音、把手机免提举到电脑前让妈妈一通说,自己追问两句,一按回车——「我替你办完了」。她说大家严重低估了这种用法,它是把需求灌进系统的高带宽方式,而且不必是你一个人对着它说→ 详细
  • 「这个会本来发条语音就够了」:Nick 需要同事的上下文时会说「你随便对着 Slack 口述一段,多乱都无所谓」,对方却回「要不咱们约个会吧」。他的原则是:「把信息给我就行,多不结构化都无所谓,只要我的 agent 能读懂,对我来说就够了。」→ 详细
15

用 Codex 剪 UGC 视频:从一堆废镜头到能发的成片

  • 起点是「降低出镜门槛」:他在 DX 团队做内容,目标是触达不在 Twitter 圈子里的人(「我们这帮人在 Twitter 上确实不少,但不在上面的人更多」),形式是对着镜头 45 秒、用特别接地气的方式讲清一个工具怎么用——做法就是去趟公园,自己给自己拍一堆零碎片段。→ 详细
  • 素材量级要有概念:「我只要去趟公园就行了。前两天我在一个半小时里录了三条视频」,然后「上传了大概五六十个片段」——其中大部分是他自己也知道不会用的废镜头。演示中那次只提交了二十来个。→ 详细
  • 投喂方式简单到不像话:把片段直接拖进 ChatGPT Work,然后口述一遍叙事线。他现场那段口述几乎就是脚本大纲:「我录了一支关于 record and replay 的视频。开头是我讲自己在找房子、这事儿挺折磨人的;然后实拍演示这个功能;最后收尾是我把做好的 skill 挂到 heartbeat 上,让 Codex 在后台自动帮我搜房源。你能不能先把这些片段过一遍,把转写文本拉出来,挑出最好的几条,然后拼成一支 UGC 风格的视频?→ 详细
  • 它内部怎么干:先处理所有片段只取转写文本,用来理解整个故事(加上你那段粗略描述,它就更清楚);然后真的抽帧看画面,理解你在演示什么;再挑出最好的 take。关键技巧:录制时他会随口说「cut」「这条废了」「这条不错」,模型把这些当成筛选提示——等于你在拍摄现场就顺手标注了素材。→ 详细
  • 它会反问你,而且随时能改口:这次它先抛问题让他选(画幅选 organic vertical 原生竖版、风格选 complete and clean)——这个反问不是天生的,是他后来主动加进 plugin 的,因为他发现「你干嘛不先问我几个问题呢」比来回返工省事。改口也不用守在电脑前:中途他想起还要一版 4:5,人在 Uber 上用手机说了一句发过去,它回「收到,正在更新交付清单」→ 详细
  • 它跑得慢,但慢不要紧:整支片子跑了挺久——「我去睡了一觉,回来再看,要的东西都在了」;因为已经有 plugin 和一个「很懂我要什么的 task」在那儿,他只需要口述三条视频各自的叙事线。前两天其中一条真发到了他们的 Instagram。→ 详细
  • Claire 的平行用法(她视频剪辑量很大):三十到六十分钟的演讲或播客整段丢进去,「给我剪一支 60 秒的高能预告,把最好笑的部分挑出来,前后各留一点余量方便我再修」——她评价「它对『好笑』的品味其实相当不错」;每季度那场三小时工作坊的 Zoom 录像也拿它切章节、切短视频。→ 详细
  • Claire 顺口交代了自己荒废 TikTok 的真因,含金量比方法论还高:不是没时间,是「我对自己要求特别高,老是录一堆片段然后觉得『这就是垃圾』,一沮丧就撂挑子走人」。她从这个流程里拿到的解法是——一直录到有一条感觉对了为止,然后全丢进去,「我甚至不用记住哪条是好的」。→ 详细
  • 对独立创作者的隐藏收益(心理层面):Claire 说自己剪自己特别尴尬——「一遍遍盯着自己看……『这段我还挺可爱挺有梗』『那段我完全不知道自己在说什么,根本不像个正常人』」。所以她乐意把「评判自己、评判自己的表现」外包给一个中立的第三方模型,「这样我就不用整天坐在那儿听自己讲话」——尤其当你是独立创作者、独立创业者、一个人干活的时候。→ 详细
16

UGC video plugin:把一周里说过的所有口头要求沉淀成一个插件

  • 它是什么:Nick 做了个叫 UGC video 的 plugin(他还做过一个带 OpenAI 品牌风格的版本),里面装的全是他边做边给的引导——最先加进去的两条是「注意别踩进 Instagram 广告的安全区」和「画幅要 9:16,也要 4:5」。→ 详细
  • 它怎么来的(这才是可抄的部分):「我有一个超长的对话线程,在里面做了好几支视频,攒下了大量这种很定制化的经验和流程,于是我就说:你能不能把这些做成一个 plugin?」——沉淀进去的包括需要哪些画幅、某些区域不能放文字否则会被裁掉、自然断点在哪儿、字幕该怎么处理。而且 ChatGPT app 里本来就有一个 plugin creator 的 skill,所以做起来挺容易;生成后他又微调了几下,「现在就能比较稳定地拿到我想要的那条『顺利路径』了」。→ 详细
17

自动打码:连滚动都能跟住的马赛克,而且它自己检查自己

  • 成片里它主动给房源地址打了码,没人要求。→ 详细
  • 更狠的一次:有几支要发 Instagram 的片子里出现了从 Slack 带出来的未发布敏感物料,它「真的是一行一行地糊,我往下滚动的时候码还能跟着走」;而且整个过程有自检——先打码、再回头检查自己做得对不对、反复迭代直到满意。Claire 半年前为播客手写过一个打码工具,唯一没解决的难点正是「码怎么跟住屏幕共享的画面」。→ 详细
  • Nick 借这里说了句更深的话:手动打码烦,但**「更烦人的其实是,你还得动脑子想:我怎么才能让产出里不带机密信息,同时又让它看起来还是真实的、不假。这也是件麻烦事,我现在干脆不想了,全丢给 ChatGPT app 去处理。」**——真正的成本在「持续动脑判断」,不在体力。→ 详细
18

为什么剪视频要用 Sol Ultra

  • Sol Ultra 是配 5.6 用的多 agent 框架。他选它「别的先不谈,光为了速度就值得」:剪视频里有太多细碎的小任务——一帧一帧地检查、一段一段核对转写文本——很多可以并行跑,也有很多判断可以并行做,所以用它效率更高、产出质量也更好。→ 详细

Q1:大家都爱上语音之后,OpenAI 办公室里是不是全在自言自语? Nick 说这问题问得「说实话有点让人不自在」:在家他完全靠口述;坐工位上周围有人时,有时压低声音说,但更多还是用键盘。他观察到公司里那些一人电话亭,最近越来越多人钻进去不是打电话,而是去用听写、用语音操作 Codex——「很明显大家在往这个方向适应,因为体验确实更好」。但现状不理想:「我不知道最终答案是不是我们每个人都戴一个罩子,把声音挡住只让 agent 听见。」他的结论是更好的版本已经存在(就是语音),只是跟现在的办公室格局和基础设施不匹配。Claire 接梗:应该按个按钮,天上降下一根管子罩住你,说完再升上去。→ 详细

Q2:过去三个月里真正的阶跃式变化是什么(语音除外)? 不是某个新模型,而是把 coding agent harness 和「常驻在线 agent」这两个原本只有工程师能用的底层能力,搬到了网页和手机上——让本来就在用 ChatGPT app 的普通人,切个标签页就能拥有一天跑两次、替他看邮箱和账单的 agent。→ 详细

Q3:AI 不听话时你的 prompt 策略是什么?会吼吗?会全大写吗?这得看我是坐在工位上,还是在自家客厅里——我对 AI 的态度在这两种场合是不一样的。」在办公室可能就是全大写、一边敲键盘一边砸;在家打开听写,顺带骂几句脏话,然后再想办法把它拽回正轨。他补了句反直觉的观察:最近他没那么容易上火了,因为东西确实跑得更顺了;Claire 正相反——「我反而更容易上火了,因为我的标准更高了。我会想:我知道你能做到这个,你又不是笨蛋,来吧。」她自我总结:「把它当成平等甚至更强的对手来对待,所以它做不出来的时候你会觉得意外。」→ 详细

  • Nick Baumann:Twitter / X @nbaumann_,私信开放——关于 Codex、ChatGPT Work、OpenAI 正在发布的任何东西都可以问。→ 详细
  • 节目:How I AI(主持人 Claire Vo)· 往期与介绍在 howiaipod.com,Apple Podcasts / Spotify 同步更新。→ 详细
🎯 于你何益 为你定制 · 非通用结论

这期相关度很高,而且高得偏实操:整期没有一个新观点,全是「这个按钮长这样、我这么按的」。对你来说,最值钱的三样东西按顺序是——Heartbeats(把 agent 挂成常驻)、把长对话沉淀成 plugin、口述 + 一股脑投喂的剪视频流水线


一人公司(onehuman_company)

① Heartbeats 就是你「大佬说 X 我试了」这个支柱的现成弹药,而且是最容易出证据的一发

  • 怎么做的:Nick 不写代码、不配服务器,只做三件事——装两个插件(Gmail + 财务),切到 ChatGPT Work 说一句「帮我盯着这两个,有什么值得注意的、哪里出岔子了就告诉我」,然后就有了一个一天自动跑两次的 agent。他形容成效的那句话很朴素也很好用:「我根本没在盯我的邮箱和账单,但这些事有人替我盯着。」更进一步的用法是把已经做好的 skill 挂到 heartbeat 上——他那条找房视频的收尾就是「Codex 在后台自动帮我搜房源」。
  • 你可以怎么做:这条选题几乎是给你量身定做的,因为你已经有真实的定时 agent 在跑(wiifm 巡检、content-radar 内容雷达),你不是"听说很好用",你是"跑了两个月,我来算账"。写成验证体的骨架建议是:挂了哪几个常驻 agent、每个每天/每周跑几次、真正推到我眼前的有几条、其中我动手处理的有几条(这个"信噪比"数字才是别人抄不走的可抄物),以及哪一个我挂上去两周就关掉了、为什么。标题和封面前置——直接把那个比例放封面上。
  • 顺带一个产品判断:这期给了你一个很干净的四件套框架,可以当成你讲 agent 的固定语言——插件管「能接到什么」、skill/plugin 管「怎么做才对」、heartbeat 管「什么时候自己跑」、手机通知管「什么时候找你」。你现在的 9+1 Agent 讲法偏"角色分工",这套讲法偏"生命周期",对不懂技术的读者更好懂。

② 「把一个超长 thread 变成 plugin」= 你的 skill 化流程,但顺序是反的

  • 怎么做的:Nick 的 UGC video plugin 不是先设计出来的。他先在一个超长对话线程里做了好几支视频,边做边口头纠偏(要 9:16 和 4:5、别踩 Instagram 广告安全区、某些区域不能放文字否则被裁、断点在哪、字幕怎么处理),攒够了以后直接说一句「你能不能把这些做成一个 plugin」——ChatGPT app 里本来就有 plugin creator skill,生成完再微调几下,「现在就能比较稳定地拿到我想要的那条顺利路径了」。
  • 你可以怎么做:你的 de-ai-flavor、video-to-text 这些技能都是先写规则再用;这期给的是先用再萃取。最直接的动作:把你和 solo-editor 来回改稿最狠的那一个长会话翻出来,让模型把你在里面说过的所有"不要这样/要那样"提炼成一份规则清单,再对照现有 skill 看哪几条是你反复说但从没写进去的——那几条就是你真正的编辑品味,也正好是"AI 员工管理成本账"这个支柱的素材:我花了多少轮才把一条隐性标准说清楚。

③ 剪视频这条流水线,是你 Phase 0 存稿最缺的那个产能杠杆

  • 怎么做的:他一个半小时在公园录三条视频、上传五六十个片段,大半是明知不会用的废镜头;投喂方式就是把片段拖进去 + 口述一遍叙事线(找房痛点 → 实拍演示 → 收尾讲挂 heartbeat);模型自己拉转写理解故事、抽帧看画面、挑最好的 take。有两个细节很关键:录的时候随口说「cut」「这条废了」「这条不错」,模型会当成筛选提示(等于拍摄现场就顺手打了标);以及他让 plugin 先反问几个问题再动手,因为"你干嘛不先问我几个问题"比来回返工省事。整支片跑了很久——「我去睡了一觉,回来要的东西都在了」。
  • 你可以怎么做:你现在的内容是"吃判断"的图文,视频这块基本没开。这套流程降的正好是你最怕的那块成本——不用当场判断哪条能用,也不用记住哪条好。可以先拿一件你本来就要做的事试:把某次给 drizzle tech 派活的屏幕录制 + 你的几段口述,丢进去让它出一支 45 秒的"我让 AI 员工干了 X,翻车在 Y"。注意 Nick 那句话的适用边界:他有 Sol Ultra 那种多 agent 框架撑并行,你手上的工具链未必等价,第一支的目标不是出片质量,是量出"从素材到能发,我实际花了几分钟人肉时间"——这个数字本身就是一篇。

momorain 家居号(xiaohongshu_momorain)

「一直录到有一条对了为止,然后全丢进去」是对你产能焦虑的一剂解药

  • 怎么做的:Claire 自曝她荒废了曾经还不错的 TikTok,原因不是没时间,是**「我对自己要求特别高,老是录一堆片段然后觉得『这就是垃圾』,一沮丧就撂挑子走人」。她从 Nick 这儿拿到的解法是:不用在录的时候判断,录完全丢进去,让模型去挑。她还补了一个纯心理的收益——自己剪自己特别尴尬,要一遍遍看自己的脸,所以她乐意把"评判自己的表现"这件事外包给一个中立的第三方模型**,尤其当你是一个人干活的时候。
  • 你可以怎么做:你的家居号卡在"指标盘空着、封面标签没激活",本质是每条内容的启动成本太高、自我审查太早。可以把审查环节整个后移:拍的时候只管拍够(一个场景多角度多录几条,随口说"这条废了"),成品判断交给模型初筛,你只在它挑出来的三条里选一条。这不省拍摄时间,省的是"边拍边否定自己"的那部分损耗——而那部分才是让你停更的真凶。

第二大脑(Personal Thinking)+ 你的播客流水线

① 手机上养一个 thread,比在电脑前开一个新会话更适合你的摄入节奏

  • 怎么做的:Nick 工作手机上常年留着一个 thread 专管他那个推文聚合站——看到好东西就把链接丢进去说一句"加上";有 prompt 点子就对着手机口述一段让它加上去;站点的编辑和 deploy 全在手机上完成。这不是"手机也能用",是"因为在手机上,所以真的会随手做"。
  • 你可以怎么做:你的摄入 SOP 现在是"攒到坐下来才处理",所以入库批次总是一波一波的。可以试着留一个常驻会话专门吃"半成品输入"——看到值得存的链接/想法就丢进去说一句,让它按你的入库 SOP 排队,等你坐下来时已经是分好类的一叠,而不是一堆裸链接。判断标准很简单:一个月后看,这个 thread 里有没有沉下来十条以上你原本会忘掉的东西。

② ChatGPT Sites 的"按邮箱可见",值得对着你现有的发布链路比一比

  • 怎么做的:Sites 部署出来的站支持 SQL 数据库、S3 文件存储、环境变量,权限可以按邮箱过滤——完全私有、指定几个人可见、或完全公开,切换只是点一下分享;访问者用 ChatGPT 账号登录。他们现场演示的是"先私有部署,看着行再公开"。
  • 你可以怎么做:你现在的产出路径是 Notion 学习知识库 + 私人 RSS 播客,缺的正是中间那档——想给某个具体的人看一份东西,但不想公开、也不想让对方装 Notion。比如某期总结报告、某本书的研读报告,或者一个"我最近在读什么"的小站。别急着迁移:你的 Notion 链路已经跑通且沉了很多内容,这条只适合当"临时分享用的第三条腿",试一次就好,不要变成第三套要维护的东西。

ERP 产品工作 + app_incubator

「准备到最后一步,人来按那个按钮」是一条现成的 gate 设计

  • 怎么做的:整期演示里同一个模式出现了三次——差旅任务"只准备选项、不做预订";报销任务"填好待提交,确认前不提交";他自己交代的是"弄好了告诉我,我来点立即预订"。注意这不是模型天生谨慎,是他把边界明确说进了指令里,而且这个边界卡在"所有准备工作都做完、只差一个不可逆动作"的位置上。
  • 你可以怎么做:你的三驾马车 PRD 工厂有个类似的悬念——碰撞协议的纪律(初稿互不可见、三件交齐才进合成)写在协议里,但靠自觉执行,没有一个地方真的会停下来。这个模式给的是一种更省力的解法:别在流程里做拦截逻辑,而是把每个环节的产出终点定义成"待提交态"——初稿写完停在"待碰撞"、合成定稿停在"待真人评审",让"推进"这个动作在物理上只能由人触发。同样的思路也适用于 app_incubator 里"设计稿即工程契约"那一环:契约生成完不自动落库,停在待批准。
  • 另一条顺手的:那个 plugin creator 的路子(长对话 → 萃取成 plugin)对你三驾马车的 agent 定义(.Codex/agents/*.toml)维护同样成立,尤其是那些"写的时候没想到、实际用起来每次都要补一句"的规则。

StockHelp(投资)

这期没讲投资,但 heartbeat 这个机制正好是你 Phase 2/3 缺的那块

  • 怎么做的:Heartbeats 的完整形态是"定时自己跑 + 只有值得说才推给你"——Nick 的邮箱/账单 agent 一天跑两次,平时无声,出现"你确定买了这个吗"这类异常才发通知。
  • 你可以怎么做:你的看板 Phase 1 只看数据,Phase 2/3 才做信号和通知,而 Phase 2/3 的难点从来不是技术,是**"什么才配得上打断我"**。这期给的参照是把标准定得极保守:只推"异常",不推"日报"——比如某只标的跌进你设定的 5 年分位安全边际、或公允价与股价的差第一次翻过某个阈值。反过来说,一个每天准时告诉你"今天没事"的通知,一周之内你就会开始无视它,那它就等于没做。这一点和价值投资的心态是一致的:不看盘不是懒,是刻意减少被打断的次数。

更深的三个角度

该反着用:Nick 的每一个演示背后都是资源充足——公司插件全接好、Navan 差旅系统、Sol Ultra 的多 agent 额度、内容是本职工作所以可以"跑一夜没关系"。你是一个人扛正职 + 多条副业,精力才是稀缺项。所以正确的借鉴不是"把这五个新功能都装上",而是只挑一件你每周真的重复三次以上的活挂成常驻,其余的先当情报存着。他那种"看到新功能就全家桶接上"的姿态,你反着用才对:新功能越多,越要提高准入门槛。

和你现在做法冲突:你的流水线信的是确定性脚本——prep_episode.py 给净正文区间、publish.sh 质检合成推送、发布日必须用视频原始日期,这些红线之所以是红线,正因为你被模型的"自由发挥"坑过。而 Nick 这一整套的核心恰恰是把标准写成自然语言的 plugin,然后信任模型每次自己判断(画幅、安全区、断点、字幕,全靠它读你的规则去拿捏)。这两条路是真冲突:一条追求可复现,一条追求可演进。这里不替你下结论,只提醒一件事——你的红线都长在"错了就要重来一整轮"的环节上,而他的 plugin 都长在"错了当场再说一句就改"的环节上。冲突可能只是位置的问题,不是路线的问题。

对你的镜子:Claire 那句"我对自己要求特别高,录一堆然后觉得是垃圾,一沮丧就撂挑子走人"——这句话对着的不是她的 TikTok,是你 onehuman_company 的 Phase 0 存稿期。你的账号迟迟没开张,卡点大概率不在"没有好选题",而在你把"这篇够不够格"的判断放在了动手之前。 而这期从头到尾在讲同一件事:把判断往后挪,先产出一堆明知有废品的东西。


所以呢

可迁移思维模型:

  • 【耐用】真正的成本是"持续动脑",不是体力。 Nick 那句"手动打码烦,但更烦的是我还得动脑子想:怎么让产出不带机密、同时看着还真实"——这条判断标准适用于你所有的流程设计:一个环节值不值得交给 agent,不看它花你多少分钟,看它占不占你的判断带宽
  • 【耐用】把审查放在产出之后,不是之前。 一股脑投喂 + 让模型初筛,本质是承认"边做边判断"这件事会杀死产量。这条对写作、剪视频、选股筛选一样成立。
  • 【会过期】"延迟比智能重要"这个答案。 Nick 自己是拧巴着选的(他日常开在高智能档,但被逼选一个时选延迟),成立的前提是"手上有足够好的工具可以委派出去"。等模型再快一档,这个权衡就不存在了。但 Claire 那句底层观察是耐用的:现在的 AI 产品设计里,大量假设建立在"一定会有延迟"上,延迟一压小,这些假设连同它们撑起来的产品形态会一起垮掉。 这句话对你判断 AI 产品的护城河比对做产品更有用。

判断更新:你原本可能把"定时 agent"归在"锦上添花的自动化"里。这期给的信号是它更靠近分发形态的变化——agent 从"你打开它才存在"变成"它一直在,只在需要时找你",这直接改变了什么值得做成产品。对你看 AI 公司的估值也一样:能常驻并且有权打断用户的产品,粘性完全不是一个量级。

这周一个赌注:把你已经在跑的定时 agent(wiifm 巡检、content-radar)当成一个选题去写,而不是当成一个工具去优化。花两小时把它们最近的推送记录扒出来,数三个数字——推了多少条、我看了多少条、我因此动手做了几件事。如果这三个数字不难看,它就是你 onehuman_company 的第一篇验证体;如果难看,那篇文章更好写——"我挂了两个常驻 agent,然后把其中一个关掉了",正是别人写不出来的那种。

接着读