ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.103
第 103 期 · AGENT 工程 · 收录于 2026 年 8 月 15 日

每个Harness终将进化成Claw

SB
Sam Bhagwat · AI Engineer
视频 15:35 原文约 1.5 万字 预计阅读 12 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 15:44
TL;DR · 三句话
  1. 今天的分水岭是 harness,不是 agent。 去年在 AI Engineer 大家还在聊 agent loop、agent 和 workflow 怎么选;现在拉开差距的是 harness(外壳/驾驭层,即包在模型外面那层帮它拿上下文、调工具、管流程、扛失败的工程)——planning mode、并行 subagents、skills、后台任务这套开发者体验,才是它区别于「一个会调工具的 agent」的地方。→ 详细
  2. 给 harness 注入「主动性」和「学习能力」,它就变成 Claw。 让它监听外部信息源、开一条通道给你发短信/WhatsApp/Telegram、给它一个 heartbeat(心跳,每隔设定时间自己醒来干点事),再让它按自己的 trace 自我改进——agent 就从「你叫它才动」变成「它自己会动、会来找你」。→ 详细
  3. 但 Claw 之间必有一轮洗牌。 他给这个趋势起名「Steinberger 定律」:我相信每一个 harness 都会不断膨胀,直到它变成一个 Claw;而人脑装得下的东西就那么多,就像智能手机十年后每个品类只剩一两个 logo,最后我们的生活里也只装得下几个 Claw。→ 详细
01

开场:欢迎来到 harness 时代

  • 讲者 Sam Bhagwat,Mastra(TypeScript agent 框架)联合创始人兼 CEO,《Principles of Building AI Agents》作者。→ 详细
  • 他的凭据是「过去 18 个月见过大量真正跑在生产环境里的 agent」;开场第一句就是「欢迎来到 harness 时代」——别人讲「现在」,他讲「未来」。→ 详细
02

现在有哪三类 harness

  • 本地 harness(每天写代码的日常主力)、云端 harness(能买的产品,也有公司自建、直接跑在 Slack 里的内部 coding agent)、开源框架(把这些基础能力打包好让你自己搭)。→ 详细
  • Mastra 做的是第三类。去年在同一个大会上,大家聊的还是 agent loop、agent 和 workflow 怎么选。→ 详细
03

agentic 光谱:像自动驾驶一样分级

  • 他拿自动驾驶类比这条「agentic 光谱」:车道保持辅助 → Tesla FSD → 坐在 Waymo 后排、方向盘后面根本没人。对应到 AI 就是 LLM → agent → harness → Claw,自主程度一级一级往上爬。→ 详细
  • agent 和 LLM 的分界线是:agent loop(模型自己一轮轮「想—调工具—看结果—再想」)、tool call、memory、失败重试、context engineering(上下文工程,即每轮该往模型窗口里塞哪些信息)、agent state。换句话说,context engineering 只是 agent 那一层的入场券,不是终点——这正是他说「别停在去年」的理由。(他点名 Dex Horthy 是好友,也是本场灵感来源之一。)→ 详细
04

从 agent 到 harness,冒出两个新特质:durability 与 doggedness

  • 共同点是你在一个循环里跑 agent,光靠一次性调用 LLM 根本做不到(他自嘲「能采取行动」这个特质该叫什么没想好,索性写了 action)。→ 详细
  • durability(持久性)=能连续跑几小时甚至几天,比如某轮中间断线了、但整个流被持久化下来,可以从断点接着跑;**doggedness(不撞南墙不回头的劲儿)**这个词是他朋友形容自己用的 agent 时说的,他喜欢就直接借来当术语。→ 详细
05

harness 的四根强力支柱:planning mode / 并行 subagents / skills / 后台任务 ⭐

  • planning mode(先出计划再动手的模式)——「我们在 Claude Code 里都见过」。这是 harness 把「先想清楚」显式做成一档模式,而不是指望模型自觉。→ 详细
  • 并行 subagent(子智能体)——可以把多个任务同时 fan out(扇出,一次派多路人马分头干活)出去。这是 harness 把「一个人干」变成「一支队伍干」的关键;配套的还有 TUI(终端图形界面)和 slash command,给了你更多直接操控的手柄。→ 详细
  • skills——他强调这一条的价值在于时序:「我们不需要一开始就把所有 agent 都定义好」,而是可以在运行过程中动态地把它们创建出来,他评价这一点「非常强大」。换句话说,能力清单不再是设计期写死的静态编制,而是运行期按需长出来的。→ 详细
  • 后台任务——harness 能在后台拉起 bash 任务,主线程不用干等着它跑完。这一条和上面三条一起,构成了「harness 能连续跑几小时几天」的物理基础。→ 详细
  • 再加上 autocompact:context window 用满时自动压缩上下文,让长任务不至于撞墙就死。他明确点名这些都是「我们在用 Claude Code 或者 Codex 的时候会看到的东西」——这四根支柱不是理论构想,而是已经在你手上的既成事实。→ 详细
06

harness 的操控层:持久化、排队、拨方向、打断 ⭐

  • thread 持久化:harness 会把对话线程存下来,你断开连接之后过一阵子还能把这个 thread 接着跑起来——这是 durability 在交互层面的落地。→ 详细
  • queue(排队投喂指令)/ steer(中途给它拨方向)/ interrupt(直接打断):你不用干等着 LLM。他打了个很生动的比方——那不是「我走一步、你走一步」的回合制,「那就像玩《文明》,别的文明没走完我就动不了。不,现在玩的是《星际争霸》,是《帝国时代》,是实时的」。→ 详细
  • session 级别的工具授权:不只是「我批准这一次 tool call」,而是「这个 session 里所有这类调用你都可以执行」。他顺手抖了个包袱:那就意味着整个 session 里所有的 rm -rf / 都放行——「虽然第一次执行基本就把你的机器清空了」。这句玩笑背后是真问题:授权粒度往上放一档,风险面就整体抬高一档→ 详细
07

中间阶段:本地 harness → always-on 云端 harness

  • 这是过去三个月真正在发生的变化,他说大家现在也都还在消化它意味着什么:harness 从本地搬到云端,变成 always on(一直在线、随时可叫)。→ 详细
  • always on 长什么样?你可能在 Slack 里跟它对话,甚至是你和同事一起在 Slack 里跟它对话——各自下各自的指令,它得自己搞明白怎么解析、怎么用好用户的 metadata(元信息,比如这句话是谁说的)。也可能你用手机 App,有些 harness 的手机 App 会打一条隧道连回你本地机器。→ 详细
  • 它到底跑在哪?大概率是云端 sandbox(沙箱,隔离出来的临时机器)。好处是并行度突破本地上限——同时能跑的 subagent 数量远超自己那台机器。「这永远是个权衡,也是分布式系统必然会带来的东西」:云上资源更多、能力更强,但架构完全不一样。→ 详细
  • 产出物的落点也变了:代码不再只落在本地机器、甚至也不只是落在一个 git worktree(同一仓库的多个并行工作副本)里,而是直接生成一个 PR(Pull Request,代码合并请求)→ 详细
  • PR 直接推到 GitHub。他也承认转变还在中途:你可能只用本地 harness,也可能已经看到公司里冒出各种云端 harness、和团队一起在琢磨怎么用。→ 详细
08

harness → Claw:注入主动性(initiative)与学习(learning)⭐

  • 这一步的定义很清楚:给 harness 注入主动性和学习能力,它就成了 Claw(爪子,指那类常驻在线、事件驱动、会自己找上门的 agent)。→ 详细
  • 主动性长什么样?他举的例子是个人助理类 agent 主动发消息给你:「我看到一封紧急邮件进来了,这封邮件真的紧急吗?还是有人在给你发垃圾邮件?」这一句话背后拆出两个机制——它一直在监听外部信息源(不是等你开会话),以及它有 heartbeat(心跳),也就是每隔一段设定好的时间就自己醒过来一次,然后做点什么。心跳是「从被动到主动」最小的那块拼图:没有心跳,agent 永远只能在你敲回车的那一刻活一下。→ 详细
  • 通道(channel):它得能找得到你——短信、WhatsApp、Telegram,随你喜欢。配套的还有两处架构升级:memory 不再只是简单的文件存储,而是放在一个更容易访问的地方;以及它可能常驻一个 daemon(守护进程,后台不退出的程序)、配一个 gateway(网关)来统一收发进出的请求。→ 详细
  • 持续学习(continual learning):harness 跑完之后,会根据自己产生的 trace(执行留痕)来自我改进。比较常见的一种做法是自动生成 skills;更激进的做法是让它去改动驱动自己的那套代码→ 详细
  • 但他很诚实地留了个未解:「到底哪种做法才是对的,我们还没搞清楚,整个行业也都还在探索。」这是全场唯一一处他明确承认没有答案的地方——自我改进这一环谁做谁自己踩。→ 详细
09

Mastra 的判断:大家要的是「有掌控力的 Claw」

  • 过去三个月 Mastra 认定这就是未来,于是「疯狂研究」OpenClaw 和 Hermes agent 各有哪些功能。结论是:很多人确实想要这些功能,但要的是有足够能力和掌控力(power and control)的版本→ 详细
  • 原话是:用户「不想只是把一个 Claw 随便丢进一个盒子里就完事,他们想要更多」。他随后把整条演进链条念了一遍收口:action → durability → doggedness → always on → initiative → learning→ 详细
10

「Steinberger 定律」:每个 harness 都会膨胀成 Claw

  • 他现场给这个趋势起了名字(并声明「没经过 Pete 本人同意」)——Steinberger 定律:每一个 harness 都会不断膨胀,直到它变成一个 Claw。 背景是 18 到 24 个月前还只是简单 LLM 的东西,现在已经强大太多。→ 详细
  • 这条定律有三层驱动力:技术、经济、心理——后面两节拆的就是后两层。→ 详细
11

为什么它一定会膨胀:因为我们自己要的「多巴胺赌场」

  • harness 会扩张,是因为我们希望它扩张:想在 Slack 里给它发私信,想睡前发条消息让它通宵跑任务。→ 详细
  • 他管这叫「多巴胺赌场」——投进去 token,吐出来代码(也可以是别的行动,「agent 远远不只是 coding agent 这一类」)。这张图出处:感谢 Dex Horthy。→ 详细
12

洗牌论:手机十年的剧本会重演一遍

  • 「一切越做越强」之后会有一轮洗牌。推理起点是 2010 年代的 Android/iOS:手机上能做的事一夜之间多了起来——导航、叫车。→ 详细
  • 后面十年又长出转账付款、听音乐、刷短视频、看长片纪录片、上网浏览(从桌面端搬来的)、点外卖、订住宿。→ 详细
  • 每个品类真正在用的就那么一两个 logo。他现场发问:打车用 Uber、也用 Lyft,「但在座各位还有谁在用第三个打车 App 吗?」→ 详细
  • 消费者行为专家的解释是人脑子里能装下的东西就那么多:Thumbtack 经济价值没那么高,Airbnb 虽偶尔用但真要用时非用不可、价值极高。→ 详细
  • 所以规则只有两条:要么经济价值特别高,要么使用频率特别高——DoorDash、Uber 有人一天用好几次;Thumbtack 两头都差一点,「这两条都占不上,我们就把它给忘了」。→ 详细
  • 比喻很有画面感:被忘掉的产品像大学时那个多年没联系的朋友——不是当年不重要,而是搬了城市、朋友圈和职业各奔东西,「就是没有什么事情能让他们在你脑子里冒出来」。→ 详细
  • 现在大家对 harness 一片兴奋(扔 token 出来全是有用的东西),但他判断不远的将来必有一次非常真实的洗牌→ 详细

洗牌的结论是那句最狠的话:「我们会发现,我们的生活里其实只装得下这么几个 Claw。它们非常强大,我们也非常喜欢它们。」本场无 lightning round,以下是他顺着这个结论给出的三条 → 详细

  1. 别掉队。 这正是这类大会重要的原因——如果变化的速度快了三到四倍,就意味着你得更频繁地去搞清楚到底发生了什么。「这也是我们今天聚在这儿的原因。」→ 详细
  2. 如果你在做 agent,一定要确保它具备用户真正需要的能力。 因为如果它不具备,等更新的东西出来,用户可能转头就去选那个更强的了——「这种事现在发生得非常快」。→ 详细
  3. 就算你已经爬到了山顶,也别忘了下一波洗牌还会到来,大概就在 2020 年代的后半段。→ 详细
  • Sam Bhagwat — Mastra 联合创始人兼 CEO(Mastra 是 TypeScript agent 框架)、《Principles of Building AI Agents》作者。他说书在场外可以领,自己手上也带了几本,欢迎过去打个招呼。→ 详细
🎯 于你何益 为你定制 · 非通用结论

这一篇对你相关度极高,但不是因为它教你怎么用 Claude Code。 而是因为按 Sam 的分级,你手上那几摊——Holdwell 的多角色 PRD 工厂、app_incubator 的造 App 链路、Chief of Staff 决策外脑、StockHelp 看板、这本第二大脑——全都停在「harness」这一格,一个都还没迈进「Claw」。他这 15 分钟等于列了张清单:从 harness 到 Claw 还差哪几个零件。清单上每一项,你都能在自己某个项目里找到对应的空位。


Codex Holdwell ERP work · 多角色 PRD 工厂

1)把「先想清楚」做成一档显式模式,而不是指望模型自觉

  • 怎么做的:四根支柱第一根就是 planning mode——「我们在 Claude Code 里都见过」。关键不在于模型会不会做计划,而在于它被做成了一档「模式」:进这档只出计划、不动手,出了这档才允许改东西。→ 详细
  • 你可以怎么做:你那条从澄清到定稿的流水线最疼的一处,是碰撞协议的纪律没人担保——独立初稿互不可见、碰撞各交三件,都是"写在文档里的规矩",agent 心情好就走、赶时间就跳。他的解法是把规矩降级成状态:不在提示词里写"请先做计划",而是让那个环节只暴露"读 + 写计划"这类动作,没产出计划文件之前物理上拿不到改正文的权限。这周挑最常被走过场的那一个环节,从"一句叮嘱"改成"没有产出物就不放行的一道门"。

2)能力清单该是运行期长出来的,不是设计期编好的

  • 怎么做的:他讲 skills 时强调的是时序——「我们不需要一开始就把所有 agent 都定义好」,而是可以在运行过程中动态创建出来,他的评价是「非常强大」。→ 详细
  • 你可以怎么做:你现在是先在 agent 定义里写死三驾马车的职责,再拿去套所有需求。熟悉的产品线里跑得动,一碰跨线联动就卡——因为新场景要的那个能力不在定义里。第一步不是重写定义,而是开一条"缺能力就现场写"的口子:发现现有能力不够用时,把这次的做法沉成一个新文件存进目录,下次自动可用。跑三次再回头看沉下来的是什么——那才是你 agent 定义里真正缺的,比坐着想准得多

3)「跑得完」比「编排得漂亮」更靠前

  • 怎么做的:他把 agent 和 harness 的分界线压在两个新特质上——持久性(能连续跑几小时几天,中间断线也能从断点接着跑,因为整个流被持久化了)和不撞南墙不回头的劲儿;配套是线程持久化、排队投喂、中途拨方向、直接打断,「不是我走一步你走一步的回合制……不,现在玩的是《星际争霸》,是实时的」。→ 详细 → 详细
  • 你可以怎么做:你那条流水线"产出缺可验证的闭环",很可能不是质量问题而是根本跑不完——断一次就得从头再来,于是没人愿意走完整一轮。先补最便宜的那一半:每个环节结束时把状态落盘成一个可读的续跑点(现在在哪一步、已产出什么、下一步该谁),下次从这个点接着跑。有续跑点,"完整跑通一次"才可能发生,闭环证据才有得收。

app_incubator · 造 App 的那条 agent 链路

1)产出物的落点,决定这条链路算不算「交付」

  • 怎么做的:讲云端 harness 时他点了个很实的变化——代码不再只落在本地机器、甚至也不只落在某个并行工作副本里,而是直接生成一个 PR 推到 GitHub→ 详细
  • 你可以怎么做:你这条链路的痛点写的是"激活/首屏体验",但更上游的问题是终点在哪。如果 agent 跑完,产物还躺在本地某个目录里等你手动搬,那这条链路的真实终点是"你",不是"交付"。把终点往前挪一格:让链路自己开分支、自己提 PR,你只做 review。终点一改,中间所有环节的验收标准会被自动拉齐——比逐个环节去定标准省力得多。

2)授权粒度往上放一档,风险面就整体抬高一档

  • 怎么做的:他抖了个包袱——session 级工具授权意味着这个会话里所有的 rm -rf / 都放行,「虽然第一次执行基本就把你的机器清空了」。玩笑背后是真问题。→ 详细
  • 你可以怎么做:你越往"把该做什么前移到 agent"走,这条越贴脸。给链路划一张不可逆动作清单(删文件、改远端、要花钱的调用),清单之内一律逐次确认,之外整个会话放行。这比"全放开"和"全逐次确认"都强——前者迟早出事,后者你会烦到干脆不用。

Chief of Staff apps · 宪法驱动的决策外脑

这是你所有项目里离 Claw 最近、也最该先被 Claw 化的一个。

1)心跳 + 通道,就是「被动 → 主动」的全部零件

  • 怎么做的:他给主动性举的例子是个人助理主动发来一条:「我看到一封紧急邮件进来了,这封邮件真的紧急吗?还是有人在给你发垃圾邮件?」拆开只有两个机制——它一直在监听外部信息源(不是等你开会话),以及它有心跳:每隔一段设定好的时间自己醒过来,然后做点什么。第二个零件是通道:短信、WhatsApp、Telegram,随你喜欢,它得能找得到你。→ 详细 → 详细
  • 你可以怎么做:这个外脑的设计目标是"把你写过的原则放回你眼前",可它现在只在你主动打开时才存在——而你最需要它的那一刻,恰恰是你顾不上打开它的时候。装一个最朴素的心跳:每天固定时间自己醒来,扫一眼今天的日程和昨天的记录,只在命中你写过的某条原则时才出声;再挑一条你本来就每天看很多次的通道推给你。别一次接三条通道——通道一多,你会像屏蔽推送一样屏蔽它,这个项目就废了。

2)自我改进这一环全行业都在摸,所以你不用等

  • 怎么做的:持续学习是 Claw 的最后一块,做法有两种:自动生成 skills(常见),或者让它去改动驱动自己的那套代码(激进)。然后是全场唯一一句"没有答案":「到底哪种做法才是对的,我们还没搞清楚,整个行业也都还在探索。」→ 详细
  • 你可以怎么做:这句话是一张许可证——你那个"软教练质量"的问题别指望有成熟范式可抄。先走保守那条:把每次它给建议、你采纳或拒绝的记录留痕,每季度让它读一遍自己的留痕,产出一份「哪些提醒你从来不听」的清单。这份清单既是季度回望的原料,也是它下一版提示词的输入。

StockHelp · 看板,以及你本人的价值投资

1)你的 Phase 2/3 其实就是「给看板装心跳和通道」

  • 怎么做的:他把整条演进链念了一遍收口:能行动 → 持久 → 有韧劲 → 一直在线 → 有主动性 → 会学习→ 详细
  • 你可以怎么做:你的看板停在第一格——你打开它,它才有数据。而它偏偏是所有项目里最容易装心跳的一个:收盘时间是天然的唤醒点,那 12 只 watchlist 是天然的监听对象,判断逻辑(跌进你的公允价安全边际)你也已经有了。把 Phase 2 就定义成两件事:收盘后自己拉数、只在有票跌进安全边际时推一条消息。剩下的信号设计全部往后放——"它自己会说话"的价值,远大于它说得多准

2)洗牌论的两条规则,是一把现成的护城河筛子

  • 怎么做的:他解释为什么每个品类最后只剩一两个 logo——人脑子里能装下的东西就那么多。Thumbtack 经济价值不够高、频率也不够高,两头都差一点,「我们就把它给忘了」;Airbnb 偶尔才用,但真要用时非用不可、价值极高;DoorDash、Uber 有人一天用好几次。规则只有两条:要么经济价值特别高,要么使用频率特别高;两条都占不上就出局。→ 详细 → 详细
  • 你可以怎么做:这是讲消费者行为的话,但它就是一条消费级护城河的判断标准,可以直接进你的选股清单:给 watchlist 每一只加两栏打分——单次使用的经济价值多高、用户一年用多少次。两栏都平庸的公司,无论财报多好看,都要额外解释一句"它凭什么不被忘掉"。他那个比喻还给了你把更狠的尺子:被忘掉的产品像大学时多年没联系的朋友,不是当年不重要,而是"没有什么事情能让他们在你脑子里冒出来"。问一家公司"它靠什么留在用户脑子里",比问"它护城河是什么"更难糊弄过去。→ 详细

Personal Thinking · 这本第二大脑

  • 怎么做的:Claw 的主动性不只是"会说话",前提是它一直在监听外部信息源,而不是等你开一个会话;另外 harness 还有个不起眼的零件——上下文用满时自动压缩,让长任务不至于撞墙就死。→ 详细 → 详细
  • 你可以怎么做:你这本第二大脑的痛点是摄入 SOP 和信噪比,而你其实已经有心跳的雏形了——那个定期扫最近输入、挑出"当下最该借鉴的三件事"的巡检任务。缺的是前半截:监听。补上"新东西进来自动登记"这一步(新的视频总结、研读报告一落地就入库存条),巡检才有稳定原料,而不是每次现翻。自动压缩那条则是另一个提醒:知识库也需要一个压缩动作——每季度把一批原子笔记压成一条主题结论,否则你迟早撞上自己的上下文墙。

onehuman_company · 一人公司 build-in-public

1)这一篇本身就是现成的「大佬说 X,我试了」弹药

  • 怎么做的:他现场给趋势命名(并声明"没经过 Pete 本人同意")——Steinberger 定律:每一个 harness 都会不断膨胀,直到它变成一个 Claw。→ 详细
  • 你可以怎么做:这是你那个验证体支柱最标准的原料——一句有名有姓、可证伪的断言,而你手上正好有一套多 agent 链路能拿来试。选题几乎自己就成型了:「大佬说每个 harness 都会变成 Claw,我给自己那套 agent 装了个心跳,第七天它半夜把我叫醒了」。过一下弹药库闸门:把你的实测和判断删掉之后剩下的只是会议纪要,所以必须带上你自己的三个数——装心跳花了多久、它主动说了几次话、其中几次真有用。有这三个数才有"可抄物";没有,就只是转述。

2)「不想只是把一个 Claw 随便丢进盒子里」——用户要的是掌控力

  • 怎么做的:Mastra 疯狂研究了 OpenClaw 和 Hermes 之后的结论是:很多人确实想要这些功能,但要的是有足够能力和掌控力(power and control)的版本——用户「不想只是把一个 Claw 随便丢进一个盒子里就完事,他们想要更多」。→ 详细 → 详细
  • 你可以怎么做:这句话正好戳中你这个账号的差异化。市面上一堆"我让 AI 全自动干了 X"的爽文,你的位置在反过来那一半:一个 PM 怎么给自己的 AI 员工设边界、留刹车、算成本。把"掌控力"写成内容支柱的注脚,你那条"AI 员工管理成本账"就有了靠山——你不是在讲省了多少钱,你是在讲怎么在不撒手的前提下省

你本人的精力 · 元约束

  • 怎么做的:最狠的一句在收尾:「我们会发现,我们的生活里其实只装得下这么几个 Claw。它们非常强大,我们也非常喜欢它们。」顺下来三条建议——别掉队(变化快了三到四倍,就得更频繁地搞清楚发生了什么);在做 agent 就确保它具备用户真正需要的能力,否则用户转头就走;就算爬到山顶,下一波洗牌还会来,大概在 2020 年代后半段→ 详细 → 详细 → 详细
  • 你可以怎么做:把"只装得下几个"这句从产品市场搬到你自己身上——你同时在推的项目数量,已经超过你脑子里装得下的数量。用他那两条规则给项目组合筛一次:哪个对你的经济价值特别高,哪个使用频率特别高(你自己每天都在用)。两条都占不上的不是砍掉,而是降级成"这一季不投注意力"。这跟你自己写过的"99% 的努力终将白费,盯那 1%"是同一句话,只是这回有了把能打分的尺子。

更深三个角度

该反着用。 Sam 是框架公司的 CEO:他必须让产品覆盖尽可能多的能力,因为"用户可能转头就去选那个更强的"。你的立场完全相反——你的用户只有一个人,就是你自己,而这个用户最缺的不是功能,是注意力。所以「每个 harness 都会膨胀成 Claw」这条定律,在你这儿正确的用法是反过来:不是让五个项目各自膨胀成 Claw,而是承认你只养得起一个。选一个装心跳、装通道、装学习,其余的老实停在"你叫它才动"这一格。膨胀在他那儿是竞争必需,在你这儿是精力泄漏。

和你现在做法冲突。 两处。一是你把角色和技能精心写死,把确定性当作质量的来源;他说的却是"不需要一开始就定义好,运行中动态创建"——如果他对,你那套编制就从"资产"变成"包袱",为它花的时间是沉没的。二是更贴身的:你给自己定的规矩是每周留一天思考、判断力大于努力;而 Claw 的全部意义在于它会在你没打算理它的时候主动来找你,心跳越准,那一天被切碎的概率越高。这是硬冲突,不是能两全的取舍。这里不替你下结论,但你得先回答一句:你要的是一个会打断你的外脑,还是一个绝不打断你、只在你去找它时给足弹药的外脑? 这两个答案会导出完全不同的产品。

对你的镜子。 你一直以为自己在"用 AI 工具",但按他这套分级看,你手上那几摊做的其实是同一件事——你在造 harness,而且已经造到了要不要给它们装心跳的那一格。你的身份不是"会用 AI 的产品经理",而是一个同时维护着五个半成品 harness 的人。而他讲的那场洗牌不只发生在市场上:在你有限的脑容量里,这五个也要洗一次牌,只是这次的裁判是你。他说被忘掉的产品像大学时那个多年没联系的朋友——你的项目里已经有几个是那样了,不是它们不重要,是没有什么事情能让它们在你脑子里冒出来。→ 详细


所以呢

可迁移的思维模型

  • 【耐用】「要么经济价值特别高,要么使用频率特别高,两条都占不上就被忘掉。」 对选股、对做产品、对给自己的项目排序都成立——因为它的底层不是商业规律,而是脑容量。这是本篇最值钱的一句。
  • 【耐用】心跳是「被动 → 主动」最小的那块拼图。 一个定时唤醒 + 一条能找到你的通道,就完成了从"工具"到"会找上门的东西"的相变。这个结构跟 AI 没关系,换套技术栈照样成立。
  • 【耐用】把规矩降级成状态。 关口靠"提示它要遵守"执行不了,靠"这一档里只有这些动作可做"才执行得了——planning mode 的本质就是这个。
  • 【会过期】四根支柱那张具体清单(计划模式 / 并行子智能体 / 技能 / 后台任务)。他自己说 18 到 24 个月前这些还都不存在,同样周期之后大概率又换一批,「Claw」这个词本身也会过期。别背清单,记住"harness 正在往自主的方向一级级往上爬"这个方向感就够了。

判断更新

  • 之前你大概默认"多 agent 系统的难点在编排";这一篇给的答案是难点在能不能连续跑完、断了能不能接上。持久化和续跑点的优先级,该排在"再加一个角色"之前。
  • 之前你把"主动通知"当成锦上添花、可以放到很后面的阶段;他把它列成 harness 与 Claw 的分界线。"会不会自己醒来"不是一个功能,是物种差别。
  • 心态上也更新一条:他明说自我改进这块整个行业都还没搞清楚。你不用等最佳实践,也别指望抄到成熟方案——这一格谁做谁自己踩,早踩早有数据。

这周一个赌注

StockHelp 装上第一个心跳——不是因为它最重要,而是因为它改造成本最低、反馈最快:收盘时间是现成的唤醒点,watchlist 是现成的监听对象,判断逻辑你已经有了。目标只有一个:这周之内,让它在你没打开它的时候,主动给你发出第一条消息。一条就算赢。 它一旦发出来,你同时就验证了三件事——心跳这套结构在你的环境里跑不跑得通、被主动打断的感觉你受不受得了、以及这段经历值不值得变成一人公司账号里那篇"我给看板装了个心跳"。一次押注,三件事有答案。

接着读