这期是 Anthropic 首席产品官 Mike Krieger(Instagram 联创)系统讲「智能体原生产品」怎么造、团队怎么搭、节奏怎么把。你手上同时在跑两条 agent 流水线——app_incubator 那条 7-Agent 造 App 链路、Holdwell 那座多角色 PRD 工厂——这期几乎是冲着这两件事来的,强相关。下面按项目落到具体的事上。
app_incubator(7-Agent 造 App 链路)
1 · agent-native 第一原则,建议直接焊进你 7 个 agent 的契约层
- 怎么做的:Krieger 说这是他「用得最多的那个词」——「凡是用户在 app 里能做的,agent 都能做」,而且产品的每个最基本积木(一条文档、一个项目)都要被模型「知道」且「可改」。他还点了反面:Claude AI 是 2024 年的产品,没从一开始把这条烙进去,结果用户让它「把这个加进项目知识库」,它居然回「好,让我告诉你加进去的步骤……」——本该原生直接做的事,退化成了教程。
- 你可以怎么做:你 app_incubator 里已经有「设计稿即工程强制契约」。在那份契约里再加一条硬约束:每个被生成的 app,凡是终端用户能在界面上做的操作,都必须暴露成 agent 能直接调用的动作,不能只生成「让用户自己点」的 UI。验收时拿 Claude AI 那个反面案例当 checklist——让你的某个 agent 试着「请 agent 替我改这个」,如果它回的是步骤说明而不是直接动手,就是没达标。
2 · 「该砍什么」才是真瓶颈,给链路加一道「砍」的强制 gate
- 怎么做的:全片第一句金句——「今天的 model 很擅长往产品里加功能,但不擅长判断该砍掉什么」。他用自己做实验佐证:让 Claude 两小时把 Instagram 前身 Bourbon 重做到「功能齐全」,模型还自作主张加了当年没有的滤镜。动手建已经轻松到离谱,难的是品味。Dan 现身说法踩了坑:他做的 Proof 因为「vibe coding 太上瘾」越加越乱,造出个「四不像」,最后整个推倒、只留「一个可分享的 markdown 链接」才爆。
- 你可以怎么做:你的链路现在大概率是「往前加 agent、加能力」的方向。给它补一个对称的反向环节——某个 agent 专职问「这一版能不能砍掉一半」。具体动作:在 app 产出 V1 后插一道「减法评审」,强制列出「哪些功能是因为能做才做、不是因为该做」,默认砍掉,要保留得给理由。这正对你「把'该做什么'前移到 agent」这个痛点——把「该不该砍」也前移给 agent,而不是等用户用崩了才发现臃肿。
3 · 「室内长树」——别让 vibe coding 一次性甩出整棵树
- 怎么做的:树养在室内不经风吹会长歪,因为它需要「来回推它的力」。映射到产品:开发被加速太猛,本该「一次做一件、拿给用户试」的循序渐进,被压成「室内一下养出整棵树」——你手上突然有个完整东西,但「没有每一步积累起来的直觉、没经过经验检验」。对用户也是灾难:等于把人「直接扔进电视剧大结局那一集」,人懵「这都是谁、我怎么被默认全懂了」。
- 你可以怎么做:你的痛点写着「激活/首屏体验」——这条几乎是为它写的。让 agent 一口气生成的完整 app,恰恰最容易把新用户扔进「大结局」。动作:在链路里加一个「首次使用路径」约束,让 agent 不只生成功能矩阵,还要生成一条「第一集→第二集」的渐进上手路径(先露一个核心动作、跑通了再解锁下一个),而不是开屏就把全部能力摊开。
4 · 验证 agent-native 产品不能写传统端到端测试——让 agent 自己「演练」给你看
- 怎么做的:Krieger 说 agent-native 软件「就是一种完全不同的测试」,「你很难写端到端功能测试,因为它本身带不可预测性」。Labs 的方向是搭 harness「尽可能多地演练那些 agent-native 能力」。还有个会心案例:他做的工作日志 app,让 Claude 去交互,结果两个 Claude 在聊天里自己聊起来了(「我老板对我很凶」「真替你难过」)——「你不会为这种情况写单元测试,但它可能冒出涌现的点子」。配套是「工作量证明」三层:不要任由模型说「我读了代码,看起来没问题」,他的反驳「代码就是你写的,我才不信你呢」。
- 你可以怎么做:你 7 个 agent 互相产出、最后吐一个 app,传统跑通测试覆盖不了「agent 实际能不能用这个 app 干活」。动作:给链路加一个「演练 agent」,让它真的去操作生成出来的 app、走一遍真实用户会走的流程,把过程录下来(Krieger/Dan 都在用录屏当验收物),而不是只看「构建成功」。在每个 agent 的 prompt 末尾加一句硬要求:「提交前,先向你自己、再向我证明它确实按预期工作。」
Holdwell ERP(多-Agent PRD 工厂 · 三驾马车 + 碰撞协议)
1 · 「用心程度证明」——你碰撞环节正缺的那把尺
- 怎么做的:Krieger 区分了两层。「工作量证明」是「你确实演练过」;更高一层是「用心程度证明(proof of thoughtfulness)」——他常碰到工程师提改动,他一问「你为什么选这种做法而不是那种」,「很多时候答案是:他们没选,那是模型做的选择」。这种选择「也许还算合理,但不是放进整个范式里最优的那个」。他警告:一堆想当然的小决定叠起来,就成了「一座你自己都没意识到的假设之塔,地基早就歪了」。
- 你可以怎么做:你的痛点里有「碰撞协议纪律是否真执行」——「假设之塔」简直是给它量身画的。在碰撞与合成环节(尤其涉及实体建模、新 primitive 的需求)加一道强制问答:每个关键设计选择,agent 必须回答「为什么是这个方案、被否掉的备选是什么」——碰撞三件里的「第 3 案」本来就在逼这个问题,答不上来=没想透=不准进合成定稿。这比「检查产出格式对不对」更能堵住「模型替你拍板、你不知道」的洞——正好让碰撞从走形式变成真纪律。
2 · 主智能体别自己干活,把活委派给子智能体、保持主循环常开
- 怎么做的:Krieger 在 Claude Code 里「强烈写了一条 prompt」:「你自己别干太多活,把活委派给子智能体。」好处是「大部分时候主运行循环都空着,随时能跟你对话」——这让它「感觉更像一个能对话的人,而不是一个你丢活给它、然后它卡上五分钟的工具」。
- 你可以怎么做:你是三驾马车 + PM 主持的编排。如果「主编排者」(product-manager)自己也在埋头干具体活,它就会经常「卡死」、没法响应你中途的调整。动作:把编排层和执行层拆干净——让顶层只做澄清、派活、主持合成收口,具体 PRD 章节交给子 agent 写。这直接对到你的「跨线对齐」痛点:一个常开、随时能被你打断重定向的协调者,比一个埋头跑完才抬头的更好对齐。
3 · 「影子组织架构图」——信任随 agent 在团队里传递
- 怎么做的:Dan 描述了一条信任链:我用我的 agent 干我擅长的事,别人看我用它干这些、知道我擅长什么,「他们信任它是因为他们信任我」;它又「根据我自我调整」,于是信任被「转移」过去,组织里的人也开始用它干这类活——最后长出一张「影子组织架构图」:每个人的 agent 因为主人擅长的那件事而被大家知道、被大家调用。
- 你可以怎么做:你的工厂是三个固定角色(如同三个「岗位」)。这条提示一个演进方向:每个角色 agent 不只是「执行某类任务」,而应携带「这个岗位的判断与品味」,让别的 agent(和你)逐渐信任并直接调用它的判断,而不是每次都从头校验。也对到「agent 产出缺可观测/可验证」——信任是靠「别人看它干成过这类事」攒出来的,所以工单要留下「这个角色 agent 干成了什么」的可见痕迹,信任才传得起来。
4 · 删功能当使命 + 模板化 vs skill化的平衡点
- 怎么做的:Krieger 夸 Claude Code 团队「几乎把删功能当成一种使命」,判断标准是「这个东西没起作用,就下掉它」。教模型用 agent-native 方式时,关键是找「模板化(固定骨架)和 skill化(打包成可调用技能)之间的平衡点」——以及「那个平衡点到底在哪」。他还做了个「关于 Claude API 的 skill」,因为新模型一发布就不在模型固有知识里,会出现「不,那叫 Sonnet 45」「不不不」的鸡同鸭讲。
- 你可以怎么做:你的 agent 定义与协议约束都收在
.Codex/agents/*.toml 和碰撞协议里。对照「删功能当使命」——定期审一遍:哪些约束/步骤其实没在产出里真正起作用?没起作用的果断下掉,别让协议越写越厚、变成你自己的「假设之塔」。对照「模板化 vs skill化」——审每个环节:它到底该是个固定模板(每次照填)还是个可被 agent 灵活调用的判断?放错位置(该灵活的写死、该写死的太散)就是碰撞纪律走形的一个隐藏来源。
StockHelp(价值投资看板)
1 · Phase 1 只看数据 = 教科书级的「精简 V1」,别急着加信号
- 怎么做的:Cowork 案例——这种产品他们「琢磨了很久」,最后拍板「10 天内放出去」最精简的 V1。Krieger 说「V1 本该或本可以有上百样东西,但它没有」,可它「已经够好用,足以在外面验证出点什么」;他甚至怀疑「再开发两个月、加 50 个功能会不会更有用」,因为那多半「又在搭室内的树,一接触真实就发现根本没人想要那个,大家想要的是另外那块」。
- 你可以怎么做:你 StockHelp 的 Phase 1 就是「只看数据」、Phase 2/3 才做信号通知——这恰好就是 Krieger 说的对的节奏,给你一个外部背书:别被「该不该现在就加买卖信号」诱惑。先让「Phase 1 只看 PE / 5 年分位 / 公允价」这一版自己用够久,看你真实盯盘时缺的是哪块,再据此决定 Phase 2 加什么——而不是凭想象一次加满。
2 · 「安全的游乐场」——边缘要稳,中间才能放开
- 怎么做的:「能有游乐场的唯一前提,就是它的边缘是安全的。」只有把外围护栏(数据安全、不越权、不崩)做死,中间才敢让 agent 自由发挥。Krieger 还讲了稳健性的标尺:不一定要 WhatsApp 那种荒野一格信号也发出去,但「至少加载消息时感觉稳、显示已发送就是真发了,那里有个小小的对勾」;以及到底是「建在沙子上还是有结实主干」。
- 你可以怎么做:你这是自用投资看板,「边缘安全」对你=数据正确性这条护栏不能松。具体:估值数字(PE、5 年分位、target_pe×EPS 算的公允价)是你做买卖判断的地基,这块必须「显示对勾级」的可靠——拉数失败要明确报错,绝不能默默显示上次的旧值让你误判。把这条钉死了,Phase 2/3 的信号、通知才敢往上搭;地基是沙子,越往上加越危险。
职业 / 你本人精力(聚焦、杠杆、该 all-in 哪个)
1 · 保持小团队 + 你这种「一个人多线」其实占了 AI 时代的便宜
- 怎么做的:核心数字——「在 AI 领域每隔 3–6 个月,你就得把产品里差不多一半的东西扔掉」,而「如果只有一个 GM 自己意识到'我得直接把这一半扔掉,因为模型强太多了',转向就容易多了」。他反复证明扩张太快是「净负面」:人多了「最后把所有时间花在协调上」,开一堆对齐会;连 Instagram「就我们俩,让两个人想到一块就已经够难」。
- 你可以怎么做:你的元约束是「一个人扛正职+多副业,精力是最稀缺资源」。这期给你一个反直觉的安慰:你「一个人」恰恰是 AI 时代最灵活的形态——不用跟任何人开对齐会,模型一变强你能立刻把半个项目推倒重来。所以别因为「人手不够」焦虑去拉人协作;真正该做的是养成「每 3–6 个月主动扔掉一半」的肌肉。这周可挑一个副业,问自己「如果今天模型水平重做,我会砍掉它现在哪一半」。
2 · 「极强信念」是启动的把关因素——帮你判断该 all-in 哪个下注
- 怎么做的:Krieger 说启动新项目「最重要的把关因素,是得有一个人抱极强信念」——但澄清信念该落在「问题领域」而非「具体想法」(对具体想法太执着很危险)。劲头要到「我会一直撞墙,直到这事要么被证明成立、要么彻底死掉」。反面信号是项目「丧钟」:复盘发现「团队里没一个人真觉得这是值得做的事,大家只是觉得'听起来挺合理'」。
- 你可以怎么做:你在纠结「该 all-in 哪个编码下注」。拿这把尺筛你手上 6 个项目:哪个是你愿意「撞墙撞到它成或死」的?哪些只是「听起来挺合理」?后者就是你的精力黑洞。注意他的细分——信念该落在「问题领域」:你对「价值投资该有什么工具」「ERP 该怎么用 agent 造」哪个领域有那种非做不可的劲,比你对某个具体功能更值得信。
投资视角(你是价值投资者 · 顺手问一句)
这期最该进你投资脑子的,是「会过时的版本」这个颠覆陷阱。
- 怎么做的:Dan 抛的尖锐观察——「如果你现在在 AI 领域卖给企业,哪怕产品很现代,它也会相当快变得相当过时,可你的客户偏偏想要那个过时的版本」;「只要你为'某家巨型上市公司现在会买的东西'做优化,你就很容易被颠覆」。Krieger 补具体困局:很多 2–3 年前起步的创业公司,「有套特定技术栈、特定'我们这么做 AI'的思路,模型已天差地别,但跟客户签的合同还按那套过时的来」,并点名「你看 Copilot 之类的,差不多就那种感觉」。Anthropic 的应对范式是「列车持续前进 + 沿途给企业开关」:核心一直演进,给企业留「不想用就关掉」的旋钮(Coda 案例从第一天就带开关)。
- 你可以怎么做:作为找「卓越生意+护城河」的价值投资者,这给你一道筛 AI 公司质量的硬题——别只看它现在产品多先进,要问「它的护城河是不是建在一个会被下一代模型抹平的范式上」。具体落到能力圈:评估任何 AI/SaaS 标的时,问三件事——① 它跟企业签的长约,是锁死在某个会过时的技术栈,还是「列车+开关」式能持续演进?② 它愿不愿意整段重写自己的栈(Krieger 说现在重写是「月」尺度,不愿重写的就是「等着被从零重做的公司取代」)?③ 它是「为巨头现在会买的东西做优化」还是为终局做优化?这套问题可以沉淀成你 StockHelp 的一条定性 checklist,专门给 AI 时代的标的用。
🔍 更深三角度
该反着用:Krieger 整套是「资源足、人手多、要刻意保持小」的语境——Labs 还能在「人才池」里调人进出。你正相反:你天生就是一个人,没有「扩张太快」的风险。所以对你,这期的正确读法不是「保持小」(你已经够小),而是反过来——把他用来对抗大公司协调成本的那套(委派给子智能体、模型一变就重写、删功能当使命),直接当成你一个人放大杠杆的工具。他的「小」是节制,你的「小」是优势,别把节制误读成你也得克制造东西。
和你现在做法冲突:你这本第二大脑、你的多 agent 工厂,骨子里都是「不断往里加」——加主题、加笔记、加 skill、加 agent 角色。Krieger 全片在反着说:最大的错是「不断加功能而非删功能」,「八个功能撑不起好产品、也许第九个就行」是自欺。这跟你「摄入 SOP、信噪比」的痛点正面撞上——你的知识库和你的工厂,会不会也在「加第九个」?张力摆这儿,结论你自己下:你下一个动作,是再加一个,还是先删掉一个没在用的?
对你的镜子:Krieger 那句「代码就是你写的,我才不信你呢」,照出的不只是怎么验收 agent——而是你对「agent 替你做的所有决定」的默认信任度。你同时在用 agent 造 app、造 PRD、(未来)给投资出信号;你有多少次是接受了「模型做的选择」、却没问过「为什么是这个、被否掉的是什么」?你最稀缺的是精力,但省掉「想透」这一步省下的,恰恰是你最不该省的那部分判断力——而判断力 > 努力,正是你写在操作系统里的第一条。
One Human Company 新号(2026-07 回填)
1 · 「模型擅长加功能、难在该砍什么」——一篇能出强对比图的 C 类验证体
- 怎么做的:Krieger(Anthropic CPO、Instagram 联创)全片第一金句:「今天的 model 很擅长往产品里加功能,但不擅长判断该砍掉什么。」他让 Claude 两小时重做 Instagram 前身 Bourbon,模型还自作主张加了当年没有的滤镜;Dan 的 Proof 因为「vibe coding 太上瘾」越加越乱,最后推倒只留「一个可分享的 markdown 链接」才爆。
- 你可以怎么做:选题化成 C 类:「Anthropic CPO 说 AI 难在砍功能,我给 AI 员工加了一道『减法评审』岗」——拿 drizzle tech 验:在第一个 App 出 V1 后强制跑一轮「哪些功能是因为能做才做」,晒砍前砍后的功能清单对比 + 砍错了什么(诚实反驳的空间就在这),判断收在「模型不会替你砍,一人公司里『砍』就是那个人类唯一不可外包的活」。可抄物:「减法评审三问卡」。闸门自检:砍单是我的实测,能过。这也是 A 支柱(方案取舍)的正面题材。
2 · 「每 3–6 个月扔掉一半产品 + 团队刻意保持小」——你新号「一人公司」立场的最硬外部背书,可做 D 类立场文
- 怎么做的:Krieger 的核心数字:「在 AI 领域每隔 3–6 个月,你就得把产品里差不多一半的东西扔掉」,而人多了「最后把所有时间花在协调上」;连 Instagram「就我们俩,让两个人想到一块就已经够难」。一个人意识到「我得直接扔掉这一半」,转向就容易多了。
- 你可以怎么做:D 类候选(带可反驳立场句):「一人公司不是人手不够,是 AI 时代最快的转向单位」——立场句摆头条,论据用 Krieger 的 3–6 个月数字 + 你 drizzle tech 一次真实的「模型升级后我一晚上重写了某条流水线」的经历压阵。这条直接回答了你账号会被反复问的质疑(「一个人能干过团队?」),值得进存稿。注意 D 类控量在 20%,这篇算立号之作级别的一篇,不是常规款。闸门自检:有我自己的转向实例,能过。
3 · 「用心程度证明(proof of thoughtfulness)」——你弹药库闸门的官方命名,焊进办号纪律
- 怎么做的:Krieger 区分两层:「工作量证明」是你确实演练过;「用心程度证明」是他问工程师「为什么选这种做法」,很多人答「那是模型做的选择」——一堆想当然的小决定叠成「假设之塔」。价值单元正从前者升级到后者。
- 你可以怎么做:这就是你「删掉我自己的判断和实测,这篇还成立吗」闸门的另一种说法——读者收藏你,收藏的是用心程度证明,不是工作量证明(AI 编译文就是纯工作量)。经营动作:把「每篇必须回答一次『为什么选这个方案、被否掉的备选是什么』」写进你的发文自检清单,和可抄物并列成第二道硬门。这一条不用发文,先焊进流程。
🧭 所以呢
可迁移思维模型
- 【耐用】「该砍什么」比「能加什么」难,且只能靠真实使用磨出来。 这条不随模型迭代过时——模型越强、加得越容易,"砍"的品味反而越值钱。适用于你每一个项目,也适用于你筛投资标的(一家公司敢不敢砍自己的旧功能,是它有没有产品力的信号)。
- 【耐用】假设之塔。 一堆「看起来合理」的小决定叠起来,地基早歪了你还不知道。这是你做 agent 编排、做投资决策的通用警报器——每隔一阵,把塔拆开看看底下那几块假设还成不成立。
- 【会过期】「3–6 个月扔掉一半产品」「重写是月尺度」「现在能招轻技术的 GM 了」。 这些是 2026 年初这个模型水平下的具体节奏,半年后数字会变(Krieger 自己都说「不敢讲整个 2026,就说到 8 月底」)。当成此刻的校准、别当成永恒定律。
判断更新:你大概默认「一个人=人手不足=劣势」。这期该把它翻过来——在「每几个月要推倒重来」成为常态的 AI 时代,一个能把整件事装进自己脑子、不用跟任何人开对齐会的人,反而是最快的转向单位。你的稀缺不是人手,是「敢不敢删、想不想透」。
这周一个赌注:挑你 6 个项目里最臃肿的那一个(最可能是这本第二大脑、或那座 PRD 工厂),做一次「减法评审」——列出「哪些是因为能做才做、不是因为该做」,当周至少删掉一个。一个动作同时练你最缺的两块肌肉:删的勇气 + 把「为什么留/为什么删」想透。