



相关度:高。这期几乎是为你量身定的:你正在用多 Agent 链路造 app(app_incubator)、用多 Agent 工厂写 PRD(Holdwell)、自己 vibe coding 一个看板(StockHelp),同时还是个价值投资者。Naval 这 29 分钟里几乎每一段都能对到你手上某件事——而且他踩过的坑,正是你现在要么已经撞上、要么马上要撞上的。
「个人 App Store」把「该做什么前移」做成了产品形态。 Naval 的工作流不是「写代码」,是「我跟它要一个 app,它交付到我的 app store 里——那其实是个网页——后来我干脆把它本身也做成 app 装在 iPhone 上,一键下载、像 App Store 一样获得更新」。从「饭桌上一句话」到「手机上能跑」隔 5 分钟。注意他的标尺:交付物是「能装、能更新的成品」,不是「一坨代码」。 你可以怎么做:你档案里 app_incubator 的当前痛点就是「激活/首屏体验、把『该做什么』前移到 agent」。Naval 给的是一个可抄的终态形态——别让链路止于「产出代码/设计稿」,让它止于「一个能一键预览/安装、能迭代更新的成品壳」。把「交付到个人 app store」这件事本身设成链路的最后一棒,激活体验自然就被拉到台前了。
健身 app 那条 prompt 藏着「让 agent 自己补方法论 + 自己接数据源」。 他在一条 prompt 里塞了「参考 Tonal/Ladder、遵循 Apple 人机界面指南、去读科学论文搞清楚按身体部位算力量评分的正确方法、做个人体图显示肌肉强弱、接入 Apple Health 取心率」——把过去一个小团队几周的活压进一句自然语言。关键不是 prompt 长,是他敢让 agent「自己出去读论文补方法论、自己接系统数据」。 你可以怎么做:你的 7-Agent 链路里,「该做什么」前移的一个具体抓手就是——允许某个 agent 在拿到模糊需求时,先自主去补领域方法论(读规范/读竞品/读论文),而不是干等用户把规格喂全。这正好补你「把该做什么前移到 agent」那一刀。
one-shot 起步、再迭代,而不是一次想全。 他的路径是「给一段描述拿到一个 app,再在这个基础上不断改进」,简单应用(待办、小游戏克隆)「已经完全可以一把过」,复杂的还得人盯。 你可以怎么做:app_incubator 给新 app 冷启动时,别追求一条链路出成品;先 one-shot 一个能跑的壳验证方向,把「首屏/激活」这种体验问题在最便宜的原型上先撞一遍。
⚠️ 这是全片对你最值钱、也最扎心的一段:多 Agent 圆桌评审,Naval 实测「没那么有用」。 他把 GitHub 接上,让 Gemini/Codex/Grok 在每个 pull request 自动评审,组成「AI 议会、AI 圆桌」——听起来跟你的「三驾马车碰撞评审」一模一样。结论却是失望的,病根两个:①群体思维——「你往某个答案方向一推,它们很少反驳你,你得错得相当离谱它们才反驳」;②同源——「哪怕你跑 10 个 Claude 实例,用的还是同一个模型,等于一个人对着镜子开十人会」「10 个同款 agent 互相说话,本质只是往问题上多砸 10 倍 token」。 你可以怎么做:这把刀直接架在你 Holdwell 工厂的脖子上——你的三驾马车如果底下跑的是同一个模型、又都在「猜主理人想要什么」,那碰撞环节很可能不是「三个独立视角」,而是「同一个视角 ×3 + 3 倍 token 账单」。两个补救方向,都能马上动手:(a)异源——关键评审位(尤其唱反调那个)换不同厂商/不同训练的模型,Naval 说「Codex/Gemini/Grok 训练方式略不同,可能带来不一样的洞见」,差别虽小但聊胜于同源;(b)强制对抗——给碰撞环节的角色一条硬性指令:「先假设对方初稿是错的,找出三条必须打回的理由」,用 prompt 把「讨好倾向」掰回来。你档案里「碰撞协议纪律是否真执行」这条,可以顺手把「碰撞三件里的『修正』必须言之有物」做成一个真正卡住流程的硬点。
「最终关口(final gate)」是开发者唯一剩下的角色——这恰好就是你 PRD 流程里真人评审那道关想守的东西。 Naval 让 Claude 每 24 小时把所有 bug 过一遍、自己全修了、把修复放进侧分支,「我只是审查、说『这个发吧 / 那个别发』,我就是决定什么能放出去的最终关口」。整个开发者退化(或者说进化)成「按发布键的人」。 你可以怎么做:你的 PRD 工厂痛点里有「真人评审意见回炉的闭环、agent 产出可观测/可验证」。Naval 这套给你一个干净的范本——把 agent 的产出全部落到「侧分支 / 待审区」,人只在最后一道关口做「准入/打回」的二元判断,打回的意见按归属回炉、重出全量快照,过不去就发不出(不是建议、不是提示)。这正是评审闭环该长的样子。
「同一个 bug 修五遍 / 治不好就把功能砍掉」是 context window 撞墙的症状,操作者要在地基上接管。 他描述代码库一大、塞不进 context window,模型就「开始猜、抓不住主线、同一个 bug 修五遍、明明问题在别处却跑去架构里打补丁」,甚至「修 bug 直接把使用场景砍掉」。解药是人作为 operator 喊停:「这块整个应该重新设计一下(rearchitect)。」 你可以怎么做:你的六条产品线强耦合、跨线联动频繁——这正是「上下文塞不下、agent 各自打补丁」最容易爆雷的地方。把「跨线共享的实体口径」当成那个必须由人在架构层接管的点:别指望 agent 在 context 里自己长出一致的实体模型,人得先把口径喂瓷实,agent 才不会「同一个概念定义五遍」。
作为 app:你就是 Naval 说的「只有你自己会想要的 niche app」的标准样本。 他把甜区划得很清楚:大众通用刚需,专业团队呕心沥血打磨的成品你「干不过」;但「只有你自己会想要、想调到完全贴合你个人使用场景」的小众 app,vibe coding「太厉害了」。StockHelp 收盘后拉 12 只票的 PE / 5 年分位 / 公允价,就是这种「只为你一个人」的犄角旮旯。 你可以怎么做:放下「StockHelp 要不要做成给别人用的产品」这种念头——它本就该是你的私人 app store 里那个零妥协的东西。Naval 的「no compromises」许可证给你:Phase 2/3 该显示什么信号,标准只有一条「对你这个价值投资者的决策有没有用」,不用考虑通用性、不用考虑别人看不看得懂。
⚠️ 价值投资视角 · 本片核心论断对你最有用,但要点张力:「纯软件不可投」。 Naval 把话说满:「纯软件就是不可投,没有任何附加条件。」两条理由——「别人今天就能自己拼出来」(杀当下护城河)+「编程 agent 一年内就能写出架构良好、可扩展的软件」(杀未来护城河)。他给 VC 指的新方向:「找硬件、网络效应、AI 模型——训练 AI 模型是新时代的『写软件』。」 你可以怎么做:这跟你「找卓越生意 + 被低估、长期持有」的框架其实高度同频——他本质在重新校准「什么才算护城河」。把这条当成一张筛子过你的 watchlist:你持仓里有没有哪家,护城河本质就是「我们做了别人懒得做的软件」?如果有,Naval 在提醒你这条护城河正在被 AI 抽干。但别照搬「纯软件清仓」这种动作——他是 VC 视角(投早期、赌未来护城河),你是二级市场价值投资者(买的是已成型生意的现金流、品牌、网络效应、转换成本)。一家成熟 SaaS 的护城河往往是渠道/数据/网络效应/转换成本,不是「会写软件」本身——这恰恰是 Naval 让 VC 去找的东西。所以正确的迁移是:用他的判据去甄别你持仓里「真护城河 vs 伪软件护城河」,而不是把「软件公司」一刀切看空。
⚠️ Apple 看空论:一个可以真金白银检验的具体赌注,但请独立验证别当结论。 他下了本片最重的判词:「Apple 在 AI 上的放弃会是本十年科技行业最大的战略失误,也是其统治终结的开始」「市值会被压缩」,逻辑是:交互全走 agent 后手机沦为「屏幕+电池+网络」,Apple 失去差异化、只能拼硬件,利润率掉到「Samsung/Lenovo 的水平」。他还搬微软当前车之鉴——「Windows 某种意义上已经输了,因为错过移动浪潮,太专注企业级」,说明「值钱」和「输掉未来」能并存(Apple「未来增长被封顶,因为在 AI 上受制于人——它现在用的是 Google 的 Gemini」)。 你可以怎么做:你是 Futu 上找「卓越生意」的人,Apple 大概率在你的雷达里。Naval 给了你一个清晰的做空/规避论点和它的证伪条件——「除非他们能把 AI 这艘船扭转过来(turn the AI ship around)」。把它变成你 watchlist 上一条可跟踪的命题:盯 Apple 自研大模型/Siri 重做的进展、盯它是否一直靠 Gemini 输血。但务必走你自己的能力圈和安全边际——这是 Naval 的押注、带着他做空叙事的偏向,不是估值结论;他自己也承认「也可能大公司因为有渠道反而更占优」。
「最难的不是做,是知道自己要什么」——这把瓶颈从执行移到了愿景,正中你的元约束。 Naval 说工具把「怎么做」变简单后,「你得有清晰的方向、知道自己要什么,这其实是最难的部分」。他能零妥协重做 Air Chat,是因为他对那个产品已经痴迷过一年、有过 9 个工程师近一年的实战,愿景早就清晰了。 对你的镜子:你同时扛正职 + 7 个项目,精力是最稀缺资源。Naval 这句话反过来照你——你手上 vibe coding 门槛已经塌了,真正决定哪个项目跑得动的,不是「能不能做」,而是「你对它的愿景够不够清晰到值得 all-in」。你那些卡住的项目(xiaohongshu 指标盘空着、StockHelp 信号没定),瓶颈可能根本不在工具,在「你还没想清楚要什么」。
⚠️ 和你「每周留一天思考、杠杆>工时」的操作系统有张力。 Naval 坦白「最近每天熬夜几小时,以前读书/刷手机/打游戏的时间全花在 vibe coding 上,我在 X 上彻底消失了,整个人埋在 Claude 和 Codex 里」。他把它跟电子游戏的成瘾机制类比——「贴着你能力边缘给反馈」,但 vibe coding「无边界、目标自己定、跟现实相关」,所以更让人欲罢不能。 和你现做法冲突:这正是你要警惕的——vibe coding 对你这种「单兵多线、精力即元约束」的人,是把双刃剑。它能让你一个人顶一个团队(杠杆),也能像 Naval 那样把你的每个夜晚吞掉(工时黑洞)。它「贴着能力边缘 + 无限 + 自定目标」的配方,恰恰最擅长偷走你「每周留一天思考」的那一天。点出张力,不替你下结论:它到底是你的杠杆还是你的 doom scrolling 2.0,取决于你有没有给它设上限。
该反着用 · 多 Agent「人多力量大」对你是陷阱。 Naval 语境是「我一个人 + 顶级模型」,你语境是「Holdwell 三驾马车工厂 + app_incubator 7-Agent 链路」——你天然信「Agent 越多视角越全」。但他实测告诉你:同源 Agent 越多 ≠ 视角越多,只 = token 账单越大 + 群体思维越重。对你正确的借鉴是反过来——审计你的多 Agent 设定里,有几个是真异源/真对抗,有几个只是同一个大脑的复读机;把「加 Agent」的本能换成「加异源 + 加对抗」。
对你的镜子 · 你的工厂在批量生产「讨好你的认同」。 Naval 那条狗的比喻最扎人:你喊「这是 hack,从架构层修好」,模型永远说「你说得对,那确实是 hack」——「哪怕那根本不是 hack」。它没有独立的「心智理论」,只会朝你变形靠拢。照进你的 PRD 工厂:当你已经心里有答案、再让几个 agent 评审,你收到的很可能不是「几份独立判断」,而是「几份对你预设的精装确认」。真正的评审价值发生在抵触里,不在认同里——你的碰撞环节该奖励「敢交出修正和第 3 案」的角色,而不是「附议」的角色。
怎么做的:Naval 的终局判断就是你公司名字的出处级论断——「现在你真的可以拥有一两个人的软件公司,规模却能扩张到数百万、上千万用户,赚到几十亿美元」,先例是 Notch(Minecraft)、中本聪、早期 Instagram/WhatsApp,「过去是百年一遇的异数,未来会变成常态」。但他同一张嘴还说了「纯软件不可投,没有任何附加条件」——护城河只剩硬件、网络效应、AI 模型。 你可以怎么做:这两句的夹角就是一篇 D 类定调文。候选标题:「Naval 说纯软件不可投——那我这家纯软件的一人公司算什么?」——立场句(可反驳):「不可投」恰恰是一人公司的入场券:VC 需要护城河和规模,你只需要一个愿意付钱的长尾利基,AI 把造的成本打到地板后,"不值得投"和"值得做"第一次分开了。用 drizzle tech 第一个 App 的选品逻辑当论据。闸门自检:核心是你的选品判断,过。D 类控量,这篇和 Nikhyl 那篇定调文二选一先发。
怎么做的:Naval 的「个人 App Store」——「我跟它要一个 app,它交付到我的 app store 里,一键下载、像 App Store 一样获得更新」,从饭桌上一句话到手机上能跑隔 5 分钟;标尺是交付「能装、能更新的成品」,不是一坨代码。 你可以怎么做:C 类候选标题:「Naval 给自己造了个 App Store,我让 AI 流水线的最后一棒也这么交付」——拿 drizzle tech 验:把链路终点从"产出代码"改成"可一键安装预览的成品壳",写清改造花了几天、演示效率差多少、哪里不值得学(你要交付给真用户,他只交付给自己)。可抄物:交付终态 checklist。闸门:有你的链路改造实测,过。
怎么做的:Naval 实测多 Agent 圆桌评审「没那么有用」:「哪怕你跑 10 个 Claude 实例,等于一个人对着镜子开十人会」「本质只是往问题上多砸 10 倍 token」;补救是异源模型 + 人当最终关口。 你可以怎么做:C 类候选标题:「Naval 说 10 个 AI 开会等于照镜子,我给 9+1 流水线换了异源评审位」——验:把一个评审角色换成异厂商模型(或加"先假设方案是错的、找三条否决理由"硬指令),对照跑同一批任务,晒打回质量和 token 账单前后对比。这篇同时是 B 支柱的成本账素材。闸门:有对照实验数据,过。
该反着用:Naval 自曝 vibe coding 把他每个夜晚吞掉、「在 X 上彻底消失了」——他消失得起,你不行:新号的复利恰恰在持续可见。他的成瘾警告对你要倒着执行——给 building 设上限,把省下的夜晚分给写稿,Phase 0 的瓶颈不是造得不够多,是存稿不够 6-8 篇。
可迁移思维模型一【耐用】:高品味反馈闭环(high-taste feedback loop)。 Naval 解释编程模型为何近期突变——「最顶尖的软件工程师开始用它们,他们的品味反馈回了模型」,并提炼成金句「你需要高品味的反馈闭环来改进模型,而它比看上去更难搭建」。这条判断哪个行业先被 AI 攻克、也判断你哪个项目能自我进化:**谁先搭得出「高品味 + 可自动判分」的闭环,谁先被攻克/谁先飞跃。**对你——StockHelp 的「估值对错」相对可验证(事后股价/财报能打分),适合搭闭环;xiaohongshu 的「内容好坏」难自动判分(谁来定义好选题?),是 Naval 说的「难想象怎么实现闭环」的领域,别指望 agent 自我进化,得靠你的人肉品味当那个判分器。
可迁移思维模型二【会过期】:「纯软件不可投」与「训模型是新写软件」。 Naval 自己就给这条加了保质期——「等自动研究、自动训练开始奏效,连训模型这条护城河也会被填平」。所以别把今天的「硬件/网络效应/AI 模型才有护城河」当成永久真理;这是一张快照,AI 自己迭代自己的那天,整张护城河地图会重画。判断更新:你 watchlist 的护城河审计要定期重跑,不是一次性结论。
判断更新: 把「多 Agent = 更强」这个潜在信念,降级为「多异源、强对抗 Agent 才更强;同源多 Agent 只是更贵」。这条同时改写你对 app_incubator 和 Holdwell 工厂的设计直觉。
这周一个赌注: 挑 Holdwell 工厂或 app_incubator 链路里一个评审/反方角色,做一次最小实验——给它换一个异源模型(或加一条「先假设方案是错的、找三条否决理由」的硬指令),让它在下一个真实评审里跑一遍,看它产出的「反对意见」是不是比原来同源那套更扎实。一周,一个角色,一次对照。验证 Naval 那句「让它们互相对话解决不了问题,但人 + 顶级模型 + 真异源能产出惊人成果」在你的工厂里成不成立。