ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.29
第 29 期 · 创业增长 · 收录于 2026 年 8 月 15 日

AI自我改进公司

TB
Tom Blomfield · Y Combinator
视频 13:29 原文约 1.5 万字 预计阅读 24 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 32:07
TL;DR · 三句话
  1. 别再把公司当「罗马军团」。 今天绝大多数公司像罗马军团一样,靠「人」充当信息上下传导的「管道」(conduit)来组织——命令一层层往下传、信息一层层往上报。Tom 认为 AI 从根上打破了这个默认假设:公司可以被重新想象成一组「递归式自我改进的 AI 循环」(a set of recursive self-improving AI loops),做到位之后,「公司在你睡觉的时候都还在自我改进」。→ 详细
  2. AI 不是贴在旧流程旁边的「更强引擎」,而是公司的构建层(构建材料)。 他借 Pete 的博客点破误区——「我们基本上就是把旧的工作方式原封不动拿过来,给它装了个更强劲的发动机而已」。真正关键的动作,是把藏在人脑、Slack、邮件、Notion 里的领域知识(domain knowledge / know-how)抽取出来,定义成 context / skill,让整个组织**「对 AI 可读」(legible)**。→ 详细
  3. 两条可落地的铁律:烧 token,别堆人头;干掉中层管理。 YC 已经看到公司带着比 18 个月前高约 5 倍的人均营收走到 demo day;他判断未来的瓶颈会是 token 用量而非人头。公司只需要两种角色:人人都是动手干活的 IC(一线贡献者 / builder / operator),外加对每件事「具名负责」的 DRI——不要委员会、不要一群人,就一个有名有姓的人。→ 详细

Tom Blomfield(YC 合伙人、前 Monzo 创始人)开讲,标题幻灯片「AI Native Companies」 Tom 开场用的罗马军团编制图:顶端 LEGION(SPQR 军徽)→ 10 Cohorts(军团步兵大队)→ 6 Centuries(百人队)→ 10 Contubernia(帐篷班)→ 8 Soldiers(士兵)——层层嵌套的等级 + 一致的管辖幅度 + 每级一个具名指挥,正是他说的「人当信息管道」的原型 罗马军团这套设计本质是一套「信息与命令的远程投射系统」,当年被造出来是为了把权力从罗马这个中心、横跨两个大陆,一路投射到「哈德良长城上戍守的人」身上。核心机制是三件套:层层嵌套的等级结构 + 每层一致的管辖幅度(spans of control)+ 每个岗位一个具名的人→ 详细 Tom 的关键类比:今天绝大多数公司「其实就是按罗马军团这套组织起来的,人,就是信息上下流动的管道(conduit)」——大量人其实在干「传话」,把上面的意图翻译下去、把下面的情况汇总上来。他转述并认同 Jack Dorsey:「我们默认『公司就该按等级制组织、当成创造价值的经济单元』,这其实只是一个未经检验的潜在假设」,而「AI 基本上把这个假设给打破了」。→ 详细 幻灯片「Not productivity. Rather Capability」(不是提效,而是能力):左下罗列旧范式三句口头禅——「Make engineers 20% more productive」「Add copilots to existing workflows」「Ship more software with AI」,正是 Tom 要破的「给旧车换更猛引擎」式误区 一年前(也是当下大多数人)对 AI 的理解停留在「提效」:copilot、让工程师效率提升 20%、给工作流加个副驾多出点软件。他认为这是「很错误的看待 AI 的方式」,引 Pete 的博客——我们只是「把旧的工作方式原封不动拿过来,给它装了个更强劲的发动机」。引擎再猛,车还是那辆旧车。→ 详细 全场核心论点幻灯片:「AI is not something you bolt onto the side of a company(AI 不是你贴在公司侧面的东西)/ The company itself has to be built with self-improving AI Loops from the ground up(公司本身必须从地基起、用自我改进的 AI 循环来搭)」——AI Loops 被高亮标红

🎯 于你何益 为你定制 · 非通用结论

相关度:高。 这是一期对你近乎"量身定制"的演讲——Tom 讲的"把公司本身重造成一组递归自我改进的 AI 循环",正好是你那个多-Agent PRD 工厂、那条 7-Agent 造 App 链路、还有你"一个人扛正职 + 多副业"这件事的同一道命题。他还是创始人 + 投资人,谈的是公司构建与效率本身,所以也能接到你的价值投资视角上。下面按你的项目拆。

Holdwell ERP 工厂(多-Agent PRD 工厂)

① 给你的工厂加一个"监控 agent",让它自己修自己。

  • 怎么做的:Tom 最重的实证案例分三级——前两级(查库问答 agent、会做 RAG 关联检索的引荐助手)他亲口泼冷水,说那"还只是个跟班 sidekick……让我效率提升 20%、30%",没跳出旧范式。质变在第三级:他们在上面叠了一个监控 agent,"会去看每一个 YC 员工发出的每一条查询,看它什么时候奏效、什么时候不奏效";某条查询一失败,它就自问"为啥不行?要不要换确定性工具?要不要更新 skills 文件?换个数据库视图?加个新索引?"——然后真的自己动手:"直接写好代码,往代码库提一个 merge request,再让另一个 agent 去 review、合并、部署",第二天人类问同一条就能跑通了,"一夜之间"发生。
  • 你可以怎么做:你的工厂现在最大的窟窿是"碰撞协议纪律没人盯 + agent 产出缺可观测"——也就是没人(没东西)在持续盯着每次 PRD 跑下来哪一步失了准(独立初稿是不是真互不可见、评审意见有没有真回炉)、然后把规则改对。把 Tom 这个监控 agent 抄过来:做一个轻量的"工厂质检 agent",专门读每个 AG 工单跑完后留下的产物 + 碰撞与评审记录,标记"哪个角色这次输出又不合格、哪条纪律又被绕过去了",先只让它写诊断 + 提改 agent 定义的建议 MR(别一上来就自动合并,你当审核者)。这一步同时把"agent 产出可观测/可验证"补上了——监控 agent 的失败日志本身就是可验证的证据。

② "record everything → 自我改进 artifact"——直接对到你六条产品线的跨线对齐。

  • 怎么做的:Tom 的第一性原则是"每件事只要被记录下来,对 AI 就发生过;没记录,对你的智能体系就等于没发生过"。YC 把邮件、Slack、DM、office hour 全量入库,再 diarize(说话人分离)+ 聚合压缩成"面包屑"。落点案例是用户手册:Haj 一个周末拿 2000 小时 office hour 录音重生成了一本 150 页的新手册,"比现有那本好太多",还能每月自更新——每条新建议都跟现有手册比对,要么吸收要么舍弃,于是手册成了一个"活生生的大脑 living brain"。他给的判据很锋利:"如果它产出的是一个能自我改进的 artifact,那它就是可读的;如果不是,那就扔掉。"
  • 你可以怎么做:你 8 人 PM 团队的"领域知识"现在就藏在 Tom 说的那些地方——人脑、聊天记录、散落的 PRD 里,而你六条产品线强耦合、跨线联动频繁,却还没有一份所有 agent 共认的业务实体/术语底座(这正是你「跨线对齐」的痛)。别想着"手写填满"它:照 Haj 那招,把已有的历史 PRD、评审记录、实体定义当语料喂给一个 agent,让它生成第一版跨线共享底座,然后挂上自更新闭环——每跑一次新需求,新出现的实体/字段就跟现有底座比对、吸收或舍弃。拿"它最后有没有留下一个能被 agent 继续吃进去、还能不断变好的产物"当筛子,去判断你工厂里哪些环节值得保留、哪些是花架子。

③ 把"该做什么"前移、把人撤到监督位——这正是你"评审回炉闭环"和"碰撞纪律强制执行"的解法形态。

  • 怎么做的:客服循环那段,做分流判断的是一个身兼 CPO + CTO 的 agent,由它拍板"这条建议不想做,丢掉;这条符合路线图,一夜之间搞定、部署、发布,全程不需要人"。Tom 抽象出的行动公式是:"识别出公司里哪些环节按这个模式运转,把人类从里头抽出去、只让人当监控者(supervisory capacity),然后只管往这个问题上砸 token。"
  • 你可以怎么做:你一直纠结"评审意见怎么真回炉、碰撞纪律怎么强制",本质是在问"判断该放在流程的哪一层"。Tom 给的答案是把判断前移进 agent、把人留在监督位。具体到工厂:与其在末端靠真人评审拦不合格 PRD,不如在①澄清那一步(流程最上游)就把"要不要做、做到什么粒度"问透——让"该不该做"先于"做多快"被机器问一遍——这跟你操作系统里"问该不该做先于做多快"是同一句话,只是搬到了流水线上游。

app_incubator(7-Agent 造 App 链路)

软件是易耗品、数据/context/skill 才是资产——给你"设计稿即工程契约"再加一条底层信念。

  • 怎么做的:Tom 说"Codex 现在已经够好用了,大多数简单的内部软件、内部 dashboard 你都能 oneshot 一次生成,质量相当高",他上周末亲测"简直不可思议"。所以他的策略是"珍惜数据如黄金,对待软件如易耗品"——"一两个月后模型更聪明了,就把旧软件扔掉,把你最初那组指令再喂给它重新生成"。值钱的是"人脑子里那份理解:这个职能怎么运转……业务上下文和技能才是有价值的部分,跑在上面的软件是转瞬即逝的"。
  • 你可以怎么做:你这条链路的强契约现在押在"设计稿(Figma)即工程"。Tom 的视角让你把契约的重心再往上挪一层:真正要沉淀的资产,是那份让 7 个 agent 都能复用的 context/skill 包(怎么算一个好的激活首屏、你的设计 token、组件规范),而具体生成出来的某个 App 代码反而该当易耗品。这直接回应你"激活/首屏体验、把该做什么前移到 agent"——把"什么是好首屏"写成可喂给 agent 的 skill,模型升级了就重生成 App,但那套审美/规则不丢。

本人(单兵公司 / 职业精力)

"Burn tokens, not headcount" + 一个人能压过一支团队——这就是给你这种单兵作战者的宣言。

  • 怎么做的:Tom 的硬数据是"企业走到 demo day 时的人均营收,比 18 个月前高了大约 5 倍",他判断"很快你的瓶颈就是 token 用量,而不再是人头"。更直接的是开场那句——"我是真心相信 Gary 一个人产出的代码能比一整个工程团队还多"。组织结论是砍掉中层、只留 IC + DRI,因为中层主要在干"协调、传话"这种"人当管道"的活,恰好是 AI 最擅长替代的。
  • 你可以怎么做:你的元约束是"精力与聚焦是最稀缺资源"。Tom 把这件事翻译成了一句可操作的话:你缺的不是人手,是 token 用量和"把流程拆成自我改进循环"的设计。落到你身上——别再用"我一个人忙不过来"来框你的瓶颈,改成问"我哪件反复手动的活(摄入笔记、跑 PRD、整理选题)还没被拆成一条无人值守的循环"。这周挑一件你每周都要手动重做的事,按"传感→决策→工具→质量闸门→学习"五层去搭一遍,让它在你睡觉时也在跑。这恰好喂养你"杠杆 > 工时"那条价值观。

Chief of Staff(决策外脑)

"living brain"模式——把你写过的原则录下来、让它自更新,正是 CoS 的内核。

  • 怎么做的:那本自更新的用户手册,机制是"每条新建议跟现有手册比对,要么吸收、要么舍弃",最终成为"承载我们给创始人全部建议的活生生的大脑",再作为 context 喂给 agent,"一下子拿到 16 位 YC 合伙人合在一起的智慧"。
  • 你可以怎么做:CoS 的命题就是"把你写过的原则放回你眼前"——你的宪法、2021 三条产品价值观、操作系统那几条,现在是静态文档。照"living brain"改:每次你做完一个决策、或事后回望发现某条原则需要修正,让 CoS 把这条新判断跟宪法比对、吸收进去,而不是让宪法一年不动。你那块"季度回望"痛点,本质就是缺这条 record→比对→吸收的闭环。

StockHelp / 投资视角

5x 人均营收不是段子,是给你筛"卓越生意"的一条新尺子。

  • 怎么做的:Tom 反复的实证是"demo day 人均营收比 18 个月前高约 5 倍",并预判这趋势会延续到 A 轮、B 轮——少的人、高的产出、token 取代人头。
  • 你可以怎么做:作为价值投资者找"卓越生意 + 被低估",AI 时代的护城河与资本配置正在重定价。把"人均营收 / 增速 vs 人头增速"加进你看公司质量的镜头:那些营收猛涨但几乎不扩编(甚至缩编)的公司,可能正是 Tom 说的"AI 原生"红利的早期受益者;反过来,营收增长靠疯狂堆人头撑着的,护城河存疑。StockHelp Phase 2/3 想做"信号"时,这是一个值得加的基本面比率——不必现在做,先记进你的选股逻辑清单。

更深三角度

  • 该反着用:Tom 的语境是"一屋子 YC 创业者、要把整家公司推倒重建",资源、团队、试错预算都在;你是单兵 + 精力紧 + 正职在身。所以"全职能自我改进公司"对你不是目标、是过度工程——他自己也老实承认"我不确定有没有谁真做出了一家每个职能都自我改进的公司"。正确的反向借鉴:别想着把你 6 个项目全都改造成自我改进循环(那会烧光你最稀缺的精力),只挑一条最高频、最痛的链路(八成是 Holdwell 工厂)做深一个监控 agent,其余先维持现状。他能"砸 token"是因为有 YC,你的"token"是你自己的注意力——更要省着砸在那 1% 上。
  • 和你现在做法冲突:你的本能是"把地基(跨线共享的业务底座、宪法)先手工填扎实再让 agent 上"——这是产品经理的严谨。Tom 直接顶你:"record everything、让 agent 生成第一版、再挂自更新",他赌的是"先有可自我改进的脏 artifact,胜过迟迟憋不出的完美地基"。这张力你得自己掂:你信"判断力 > 努力、盯那 1%",那到底是"手工把地基做对"更接近那 1%,还是"先让它跑起来、在迭代里逼近对"更接近?他没替你下结论,你也别急着站队,先在工厂那一处小范围试他的路子,用结果说话。
  • 对你的镜子:你常把瓶颈归到"我一个人,时间不够"。Tom 这场演讲是面镜子——他让你看见,瓶颈可能从来不是"人手少",而是"你还没把哪些活拆成能在你不在场时自己变好的循环"。"公司在你睡觉时也在自我改进"这句话,对一个单兵作战者的诱惑和意义,比对一个有团队的 CEO 大得多。

One Human Company 新号(2026-07 回填)

① "烧 token,别烧人头"就是你 B 支柱(AI 员工成本账)的镇柱选题。

  • 怎么做的:Tom Blomfield 的硬数据是"YC 公司走到 demo day 的人均营收比 18 个月前高约 5 倍",判断"很快你的瓶颈就是 token 用量而不是人头";组织上砍掉中层、只留 IC + DRI——人人动手干活、每件事一个具名负责人。他甚至说现在最粗暴的观察指标就是"看每个人的 token 用量"(自己也承认这指标蠢、可刷,但方向对)。
  • 你可以怎么做:这是一篇现成的 C 类「大佬说 X 我试了」:候选标题**「YC 合伙人说要烧 token 别烧人头,我把一人公司这个月的 token 账单摊开算了笔账」**——拿 drizzle tech 验的是:9+1 个 agent 角色这个月各烧了多少钱、折算成"假想人头"等于几个员工、哪个角色的 token 花得最冤。可抄物:一张"token 账单 → 人头等价"换算表。闸门自检:账单和判断全是你自己的实测,删掉后文章不成立——过。

② "监控 agent 让系统自己修自己"是一条能持续产出 A/B 类内容的实验线。

  • 怎么做的:Tom 最重的案例分三级——前两级 agent 只是"提效 20-30% 的跟班",质变在第三级:叠一个监控 agent,盯每条失败查询、自己诊断、自己写代码提 MR、让另一个 agent review 合并,"一夜之间"修好。他的判据也锋利:"能产出自我改进 artifact 的流程才叫可读,不能的扔掉。"
  • 你可以怎么做:给 drizzle tech 装一个最小监控 agent(只读流水线失败日志、出诊断清单、你终审),过程本身就是一篇 C 类:「YC 说公司该在你睡觉时自我改进,我给 AI 流水线雇了个'夜班质检员',第一周它抓到了这些」。之后它抓到的每次翻车都是 B 类"AI 员工绩效/返工"的天然素材。这条线的好处是内容和产品建设是同一份工——不用为发帖额外干活。

③ "record everything"给 build-in-public 一个比"晒过程"更硬的理由。

  • 怎么做的:Tom 的第一性原则:"每件事只要被记录下来,对 AI 就发生过;没记录,对你的智能体系就等于没发生。" YC 靠 2000 小时 office hour 录音,一个周末重生成了 150 页用户手册,还能每月自更新成"living brain"。
  • 你可以怎么做:你的号本来就要求"每篇讲清一个决定"——照 Tom 这条,你写的每篇复盘同时是喂给 drizzle tech 的语料:决策、翻车、成本被记录下来,既是内容又是公司资产。可以直接立成一条 D 类立场句:"build-in-public 不是营销,是给你的 AI 员工写训练数据"——有自家闭环垫底,立场鲜明、可反驳。

所以呢

  • 可迁移思维模型
    • 【耐用】"递归自我改进循环"作为组织单元(传感→决策→工具→质量闸门→学习,最后一层接回起点)——这是一个跨载体的结构:公司、你的工厂、你的第二大脑摄入流,凡是"反复发生、能留下产物"的活都能往上套。模型会变、工具会变,这个"让系统在无人值守时自己变好"的框子不会过期。
    • 【耐用】"没被记录的,对智能等于没发生"+ "能产出自我改进 artifact 才算可读"——一条筛流程的硬筛子,十年后依然成立。
    • 【会过期】"直接量 token 用量当观察窗"、"Codex 能 oneshot 内部软件"、"销售真人还得在场 20 年"——这些是 2025/2026 这个时点的能力快照,Tom 自己当场就在改口("我本来想说打电话,但 AI 现在已经能介入电话了")。半年就该重新校准,别当定律。
  • 判断更新:你大概率原来把 AI 在你项目里的角色定位成"提效工具"(让 PRD 写快点、让 App 生成快点)。这期之后该更新成:AI 是你项目的"构建层",而你最该设计的不是"更快的单步",而是"无人值守的闭环 + 你站在监督位"。"提效 20%"和"系统自己走完循环搞明白怎么自我改进"是两个物种。
  • 这周一个赌注:在 Holdwell 工厂里,给它加一个最小可用的"质检 / 监控 agent"——只做一件事:读最近 N 个 AG 工单的碰撞与真人评审记录,列出"哪个角色这次又输出不合格、哪条纪律被绕过(独立初稿是否真互不可见)、哪条评审意见没回炉",输出一份诊断清单(先不自动改、你当审核者)。一周,一条链路,一个 agent。这一注同时啃掉你三个痛点:碰撞纪律没人盯、评审回炉缺闭环、agent 产出缺可观测——因为这个 agent 的失败日志,就是你一直缺的那份可验证证据。
接着读