本期相关度:高。 这场演讲讲的是「AI 生成物的验证机制」,正对上你 PRD 工厂两个最疼的地方——真人评审意见回炉缺一个真的会拒绝的闭环,以及agent 产出拿不出可验证的证据。下面按项目对。(家居号 xiaohongshu_momorain 这次确实没有可对的点,略过不写。)
一、Codex Holdwell ERP work · 多-Agent PRD 工厂
1. 「评审意见回炉缺闭环」这个痛点,本期给了它的形状
- 怎么做的:Sonar 反复强调,验证必须「完全可审计、完全可解释」,而且是「算法化的、可重复的、一致的」。但真正让门禁成为门禁的是那句最朴素的话——「除非各项都达标,否则不让这个 PR 往生产环境走」。他们的做法是把质量、安全、可维护性三项分别打分,不过就卡住,然后交给 fix agent 去修,修完重跑。
- 你可以怎么做:你的碰撞协议每一步流转(独立初稿→碰撞→合成定稿→真人评审),现在多半是「agent 给出意见 → 人或下一个 agent 自己决定要不要理」。挑最贵的那一道(我押合成定稿前那一道),把它改造成能返回「通过 / 不通过」的机器检查:先定 3–5 条机器判得了的硬条件——比如每个需求点是否都有配套的验收标准、引用的实体是否与产品线现有口径对得上、是否列出了受影响的上下游产品线——任何一条不过就不许进下一步。agent 的自然语言意见照旧输出,但从此不再持有放行权。
2. 「不要用写代码的 AI 去验它自己写的代码」——这条直指多-Agent 自评的软肋
- 怎么做的:零信任的定义里有一句很硬的推论:「你不会想用同一个 AI 去校验它自己写的代码」,要「用一套跟『写代码』不同的方法论去审查代码」;所以他们坚持多层——计算式审查(规则/数据流/控制流那类确定性分析)+ LLM 审查同时上,因为「光靠一两种方法,你不可能把所有问题都揪出来」。
- 你可以怎么做:你的三驾马车碰撞(补强/修正/第 3 案)目前基本是「LLM 评 LLM 的产出」,方法论同源,能发现的错误类型也同源。给每一路意见配一条非 LLM 的确定性检查做底:术语一致性用词表比对(而不是问模型「术语一致吗」)、实体与字段引用对着产品线现有口径做存在性校验、跨线影响用依赖表跑一遍闭包。让 LLM 负责「发现你没想到的问题」,让脚本负责「保证该有的东西一定有」——这两层的失效方式不一样,才配叫多层。
3. 「agent 产出缺可验证证据」:卡内基梅隆那条三个月曲线告诉你该量什么、什么时候量
- 怎么做的:CMU 用 GitHub 元数据把项目分成用 AI 和不用 AI 两组,发现生产力飙升只持续约三个月就回落,而静态分析告警数和代码复杂度是持续上升的。也就是说:只看短期收益指标,试点结论必然乐观;成本是滞后出现的,而且不会自己消失。
- 你可以怎么做:给 PRD 工厂补一个同构对照——一组用三驾马车产出的 PRD,一组走原流程;短期指标(PRD 产出周期、评审轮次)和滞后指标(需求返工率、开发端提问次数、上线后变更单数)一起采;并且现在就把三个月后的复测日期写进日程。你目前手上大概率只有头几周的爽感数据,那恰恰是 CMU 曲线里最会骗人的那一段。
二、app_incubator · 7-Agent 造 App 链路
1. 规格必须「写下来并编码固化」,才轮得到谈「强制契约」
- 怎么做的:Sonar 说无论内外循环,开跑前都得先有规格:架构约束、编码规范与模式、哪些依赖可以用哪些不许用、日志与可观测性实践;外加一套单独定义的质量标准(安全 / 质量 / 可维护性各愿意接受什么水位)。落点是那半句「你得把它写下来、编码固化」。
- 你可以怎么做:你的「设计稿即工程强制契约」现在强在设计一侧,弱在它是不是机器判得了。把契约拆成一份机器可读清单——token 名、组件白名单、允许引入的依赖、无障碍与点击区底线——在 agent 生成代码后自动比对,不符就退回重写。「强制」这两个字,只有在存在一个会真的拒绝的地方时才成立,否则它只是一份措辞很严肃的建议。
2. 边写边验,比事后大扫除便宜一个量级;顺带还省 token
- 怎么做的:Sonar Vortex 的做法是让 agent 一边写一边回调拿问题列表、当场修,理由是这些问题「不会继续传播到后面那些为了把整个软件项目搭完而要跑的 agentic loop 里」。同时他强调不能把整个代码库砸给 agent,否则它会「花大量时间来回折腾、四处探索,还一路烧 token」。
- 你可以怎么做:把 lint、类型检查、契约比对做成 agent 自己能调用的工具,而不是流程末尾的人工把关,让它写完一屏就自查一屏;同时把喂进去的上下文按当前任务裁一遍,别整包塞。这两件事一起做,省的是同一笔钱——返工和 token 是一回事。
三、onehuman_company · 一人公司 build-in-public
1. 「AI 写代码的生产力增益三个月就没了」是一条现成的验证体选题
- 怎么做的:CMU 这个结论有出处、有明确时间窗(约三个月)、有明确的反向指标(静态分析告警 + 代码复杂度持续上升),而且反直觉——正是「大佬说 X 我试了」这个支柱最好的原料。
- 你可以怎么做:拿 drizzle tech 的 agent 链路做一次真实回测:把过去三个月里 AI 生成代码的返工次数、被推翻的方案数、每个功能从开工到能用的实际周期拉出来,看你自己的曲线是不是也在第三个月拐头。这条能过弹药库闸门——删掉你的实测数据,这篇就不成立。按你的规矩把标题和封面前置:把那个拐点数字直接放标题上。
2. 「验证债」这个词很好用,但别只做转述
- 怎么做的:讲者用一个词(verification debt)把一堆模糊的不适感命名了——AI 帮你写得更快,但把「确认它没问题」这份活儿留给了未来的你,而且是带利息的。
- 你可以怎么做:这条适合「观点短评」支柱,但按你自己的闸门,纯转述不发。可发的版本是你自己的验证债账单:这个月你为 AI 产出补的验证工时占了多少、你主动砍掉了哪几道验证、代价具体是什么。名词借来,数据必须是你的。
四、Personal Thinking / 播客流水线
「只提示不拦截」的检查,效果接近于零——你的流水线里正有一个
- 怎么做的:Sonar 的质量门禁,关键不在于检查得多细,而在于不达标就不放行;再对照沃顿那组数字——人对 AI 建议的采纳率几乎不随对错变化(对时 92.7%,错时仍近 80%),把最后一道防线交给「我会认真看一眼」是最不可靠的安排。
- 你可以怎么做:播客流水线里,
lint_script.py 不过就中止(这是真门禁),而 fact_check.py 只提示不拦截——按本期的逻辑,那道检查实际上依赖你每次都认真扫一遍。给它加一档硬失败:报告里完全找不到出处的数字或人名直接中止合成,其余(缩写展开、数字口语化那类必然误报)仍然只提示。这是今天下午就能改完的一条规则。
五、StockHelp / 投资视角
- 怎么做的:Sonar 把自己定位成 AI 编码时代的「验证层」,并给了体量证据:超过 700 万开发者、每天分析近 7500 亿行代码、Gartner 魔力象限领导者,还刚把做 AI code review 和 CI 自动化的 Gitar 收进来。它的商业逻辑很干净:模型越强、生成的代码越多,需要被验证的东西就越多——它的需求随上游技术进步而增长,而不是被上游替代。
- 你可以怎么做:这是个可以放进能力圈的生意模式模板——「卖给淘金者的不只是铲子,还有验金石」。找那些收益随 AI 变强而增长、而不是被 AI 吃掉的环节:合规、审计、测试、监控、结算。Sonar 未上市、买不了,但这条筛选逻辑可以直接写进 StockHelp 的选股备注,看每家公司时多问一句「AI 再强十倍,它是被吃掉还是被喂饱」。注意:本期所有市占与规模数字都是厂商在自家演讲里说的,可以当线索,不能当尽调证据。
更深一层
该反着用:Sonar 最后一条建议是「统一到一个独立的多层验证平台,覆盖所有项目、团队、开发者、工具」——那是给几千人工程组织和受监管行业开的药方,顺便也是他们的生意。你是一个人 + 8 人 PM 团队,先建「统一平台」大概率会死在建设本身。反过来做:先找出你最贵的那一类错误(大概率是「PRD 少写了一个跨线影响,开发到一半才发现」),只给它写一道会拒绝的检查,跑满三个月证明有效,再谈第二道。他追求的是覆盖面,你该追求的是命中率。
和你现在做法冲突:你正在建的是「多角色互审、层层碰撞」的体系,本质是加人(加 agent)来提质量;本期的立场恰恰相反——加人不解决问题,加「一个会说不的机器」才解决问题,沃顿那个近 80% 就是「加人」这条路的天花板。更刺的一点:你的三驾马车碰撞里,评审方和被评审方是同一类智能,按零信任的标准那不算独立验证。这个张力我不替你下结论,但值得你在下次给碰撞环节加码之前先问一遍:我是在增加验证,还是在增加同源的意见?
对你的镜子:你缺的不是更严的标准,是一个会拒绝的地方。你已经写下了很多标准——宪法、契约、SOP、红线,它们都不差;但只要没有任何一处会真的把不合格的东西挡回去,它们全都只是建议。「验证债」这个词也适用于你的知识库和副业:每一次「先跑起来、回头再校」,都是在给未来的自己开一张带利息的欠条。
所以呢
- 【耐用】验证债:任何提速工具的账都要看三个月后的曲线,不是第一周的爽感——提速的收益和它推迟的验证成本,是同一笔钱的两端。
- 【耐用】零信任:验的方法论必须和造的方法论不同源;同源的检查只能发现同源的错。
- 【耐用】机器可判 > 有人看过:门禁的价值不在标准多细,在于它会不会真的拒绝。
- 【会过期】具体产品与榜单排名(Sonar Vortex / Gitar / leaderboard 上 4.6 代模型的强弱分布),半年后基本要重查。
- 判断更新:你以前多半默认「重要的地方我会认真看」。沃顿的 92.7% 对 近 80% 说明,人的采纳率几乎不随建议对错变化——「我会认真看」不是一项控制措施,它只是一个愿望。
- 这周一个赌注:在 PRD 工厂里挑一道关口,把它从「评审意见」改成「三条机器可判的硬条件 + 不过不放行」,同时给正在跑的流水线补上一个三个月后的复测日期。一道就够——这周要验证的是「能不能真的拒绝」,不是「能不能覆盖全」。