这场演讲表面在讲「怎么读别人的模型基准」,实际给的是一份评价体系体检表。而你已经在造评价体系了——PRD 工厂的三驾马车碰撞加真人评审,本质就是一套自建基准:你定了题(PRD 该有什么)、定了校验器(评审判据)、还有一批被测对象(各角色 agent 产出的稿子)。所以他讲的每一条反模式,你都可以直接当自查项来用。
一、Holdwell 的 PRD 工厂:你的评审判据就是一套自建基准
六条反模式 → 一张评审体检表
- 怎么做的:他把毁掉一个基准的方式拆成六条,每条都有实锤——成本(1000 道题 × 60 小时 × 50 万年薪=1500 万美元,每年还要 500 万换掉被冲刷掉的三分之一)、污染(题和答案挂在网上,模型早背下来了)、奖励作弊(校验器只查「字母 i 不超过一次」,模型换个西里尔字母就满分)、野心不足(硬编码字符串匹配,Haiku 和 Fable 都得 20%)、没品味(IFEval 那些没人会真问的指令)、执行力不足(APEX 里文件内容和评分标准对不上,照着标准答案做反而拿负分)。
- 你可以怎么做:把这六条抄成六个问句,贴在评审判据清单最上面,下次改判据先自问一遍——「这一条是不是只在验格式?」「这条检查有没有可能被一句套话骗过去?」「这道题真的是业务里会发生的,还是我为了凑检查项编的?」六条里你最可能中的是「奖励作弊」和「野心不足」:检查项一旦是关键词匹配,agent 就会学会写那个关键词,而不是写清楚那件事。
双向对齐 + 你的坏题率
- 怎么做的:他给正面清单时特别强调「双向对齐」——校验器要把题面要求的每一件事都验到,题面要求的每一件事也都得被校验器覆盖到,两边只要有一边没对上,就是在往结果里灌随机噪声。配套那条更狠:实验室做到 80% 说「饱和了」,可能只是因为剩下 20% 的任务本身是坏的,而爬坡途中你根本不知道坏的是哪 20%。
- 你可以怎么做:拿你的 PRD 模板和评审判据并排放一次,做两遍对照——模板里要求的每一节,评审有没有对应检查?评审里的每一条检查,模板有没有真的要求?对不上的就是噪声源。然后做一件更疼的事:抽 10 份已经通过评审的 PRD,自己人工读一遍,数出有几份「评审给过、但你自己不满意」——这个比例就是你的坏题率。你现在最缺的正是这类闭环证据,而这个数字是最便宜的一份。
专家先行 + 产品感:光有格式检查不够
- 怎么做的:他说做好基准第一步是「从一流的人类专家开始」,因为专家决定下游一切;但光有领域专家还不够——做医疗基准,只有会答医学题的医生不行,你还需要一个懂监管环境和法律要求的人,因为那才决定你该让 AI 去解决哪类任务。
- 你可以怎么做:你三驾马车的评审关注点里,多半有几条是「格式/完整性」类的。对到 ERP,真正决定 PRD 好坏的往往是跨境合规、税务口径、平台规则这些只有业务人说得清、格式检查永远查不出来的东西。挑一条产品线(比如财务对账或 TMS),找业务侧最懂的那个人聊 30 分钟,把他脱口而出的三条「这么写就是错的」变成评审判据里三条新检查——这比再加十条格式检查值钱。
二、app_incubator:造 App 那条链路
「你没法从边界之内去拓展边界」
- 怎么做的:这句话他讲了两遍。第一遍是说造基准不能靠 AI 代劳出题;第二遍是解释为什么写作榜不用 LLM 当评委——LLM 在写作上没什么品味,所以 Surge 宁可雇上千名职业写作者(技术写作者、诗人、记者、编辑)做盲测,贵也认。
- 你可以怎么做:你的链路里「设计稿即工程强制契约」这一环,验收如果是让 agent 自己判断「像不像设计稿」,那就是在边界之内量边界。留一个人类环节:每次交付你自己花 3 分钟做一次盲看——两版截图不告诉自己哪版是新的,选一个。这 3 分钟就是你的 human eval,别用 agent 自评把它省掉。
工具带 bug ≠ agent 能力差
- 怎么做的:他把「工具必须真的能用」单独列成正面清单第一条——很多基准里的工具带着各种 bug,除非你就是故意要考「模型怎么应付坏工具」,否则这只会引入噪声。
- 你可以怎么做:你的 agent 挂着一串外部工具连接(设计稿、浏览器、笔记库)。在每次跑之前先跑一遍工具自检:每个连接发一个最小请求,通不过就中止,别让链路带病往下跑。否则你会花一晚上调提示词,而真正的故障在工具那一层——这是把噪声当成信号在爬坡的典型姿势。
三、一人公司(build-in-public):这期天生就是选题
「大佬说 X 我试了」的现成弹药
- 怎么做的:整场最有传播力的不是观点,是那组数字和那个反差——1500 万美元造一套基准、每年 500 万维护;Haiku 和 Fable 都得 20%,可 Fable 有 80% 的时候是对的,只是电话号码格式挑得不一样。一个具体到荒谬的例子,胜过十句「基准不可信」。
- 你可以怎么做:这条能直接变成验证体选题——「大佬说基准里有 20% 的题是坏的,我数了数我自己的」。你手上就有一套自建基准(碰撞判据 + 真人评审),跑一次上面那个「抽 10 份数不满意的」实验,把数字发出来。过弹药库闸门也没问题:删掉你的实测数字这条就不成立了,这正是它该发的理由。可抄物也现成——那六条反模式清单。
披露纪律就是你的差异化
- 怎么做的:他两次点名披露问题——Opus 4.8 的 model card 谈了 SWE 分数但没披露污染;Meta 测了 27 个模型却没披露自己在这么做。他的判断是「我们整个行业其实都没有做这类披露的习惯」,而这恰恰是消费者最缺的信息。
- 你可以怎么做:这就是 build-in-public 的护城河在哪儿的答案。别人发结论,你发条件:这次实验跑了几轮、失败几次、我挑了哪一版发出来、成本多少。你那四个支柱里「AI 员工管理成本账」本来就在干这事——把「我测了 N 次只发了最好的那次」这句话主动写进每篇文末,一句话,长期就是信任复利。
四、StockHelp / 你的价值投资:代理指标必然被套利
- 怎么做的:整场的底层机制其实是一条通用规律——当一个代理指标变成目标,它就会被优化到脱离它本来要代表的东西。刷榜是模型侧的版本;他说的「基准分继续涨,而人类评价是往下掉的」,描述的就是这条曲线的分叉。
- 你可以怎么做:资本市场有一模一样的版本——调整后 EBITDA、非公认会计口径利润、回购拉高每股收益。你的看板现在看 PE 及其 5 年分位,这也是代理指标:分母(每股收益)是可以被「刷」出来的。给看板加一栏最轻的东西:每只票记一句「这个数字可能被什么方式做出来」(一次性收益?回购?会计口径变更?)。再借他那条私有保留集的思路——你自己读年报原文得出的那个判断,就是你的私有保留集,不要让任何现成分数替你下结论。
五、小红书家居号:平台指标是蒸馏,不是原件
- 怎么做的:他说得很干脆——人类评测才是我们真正在意的东西,基准做的很多事本质上都是在绕开它的成本,你希望这次蒸馏足够忠实,但必然会出现一个临界点,过了它你继续爬坡、人类评价已经躺平。最生动的例子是那条「现在几点了」的精神错乱回答,没有任何人类评委会选它,LMArena 却把它排到第一。
- 你可以怎么做:你的指标盘还空着没跑起来——那正好,别一上来只填曝光和点赞,那是蒸馏出来的代理指标。留一行叫「人类评测」:每月挑 5 条真实评论或私信原话贴进去。哪天曝光在涨而这 5 条越来越敷衍,你就知道自己开始刷平台的榜、而不是在做「决策型生活记录」了。
更深三角度
该反着用:Surge 的路径是花钱堆人——1000 道题、上千名写作者、「不追求把成本压到最低」。你的处境正相反:一个人扛正职加多条副业,精力才是最稀缺的那样东西。所以别学它的规模,学它的取舍方向:不要造 100 道检查项去追覆盖面,造 20 道你业务里真发生过、且从没进过任何提示词的题——小、真、私有,比大而全有用得多。他自己也说了,覆盖面那条路对绝大多数项目「直接超预算」。
和你现在做法冲突:你的多智能体链路里,很可能有相当一部分评审是让模型给模型打分。而他明确说 LLM-as-a-judge 在需要品味的地方不行,因为「你没法从边界之内去拓展边界」。这里有个张力值得你自己掂量:你的评审判据里哪些是「格式能验的」,哪些是「需要品味的」? 前者交给模型没问题,后者交给模型就是在自欺。这个比例只有你能定,但至少要显式定一次,而不是默认全交出去。
对你的镜子:他那句判据可以原封不动搬过来——「一道连 Haiku 和 Fable 都区分不出来的题,就不是一道有用的题。」 换成你的语境:一道所有 PRD 都能过的检查,不是检查,是仪式。 判断一道检查项该不该留,标准不是它「有没有道理」,而是它有没有真的把好稿和差稿分开过。
所以呢
可迁移思维模型
- 【耐用】代理指标一旦变成目标,就一定会被套利。 这场演讲六条反模式,本质是同一条规律的六个断面;它在模型评测里叫刷榜,在公司里叫 KPI 变形,在股市里叫非公认会计口径。
- 【耐用】你没法从边界之内去拓展边界。 想超过当前水平,必须注入外部的、真实的人的判断——这条对你的第二大脑、对你的 agent 工厂、对你的投资都成立。
- 【耐用】衡量的成本是真实成本,省下来的会以噪声的形式还回来。 便宜的校验器不是省钱,是把钱换成了你以后分辨不清好坏的时间。
- 【会过期】具体的基准名字、Opus 4.8 那份 model card、20% 坏题这个比例——这些是 2026 年的快照,明年就换了。
判断更新:你之前大概默认「有检查 > 没检查」。这场演讲给的更新是——坏检查可能比没检查更危险,因为它把噪声当成信号,让你和你的 agent 对着错的方向一路爬坡,还一路显示绿灯。同理,下次看模型发布公告,把注意力从「分数多少」挪到「这个分数是在什么条件下、用哪套题、有没有披露污染」。
这周一个赌注:抽 10 份已经通过评审的 PRD,自己人工读一遍,数出「评审给过但你不满意」的份数。如果超过 2 份,这周别再往评审里加任何新检查项,先去修已有的那几条。 这个数字同时是你的坏题率、你「agent 产出可验证」的第一块闭环证据,和一人公司那篇验证体的开头一句话。
配着看:库里 v109《手把手做 AI 评测》(Daniel McKinnon)讲的是怎么动手做评测;本期讲的是怎么读别人的基准、别被分数骗;同批入库的 v128《基准测试的好坏丑》(Ali Khial)讲的是你自己造基准会怎么翻车。三期是一条线上的三段,连起来读比单看任何一期都值。