这期是近期最贴你的一集:你要的那个"agent 产出可验证"的抓手,这期把它的物理形态摆出来了;而"决定 eval 好坏的是领域专业度不是工具"这句,等于给你八年 ERP 积累重新做了一次估值。
一、Holdwell ERP · 你的 PRD 工厂:eval 就是那个你一直缺的可验证抓手
1) 让评审关卡从"文档里的一句话"变成"跑得出分数的东西"
- 怎么做的:Daniel 两年前的论断今天还成立——eval 是传达"产品该做什么"、并向工程团队解释"什么叫做成了"的最好方式。传统 PRD 把篇幅花在"功能怎么运作、某某情况下会怎么表现",但 GenAI 产品几乎什么都要能干,写不清楚,只能用例子说话。而 eval 的判定是二值的:分数不达标,就三条路——换模型、改 harness、改产品。
- 你可以怎么做:你的三驾马车 PRD 工厂现在最疼的地方,是碰撞协议的纪律只是"写在文档里的一句话",没有任何东西真的拦得住。eval 就是那个拦得住的东西——它可执行、有分数、不达标就是不达标,没有讨价还价的余地。挑六步流程里最容易被糊过去的那一道关(比如"实体定义是否完整"),拿 20–30 个真实的 ERP 需求片段当输入,标准答案是你自己判定的正确实体 / 字段 / 状态机,判分交给一个 LLM 裁判对着评分卡比对。关卡就从"评审时靠人记得问"变成了"分数不到线就不放行"。
2) 那套七步机械流程,可以整段抄进你的工厂当一个固定环节
- 怎么做的:他把写 eval 说成"机械活",七步一步不落——想清问题(不必完美)→ 挑判分维度 → 给每个维度定判分方式(自动 / LLM 裁判 / 人)→ 凑约 100 条同分布的 prompt → 全部跑一遍分难易 → 凑出一套约 50 分的题 → 交给团队往上提。他特别强调那个 50 分:太简单考 100 分,工程团队没法拿它优化;太难考 0 分,你连"这事今天可不可能"都不知道。
- 你可以怎么做:这七步就是一个现成的操作脚本,直接沉进你的工厂当一个固定环节。更值得你警惕的是"50 分"这条纪律——你现在的碰撞 + 真人评审很可能已经是一套"每次都过"的 100 分题,那它对 agent 就没有任何优化价值,只是仪式。跑一遍看看:如果每条需求都全过,说明这套检查已经饱和了,该换一批更难的。
3) 地板 + 天花板:一眼看出你哪个角色在裸奔
- 怎么做的:他先立地板(囊性纤维化那道最简单的题,确认模型真的做得了),再立天花板(双基因先天性心脏病,他判断"地球上没有哪个模型能直接做对")。地板那道题上 Haiku 当场翻车,只说"这个基因上跨了 48 个变异",还幻觉出一个"半合子大片段缺失"——逼他承认"这题对 Haiku 就是太难了,我还得再往简单里改"。
- 你可以怎么做:你的三驾马车必然有强弱之分,但现在没有任何东西能告诉你哪个弱。给每个角色配两道题:一道地板题(这个角色最基本、闭着眼都该做对的事)和一道天花板题(今天大概率做不到的)。跑一遍,哪个角色在裸奔立刻现形。而且要按"这个角色实际用哪个模型"分档出题——他专门说了,25%–50% 这个区间是相对于你打算用的工具而言的,同一道题对强模型是地板、对小模型可能就是天花板。
4) 跑完分之后那三个动作,正好治你"agent 产出无可验证证据"
- 怎么做的:50 分够不够发?"大概率不够。"那就往下拆:看哪些题型表现更好,给产品加护栏、只放开能拿到 80 分的问题类型——"这是个产品决策,是产品经理该做的决策"。剩下所有难题打包丢给研究团队:"去把模型修好,或者把 harness 修好,让它以后能答对,这样我才能把带这些能力的产品发出去。"
- 你可以怎么做:别再问"PRD 工厂好不好用"这种没法证伪的问题,改成问"它在哪类需求上能到 80 分"。能到的那类正式放开、写进流程;到不了的那类挂护栏(强制人工接管);剩下的整理成一张待修清单,喂给你自己迭代——你既是 PM 也是那个"研究团队"。三个月后拿同一套题再跑一遍,分数的变化就是你要的可核验证据,比任何主观感想都硬。
二、app_incubator · 把"该做什么"前移到 agent,靠的是示例不是形容词
1) "漂亮的厨房"那一刀
- 怎么做的:他给从没做过 AI 功能的 PM 最实用的一句是——你不能只在 PRD 里写"用户想要漂亮的厨房"就完事,你必须明确定义什么叫漂亮的厨房,而且不是用文字定义,是用示例定义,再配一套给示例打分的方法。他说这是着手做新 AI 功能时第一件该干的事,要从第 0 天就开始想"成功长什么样"。
- 你可以怎么做:你的"设计稿即工程强制契约"已经走对了一半——用图而不是形容词。缺的是后半段:打分方法。给你正卡着的"激活 / 首屏体验"配 10–15 张"及格 / 不及格"的对照示例,外加一句判分规则,让 7-Agent 链路出图之后自己先过一遍这道题。你的痛点是"把该做什么前移到 agent",而 agent 唯一能接住的"该做什么"就是示例 + 判分,形容词它接不住。
2) 别先建工具——"它就是一张表格"
- 怎么做的:全场演示做完,Aakash 的总结是"所以它就是一张表格而已,真正关键的是领域专业知识,跟怎么写、格式如何都没关系",而且 Daniel 今天连 eval 模板都没给。Daniel 自己也顺手把 eval 工具赛道判了个位置:一堆公司在做更好的工具,但构建 eval 时"字面意义上就只是 prompt、回答,以及一套判断回答对不对的打分方式"。
- 你可以怎么做:不要为这件事去找平台、装框架、搭仪表盘——那会变成又一个占掉你两周精力的副本。今晚开一张三列表(输入 / 标准答案 / 判分说明),先写 10 行你最熟的场景。你缺的从来不是工具。
三、onehuman_company · 这期本身就是一条现成的"大佬说 X 我试了"
1) 验证体选题,素材几乎是白送的
- 怎么做的:他没有讲原理,是开着屏幕现场跑——用 Codex 造合成基因组文件、三个 agent 同跑同一条 prompt、Haiku 当场翻车并幻觉、GPT-5.5 第二次采样答对推翻了他几分钟前"采样不重要了"的判断。可信度全部来自"翻车也照播"。
- 你可以怎么做:这就是你四支柱里"大佬说 X 我试了"的标准素材。选题可以是:"前 Meta Llama PM 说,决定 eval 好坏的是领域专业度不是工具——我拿 ERP 领域试了一套 30 题的 eval"。过一下你的弹药库闸门:删掉你的判断和实测数据还成立吗?不成立——因为跑分表、翻车案例、哪个角色裸奔,全是只有你有的东西。可抄物也很清楚:那张三列表模板 + 七步流程。
2) 过程摩擦比结论更像可抄物
- 怎么做的:他两次公开被打脸都没剪:Codex 造文件慢到他自己吐槽"这明明是一行就能搞定的活";Haiku 意外没过地板题,让他当场说"幸亏我先跑了这一步"。他甚至专门解释了为什么不写个 Python 脚本一键搞定——"那对观众一点帮助都没有,因为他们自己动手构造的时候还是不知道该怎么弄"。
- 你可以怎么做:你的 build-in-public 号最缺的正是这种过程摩擦。以后每篇实测都留一段"这里卡住了 / 这里翻车了 / 我原以为是 A 结果是 B",别剪掉——它比结论更像可抄物,也更难被别人复制粘贴走。
四、Personal Thinking · 你那套总结标准,本身就该有一套 eval
- 怎么做的:他解释了为什么模型在创意写作上弱——因为它难判分,人的偏好各不相同;而解法不是放弃评估,是把"好"拆成可判的维度。他给菜谱的例子拆得很朴素:格式对不对、配料有没有列全、文风写得对不对,然后给每个维度配一种判分方式(自动打分 / LLM 裁判 / 人)。
- 你可以怎么做:你的"总结密度梯度标准"(益项写厚、其余紧凑、于你何益写满)现在完全靠每次读一遍人肉判,这跟你工厂里"产出难验证"是同一个病。把它拆成三四个可判维度(益项段的原话与数字密度、非益项段的单点长度、锚点是否真实可跳、于你何益是否按项目分组),挑 5 篇你自己认可的老总结当标准答案,写成一套小 eval。以后新总结先过这套题——你的摄入 SOP 才算有了执行点,而不是每次靠记性和心情。
五、StockHelp / 你的价值投资 · 别让公司自选的口径进你的表
- 怎么做的:Gemini Ultra 那张成绩单是个绝好的案例——GPT-4 的 MMLU 86.4% 用的是 5-shot,Gemini Ultra 用的是 32-shot,Daniel 直接说"这有点像作弊:看你能从模型里采样多少次"。更深一层的是:老 benchmark 一饱和,各家就整批换成新 benchmark,"一点连续性都没有"。你以为在看进步,其实在看换题。
- 你可以怎么做:这是给你做价值投资用的一面照妖镜。任何公司自己披露的口径都自带选题权——同比换成两年比、"调整后"利润、"核心业务"重新划线,本质就是换 shot 数和换 benchmark。给 StockHelp 加一条硬纪律:看板只用你自己定义的、跨年不变的口径(你固定的 PE 分位算法、target_pe×EPS 的公允价),公司的自选口径可以看,但不进你的表。另外还有一条能直接用的商业判断:Daniel 顺手把"做 eval 工具"这条赛道判成了低价值(工具不重要、领域专业度才重要),而把价值放在垂直 harness 公司——这个框架可以拿去审视那些"卖 AI 中间层工具"的标的,问一句它的护城河到底是工具还是领域。
六、你本人 · 领域专业度是你手上最不公平的那张牌
- 怎么做的:他把话说死了——"你必须吃透这个领域的问题。如果你在某个主题上没有背景,也没真正下功夫补过课,那你基本不可能给它做出好的 eval",并直接连到 Anthropic、OpenAI 在招投行的人、会计师、律师这件事上。他整场演示本身就是证明:他能做基因组 eval,不是因为他 AI 强,是因为他懂基因组。
- 你可以怎么做:你八年 ERP 的领域积累,一直以来的估值方式是"帮我在公司里干活更快"。这期给了另一种估值方式——它是可以直接换算成 eval 质量的稀缺资产,而 eval 质量决定了 AI 产品能不能做成。同时对照他开场那句"普通 PM 干的活无非协调、鼓舞、分析,这几样 AI 做起来都不难":你身上可替代的部分和不可替代的部分,这期给你划了条很清楚的线。往下走的方向不是"多学几个 AI 技术名词",而是"把只有干过八年的人才知道的那些判断,写成题"。
更深三角度
- 该反着用:Daniel 有一整支研究团队可以接住"把难题打包丢过去修",他的 PM 角色是只出题不修题。你没有那个团队——你就是那个团队。所以对你,出一道"今天做不到"的天花板题不等于甩锅,而等于给自己排期;如果一道题你三个月内不打算修,就别放进 eval,否则它每跑一次都在提醒你一件你不会去做的事,纯消耗精力。同理,他攒 100 条题是因为有工程资源去跑;你一个人扛正职加多条副业,20–30 条真跑得起来的,远胜 100 条躺在文档里的。
- 和你现在做法冲突:你在 PRD 工厂上投了大量精力做结构——三驾马车、六步碰撞协议、agent 定义、真人评审,而这期的核心论断是"工具和格式不重要,值钱的是领域专业度和那张三列表格";Aakash 说得更直白:今天没给 eval 模板,不像以前给 PRD 模板。这跟你把很多时间花在"把架子搭得更整齐"是有张力的。这个张力我不替你下结论——有可能你的架子是对的(多 agent 编排确实需要结构),也有可能架子已经跑在内容前面,而真正缺的那 30 行"什么叫对"还没人写。至少值得问自己一次:如果这周只允许做一件事,是再给流程加一环,还是坐下来写那 30 行标准答案。
- 对你的镜子:你一直把"我是 ERP 领域专家"和"我在做 AI 产品"当成两件需要平衡的事——一件是老本行,一件是新方向。这期给的框架是:它们不是两件事,领域专业度就是 AI 产品的原材料。你不是"一个懂 ERP 的人在学 AI",你是"手里正好握着 AI 公司花钱去雇的那种东西"的人。Anthropic 招会计师和律师,是因为他们买不到那些只有干过八年才知道的判断——ERP 这一行同理。
所以呢
- 可迁移思维模型
- 【耐用】"好"必须用示例定义,不能用形容词定义。凡是你写下"清晰的""完整的""高质量的",就去找三个正例三个反例把它钉死。这条跟 AI 无关——写标准、带团队、教人、给自媒体定选题标准,全都成立。
- 【耐用】地板与天花板。评估任何东西,先确认最简单的那档做得到(否则你在优化一个不可能的目标),再确认最难的那档做不到(否则你的标准已经饱和、失去区分力)。中间那段才是有信息量的区间——这也是为什么"每次都过"的评审等于没评审。
- 【耐用】度量本身就是执行力。没有分数的规则只是一句提醒;有了分数,规则自己就会执行。
- 【会过期】这期所有的模型分档和跑分结果(GPT-5.3 Codex Spark Low、Haiku、5.5 extra high 谁能过哪道题)——他自己就说了,好 eval 几个月就会被爬到 100 分然后扔掉。别把这些当知识存。
- 【会过期】"采样已经不重要了"这个判断——他在同一集里就被 GPT-5.5 第二次采样答对当场推翻了。
- 判断更新:你之前把"agent 产出难验证"当成一个流程设计问题(该在哪一步卡、由谁来卡)。这期建议换个框架看它:它是一个度量缺失问题。你不需要再设计一道关卡,你需要给已有的评审环节配一套题和一个分数。
- 这周一个赌注:不加新环节、不改流程图。开一张三列表格(输入 / 标准答案 / 判分说明),针对 PRD 工厂里你最不放心的那一道检查,写满 20 行——其中 5 行是"闭着眼都该对"的地板题,3 行是"今天肯定做不到"的天花板题。然后拿现在的链路跑一遍,把分数记下来。这一次跑分的数字,同时是你的评审执行点、你的 agent 产出可验证证据,和你 one human company 的第一篇验证体选题——一件事,三处交付。