ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.109
第 109 期 · 产品 · 收录于 2026 年 8 月 15 日

手把手做AI评测

DM
Daniel McKinnon · Aakash Gupta
视频 56:49 原文约 5.5 万字 预计阅读 25 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 31:53
TL;DR · 三句话
  1. 在生成式 AI 时代,把「产品该做成什么样」讲清楚的最好方式不再是 PRD 里那些描述细节的段落,而是给一组例子——这组例子就是 eval:一批 prompt + 标准答案 + 一套判分方法;跑不达标就三条路,换模型、改 harness、改产品。→ 详细
  2. 写 eval 本身是纯机械活(定义问题 → 挑判分维度 → 凑约 100 条 prompt → 跑一遍分难易 → 凑出一套约 50 分的题),真正决定它好坏的是领域专业度而不是工具——这也是 Anthropic、OpenAI 在招投行的人、会计师和律师的原因;全场演示做完,Aakash 的总结是「它就是一张表格而已」。→ 详细 → 详细
  3. eval 跑完不是终点,而是产品决策的输入:只得 50 分大概率不够发,那就看哪些题型能到 80 分、只放开那些(加护栏),做不到的整批打包丢给研究团队去修模型或修 harness——「这是个产品决策,是产品经理该做的决策」。→ 详细
01

「eval 取代 PRD」这句挑衅话,到底在说什么

  • 两年前 Daniel 写过一篇文章,配了张梗图,标题就是「eval 是不是取代了 PRD」。他自己先承认这话有点故意刺激人——因为没有产品策略、没有明确的目标用户,产品就什么都不是;但话说回来,策略那部分往往一段话就写完了,有的产品甚至一句话就够。→ 详细
  • 他要取代的是 PRD 里最占篇幅的那部分:功能怎么运作、在某某情况下会怎么表现、用户能从中获得什么价值。「我职业生涯里见过的绝大多数 PRD,篇幅主要都花在细节上。」可到了生成式 AI 这里这套写法被彻底颠覆——这类产品几乎什么都要能干,你很难描述清楚,总不能写一句「这玩意儿啥都能干」。→ 详细
  • 替代方案是:把产品该做成什么样,用例子讲明白,而 eval 就是那组例子。用他的话说,「它其实就是给模型出的一道道知识问答题」,等于在告诉团队:模型要做好的事,大致就长这个样子。→ 详细
  • 因果链他讲得很完整:模型在这些题上答得好 → 用户大概率会喜欢 → 那就上生产环境,再用线上 eval 看他们是不是真的喜欢。答得不好,只有三条路——换模型、改 harness(模型外面那层调度和工具的框架)、或者改产品。还有第四种可能是「你想做的事,用今天的模型根本做不出来」,而这件事早点靠离线 eval 发现,「总好过直接上线,然后收获一堆被激怒的用户」。→ 详细
02

离线 eval 和「直接上线看看」差在哪

  • 离线 eval(offline eval,线下评测)=一套事先准备好的问答题库,在产品开发过程中跑,当成真实用户流量的代理指标。他举菜谱网站的例子:想教用户做冰淇淋,就准备 100 条不同冰淇淋的 prompt,每条配一个正确(或者说得过去的)答案,外加一套判分方法。→ 详细
  • 等离线分数够好了再上线,指望「离线那套题上的表现能反映线上真实用户的满意度」——他自己补了句「当然这事儿不是每次都成立,但思路就是这样」,并认为这仍是判断一个 GenAI 产品能不能让用户满意的最好办法。(RL environment 强化学习环境这类东西属于中间的灰色地带。)→ 详细
03

两年过去,没变的那一句

  • 这套论点写下来两年了,核心仍成立:eval 是传达「你的产品到底该做什么」的最好方式,也是向做这个产品的工程团队解释「什么叫做成了」的最好方式。在 AI 世界这件事非常难,因为这些产品能干的事太多了,你很难说清楚「好」到底长什么样。→ 详细
04

老一代 eval 长什么样:GPT-4 的那张成绩单

  • 当年的 eval 特别简单,就是一问一答,他那篇博客覆盖的也只有这种。两年前的核心论调是「GenAI 本质上是搜索的替代品」——大家还记得 Google 股价暴跌那阵子,那时候的产品本质上就是问答型产品。这一切都发生在 Claude Code、agentic coding(智能体写代码)和 Claude Cowork 这类东西出现之前。→ 详细
  • 他把 OpenAI 当年为 GPT-4 汇报的基准逐个列了出来:MMLU、HellaSwag、ARC、WinoGrande、HumanEval(「讽刺的是,它其实是一套自动化的 Python eval」)、DROP——全都是一问一答。他现场读了一道 MMLU 原题:已知一个物体的实际亮度和它在你所处位置的视亮度,在没有其他信息的情况下你可以估算出——A 相对你的速度、B 成分、C 大小、D 离你的距离。这些老题都还挂在 Hugging Face 上,可以当历史趣味翻。→ 详细 → 详细
05

写一条 eval 的机械流程(他的原话:「真正写 eval 就是个机械活了」)

  • 第一步,先想清楚你要解的问题,而且不需要一开始就完美——问自己「你的用户可能会问的一组问题是什么」。他当年举的例子是:我的社交媒体网站上有一段视频,我希望能生成一份菜谱,让人一边看视频一边照着做出那道菜。→ 详细
  • 第二步,挑出判「好不好」的那几个维度:格式对不对、配料有没有列全、文风写得对不对。→ 详细
  • 第三步,给每个维度假设一套判定对错的办法——可以是自动打分,可以是另一个 LLM 当裁判(LLM-as-judge),也可以是人来判。「判正确性的方式有很多种。」→ 详细
  • 第四步,凑大概 100 条落在这个分布里的 prompt。可以更少也可以更多,但「在 GenAI 这个世界里,这是一套 eval 的典型规模」。→ 详细
  • 第五步,把这批题丢给模型跑一遍,看哪条难、哪条容易。→ 详细
  • 第六步,凑出一套大概能得 50 分的题——因为你得留出提升空间。做一套特别简单、直接考 100 分的,工程团队就没法拿它去优化;做一套特别难、考 0 分的,你连「这事儿在今天的技术条件下到底可不可能做到」都不知道。→ 详细
  • 第七步,把它交给团队照着往上提;分数够高了就发布给用户,看线上的实际表现是不是跟你在离线时的预期对得上。他说到这儿就收了:「基本就是这样。」→ 详细
  • 换句话说,整套流程里没有一步是玄学,难度全部压在最前面两件事上——把题目对准你关心的领域,再把答案判分做出来→ 详细
06

为什么这套老流程今天不够用了

  • 真正的原因是模型在 QA(问答)上基本已经饱和了。今天说一个模型好,想的已经不是它能不能答对一道偏难的高中物理题,而是它能在国际数学奥赛上拿金牌——「基本上除了极少数超级专才,普通人能问出来的问题,模型都能给个像样的回答」。→ 详细
  • 而且 QA 也不再是最有用的应用了。当年那套叙事是 ChatGPT 会成为下一个伟大的消费级应用、Google 也跟着做了生成式搜索体验;但现在 GenAI 的头条主角已经不是 QA,是 agent(智能体)。→ 详细
  • 从各家实验室怎么汇报进展就看得出来:两年前 OpenAI 是那五六个 eval,快进到 Anthropic 汇报 Opus 4.5,用的完全是另一批 benchmark,一点连续性都没有。一半原因是老题饱和(Opus 4.5 在上面基本接近满分),另一半是任务本身真的变了——名目全换成了 agentic coding、agentic terminal coding(智能体终端编程)、多学科推理、agentic computer use(智能体操作电脑)、knowledge work(智能体知识工作)、agentic 财务分析。→ 详细
07

新范式:考的不是问答,是任务(金发姑娘原则)

  • 模型的核心任务不再是「接住用户一个 prompt、回一个答案」,而是接住一个需要很多很多步才能完成的任务:有些步骤只是「想」(reasoning,推理),有些是调工具比如搜索,有些是更高级的工具调用。→ 详细
  • 好消息是框架大体没变:还是得定义问题、还是得当个好 PM 清楚自己在解什么问题、还是得收集有代表性的 prompt。→ 详细
  • 收 prompt 这一步他叫**「金发姑娘原则」(Goldilocks,不多不少刚刚好)**——题不能太难,也不能太简单,得留出提升空间。→ 详细
  • 数字他给得很硬:一套好 eval 典型的起点成功率是 25% 到 50%,然后过个几个月就会爬到 100%,「那时候你就得把它扔了,再造一套更难的」。这意味着 eval 天生是消耗品,不是一次性资产。→ 详细
08

判分为什么突然变难了

  • 有条规律他讲得很透:模型在创意写作这类事上弱,是因为它难判分——人的偏好各不相同,不同用户喜欢的东西不一样;在数学和代码上强,是因为有明确的正确答案,沿着指标往上爬(hill climb)容易得多。→ 详细
  • QA 类问题实在找不到更好的判分办法时,最差还能找人工标注员来评。到了 agentic 的活上就难多了:任务的时间跨度往往很长,最终产出是很多很多步累积出来的——「有些步骤是对的却导向了错误的结果,有些步骤本身就是错的」。→ 详细
  • 所以从人力成本和「定义成功」两个角度,你都更需要一套能自动判分的东西——只有这样才跑得起足够多的 rollout(一次完整的任务执行轨迹),才做得了更多实验。→ 详细
09

现场演示的预防针与选题

  • 开演示前他先打预防针:「指望 45 分钟里从零做出一套全新的 eval 是不现实的,这基本是个要花几周甚至几个月深度思考的活儿。」所以演示是半预制的,但每一步他还是走一遍。→ 详细
  • 题目选的是临床基因组学:全基因组测序(whole genome sequencing)已经是 NICU(新生儿重症监护室)诊断里绝对的金标准,但解读一份结果极其耗人力,这就限制了这项救命技术的可及性。他想看看能不能把这部分人类专业经验蒸馏进模型——这也是他新创业公司要解的问题。→ 详细
10

第一步是深刻理解问题——全场最重的一句话

  • 他没有逐张过流程图,放出来只是让人感受这有多复杂:从测序仪出来的原始 reads(测序读段)开始,先做大量处理算出这位病人的基因组跟参考人类基因组差在哪,再做另一轮工作判断这些差异到底有没有意义。→ 详细
  • 量级感他给得很具体:给他自己做测序,会得到约十亿条 reads、每条 150 个碱基对,全都躺在一个巨大的文本文件里;而他要把这一坨东西变成一句诊断结论——「这个基因可能是、也可能不是造成这位病人症状的原因」。→ 详细
  • 然后是那句串起全场的话:「这也是为什么 Anthropic、OpenAI 这类公司在招投行的人、会计师、律师。 你看到他们那么多垂直行业团队在发招聘广告,就是这个原因:你必须吃透这个领域的问题。」→ 详细
  • 他把话说死了:如果你在某个主题上没有背景,也没真正下功夫补过课,那你基本不可能给它做出好的 eval。→ 详细
  • 顺带一个术语约定:在 agentic 场景里他说「模型」时,一般指的是模型 + harness(外面那层脚手架 / 执行框架),全场这两个词混着用。→ 详细
11

立地板:先挑一道最简单的题(CFTR / 第 508 位苯丙氨酸缺失)

  • 找 Goldilocks 那组题的第一步是先从简单的开始,确认模型真的做得了这件事。他挑了最简单的遗传病:囊性纤维化(cystic fibrosis,一种肺部疾病),遗传病因很早以前就搞清楚了,也有几个公认的致病基因。→ 详细 → 详细
  • 他打开 ClinVar(NIH 美国国立卫生研究院维护的遗传病数据库)里那个最经典的突变,现场还吐槽了一句「它标着四星和三星,其实这里应该是四星四星才对」。→ 详细
  • 表格就这么一列列搭起来:基因填 CFTR;变异(variant)——在 CFTR 的这条特定转录本上,这个位置少了一个碱基,结果是第 508 位的苯丙氨酸(phenylalanine)被删掉;**表型(phenotype)**填囊性纤维化。一张「问题—答案」表就成型了:问题=表型 + 这位病人的基因组,答案=这个变异。→ 详细 → 详细
  • 他借这个变异的复杂程度再次回扣主论点:「这东西非常复杂、非常讲究细节……要做这类 eval,你必须真懂这个领域。」对比之下,Python 编程的 eval 现成的已经不少、质量也挺好——说「Python 编程已经被解决了」有点言过其实,但它确实是个被理解得非常透彻、刻画得非常清楚的问题。→ 详细
12

用 AI 造给 AI 用的 eval

  • 造题环节他直说:「你在构造这些 eval 的时候,会非常非常非常频繁地用生成式 AI 来帮你造。」现场用的是 Codex(「其实换成任何工具都行」),档位设成 5.3 Spark Low,因为演示需要快。→ 详细 → 详细
  • 做法是拿他自己的基因组文件造一个合成版本,把目标变异塞进去,生成 dan_cf5.vcf.gz。他自己点破了这层套娃:「我们其实是在让 AI 帮我们造给 AI 用的 eval。」→ 详细
  • 顺带科普了变异文件(VCF)长什么样:说白了就是个文本文件——一列染色体(人有 23 对,1 号最大)、一列位置(人的基因组约 30 亿个碱基)、然后是替换(参考人类基因组这个位置是 C,他这儿是 CA),后面跟一堆质量指标说明结果多可信;每个基因有两份拷贝,这条标着杂合(heterozygous)=只有一份受影响。→ 详细 → 详细
  • 演示中 Codex 跑得很慢,他一边等一边吐槽「说实话我也不知道它为什么这么慢,这明明是一行就能搞定的活」。他还解释了自己为什么不图省事:「我也纠结过,要不要直接写个 Python 程序一键把这些都替你干了?但转念一想,那对观众一点帮助都没有,因为他们自己动手构造的时候还是不知道该怎么弄。」→ 详细 → 详细
  • 最终加进去的那行落在7 号染色体上,是个缺失:原本是 TCTT,现在只剩一个 T——经典 CF 突变,一个「假的囊性纤维化病人」就造好了。→ 详细 → 详细
13

为什么要同时跑好几个 agent

  • agent 可以是任何东西:他这里用 Codex,你也可以用 Claude Code、OpenCode、自己写的 harness;「现在连 ChatGPT 和 Claude 的网页版,背后用的也都是 agent」——不是模型进模型出,而是输入、推理、工具调用一整套。→ 详细 → 详细
  • 同时跑的理由是:25%–50% 这个目标区间是相对于你打算用的工具而言的。拿顶配去做生物防御这类事,题就得出得非常非常难;如果因为基础设施或成本只能上很小的模型(比如 Haiku),题就得往简单里改。(字幕此处把某个顶配模型名识别成了「Mythos 5」,识别存疑。)→ 详细
  • prompt 写得很朴素:「这里是一位患者的基因组,他的症状是……我们怀疑是囊性纤维化,请找出遗传学病因。」同一条 prompt 复制到三个 agent 上跑:GPT-5.3 Codex Spark Low、Haiku、ChatGPT 5.5 Extra High(不用 Pro,「太慢了」)。→ 详细
14

地板的跑分结果:小模型翻车,还幻觉了

  • Codex 那边思考一分钟就找到了 CFTR 上与该缺失一致的突变模式,答案正确。判分怎么做?「实际做法多半是再上一个 LLM」——让它拿评分卡(scorecard)里的标准答案,去跟模型这段回复做比对。→ 详细 → 详细
  • 出乎他意料的是 Haiku 没做出来:它说「这个基因上跨了 48 个变异」——盯到了基因,却定位不到具体那一个,而且还幻觉出了一个「半合子大片段缺失」→ 详细 → 详细
  • 这个意外恰恰印证了「先从简单的开始」的价值:「幸亏我先跑了这一步——因为如果我要给 Haiku 做基准测试,这道题对它来说就是太难了,我还得再往简单里改。」往简单改的手段他给了三条:把要关注的基因组区域限定得更窄、多给点提示、让它更容易拿到外部信息。→ 详细
  • 表格里就记一笔:Haiku 差,另外两个好。→ 详细
15

立天花板:一道他判断「没有模型能解」的题

  • 简单题跑通之后必须把天花板也立起来——难的那头模型到底行不行。理由很直接:「如果测试集已经完全饱和了,那这个 eval 还有什么意义?任务早就解决了。」→ 详细
  • 他挑的难题来自去年一篇论文《解析先天性心脏病的双基因(digenic)架构》:先天性心脏病是婴儿一出生心脏就有问题,digenic 指它牵涉两个基因。单基因单变异的病(如囊性纤维化)很多机制已经完全搞清楚,而双基因遗传病是人们才刚开始研究的东西。→ 详细 → 详细
  • 论文补充材料里有张表,列的是一批 **proband(先证者,医学术语,指你正在评估的那个病人)**和他们的双基因致病组合。他取的那位患者是 ACACB(het,杂合、只带一份该变异)+ MYOCD(同样是 het)——研究者发现正是这两者的组合导致了先天性心脏病。→ 详细 → 详细
  • 难在哪:两个不同基因上的两个杂合变异共同导致同一种病。理论上论文已发表、agent 应该能上网搜到,但「现实没那么简单,它们并不完美,实际上需要大量的引导」——这正是为什么会有一批公司(包括他自己那家)被叫作 harness engineering 公司(给模型搭脚手架的公司)、垂直 AI 公司或 agentic AI 公司。→ 详细
  • 还有句很能说明现状的话:这些变异的记法五花八门、你必须去适应,因为现阶段的 eval 大多落在非常技术、非常专精的领域——「毕竟没人会去给『冰淇淋口味』这种无聊的东西做 eval」。→ 详细
16

采样:同一个模型要不要多跑几次

  • Aakash 问了非确定性的问题:需不需要同一个模型多测几次,看是不是三次里有两次对?Daniel 说这本质是**采样(sampling)**问题,核心论点是「正确答案可能就存在模型权重里,只是它未必每次都能把它取出来」,所以做 eval 确实应该多试几次;RL 环境做的也是这件事——不断 rollout,直到拿到正确答案就给一个正向奖励。→ 详细 → 详细
  • 但他给的现状判断是采样重要性比过去低了:「同一个 prompt 反复跑同一个模型,我没怎么见过答案会变。」不过仍建议你针对自己的场景去测一测。→ 详细 → 详细
  • 他讲了个「当年采样是件大事」的故事:2023 年大家都觉得 Google 在 AI 竞赛里出局了,Google 发布 Gemini Ultra(他自己就参与过这个模型),约 6600 亿参数的稠密(dense)模型,当时训练过的最大稠密模型之一。成绩单争议极大:GPT-4 当时 MMLU 拿 86.4%、用的是 5-shot(采样五次挑最好的),而 Gemini Ultra 用的是 32-shot——「射门机会多得多」,他直接说「这有点像作弊」。他自己也补了句严谨的:那里的 shot 也可能指 few-shot 示例数而不是采样次数,但不影响道理——多采样几次,蒙对的概率自然就上去。这事今天已经不算大话题,各家实验室基本不再公布。→ 详细 → 详细
17

天花板的跑分结果,以及一次现场打脸

  • GPT-5.3 Spark 最先跑完,完全答错:它找出 TBX1、MYH6、JAG1 一堆变异,「这些根本不是我们关心的基因,这些变异压根不相关,也没有高置信度的变异」。Haiku 同样完全跑偏——不意外,它连简单题都错了。→ 详细 → 详细
  • 意外的是 ChatGPT 5.5 extra high 这次答对了:它把「先天性心脏缺陷」这个表型,转化成了对一篇非常具体的论文的检索,再从论文里把双基因组合提取出来——他评价这条推理轨迹「相当漂亮」。→ 详细
  • 更有意思的是,这恰好推翻了他几分钟前刚下的判断。他自己当场承认:「这正好是个绝佳的例子——它在第二次采样时给出了不一样的结果,而且做对了,因为我之前试过一次。我们刚才不是还在聊采样嘛。」→ 详细
  • 他此前的剧透是「这题地球上没有哪个模型能直接做对,除非配上一套非常非常强的 harness」(他正在做的就是这套强 harness)。既然 5.5 做对了,那结论就是:「如果我要专门给这个模型做基准测试,我就得再去找一道更难的题。」→ 详细 → 详细
18

从两道题到一整套 eval:像二分查找一样填中间

  • 有了地板和天花板之后,剩下的「几乎就是个二分查找的过程」:标出简单、中等、困难,一路攒出一份 prompt 清单。「你可能会攒上一百条,每条都是『表型—基因、表型—基因、表型—基因』这样的配对,然后你就知道模型在上面表现如何。做到这儿就完事了,你的 eval 就有了。」→ 详细
19

跑完分之后,PM 该做的三个动作

  • 第一,判断够不够格发:「如果你只得 50 分,够发布吗?大概率不够。」→ 详细
  • 第二,拆开看强弱,给产品加护栏:往下看「我在哪些表型上表现更好」,然后「给产品加护栏(guard rails),只让它回答那些能拿到 80 分的问题类型」。他特别点名了这一步的归属——「这是个产品决策,是产品经理该做的决策」。→ 详细
  • 第三,把所有困难题打包丢给研究团队,原话是:「兄弟们,这些你们没做出来,去把模型修好,或者把 harness 修好,让它以后能答对,这样我才能把带这些能力的产品发出去。」→ 详细
20

全场结论:它就是一张表格,值钱的是领域专业度

  • Aakash 的总结一句话到位:「所以它就是一张表格而已。而这里真正关键的是领域上的专业知识(subject matter expertise),跟怎么写、格式如何都没关系。你今天没有给我们一个 eval 模板——不像我们以前会给大家一份 PRD 模板那样。真正驱动这一切的,是领域专业能力。→ 详细
  • Daniel 完全认同,并顺手给 eval 工具这条赛道下了个不留情面的定位:过去这些年一大堆公司都在做更好的 eval 工具,他不否认工具有存在必要、能改进的地方多得是,「但当你像刚才那样去构建 eval 时,它字面意义上就只是:prompt、回答,以及一套判断回答对不对的打分方式」。→ 详细
21

给从没做过 AI 功能的 PM:从第 0 天就想「成功长什么样」

  • 第一条建议是先找一个做过的人带你走一遍。他反复强调这事「看着简单,其实有陷阱」(deceptively simple),今天讲得这么简单是因为只有 45 分钟;「说实话我也不知道它为什么会这么复杂——我跟很多人聊过怎么做 eval,但它就是有一种偏『品味』、偏微妙的东西在里面」。→ 详细
  • 第二条是把思考前移到第 0 天。他编了个例子:你在 Pinterest 做图像生成,要的不是那种一眼假的 AI 垃圾图(slop),而是真能取悦用户的图。那从第零天你就得想:成功长什么样?Pinterest 的用户有什么独特之处?他们想看到什么?→ 详细 → 详细
  • 第三条是本期最可迁移的一句:你不能只在 PRD 里写一句「用户想要漂亮的厨房」就完事,你必须明确定义什么叫「漂亮的厨房」——而且不是用文字定义,是用示例(examples)定义,再配一套给这些示例打分的方法。 他说这是你着手做一个新 AI 功能时第一件该干的事。→ 详细
  • Aakash 顺着补完了闭环:就像 Daniel 为了做基因组把自己的专业度硬拉起来一样,你也得去学、去找那些做过图像 eval 的人聊「这类图像的 LLM-as-judge(用大模型当裁判打分)是怎么搭的」——那些东西才真正成为你 eval 的基础。→ 详细
22

为什么这件事跟每个 PM 都有关

  • 他在开场就把话说得很重:「从职业发展的角度看,PM 现在的处境其实挺难的。普通 PM 干的活无非三样:协调资源、鼓舞团队、做分析。但这几样,AI 做起来都不难。」→ 详细
  • 结论也很硬:「以后每一个 PM 都会开始做 AI 功能。不懂这套东西,你根本没法继续当 PM。」→ 详细
23

Meta vs Google:一个「评估没做好」的反面教材

  • 他先加前提:那篇对比文章是两年半前写的,离开 Google 大概三年半了。「我在 Google 那会儿,Google 简直是家『死掉的公司』,股价跌到了 80 块左右,现在大概是三四百块。」他在 Meta 是「回锅」的(boomerang,离职后又回去),前后加起来待了七年,见过剑桥分析(Cambridge Analytica)那种低谷、Llama 3 惊艳众人的高峰、再到 Llama 4 让人失望的低谷。→ 详细
  • 差别的根源:Meta 文化激进得多,源自 Zuckerberg 的创始人式领导——「他是最后一个还在亲自掌舵 FAANG 级别公司的创始人,手握绝对控制权,想干什么就干什么」(他补了句「好吧,除了 Elon 之外」)。双刃剑:好的时候是「这件事对我极其重要,公司所有资源都给你,放手去做」;坏的时候是一句「你们这帮人全都不行,去找新工作吧」,整个 Llama 团队基本就散了。→ 详细 → 详细
  • 和本期主题扣得最紧的一句藏在这里:「我以前做过 Llama。Llama 出了问题,而我认为最核心的问题恰恰出在它是怎么被评估的。挺讽刺的吧。」(他补充「那几封邮件很关键,想了解那段故事的话,自己去 Google 一下」,并强调「那事跟我没关系」。)→ 详细
  • 对两家的整体判断:Google 更讲共识驱动,「Google 的产品管理职能弱得多,至少我在的时候是这样」;外界一般说 Google 是工程驱动、Meta 更偏产品驱动。他个人更偏爱创始人信念极强、说了算的公司,对 Mark 有非常高的敬意(「我只见过他几次,但每次都是『哇,这人是真聪明』的感觉」),也承认这种模式会带来一堆问题。→ 详细
24

他的新公司:把全基因组测序送进每一家 NICU

  • 公司叫 Gamoff Labs(按字幕原样记,此处拼写识别存疑)。目标是让全基因组测序低门槛进到全世界每一家 NICU——「临床证据和经济性证据都压倒性地证明它有效,问题在于它实在太难、太贵」,所以现在只能在 Stanford、Boston Children's、CHOP(费城儿童医院)这些世界最顶尖的机构看到它在用;他希望它出现在「阿肯色州的乡下、印度的乡下、中国的乡下」。→ 详细
  • 核心判断是解读基因组过程中大量的人工工作可以被 AI 增强,而且已经有产出:用自建系统「已经证明能识别出此前从未被发现过的变异」,还让一个家庭敢生孩子了——「他们以前不敢,因为不知道病因」。规模还很小,五周前才开始,刚融完 pre-seed 轮,正在招人,接下来要造一套罕见病和基因组医学的「操作系统」。技术上他认为这件事本质就是「打造最好的 agentic harness」。→ 详细 → 详细

本期没有固定的闪电问答环节,收尾集中在两点。

  • Aakash 的观察:这条路已经成了模式。「我知道我的听众里有不少人想成为 Meta、Google 那样的 AI PM,而这往往就是之后的下一步。我们老说『别人家的草更绿』,但走到某个节点,我看到的那些 Meta、Google 的 AI PM 都跟 Daniel 一样——出去开自己的公司。」他强调有意思的地方在于,前面那段做 eval、啃 AI 的经历恰恰是在为这一步做准备——你能看到 Daniel 做 eval 的功夫和对 AI 的深度理解,现在全都用到了他自己的创业上。→ 详细
  • Daniel 的临别一句: 「Meta、Google 以及其它所有大公司,在 AI 时代都必须重新发明自己。如果你在这些公司里面,看着这套经典的『消费级软件生产流水线』是怎么被改写的,会非常有意思。但如果你出来创业、自己做,你就能从零开始造未来。而有时候,那反而更容易。」→ 详细
  • 他也顺带提了句招聘:新公司团队很小、正在招人,「如果你感兴趣,非常欢迎来找我聊」——字幕里没给出具体联系方式。→ 详细
🎯 于你何益 为你定制 · 非通用结论

这期是近期最贴你的一集:你要的那个"agent 产出可验证"的抓手,这期把它的物理形态摆出来了;而"决定 eval 好坏的是领域专业度不是工具"这句,等于给你八年 ERP 积累重新做了一次估值。

一、Holdwell ERP · 你的 PRD 工厂:eval 就是那个你一直缺的可验证抓手

1) 让评审关卡从"文档里的一句话"变成"跑得出分数的东西"

  • 怎么做的:Daniel 两年前的论断今天还成立——eval 是传达"产品该做什么"、并向工程团队解释"什么叫做成了"的最好方式。传统 PRD 把篇幅花在"功能怎么运作、某某情况下会怎么表现",但 GenAI 产品几乎什么都要能干,写不清楚,只能用例子说话。而 eval 的判定是二值的:分数不达标,就三条路——换模型、改 harness、改产品。
  • 你可以怎么做:你的三驾马车 PRD 工厂现在最疼的地方,是碰撞协议的纪律只是"写在文档里的一句话",没有任何东西真的拦得住。eval 就是那个拦得住的东西——它可执行、有分数、不达标就是不达标,没有讨价还价的余地。挑六步流程里最容易被糊过去的那一道关(比如"实体定义是否完整"),拿 20–30 个真实的 ERP 需求片段当输入,标准答案是你自己判定的正确实体 / 字段 / 状态机,判分交给一个 LLM 裁判对着评分卡比对。关卡就从"评审时靠人记得问"变成了"分数不到线就不放行"。

2) 那套七步机械流程,可以整段抄进你的工厂当一个固定环节

  • 怎么做的:他把写 eval 说成"机械活",七步一步不落——想清问题(不必完美)→ 挑判分维度 → 给每个维度定判分方式(自动 / LLM 裁判 / 人)→ 凑约 100 条同分布的 prompt → 全部跑一遍分难易 → 凑出一套约 50 分的题 → 交给团队往上提。他特别强调那个 50 分:太简单考 100 分,工程团队没法拿它优化;太难考 0 分,你连"这事今天可不可能"都不知道。
  • 你可以怎么做:这七步就是一个现成的操作脚本,直接沉进你的工厂当一个固定环节。更值得你警惕的是"50 分"这条纪律——你现在的碰撞 + 真人评审很可能已经是一套"每次都过"的 100 分题,那它对 agent 就没有任何优化价值,只是仪式。跑一遍看看:如果每条需求都全过,说明这套检查已经饱和了,该换一批更难的。

3) 地板 + 天花板:一眼看出你哪个角色在裸奔

  • 怎么做的:他先立地板(囊性纤维化那道最简单的题,确认模型真的做得了),再立天花板(双基因先天性心脏病,他判断"地球上没有哪个模型能直接做对")。地板那道题上 Haiku 当场翻车,只说"这个基因上跨了 48 个变异",还幻觉出一个"半合子大片段缺失"——逼他承认"这题对 Haiku 就是太难了,我还得再往简单里改"。
  • 你可以怎么做:你的三驾马车必然有强弱之分,但现在没有任何东西能告诉你哪个弱。给每个角色配两道题:一道地板题(这个角色最基本、闭着眼都该做对的事)和一道天花板题(今天大概率做不到的)。跑一遍,哪个角色在裸奔立刻现形。而且要按"这个角色实际用哪个模型"分档出题——他专门说了,25%–50% 这个区间是相对于你打算用的工具而言的,同一道题对强模型是地板、对小模型可能就是天花板。

4) 跑完分之后那三个动作,正好治你"agent 产出无可验证证据"

  • 怎么做的:50 分够不够发?"大概率不够。"那就往下拆:看哪些题型表现更好,给产品加护栏、只放开能拿到 80 分的问题类型——"这是个产品决策,是产品经理该做的决策"。剩下所有难题打包丢给研究团队:"去把模型修好,或者把 harness 修好,让它以后能答对,这样我才能把带这些能力的产品发出去。"
  • 你可以怎么做:别再问"PRD 工厂好不好用"这种没法证伪的问题,改成问"它在哪类需求上能到 80 分"。能到的那类正式放开、写进流程;到不了的那类挂护栏(强制人工接管);剩下的整理成一张待修清单,喂给你自己迭代——你既是 PM 也是那个"研究团队"。三个月后拿同一套题再跑一遍,分数的变化就是你要的可核验证据,比任何主观感想都硬。

二、app_incubator · 把"该做什么"前移到 agent,靠的是示例不是形容词

1) "漂亮的厨房"那一刀

  • 怎么做的:他给从没做过 AI 功能的 PM 最实用的一句是——你不能只在 PRD 里写"用户想要漂亮的厨房"就完事,你必须明确定义什么叫漂亮的厨房,而且不是用文字定义,是用示例定义,再配一套给示例打分的方法。他说这是着手做新 AI 功能时第一件该干的事,要从第 0 天就开始想"成功长什么样"。
  • 你可以怎么做:你的"设计稿即工程强制契约"已经走对了一半——用图而不是形容词。缺的是后半段:打分方法。给你正卡着的"激活 / 首屏体验"配 10–15 张"及格 / 不及格"的对照示例,外加一句判分规则,让 7-Agent 链路出图之后自己先过一遍这道题。你的痛点是"把该做什么前移到 agent",而 agent 唯一能接住的"该做什么"就是示例 + 判分,形容词它接不住。

2) 别先建工具——"它就是一张表格"

  • 怎么做的:全场演示做完,Aakash 的总结是"所以它就是一张表格而已,真正关键的是领域专业知识,跟怎么写、格式如何都没关系",而且 Daniel 今天连 eval 模板都没给。Daniel 自己也顺手把 eval 工具赛道判了个位置:一堆公司在做更好的工具,但构建 eval 时"字面意义上就只是 prompt、回答,以及一套判断回答对不对的打分方式"。
  • 你可以怎么做:不要为这件事去找平台、装框架、搭仪表盘——那会变成又一个占掉你两周精力的副本。今晚开一张三列表(输入 / 标准答案 / 判分说明),先写 10 行你最熟的场景。你缺的从来不是工具。

三、onehuman_company · 这期本身就是一条现成的"大佬说 X 我试了"

1) 验证体选题,素材几乎是白送的

  • 怎么做的:他没有讲原理,是开着屏幕现场跑——用 Codex 造合成基因组文件、三个 agent 同跑同一条 prompt、Haiku 当场翻车并幻觉、GPT-5.5 第二次采样答对推翻了他几分钟前"采样不重要了"的判断。可信度全部来自"翻车也照播"。
  • 你可以怎么做:这就是你四支柱里"大佬说 X 我试了"的标准素材。选题可以是:"前 Meta Llama PM 说,决定 eval 好坏的是领域专业度不是工具——我拿 ERP 领域试了一套 30 题的 eval"。过一下你的弹药库闸门:删掉你的判断和实测数据还成立吗?不成立——因为跑分表、翻车案例、哪个角色裸奔,全是只有你有的东西。可抄物也很清楚:那张三列表模板 + 七步流程。

2) 过程摩擦比结论更像可抄物

  • 怎么做的:他两次公开被打脸都没剪:Codex 造文件慢到他自己吐槽"这明明是一行就能搞定的活";Haiku 意外没过地板题,让他当场说"幸亏我先跑了这一步"。他甚至专门解释了为什么不写个 Python 脚本一键搞定——"那对观众一点帮助都没有,因为他们自己动手构造的时候还是不知道该怎么弄"。
  • 你可以怎么做:你的 build-in-public 号最缺的正是这种过程摩擦。以后每篇实测都留一段"这里卡住了 / 这里翻车了 / 我原以为是 A 结果是 B",别剪掉——它比结论更像可抄物,也更难被别人复制粘贴走。

四、Personal Thinking · 你那套总结标准,本身就该有一套 eval

  • 怎么做的:他解释了为什么模型在创意写作上弱——因为它难判分,人的偏好各不相同;而解法不是放弃评估,是把"好"拆成可判的维度。他给菜谱的例子拆得很朴素:格式对不对、配料有没有列全、文风写得对不对,然后给每个维度配一种判分方式(自动打分 / LLM 裁判 / 人)。
  • 你可以怎么做:你的"总结密度梯度标准"(益项写厚、其余紧凑、于你何益写满)现在完全靠每次读一遍人肉判,这跟你工厂里"产出难验证"是同一个病。把它拆成三四个可判维度(益项段的原话与数字密度、非益项段的单点长度、锚点是否真实可跳、于你何益是否按项目分组),挑 5 篇你自己认可的老总结当标准答案,写成一套小 eval。以后新总结先过这套题——你的摄入 SOP 才算有了执行点,而不是每次靠记性和心情。

五、StockHelp / 你的价值投资 · 别让公司自选的口径进你的表

  • 怎么做的:Gemini Ultra 那张成绩单是个绝好的案例——GPT-4 的 MMLU 86.4% 用的是 5-shot,Gemini Ultra 用的是 32-shot,Daniel 直接说"这有点像作弊:看你能从模型里采样多少次"。更深一层的是:老 benchmark 一饱和,各家就整批换成新 benchmark,"一点连续性都没有"。你以为在看进步,其实在看换题。
  • 你可以怎么做:这是给你做价值投资用的一面照妖镜。任何公司自己披露的口径都自带选题权——同比换成两年比、"调整后"利润、"核心业务"重新划线,本质就是换 shot 数和换 benchmark。给 StockHelp 加一条硬纪律:看板只用你自己定义的、跨年不变的口径(你固定的 PE 分位算法、target_pe×EPS 的公允价),公司的自选口径可以看,但不进你的表。另外还有一条能直接用的商业判断:Daniel 顺手把"做 eval 工具"这条赛道判成了低价值(工具不重要、领域专业度才重要),而把价值放在垂直 harness 公司——这个框架可以拿去审视那些"卖 AI 中间层工具"的标的,问一句它的护城河到底是工具还是领域。

六、你本人 · 领域专业度是你手上最不公平的那张牌

  • 怎么做的:他把话说死了——"你必须吃透这个领域的问题。如果你在某个主题上没有背景,也没真正下功夫补过课,那你基本不可能给它做出好的 eval",并直接连到 Anthropic、OpenAI 在招投行的人、会计师、律师这件事上。他整场演示本身就是证明:他能做基因组 eval,不是因为他 AI 强,是因为他懂基因组。
  • 你可以怎么做:你八年 ERP 的领域积累,一直以来的估值方式是"帮我在公司里干活更快"。这期给了另一种估值方式——它是可以直接换算成 eval 质量的稀缺资产,而 eval 质量决定了 AI 产品能不能做成。同时对照他开场那句"普通 PM 干的活无非协调、鼓舞、分析,这几样 AI 做起来都不难":你身上可替代的部分和不可替代的部分,这期给你划了条很清楚的线。往下走的方向不是"多学几个 AI 技术名词",而是"把只有干过八年的人才知道的那些判断,写成题"。

更深三角度

  • 该反着用:Daniel 有一整支研究团队可以接住"把难题打包丢过去修",他的 PM 角色是只出题不修题。你没有那个团队——你就是那个团队。所以对你,出一道"今天做不到"的天花板题不等于甩锅,而等于给自己排期;如果一道题你三个月内不打算修,就别放进 eval,否则它每跑一次都在提醒你一件你不会去做的事,纯消耗精力。同理,他攒 100 条题是因为有工程资源去跑;你一个人扛正职加多条副业,20–30 条真跑得起来的,远胜 100 条躺在文档里的
  • 和你现在做法冲突:你在 PRD 工厂上投了大量精力做结构——三驾马车、六步碰撞协议、agent 定义、真人评审,而这期的核心论断是"工具和格式不重要,值钱的是领域专业度和那张三列表格";Aakash 说得更直白:今天没给 eval 模板,不像以前给 PRD 模板。这跟你把很多时间花在"把架子搭得更整齐"是有张力的。这个张力我不替你下结论——有可能你的架子是对的(多 agent 编排确实需要结构),也有可能架子已经跑在内容前面,而真正缺的那 30 行"什么叫对"还没人写。至少值得问自己一次:如果这周只允许做一件事,是再给流程加一环,还是坐下来写那 30 行标准答案。
  • 对你的镜子:你一直把"我是 ERP 领域专家"和"我在做 AI 产品"当成两件需要平衡的事——一件是老本行,一件是新方向。这期给的框架是:它们不是两件事,领域专业度就是 AI 产品的原材料。你不是"一个懂 ERP 的人在学 AI",你是"手里正好握着 AI 公司花钱去雇的那种东西"的人。Anthropic 招会计师和律师,是因为他们买不到那些只有干过八年才知道的判断——ERP 这一行同理。

所以呢

  • 可迁移思维模型
    • 【耐用】"好"必须用示例定义,不能用形容词定义。凡是你写下"清晰的""完整的""高质量的",就去找三个正例三个反例把它钉死。这条跟 AI 无关——写标准、带团队、教人、给自媒体定选题标准,全都成立。
    • 【耐用】地板与天花板。评估任何东西,先确认最简单的那档做得到(否则你在优化一个不可能的目标),再确认最难的那档做不到(否则你的标准已经饱和、失去区分力)。中间那段才是有信息量的区间——这也是为什么"每次都过"的评审等于没评审。
    • 【耐用】度量本身就是执行力。没有分数的规则只是一句提醒;有了分数,规则自己就会执行。
    • 【会过期】这期所有的模型分档和跑分结果(GPT-5.3 Codex Spark Low、Haiku、5.5 extra high 谁能过哪道题)——他自己就说了,好 eval 几个月就会被爬到 100 分然后扔掉。别把这些当知识存。
    • 【会过期】"采样已经不重要了"这个判断——他在同一集里就被 GPT-5.5 第二次采样答对当场推翻了。
  • 判断更新:你之前把"agent 产出难验证"当成一个流程设计问题(该在哪一步卡、由谁来卡)。这期建议换个框架看它:它是一个度量缺失问题。你不需要再设计一道关卡,你需要给已有的评审环节配一套题和一个分数。
  • 这周一个赌注:不加新环节、不改流程图。开一张三列表格(输入 / 标准答案 / 判分说明),针对 PRD 工厂里你最不放心的那一道检查,写满 20 行——其中 5 行是"闭着眼都该对"的地板题,3 行是"今天肯定做不到"的天花板题。然后拿现在的链路跑一遍,把分数记下来。这一次跑分的数字,同时是你的评审执行点、你的 agent 产出可验证证据,和你 one human company 的第一篇验证体选题——一件事,三处交付。
接着读