(本期无)——这是一段 6 分半的现场短访谈,没有闪电问答环节;结尾只有 Ankit 的一句道谢收场。→ 详细
(本期无)——现场没有留任何账号、邮箱或论文链接。可循的线索只有身份信息:Surgan Jandial,CMU(卡内基梅隆大学)硕士生,该工作去年发表于 EMNLP(自然语言处理领域的顶级会议)。→ 详细
先把成熟度说清楚,免得你抱错期待。 这是一篇学术论文——CMU 硕士生的工作,去年发在 EMNLP。现场没有给出可下载的题库、没有公开排行榜、没有任何你能今天装上就用的工具。「10 美元」是他对自己那套题的说法,不是行业价目;「低于 50%」也只测了开源模型(他自己承认是算力限制)。所以这一期能拿走的只有方法,没有零件。
但方法这一层是真对得上——你 Holdwell 那条最疼的线正是「agent 产出的可观测/可验证」,而他讲的恰好是:当一个系统"只有全部跑完才知道好不好"的时候,怎么把它拆成几件便宜、能单独打分、还验证过跟最终结果相关的小事。下面逐项对。
A|先出一张技能清单,别急着造题
B|用你手上已有的东西造题,零新标注
C|别跳过"相关性验证"这一步——它是这套方法唯一的合法性来源
D|"碰撞协议纪律靠自觉",缺的可能不是决心,是一个足够轻的闸门
该反着用:Surgan 要的是一套能发论文、对所有模型都通用的基准,所以他必须做半自动的技能发现流程、必须验相关性、必须跨模型测。你不需要通用性——你只有一条自己的流水线和一个人的精力。反过来做:别想着"造一套评测体系",造十几道只对你自己那条链有区分度的脏题就够了,题少、临时、随时改、不追求能复用给别人。他的严谨是为了论文能过审,你的严谨只需要为了下一次不翻车。这两件事所需的工程量差一个数量级,别不小心接手了他那份。
和你现在做法冲突:你现在的评审是三驾马车碰撞加真人评审的完整流程——重、端到端、人在环。Surgan 恰恰说,这种形式在模型变强之后是最难发现问题的:错误越来越微妙,一条轨迹十几个规划点,找问题是大海捞针。张力就在这里——一次完整评审会给你"我已经从头到尾看过了"的踏实感,但它可能正是最容易漏掉细微错误的那种检查方式。这不是说那套评审该废(他自己也说"你应该跑轨迹、把这件事做对"),而是说它不该是你唯一的证据来源。要不要在它前面加一层便宜的粗筛,你自己判断。
对你的镜子:你把"agent 产出的可观测/可验证"记成了一个执行问题——好像只是还没抽出时间去搭那套验证。这期提示了另一种可能:真正卡住你的,是你把"这套东西到底有没有用"定义成了一个只有跑完整条链才能回答的问题。问题被定义得太贵,答案就永远排不进日程。便宜的问题才有机会被反复问,反复问才会有闭环。
可迁移思维模型【耐用】:「贵的端到端评测 + 便宜的子能力代理测试 + 两者之间的相关性验证」三件套。任何时候你面对一个"只有全部做完才知道好不好"的系统——PRD 工厂、造 App 链路、甚至你内容号的选题流程——都可以问同样三句:能不能拆成几项单独可测的能力?能不能用手上已有的素材造出便宜的题?这些题的分数真的和最终结果相关吗?这个模型跟具体技术无关,不会过期。
【会过期】:「大部分模型低于 50%」这个数字,以及"模型在时序排列这类简单题上很差"的结论。他自己就说了受算力限制只测了开源模型,而模型一两代之内就可能把这类题刷满——把它当成 2025–2026 年的一张快照,别当成长期事实去引用(尤其别在内容里当成"AI 规划能力不行"的论据)。
判断更新:你之前对"闭环证据"的默认理解大概是"端到端跑通一整条链"。可以更新成:闭环证据是分层的——一层是便宜、能天天跑、可以当自动闸门的代理指标;一层是贵、偶尔跑、用来校准前者的完整评测。前者是执行纪律,后者是校准仪式,缺哪个都不成立。你现在缺的是前者,而且正因为缺前者,后者才一直排不上。
这周一个赌注:挑你那条 PRD 流水线里最疼的一跳(大概率是需求梳理到方案定稿那一段),翻出 10 组历史产物,用上面三个模板造 20 道二选一的题,跑一遍拿到第一个分数。不建题库、不写工具、不出文档——这周只要两样东西:一个数字,以及"这个数字跟我印象中的好坏对不对得上"的答案。对得上,你就有了第一个能自动跑的闸门;对不上,你至少知道自己一直在用错的方式看这条链。