ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.150
第 150 期 · AGENT 工程 · 收录于 2026 年 8 月 15 日

WebAgent规划评测

SJ
Surgan Jandial · YC Root Access
视频 6:42 原文约 0.8 万字 预计阅读 7 分钟 来源视频 ↗ 中英对照全文
TL;DR · 三句话
  1. Web agent 每走一步都是"先想再动",但现在大家只评它最后办没办成事——Surgan Jandial(CMU 硕士生,这项工作去年发表于 EMNLP)盯的是中间那个「想」的环节(planning,规划)该怎么评。→ 详细
  2. 直接评"想"这一步太贵:一条任务轨迹里有 10–15 个规划点,评其中任何一个都得把整条轨迹(图像 + 一堆工具调用 + 各种文本)搬上来,而模型越强错误越微妙,找问题成了大海捞针。他的解法是把 planning 拆成四项单项技能——时序排列、未来状态预测、动作选择、纠错——分别打分。→ 详细
  3. 打分的题不新造:把现成数据集改造成极简的二选一小题(比如给两张截图问"哪张会先出现"),零人工、零新标注;结果是大部分开源模型在这类简单题上都低于 50%,而这几项技能的平均分与端到端任务表现高度相关——于是你可以先花 10 美元做一轮离线预筛、定位弱在哪一项,再去跑那套贵的完整评测。→ 详细
01

这项研究评的是 web agent 的「中间那一步」

  • web agent(能看懂网页界面、自己点按钮和输入、替你把事办完的 AI)的工作循环是:拿到一个任务(比如「找到最便宜的 4K 显示器」)和一张 UI 界面 → 先"想"该怎么解,产出计划和策略,这一步叫 planning(规划) → 再根据这个想法预测出当前这个界面上具体该做哪一个交互动作 → 如此反复走五步、十步,或走到设定的步数上限,最后产出一个结果。→ 详细
  • 现有评测基本只评最后那个结果,用一些 rubric(评分标准)或 verifier(校验器,自动判对错的程序)去判。Surgan 的原话是评最终输出「相对容易一些」,他真正关心的是:「中间这个 plan、这一步,该怎么评。」现场是 YC 的 YCML 活动,主持人 Ankit Gupta。→ 详细
  • 一处口径说明:Surgan 自己说论文题目讲的是 VLM agent(视觉语言模型 agent——既能看图又能读写文字的模型)的细粒度规划能力,视频标题写的是 web agent,指的是同一件事。→ 详细
02

为什么直接评 planning 又贵又难:大海捞针

  • 要评一个规划点,你必须同时有它之前的上下文(计划是基于过去生成的)和它之后的输出(计划讲的是接下来要干什么)——也就是说,光为评这么一个点,你得把整条轨迹搬上来。而一条轨迹里这样的点有 10–15 个→ 详细
  • 上下文本身也不便宜:web agent 的上下文里塞着图像、一堆 tool call(工具调用)、各种文本。再加上模型越来越强、不再犯一眼能看出的错,剩下的错误都很微妙——在这么长的东西里找问题就成了大海捞针。→ 详细
  • 他并不否定逐段评轨迹:「你应该跑轨迹、把这件事做对、再对 planning 下判断」——他要的是一个替代的、互补的做法。→ 详细
03

破题的类比:视觉问答里的"狮子左边那只动物"

  • 他借视觉推理打比方:**VQA(视觉问答)**里问「狮子左边的那只动物是什么?」,对人来说像是一个任务,其实模型得先把狮子定位(ground)出来、再搞清楚左边右边分别是哪边、再找到那只动物,最后才给出答案。→ 详细
  • Ankit 接话「我们的大脑其实也在做这几件事」;Surgan 的落点是——这几步全做对了最终答案才对,所以同理,planning(也就是「想出该怎么做这个动作」的能力)也可以拆成一组单项技能,给每项各打一个分,再回过头评价整体的规划能力→ 详细
04

把 planning 拆成哪四项子技能(本期方法的核心)

  • 技能是"发现"出来的,不是拍脑袋定义的:他们用一套半自动的方法,在一批种子任务上跑 agent,从它实际的行为里归纳出它反复在用哪几项能力。→ 详细
  • ① temporal ordering(时序排列)——agent 一直在判断自己是不是走在正确方向上。原话的例子是购物场景:任务是把商品加入购物车,它会想「我要买这个东西,那下一个状态该是结算页吗?结算是排在加购前面吗?」本质就是在给网页状态排先后。→ 详细
  • ② future state prediction(未来状态预测)——当它停在"加购"这一步、又知道接下来要去结算,它一直在想「什么动作能把我从这里带到那里?」既在预测未来状态,也在预测怎么走到那个未来。→ 详细
  • ③ action selection(动作选择)——agent 面前往往不是只有一个确定动作可走,而是一堆选项;它要评估这些选项、挑出最好的那个。→ 详细
  • ④ error correction(纠错)——这一项是"做错之后"才会用上的技能,他是在讲测试设计时补上的第四项。前三项加这一项,就是他给 planning 拆出的技能清单。→ 详细
05

两个硬约束:必须便宜、必须可解释

  • 便宜:「我要它便宜——如果它跟原来那套一样贵,那就没意义了。」这套评测存在的全部理由就是比完整轨迹评测省钱。→ 详细
  • 可解释:每一项技能都要拿到一个清楚的分数,这样才能在你原有的评测之上多给一层信息(到底错在哪一项),而不只是一个笼统的总分。→ 详细
06

怎么把技能变成能打分的题:改造现成数据集,零新数据、零人工

  • 核心手法是「完全把已有数据集重新利用」——不新造数据、不需要任何人工参与,用一种很省事的方式生成 synthetic data(合成数据,即不是人一条条标出来的,而是拿已有素材自动拼出来的题目)。→ 详细
  • 具体到时序排列这一项,题目长这样:取两张截图——比如 Google Scholar 的首页,和任务终态的那一张——然后问 agent:「要完成这个任务,下面这两张哪一张会先出现?」一道二选一,让 agent 作答。Ankit 把这个手法概括成造 counterfactual(反事实,把事实改动一点,看模型是否还答得对),Surgan 认可,并连说是「非常简单的测试」。→ 详细
  • 每一项技能都有这类题目;把它们合起来,每项技能各得一个分数。跟以前的差别用他俩的对话说最清楚:以前评的是"具体的那几段",现在评的是"通用的技能"。→ 详细
07

结果一:这些简单题上,大部分模型低于 50%

  • 所有题平均下来,大部分模型都很差、低于 50%。他强调这些本该是简单题;受算力限制他测的是开源模型,但即便如此,「低于 50% 也是很糟糕的结果、很糟糕的表现」——这几个维度上都还有很大提升空间。→ 详细
08

结果二:子技能分数与端到端任务表现高度相关

  • 这几项 planning 技能上的平均表现,和最终任务表现高度相关——模型在这些技能上强,确实对应它在端到端任务上也强。这条相关性是整套方法能被当"代理指标"(用便宜的小测代替贵的大测)来用的合法性来源。→ 详细
09

落地怎么用:10 美元的离线预筛 → 定位弱项 → 再跑重评测

  • 两段式:你当然应该把模型放到自己的任务上跑、拿到轨迹、去评那些 thought,但那是很重的活;可以先做这套离线测试——「把我的简单测试套到你的模型上,花 10 美元,就能在这几个独立维度上拿到一份初步评估」,先筛掉一大批,再去跑那个复杂的评测。→ 详细
  • 省下的不只是钱,还多了定位能力:「这样你还知道它到底错在哪」。如果是某一项技能不行,就先针对那一项做 GRPO(一类强化学习微调方法,用来把某项能力针对性地练上去)之类的处理,再进到复杂评测。→ 详细
  • 他的定位很克制:「我们觉得它不是替代品,而是对现有评测的补充。」这是给 planning 评测加上的一个维度,不是要换掉端到端评测。→ 详细

(本期无)——这是一段 6 分半的现场短访谈,没有闪电问答环节;结尾只有 Ankit 的一句道谢收场。→ 详细

(本期无)——现场没有留任何账号、邮箱或论文链接。可循的线索只有身份信息:Surgan Jandial,CMU(卡内基梅隆大学)硕士生,该工作去年发表于 EMNLP(自然语言处理领域的顶级会议)。→ 详细

🎯 于你何益 为你定制 · 非通用结论

先把成熟度说清楚,免得你抱错期待。 这是一篇学术论文——CMU 硕士生的工作,去年发在 EMNLP。现场没有给出可下载的题库、没有公开排行榜、没有任何你能今天装上就用的工具。「10 美元」是他对自己那套题的说法,不是行业价目;「低于 50%」也只测了开源模型(他自己承认是算力限制)。所以这一期能拿走的只有方法,没有零件

但方法这一层是真对得上——你 Holdwell 那条最疼的线正是「agent 产出的可观测/可验证」,而他讲的恰好是:当一个系统"只有全部跑完才知道好不好"的时候,怎么把它拆成几件便宜、能单独打分、还验证过跟最终结果相关的小事。下面逐项对。

1. Holdwell 的 PRD 工厂 · 把"这套流程到底行不行"拆成能单独打分的小问题(最高相关)

A|先出一张技能清单,别急着造题

  • 怎么做的:Surgan 不去正面问"这个 agent 规划能力好不好",而是先在一批种子任务上跑一遍,看它反复在用哪几项能力,归纳出四项——判断网页状态的先后顺序、预测下一个状态该是什么、在多个候选动作里挑一个、做错之后纠错。关键在于这四项不是他坐在桌前定义出来的,是从 agent 的真实行为里归纳的,他管这叫"半自动的技能发现"。
  • 你可以怎么做:你那条从澄清、独立初稿、碰撞到合成定稿、真人评审的多阶段 PRD 流水线(三驾马车碰撞协议那串),现在的验收方式基本还是"整条跑一遍,看最后产出行不行"。换成他的口径:翻十来次真实跑过的记录,看你的 agent 在各段里反复在做哪几件动作——大概率是"判断这个需求该不该进下一阶段""从上一阶段的产物推出这一阶段该产出什么""在几个方案里选一个""发现前面写错了往回改"。把它们列成一张不超过五项的清单。这一步只做清单,不做题,一个下午够了。

B|用你手上已有的东西造题,零新标注

  • 怎么做的:他的题一律从现成数据集改造,明确说"不新造数据、不需要任何人工参与"。时序那一项的题就是取两张截图(Google Scholar 首页 + 任务终态那一张)问"哪张会先出现",一道二选一。简单到近乎廉价正是设计目标——因为这套评测唯一的存在理由就是比完整评测便宜,「跟原来那套一样贵就没意义了」。
  • 你可以怎么做:你手上已经堆着一大摞历史 PRD、评审记录、各阶段的中间产物——那就是你的"现成数据集"。挑最疼的那一跳(大概率是需求梳理到方案定稿),三种造题模板直接套:① 把历史产物两两配对问"这两份哪个在前";② 遮掉后一阶段的产物问"下一步该产出什么"(给三个选项);③ 把一份通过评审的方案和一份被毙掉的方案并排问"选哪个"。答案你都已经知道,不用重新判。几十道题,一个晚上能造完。

C|别跳过"相关性验证"这一步——它是这套方法唯一的合法性来源

  • 怎么做的:他没停在"我造了一套题"就宣布胜利,还专门验了一件事:这些子技能的平均分与端到端任务表现高度相关。没有这条,子技能分数就只是一堆好看的数字,凭什么代替真实评测?
  • 你可以怎么做:题造完别急着当验收标准。找出五到十次你已经知道结论的历史跑批(哪几次结果好、哪几次翻车),拿新题库回头测一遍,看分数排序跟你的主观印象对不对得上。对得上,这套题才配当闸门;对不上,说明你技能拆错了,回去改清单——这比继续加题有价值得多。

D|"碰撞协议纪律靠自觉",缺的可能不是决心,是一个足够轻的闸门

  • 怎么做的:他的落地姿势是两段——先用 10 美元的离线小测筛掉一大批,再跑贵的完整评测;而且小测会告诉你错在哪一项,可以先针对那一项做强化学习微调,再进复杂评测。他反复强调这是补充不是替代。
  • 你可以怎么做:你痛点里写的"碰撞协议纪律是否真执行",卡点从来不是你不想守规矩,而是检查太重——每次都要人工跑完整评审,所以到最后总被跳过。这套思路给你一个便宜版:每次改动之后先跑那几十道二选一小题,分数没退步才允许进真人评审。闸门轻到能自动跑,才有可能真的被执行;重到要人排半天时间的闸门,写进流程也只是摆设。

2. app_incubator · 给"设计稿→代码"这条链也拆一份技能清单

  • 怎么做的:这套方法并不绑定 web agent,它绑的是"任何一个多步、有中间产物的 agent 流程"——只要中间步骤留下了结构化的东西,就能拆技能、造小题。
  • 你可以怎么做:你造 App 链路里"设计稿即工程强制契约"这条硬约束,天然适合造题——因为答案在契约里是确定的,不需要人来判。比如:给一段设计稿和两份实现,问哪份符合契约;或给一个组件问"下一步该生成哪个文件"。这类题跑起来几乎不要钱,还能在你改 agent 提示词之后立刻回归一遍。

3. onehuman_company · 这是一条现成的「验证体」选题

  • 怎么做的:这期的可抄物非常清楚,四步就能复述——把一个大能力拆成 4 项子技能、用现成素材造零人工的合成题、验一下跟最终结果的相关性、然后用便宜的小测做预筛。而且它带一个反直觉结论:这些"简单题"上大部分开源模型不到 50 分。
  • 你可以怎么做:这条完全过得了你的弹药库闸门——删掉你的实测它就不成立。做法:拿 drizzle tech 那条链,照上面的清单造 20 道小题,花几十块钱跑一遍,把分数、翻车的那几道题、以及"我原以为它最强的那一项其实最差"写出来。标题方向:《CMU 的论文说这些"简单题"上大部分模型不到 50 分——我拿自己的 AI 员工照着造了 20 道题》。一篇同时喂"大佬说 X 我试了"和"AI 员工管理成本账"两个支柱,可抄物是那三个造题模板。

更深三角度

该反着用:Surgan 要的是一套能发论文、对所有模型都通用的基准,所以他必须做半自动的技能发现流程、必须验相关性、必须跨模型测。你不需要通用性——你只有一条自己的流水线和一个人的精力。反过来做:别想着"造一套评测体系",造十几道只对你自己那条链有区分度的脏题就够了,题少、临时、随时改、不追求能复用给别人。他的严谨是为了论文能过审,你的严谨只需要为了下一次不翻车。这两件事所需的工程量差一个数量级,别不小心接手了他那份。

和你现在做法冲突:你现在的评审是三驾马车碰撞加真人评审的完整流程——重、端到端、人在环。Surgan 恰恰说,这种形式在模型变强之后是最难发现问题的:错误越来越微妙,一条轨迹十几个规划点,找问题是大海捞针。张力就在这里——一次完整评审会给你"我已经从头到尾看过了"的踏实感,但它可能正是最容易漏掉细微错误的那种检查方式。这不是说那套评审该废(他自己也说"你应该跑轨迹、把这件事做对"),而是说它不该是你唯一的证据来源。要不要在它前面加一层便宜的粗筛,你自己判断。

对你的镜子:你把"agent 产出的可观测/可验证"记成了一个执行问题——好像只是还没抽出时间去搭那套验证。这期提示了另一种可能:真正卡住你的,是你把"这套东西到底有没有用"定义成了一个只有跑完整条链才能回答的问题。问题被定义得太贵,答案就永远排不进日程。便宜的问题才有机会被反复问,反复问才会有闭环。

所以呢

可迁移思维模型【耐用】:「贵的端到端评测 + 便宜的子能力代理测试 + 两者之间的相关性验证」三件套。任何时候你面对一个"只有全部做完才知道好不好"的系统——PRD 工厂、造 App 链路、甚至你内容号的选题流程——都可以问同样三句:能不能拆成几项单独可测的能力?能不能用手上已有的素材造出便宜的题?这些题的分数真的和最终结果相关吗?这个模型跟具体技术无关,不会过期。

【会过期】:「大部分模型低于 50%」这个数字,以及"模型在时序排列这类简单题上很差"的结论。他自己就说了受算力限制只测了开源模型,而模型一两代之内就可能把这类题刷满——把它当成 2025–2026 年的一张快照,别当成长期事实去引用(尤其别在内容里当成"AI 规划能力不行"的论据)。

判断更新:你之前对"闭环证据"的默认理解大概是"端到端跑通一整条链"。可以更新成:闭环证据是分层的——一层是便宜、能天天跑、可以当自动闸门的代理指标;一层是贵、偶尔跑、用来校准前者的完整评测。前者是执行纪律,后者是校准仪式,缺哪个都不成立。你现在缺的是前者,而且正因为缺前者,后者才一直排不上。

这周一个赌注:挑你那条 PRD 流水线里最疼的一跳(大概率是需求梳理到方案定稿那一段),翻出 10 组历史产物,用上面三个模板造 20 道二选一的题,跑一遍拿到第一个分数。不建题库、不写工具、不出文档——这周只要两样东西:一个数字,以及"这个数字跟我印象中的好坏对不对得上"的答案。对得上,你就有了第一个能自动跑的闸门;对不上,你至少知道自己一直在用错的方式看这条链。

接着读