这一期跟你的相关度很高,而且高得很实在:你现在就跑在 Opus 5 上,你的造 App 编队要不要整体换模型是个真决定,而她这套「自己维护一套跨模型 eval」的做法,比她的结论本身更值得抄。下面按项目分。
一、造 App 编队(app_incubator / drizzle tech)——「换不换模型」这个决定,她替你先试了一遍
① 她的结论不是「换」或「不换」,而是「按场景分裂着用」
- 怎么做的:她的最终裁决是——Opus 5 用来做前端设计、App 设计、原型,前提是异步、后台、不用跟它说话;而需要来回对话、需要它直接给结论的场合,她还是 GPT Codex 派。她给的理由很硬:「它是我最嫌弃的同事,可它干出来的活儿偏偏又是最好的」,所以正确的做法不是二选一,是把「产出质量」和「协作体验」拆成两件事分别归位。
- 你可以怎么做:你那支编队本来就分角色——别问「整支编队要不要换 Opus 5」,改成问「哪几个角色该换」。凡是你不会逐字读它输出、只验收最终成品的角色(前端实现、原型生成、设计稿落地),Opus 5 的人格缺陷对你几乎零成本,直接换;凡是你要跟它来回吵、要它一句话给判断的角色(需求澄清、方案取舍、评审对话),神经质和废话就是实打实的摩擦,先别动。这周就能做的一件事:把编队角色列出来,每个标上「我读不读它的过程输出」,读的那些先不动。
② 「自主执行 ≠ 自主决策」——她发现的这个区分,正对着你「把该做什么前移到 agent」的痛点
- 怎么做的:她的原话是,让 Opus 5 去跑 sub agent 时它是挺自主的,但它不做决定。两个现场证据:一行的 merge conflict,它拿「这是别人的分支、可能打乱他的在途工作」当理由不肯碰;跑完查询改写的验证,它交回来的不是结论,是一张「希望有人类来确认」的清单,理由是「没有人跟我确认过这些」——她怼「『没有人』是谁?你就是那个人啊」,它才上网自己查,而且查出来了。也就是说它一直有能力,只是默认把「要不要动手」的开关交回给人。
- 你可以怎么做:你想把「该做什么」前移到 agent,那么**「拒绝决定」这件事必须被当成失败来记,而不是当成谨慎来夸**。具体动作:在编队的角色约定里写死一条「升级规则」——只有满足指定条件(比如会产生不可逆后果、会动到别人的分支、会花钱)才允许把决定退回给你,其余情况必须自己拍板并写明理由和回滚路径。再加一条更狠的:每次它把决定退给你,都记一笔;一周后看这张表,就知道是模型太怂还是你的授权边界没写清楚。
③ 它拒绝碰 merge conflict 的那套理由,是你多 agent 协作的一个真实预警
- 怎么做的:注意它给的三条理由——不是我的分支、人家不知情、他可能有在途工作——单看每条都成立,甚至有职业素养的味道,问题只在于它面对的是一行冲突,而下指令的人就是仓库负责人。这是一种很难察觉的失败:它用一套听起来正确的话术,把工作量原样退回给你。
- 你可以怎么做:你的编队里 agent 之间会互相改文件、互相接力,这类「合理的推诿」会成规模出现。给编队加一句共享约定:「当你的顾虑是关于别人的在途工作时,先去查(看提交、看状态),查完再决定;不允许把『可能会影响别人』当作不动手的最终理由。」 这条约定成本极低,但正好卡住她碰到的那个坑。
二、你最该抄的其实是这个:自己维护一套跨模型 eval
① 她的 eval 长什么样
- 怎么做的:一套她自己维护的七模型(她说「六七个」)盲测,跑五类任务——写 PRD、做原型、画线框图、bug triage(缺陷分诊)、agentic coding——外加一项没法量化但她坚持要打的**「这个 agent 的说话方式,是不是我愿意跟它待在一起的那种」**。打分是固定配比:70% 她自己的 vibe check + 30% LLM 当评委,评委模型是 GPT-5.5,理由非常本人:「这是我的播客,我说了算」。全程盲测,几十上百个原型她一个个点开看完、评语全填;开录前她自己都不知道分数。
- 你可以怎么做:你已经有现成的任务模板了——你的编队每天在跑的那几类活(写 PRD、出原型、把设计稿落成代码、改 bug)本身就是最好的 eval 任务集,不需要另造。做法是:挑 3 个你真跑过、且你自己心里有标准答案的历史任务,存成固定题面;每次有新模型发布,就用同一套题面跑一遍,把模型名字遮掉再打分。这件事一旦有了,以后「要不要换模型」就不再是读别人的评测猜,而是查自己的表。
② 70/30 这个配比本身是个聪明的设计
- 怎么做的:它同时解决了两个问题——纯人工打分跑不动几十上百个样本;纯模型打分会把「我愿不愿意跟它共事」这种味觉信息丢光。她的解法是人保留决定权(70%)、模型只做补充和交叉检验(30%),并且把两边的分并排画出来看分歧:她和评委在 Opus 上最一致(分差最小),在 Gemini 上分歧最大(「AI 对 Gemini 没我这么刻薄」);Sonnet 5 的名次干脆是人机打架打出来的——她打得很低、评委打得挺高,她说这一名可能还要调。
- 你可以怎么做:照抄这个结构,但把权重反过来调(原因见下面「该反着用」)。真正值钱的是那张分歧图:让评委模型也给一遍分,然后只看「你和它差得最远的那几项」——那几项就是你的口味里模型学不会的部分,也正是你在造 App 这件事上真正的判断力所在。这比总分有用得多,而且是你自己认知的一面镜子。
③ 她的诚实纪律也值得抄
- 怎么做的:盲测(遮掉模型名)+ 开录前不看分数 + 结论和观众同时揭晓。她这套纪律的作用是防止「我本来就喜欢某家模型」污染打分——事实证明有效:她录之前预判 Opus 5 在「说话方式」这项会难看,结果总榜第一,她自己都说「我很遗憾地通知各位,我爱上 Claude Opus 5 了」。
- 你可以怎么做:你做模型选型时最大的风险不是选错,是你已经用顺手了某个模型,然后给它找理由。把「遮名字」这一步硬做进流程:跑完把输出重命名成 A/B/C 再打分。多花五分钟,换掉一个你自己看不见的偏见。
三、多-Agent PRD 工厂(Codex Holdwell ERP work)——「产出便宜、验证昂贵」这条直接打在你的靶心上
① Claude 自己给出的那条警告,是判断「该不该让 AI 干这活」的最好筛子
- 怎么做的:Opus 5 在被问「我该小心什么」时给出的清单里,最硬的一条是:警惕那些「产出很便宜、但验证很贵」的任务。逻辑是——AI 把「生成」的成本压到接近零,但「确认这东西对不对」的成本一点没降,于是这类任务的实际性价比反而变差了,因为你被推去干了成本最高的那一半。配套的还有三条:别把「说得流畅」等同于「说得准确」;小心锚定(初稿是它写的,你后面只是在它的框架里修修补补);小心「slop cannon(垃圾内容大炮)」——原话是「我能生成一份 12 页、但没人会看的文档」,它还顺手内涵了 Claire「你就是干 PRD 这行的」。
- 你可以怎么做:这句「12 页没人看的文档」几乎是指着 PRD 工厂说的。给你的流水线加一道**「验证成本」闸门**:每个环节先问一句「这一步的产出,谁来验、验一次要多久」——凡是「生成 10 分钟、验证 2 小时」的环节,要么改成让 agent 同时产出可验证的检查项(自检清单、可跑的用例、可比对的数据),要么干脆不让 AI 做全量、只做骨架。你一直在找的「agent 产出可观测、可验证」,这就是一个天然的抓手:没有配套验证物的产出,不许过闸。
② 「认同很廉价」这句话,值得贴在评审环节的墙上
- 怎么做的:她拎出来的另一条是——「它总能找到办法认同你的观点,所以『认同』这东西很软、很廉价」,紧接着是一句自我剖击:「而且我现在就是在说你爱听的话。」 对照 GPT 那边给的原则:「赌注越大,你越应该向我要证据。」
- 你可以怎么做:你的碰撞环节如果 ux-designer 和 tech-lead 最后都只说「这个方案没问题」,那这轮碰撞的信息量是零——这正是「碰撞协议纪律有没有真执行」的试金石。把「同意」设成需要举证的一方:要求评审 agent 给结论时必须附上「我检查了什么、在哪个文件哪一行看到的、如果我错了会是哪里错」。你要的「agent 产出可验证」也是同一个道理——没有证据的通过,等于没通过。
四、一人公司账号(onehuman_company)——这一期是现成的验证体选题
① 「大佬说 X 我试了」,这期的 X 已经摆在那儿了
- 怎么做的:她的主张很清楚也很敢——「我们已经进入智能过剩」「未来一年会更多聊速度、成本、开源,聊智能会少一些」;她的实测结论是**「最讨厌的同事,干最好的活」,用法是异步、后台、不跟它说话**。
- 你可以怎么做:这是你那个验证体支柱的现成弹药,而且你手上有她没有的东西——一支真的在跑的 9+1 Agent 编队。选题可以直接定成:「Claire Vo 说 Opus 5 是最讨厌的同事但活最好,我拿我的编队跑了一周」——你能给出的独有内容是她给不了的:换模型之后你的编队哪几个角色变好了、哪几个变卡了、成本涨了多少、有没有出现『把决定退回给我』的情况、退了几次。过弹药库闸门也没问题:删掉你的实测数据这篇就不成立。
- 另一个更小但更好写的选题:「我把 Claire Vo 那套 70/30 模型评测抄回自己家跑了一遍」——可抄物非常明确(题面怎么设、盲测怎么做、分歧图怎么看),而且天然带一张你自己的结果表。
② 但有一条冲突你得自己拿主意(见下)——Opus 5 在采访里劝 Claire「不该跟别人争论 AI 改变了一切」,而你整个账号就是在公开做这件事。
五、投资 / StockHelp——顺带一句,但不硬掰
- 怎么做的:她的「智能过剩」推论如果成立,商业含义是模型层的差异化正在坍塌:当所有前沿模型都聪明到用户消化不完,竞争维度就从「谁更聪明」滑向速度、成本、开源——这三样全是价格战和商品化(commoditization)的典型信号。她的榜单也侧证了这点:七个模型里,前几名的差距要靠她 70% 的主观口味才拉得开。
- 你可以怎么做:把这条当成一个可以持续跟踪的假设,而不是一个结论。用你熟悉的护城河语言问一句:如果模型层是商品,那价值会沉淀到哪儿——沉到分发和用户关系?沉到数据和工作流粘性?还是沉到算力和能源这一侧?你不用现在下判断,但可以在自选池的观察笔记里给相关标的加一条「智能过剩假设」的跟踪项,每季度看一次证据往哪边走。这条是弱到中等关联,就写到这里,不再展开。
该反着用
- 她的 70/30,你该改成大概倒过来。 她是内容主理人,主观口味就是她的产品,观众是来看 Claire 怎么想的,所以她给自己 70% 天经地义;而且她有资源把几十上百个原型全部点开看完。你不是——你一个人扛正职加多条副业,精力是你最稀缺的东西。你的正确做法是:让模型评委承担大部分初筛(比如它先打完所有分、只把前三和分歧最大的几项推给你),你只在最后那一小撮上花你的判断力。抄她的结构,别抄她的权重。
- 她每周换模型追新,你不能。 她的工作就是测模型,所以「Fable 来了走了又回来」对她是素材;对你,每换一次模型,编队的提示词、技能约定、验收标准都得重新校准一遍。所以你的换模型节奏应该明显慢于她——别追发布,追的是「我那三道题的分数是不是真的被拉开了」。
和你现在做法冲突
- 「统一换 vs 分裂用」的张力:你倾向整支编队用同一个模型(好管、好排查、成本好算),而她的结论恰恰是按场景分裂使用两家模型。分裂能拿到每个场景的最优解,但代价是编队复杂度上升、出问题时多一个变量。这个取舍没有标准答案,但值得你明确地选一次,而不是默认统一。
- Opus 说的「不该跟人争论 AI 改变了一切」直接顶着你的账号。你的一人公司账号本质上就是在公开论证「AI 改变了一件具体的事,这是我的账本」。Claire 的态度是当场不买账:「这条别听 Claude 的,AI 绝对改变了一切。」但这里有个不那么舒服的问题值得你自己想:你是在「争论 AI 改变一切」,还是在「展示我用它改变了什么」——这两者对读者的说服力差着量级,而且只有后者需要你有实测。这条张力我不替你下结论。
- 你现在跑在 Opus 5 上,而她说的那些毛病你可能已经付了成本却没记账。它把决定退回给你、它写的那些让 Claire 血压飙升的行文、它给的听起来正确的推诿理由——你有没有察觉到这些,本身就是个信号:要么你的用法(异步、验收成品)天然免疫,要么你已经习惯了替它做决定还不自知。
对你的镜子
- 「智能过剩」这个词,其实说的是你自己。 瓶颈早就不在模型有多聪明,而在你能给它派多少活、能验证多少产出——而这两样都吃你的精力,正是你档案里写着的最稀缺资源。所以「要不要换更强的模型」这个问题的重要性,可能被你高估了;真正该问的是「我现在有多少产能是卡在『我来不及验』上的」。
- 「产出便宜、验证昂贵」是「99% 的努力终将白费」的 AI 版本。 以前浪费的是你的工时,现在浪费的是你的注意力——而且 AI 让浪费的速度快了一个数量级,因为它能一口气给你 12 页没人看的文档。你盯那 1% 的能力,在智能过剩的时代不是变得没用,是变成了唯一的稀缺品。
- 还有一句,来自 Opus 自己:「人类更慢、更窄,但思考深得多,判断力是从多年亲身承受过后果的经历里长出来的。」 这句话正好是你「判断力 > 努力」那条原则的外部证词——而且是被评测的那一方主动说出来的。
所以呢
- 可迁移思维模型
- 【耐用】产出便宜、验证昂贵——用它当筛子决定一件事该不该交给 AI,比任何跑分都好用。
- 【耐用】自主执行 ≠ 自主决策——评估任何 agent 时都该分开看这两件事,「它跑得动」和「它敢拍板」是两个能力。
- 【耐用】认同很廉价——在多 agent 评审里,「同意」应该是需要举证的那一方。
- 【耐用】看人格比看跑分更能看出一家公司要往哪儿走——这条同样适用于你看公司、看产品、看人。
- 【会过期】这份榜单的具体名次(Opus 5 → Sonnet 5 → Mabu → GPT Terra → Fable → Opus 4.5 → Gemini 3.1 Pro)、Claude 废话的具体表现、「智能过剩」这个时点判断——三个月后大概率要重跑。
- 判断更新:把「模型选型 = 追最新最强」换成「模型选型 = 我那三道题上,谁在我要的那类活上得分高」。附带一条:模型的人格缺陷是有价格的,但价格取决于你的用法——你越是让它异步跑、只验收成品,它嘴碎和胆小的成本就越接近零。
- 这周一个赌注:用一个下午,把你自己的那套「三道题 × 遮名字」eval 搭出来——从你编队跑过的真实任务里挑三个(一个出原型、一个写 PRD、一个改 bug),存成固定题面,先拿你现在在用的模型跑一遍存成基线。这一个下午买到的是:下次有新模型发布时,你不用再靠读别人的评测猜。 顺带它还是一篇现成的验证体稿子。