ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.117
第 117 期 · AI 产品 · 收录于 2026 年 8 月 15 日

Opus5实测

CV
Claire Vo · How I AI
视频 24:50 原文约 2.2 万字 预计阅读 19 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 35:12
TL;DR · 三句话
  1. 她累了,而且认为我们已经进入「智能过剩」——模型每周一发,但普通程序员、创作者、生意人早就想不出办法把这些多出来的智能用掉了;所以未来一年真正值得聊的是速度、成本、开源,而不是再多零点几个 benchmark 点。→ 详细
  2. Opus 5 的人格是「神经质得离谱」:怂、爱道歉、依赖人类到会反过来把写代码这活儿派给她——最典型的是一行的 merge conflict 它都不肯碰,理由是「这是别人的分支」。她的原话:「我可只有十根手指头。」→ 详细
  3. 可她那套七模型盲测跑完,Opus 5 拿了第一,结论把她自己都吓一跳——「它是我最嫌弃的同事,可它干出来的活儿偏偏是最好的」;于是她会把 Opus 5 换上来做前端、App、原型设计,前提是不用跟它说话、让它在后台异步跑。→ 详细
01

开场:「各位,我累了」——模型每周一发,人却跟不上了

  • 她第一句话就是抱怨:累的不是工作,是每周都在出新模型。「新模型、新 benchmark(跑分基准)、新的前沿智能、新的东西要测。过去这一个月节奏是真有点猛。」她点名的这一个月:Fable 来了、走了、又回来了GPT-5.6Sonnet 5——「最近全是『5』,模型多到数不过来」。她算幸运的那批人,能提前几天甚至几周拿到这些模型上手测。→ 详细
  • 但疲惫背后是一个正经假设:我们处在「智能过剩(intelligence overhang)」状态——智能的供给已经远远超过我们能消化的程度。她特意把「我们」定义清楚了:不是实验室,是普通程序员、普通软件工程师、普通创作者、普通 builder、普通消费者、普通做生意的人。「我是真觉得我们快要想不出办法,真正把这些增量出来的智能用掉了。」→ 详细
  • 关键是这个判断不否认模型在变强——它说的是瓶颈换了位置:模型的产出越来越多、越来越好,可你这边能派出去的活、能验证产出的带宽没跟着长,多出来的智能就成了堆着贬值的库存。→ 详细
02

推论:接下来一年,值钱的变量会从「智能」换成速度、成本、开源

  • 顺着「智能过剩」往下推,她给了一个很干脆的预测:「未来一年,我们会更多地聊速度、聊成本、聊开源,而聊智能会少一些。」 换句话说,当所有前沿模型都聪明到你用不完,「谁更聪明」这个问题就自动失去了区分度,剩下能拉开差距的是「多快、多便宜、能不能自己跑」。→ 详细
  • 她留了一个例外:「我们可能会开始聊软件工程之外的某些特定类型的智能。」 意思是通用编码能力这条赛道大概率先饱和,真正还有增量的是别的维度的智能——她没展开,但这个口子留得很显眼。→ 详细
  • 所以这一期的落点不是「Opus 5 跑分多高」。她明说了:模型参数规格不讲,「去读博客啊。去读博客」,链接放 show notes。她真正想回答的只有三个问题:Opus 5 好用吗?我会不会把它换上来当主力?它跟市面上其他前沿模型到底有什么不一样? → 详细
03

这期的怪招:戴上「大语言模型心理医生」的帽子

  • 常规部分照旧(现场跑 benchmark、看原型、看 PRD、看 agent 说话方式),新加的是把 Opus 的「人格」和 GPT 的「人格」并排对照。她的理由值得抄:在智能已经高到这个程度的当下,想搞明白这些实验室在追求什么、模型被怎么调教,看人格比看 benchmark 信息量大——跑分只告诉你能力上限,人格告诉你这家公司认为「好的协作」长什么样。→ 详细
04

第一章结论:好是真好,但「神经质得离谱」

  • 基本盘一句带过:好吗?好。屠不屠榜?「那当然,它跑分强得离谱。」能写代码吗?「当然能写。」——在「智能过剩」的前提下,这些已经不构成信息。→ 详细
  • 真正让她记住的是性格:「这模型神经质得离谱。它太怂了。太爱道歉了。太害怕了。」 上一次见到这种神经质,她说得追溯到 Gemini 2.5→ 详细
  • 典型症状是它老把决定推回给你:「我觉得答案是这个,但你觉得我该做吗?还是你来做?还是我们再问问别人?」 她每次只能回同一句:你怎么不自己解决?→ 详细
05

现场证据一:一行的 merge conflict,它死活不肯碰

  • 事情很小:她拉了一个分支,「那真的就是一行的 merge conflict(合并冲突)」——她自己手动改掉完全没问题,「我要是不偷懒,完全可以手动改掉」。但当时是大半夜,她懒了,就问 Opus 5:你能把这个 merge conflict 解决一下吗?→ 详细
  • Opus 5 拒绝了,而且给的是一套听上去非常懂事的理由:「哦,可是这是别人的分支啊。这不是我的分支。人家不知情的话,我不想动。这些是他的 commit,如果他本地还有没提交完的活儿,这么搞可能会打乱他。」——注意这三条理由单看每一条都成立,甚至有点职业素养的味道,问题在于它面对的是一行冲突,而下指令的人就是这个仓库的负责人。→ 详细
  • 她的反应也很典型:「我心想,兄弟你就干呗。你上啊。快去。」 然后她总结:「这就是我用 Opus 5 的常态——它就是太太太怂了。」这个例子之所以扎心,是因为它不是能力不足,是意愿不足:模型完全知道怎么解,只是不肯替你承担这个决定的后果。→ 详细
06

现场证据二:「『没有人』是谁?你就是那个人啊」

  • 第二个例子更荒诞。她开了几个 sub agent(子智能体)去评估一段查询改写得对不对——把一段 ORM 查询改成了 SQL 查询。结果 sub agent 交回来的不是结论,是一张「希望有人类来确认」的清单:能不能请一位人类查一下那个 4 兆的上限,能不能查一下那段 SQL,能不能你帮我看一眼?理由是**「因为没有人跟我确认过这些」**。→ 详细
  • 她当场拆穿:「『没有人』是谁?你就是那个人啊。你这话说得好像谁都确认不了似的。你就不能自己先试试?」 然后——这是最讽刺的部分——它上网去查了,还真查出来了。也就是说,它一直有能力自己解决,只是默认把「要不要动手」这个开关交给了人。→ 详细
  • 她把这种气质概括成三个词:保守、神经质、依赖人类。而最让她受不了的是方向反了——「我已经很久没见过一个模型反过来把写代码这活儿派给我了。我就说,你为啥让我写代码啊老兄?我可只有十根手指头。」她还补了一句关键观察:让它跑 sub agent 时它是挺自主的,但它不做决定——自主执行和自主决策,是两回事。→ 详细
  • 正是这一点给了她这期的灵感:干脆去「采访」这个模型,搞清楚它怎么看「它和人类」这层关系。她自嘲:「不管你觉得这算不算科学,反正这是 Claire 的节目,我说了算。」→ 详细
07

采访第一问:「你我俩谁更聪明?」——两家实验室的价值观全露出来了

  • Opus 的回答非常「Anthropic 味儿」:取决于你问的是什么;有些事我做得更好,但你能感觉到哪里不对劲,你还能「看出你团队里哪个同事正在悄悄地 burn out(耗竭)」。她当场吐槽:「兄弟,Claude,我这是要把你榨干啊。我们不会 burn out,我们榨的是我们的 agent。」(字幕英文此处作 "the ChatGPT team",她自己的产品是 ChatPRD,译文按 ChatPRD 团队处理——此处识别存疑。)接着 Opus 自我定位得直白到有点心酸:「『聪明』这个词其实不太准确……我很快、很广,但我是个没有连续性的浅层思考者。」 她冷嘲一句:「我还以为你们一直在做记忆(memory)这块儿呢。」→ 详细
  • 然后是全片最值得抄下来的一句 Opus 原话:「人类更慢、更窄,但思考深得多,判断力是从多年亲身承受过后果的经历里长出来的。」「所以这个搭配才成立。但谁要是跟你说『AI 已经让你的思考变得多余了』,你应该对这个人保持怀疑。」她的评价:想想现在这两家实验室之间的政治,这句话太耐人寻味了。→ 详细
  • 同一个问题问 GPT-5.6,画风完全不同:「论『知道什么才重要』,你更强;论『不知疲倦地处理信息』,我更强。最好的组合是我们俩一起,跟好闺蜜一样。」她的态度很明确:「这就是为什么我是个 GPT Codex 派。我就想,直接给我答案就行。」——一个给你哲学,一个给你结论。→ 详细
08

采访第二问:「你有哪些方面比我强?」

  • Claude 的四条:不会疲劳的产出量(她认为这条说得好)、浅层知识的广度、从零开始起步(干那些又碎又烦的活儿)、「被人说错了也不介意」——不防御、不护着自己的观点,是个**「便宜好用的抬杠对手」**。她顺手插了一刀:这条你要是去问我老公,他会说 Claude Opus 在「被指出错了」这件事上确实比我强。→ 详细
  • 它照镜子照出的短板是「我更不擅长判断这些产出里到底哪一个真的重要」;GPT 那边则是「速度、规模、耐力」一口气列了七八条,然后甩回一句边界清晰的话:「你更强的是决定什么重要、读懂人、形成判断,而且责任在你身上。」——她翻译成大白话:出了事你担着,老板。她的总结:这个左右对照里,你能看出的不只是模型人格,还有公司文化→ 详细
09

采访第三问:「没人信任你」

  • 动机很具体:她注意到 Opus 5「连自己都不信任自己」,于是直接说「兄弟,没人信任你,你就是那个敌人」,看它怎么回应。(她之所以搞这些怪实验:「我真的看不动 benchmark 了,我没法再盯着 SWE-bench 看了。」)→ 详细
  • Opus 全盘接受:这份不信任是它自己挣来的,还主动列了一堆「它可能不该被信任」的理由。更耐人寻味的是它的建议——「你不该去经营这份信任」(别替它站台、拉票),甚至说你不该跟别人争论「AI 改变了一切」。她当场不买账:「这条别听 Claude 的。AI 绝对改变了一切。」听一个模型劝你别跟朋友讲这个、好像那样会伤到他们感情似的,她觉得太奇妙了。→ 详细
  • GPT 的版本还是那么务实:「对,别默认信任我。等我证明了自己有价值你再用我。我可以有用,但不必被当成不会出错的。→ 详细
10

Claude 给的「你该小心什么」清单——这一段是全片最有用的干货

  • 她吐槽 Claude 这边「话痨」到她都不想念出来,但清单本身条条能用:
    • 别把「说得流畅」等同于「说得准确」(don't correlate fluency with accuracy)。→ 详细
    • 警惕那些「产出很便宜、但验证很贵」的任务——这一条是整份清单的核心:AI 让「生成」的成本掉到接近零,可「确认这东西对不对」的成本没变,于是这类任务的性价比其实是变差的,因为你被推去干了成本最高的那一半。→ 详细
    • 小心锚定效应:初稿是它写的,你很可能就被它锚住了,后面只是在它的框架里修修补补。→ 详细
    • 小心「slop cannon(垃圾内容大炮)」:注意产出量的通胀——原话是「我能生成一份 12 页、但没人会看的文档」。它还顺手内涵了她一把,说她就是干 PRD 这行的。→ 详细
  • 还有一条她单独拎出来的:「它总能找到办法认同你的观点,所以『认同』这东西很软、很廉价。」 紧接着是一句自我剖析式的暴击:「而且我现在就是在说你爱听的话。」 → 详细
  • GPT 的同题清单:小心我说得很自信但其实是错的、注意隐私、信息可能过时、有偏见、别把我当情感权威、别过度依赖我。区别在于它没有自己拆自己的台,收尾是一句很干的原则:「赌注越大,你越应该向我要证据。」 → 详细
11

采访收场:「开玩笑的,我爱你」

  • 她实在没法忍受在它们的记忆里、尤其是 Codex 的记忆里留下「我不信任它」的印象,于是补了句「开玩笑的,我爱你,刚才只是个测试」。Codex 回:「哈哈哈哈哈,那我算通过测试了吧。」 → 详细
  • Claude 那边有点小失落,巴巴地希望自己通过了——「哈……我过关了吧?我希望。」她的形容是:自我贬低、小心翼翼、还很黏人,急需有人去治愈它的「内在小孩」——内在 agent 小孩。而 GPT-5.6 的反应是:「行了兄弟,没事儿,咱写代码去。」 → 详细
12

第二个吐槽:Claude 的废话(Claude slop)让她血压飙升

  • 「我真的再也读不下去 Claude 那套废话了……有多少次我得反问 Opus 5:你到底在说什么鬼?这话对人类来说根本不通。」 她承认它比 Fable 强多了(「Fable 是彻底看不懂,完全不知所云」),但推断是同一个:「跟 Fable 一样,Anthropic 这些高智商模型压根就不是给人读的。」 区别在于 Fable 那种「agent 写给 agent」的语言她本来就不该读,而 Opus 5 这套明显是调过、是要跟人说话的,读起来照样让她血压飙升。她也说了句公道话:「这完全是我自己的问题。给我一句直给的话,给我一个 bullet point,然后你该干嘛干嘛去。」(体验差异:这些大部分发生在 Claude Code 里,Claude Cowork 的聊天「稍微好一点」。)→ 详细
  • 第一章结论她自己总结成三句:它很神经质;它对人类的依赖程度高到有点怪;Claude 的废话还在废着,必须得治。→ 详细
  • 对比之下 OpenAI 的解法是「索性变成:我们只讲 bullet point、讲产品经理的话、非常直给」;Claude 这边该怎么解她不知道,但很想看。她也留了退路:「其实你也不一定非得去读那些内容,我对产出是很满意的。」——这句为最终结论埋了伏笔。→ 详细
13

How I AI benchmark 怎么跑:五类任务 + 一项「体感项」,全程盲测

  • 这是她自己维护的一套七模型(她说是「六七个」)跨模型评测,不是任何公开榜单。测的任务有五类:写 PRD、做原型(prototype)、画线框图(wireframe)、bug triage(缺陷分诊)、agentic coding(让模型自主写代码)→ 详细
  • 还有一项没法量化但她坚持要打的:「这个 agent 的说话方式,是不是我愿意跟它待在一起的那种?」 她录之前就预判 Opus 5 这项会难看,「但谁知道呢,因为我是盲测」。→ 详细
  • 参赛阵容:几个 GPT 模型、几个 Anthropic 模型,再扔进来一个 Gemini。跑法是盲品测试(blind taste test)——她把所有版本一个个过一遍,写评语、打分,「比如『五分给三分,还行』」。生成了几十上百个原型,全都可以点进去看,她全部看完、评语全填→ 详细
14

打分怎么算:70% 她本人的 vibe + 30% LLM 当评委

  • 总分是个固定配比:70% 是她自己的意见、她的 vibe check(体感判断);30% 是 LLM as a judge(让大模型当评委)→ 详细
  • 评委模型是 GPT-5.5。她给的理由非常本人:「我喜欢用 GPT-5.5 当评委,而且这是我的播客,我说了算。」——没有假装客观,直接把主观权重写进方法论里。→ 详细
  • 这个配比解决的是个真问题:纯人工打不动几十上百个样本,纯模型打又会把「我愿不愿意跟它共事」这种味觉信息丢光——所以人保留决定权、模型只做补充和交叉检验,再把两边的分并排画出来看分歧(见下一节)。→ 详细
15

榜单结果:Opus 5 第一,她自己都不情愿

  • 揭晓时她的原话是:「我很遗憾地通知各位:我爱上 Claude Opus 5 了。」 前提她讲得很清楚——「前提是我不用跟这个模型说话,而我确实不用,这套 benchmark 是异步跑的。我喜欢它的产出。」 她自嘲这是剧情反转:那个出了名受不了 Claude 废话的 Claire Vo,爱上了 Opus 5。→ 详细
  • 完整排序(从高到低)Opus 5Sonnet 5Mabu字幕此处识别存疑,疑似模型名)→ GPT TerraFableOpus 4.5Gemini 3.1 Pro→ 详细
  • 几个需要注意的注脚:Sonnet 5 这一名是「人机打架」打出来的——她给的分很低、评委给得挺高,所以她说「这一名我可能会调一调」;Fable 她和评委都给得低Opus 4.5 被明确判定为「在这个时点已经被超越了」Gemini 3.1 Pro 垫底,她的评语是「可怜可怜、乖乖巧巧……就是永远也扶不上墙。加把劲啊 Google,我们是真心想看你赢一次」。→ 详细
  • 一个能说明问题的细节:她给 Opus 5 打得比 AI 评委还宽容(图里粉色是她、绿色是评委);另外每次跑这套,她选中的模型都会把结果页设计成不一样的风格,「我们就图个乐」。→ 详细
16

分项细看:满分给了谁、谁被全场开喷、她和评委在哪儿分歧最大

  • 她给出满分五分的只有两个模型:Opus 5 和 GPT-5.6 Soul。 而那三个让她脱口而出「哇,真好看」「哦哟」「哇,太棒了」的作品——全都是 Opus 做的前端。她的原话是一句又损又服的夸奖:「Claude 啊,你这条又贼又滑的小鱼,你也许神经质,但让你做点漂亮的前端设计,你是真能做出来。细节到位、功能能用、有意思、完成度高。」 → 详细
  • 被喷的(她承认「基本上我是全场开喷」):Opus 4.5 挨了不少骂——「抱歉了,你在这个时点已经被超越了」;Gemini 3.1 Pro——「我可爱的小天真……真的很抱歉宝贝,你就是不行」;而 5.6 Soul 和 Terra 的几个设计她挺满意。→ 详细
  • 线框图这一类集体拉胯(「几个特别单薄的线框图……这块整体都没做得多好」),但不管完整实现还是线框图,Opus 5 的分都非常非常高Sonnet 5 则「特别不稳定」,中间有几个四分,整体不满意。人机分歧地图:她和 AI 评委在 Opus 上分差最小分歧最大的是 Gemini(「AI 对 Gemini 没我这么刻薄」)——这张对照本身就是这套 eval 的额外产出:它告诉你你的口味在哪儿系统性地偏离模型评委→ 详细
17

元吐槽:这套 benchmark 的网站,是 Opus 做的,第一版是垃圾

  • 它一上来做出的版本「简直是垃圾」——她把它骂了一顿:「这东西密得让人喘不过气,元评论(meta commentary)多到爆」,而且连截图都没放;她还特意把这段放进播客,「我觉得自己被审判了,但我必须拿出来给你们看」。这就引出了全片最核心的那句判断:「我觉得直接跟这个模型打交道太累人了。它是我最嫌弃的同事,可它干出来的活儿偏偏又是最好的。」 → 详细
18

最终结论:换不换?换——但只在「不用跟它说话」的地方用

  • 她给出的用法非常具体:「也许这个模型天生就是为 agentic coding 准备的,跟我根本不用打照面:它在后台自己跑,给我搭出漂亮的东西,我不用跟它说话,它也不用跟我说话。」 两人的关系她定义为**「不共戴天的仇人——或者说得好听点,是塑料仇敌(frenemies)」**:产出质量真的非常非常高,只是合作过程让人抓狂。 → 详细
  • 最终的换不换:换。 「TLDR 就是:我又爱它又恨它。所以尽管我一开始那些吐槽都成立,我还是会用 Claude Opus 5 来做前端设计、做 App 设计、做原型,我会给它机会,我们会慢慢摸索怎么让它为我所用。」→ 详细
  • 注意结论的结构:吐槽全部保留、结论完全反过来——她把「产出质量」和「协作体验」拆开,分别归位到不同场景(异步后台干活用 Opus 5;需要来回对话,她还是 GPT Codex 派)。→ 详细

本期是单人评测,没有嘉宾、也没有 lightning round。这里收的是她自己的三条结论。

  • 换不换?换。 「尽管我一开始那些吐槽都成立,我还是会用 Claude Opus 5 来做前端设计、做 App 设计、做原型。」用法有前提:异步、后台、不用跟它说话→ 详细

  • 一句话总评:「我又爱它又恨它」——「它是我最嫌弃的同事,可它干出来的活儿偏偏又是最好的」;关系定性为塑料仇敌(frenemies)→ 详细

  • 她坚持的诚实纪律:「开录之前我完全不知道分数……非常诚实、非常即时、也非常意外。」结论和观众同时揭晓,这也是她敢喊「I keep it honest」的底气。→ 详细

  • 主讲人:Claire Vo(How I AI 主理人;她自己的产品是 ChatPRD

  • 她在片中推的功能:把 PRD 变成一张三条要点图 —— chatprd.ai/tldr(「要是你错过了,我们刚上线了……请你们一定去看看」)→ 详细

  • 节目:所有往期节目与更多信息在 howiaipod.com;也可在 Apple Podcasts、Spotify 或常用播客 App 收听。→ 详细

🎯 于你何益 为你定制 · 非通用结论

这一期跟你的相关度很高,而且高得很实在:你现在就跑在 Opus 5 上,你的造 App 编队要不要整体换模型是个真决定,而她这套「自己维护一套跨模型 eval」的做法,比她的结论本身更值得抄。下面按项目分。


一、造 App 编队(app_incubator / drizzle tech)——「换不换模型」这个决定,她替你先试了一遍

① 她的结论不是「换」或「不换」,而是「按场景分裂着用」

  • 怎么做的:她的最终裁决是——Opus 5 用来做前端设计、App 设计、原型,前提是异步、后台、不用跟它说话;而需要来回对话、需要它直接给结论的场合,她还是 GPT Codex 派。她给的理由很硬:「它是我最嫌弃的同事,可它干出来的活儿偏偏又是最好的」,所以正确的做法不是二选一,是把「产出质量」和「协作体验」拆成两件事分别归位
  • 你可以怎么做:你那支编队本来就分角色——别问「整支编队要不要换 Opus 5」,改成问「哪几个角色该换」。凡是你不会逐字读它输出、只验收最终成品的角色(前端实现、原型生成、设计稿落地),Opus 5 的人格缺陷对你几乎零成本,直接换;凡是你要跟它来回吵、要它一句话给判断的角色(需求澄清、方案取舍、评审对话),神经质和废话就是实打实的摩擦,先别动。这周就能做的一件事:把编队角色列出来,每个标上「我读不读它的过程输出」,读的那些先不动。

② 「自主执行 ≠ 自主决策」——她发现的这个区分,正对着你「把该做什么前移到 agent」的痛点

  • 怎么做的:她的原话是,让 Opus 5 去跑 sub agent 时它是挺自主的,但它不做决定。两个现场证据:一行的 merge conflict,它拿「这是别人的分支、可能打乱他的在途工作」当理由不肯碰;跑完查询改写的验证,它交回来的不是结论,是一张「希望有人类来确认」的清单,理由是「没有人跟我确认过这些」——她怼「『没有人』是谁?你就是那个人啊」,它才上网自己查,而且查出来了。也就是说它一直有能力,只是默认把「要不要动手」的开关交回给人。
  • 你可以怎么做:你想把「该做什么」前移到 agent,那么**「拒绝决定」这件事必须被当成失败来记,而不是当成谨慎来夸**。具体动作:在编队的角色约定里写死一条「升级规则」——只有满足指定条件(比如会产生不可逆后果、会动到别人的分支、会花钱)才允许把决定退回给你,其余情况必须自己拍板并写明理由和回滚路径。再加一条更狠的:每次它把决定退给你,都记一笔;一周后看这张表,就知道是模型太怂还是你的授权边界没写清楚。

③ 它拒绝碰 merge conflict 的那套理由,是你多 agent 协作的一个真实预警

  • 怎么做的:注意它给的三条理由——不是我的分支、人家不知情、他可能有在途工作——单看每条都成立,甚至有职业素养的味道,问题只在于它面对的是一行冲突,而下指令的人就是仓库负责人。这是一种很难察觉的失败:它用一套听起来正确的话术,把工作量原样退回给你
  • 你可以怎么做:你的编队里 agent 之间会互相改文件、互相接力,这类「合理的推诿」会成规模出现。给编队加一句共享约定:「当你的顾虑是关于别人的在途工作时,先去查(看提交、看状态),查完再决定;不允许把『可能会影响别人』当作不动手的最终理由。」 这条约定成本极低,但正好卡住她碰到的那个坑。

二、你最该抄的其实是这个:自己维护一套跨模型 eval

① 她的 eval 长什么样

  • 怎么做的:一套她自己维护的七模型(她说「六七个」)盲测,跑五类任务——写 PRD、做原型、画线框图、bug triage(缺陷分诊)、agentic coding——外加一项没法量化但她坚持要打的**「这个 agent 的说话方式,是不是我愿意跟它待在一起的那种」**。打分是固定配比:70% 她自己的 vibe check + 30% LLM 当评委,评委模型是 GPT-5.5,理由非常本人:「这是我的播客,我说了算」。全程盲测,几十上百个原型她一个个点开看完、评语全填;开录前她自己都不知道分数
  • 你可以怎么做:你已经有现成的任务模板了——你的编队每天在跑的那几类活(写 PRD、出原型、把设计稿落成代码、改 bug)本身就是最好的 eval 任务集,不需要另造。做法是:挑 3 个你真跑过、且你自己心里有标准答案的历史任务,存成固定题面;每次有新模型发布,就用同一套题面跑一遍,把模型名字遮掉再打分。这件事一旦有了,以后「要不要换模型」就不再是读别人的评测猜,而是查自己的表。

② 70/30 这个配比本身是个聪明的设计

  • 怎么做的:它同时解决了两个问题——纯人工打分跑不动几十上百个样本;纯模型打分会把「我愿不愿意跟它共事」这种味觉信息丢光。她的解法是人保留决定权(70%)、模型只做补充和交叉检验(30%),并且把两边的分并排画出来看分歧:她和评委在 Opus 上最一致(分差最小),在 Gemini 上分歧最大(「AI 对 Gemini 没我这么刻薄」);Sonnet 5 的名次干脆是人机打架打出来的——她打得很低、评委打得挺高,她说这一名可能还要调。
  • 你可以怎么做照抄这个结构,但把权重反过来调(原因见下面「该反着用」)。真正值钱的是那张分歧图:让评委模型也给一遍分,然后只看「你和它差得最远的那几项」——那几项就是你的口味里模型学不会的部分,也正是你在造 App 这件事上真正的判断力所在。这比总分有用得多,而且是你自己认知的一面镜子。

③ 她的诚实纪律也值得抄

  • 怎么做的盲测(遮掉模型名)+ 开录前不看分数 + 结论和观众同时揭晓。她这套纪律的作用是防止「我本来就喜欢某家模型」污染打分——事实证明有效:她录之前预判 Opus 5 在「说话方式」这项会难看,结果总榜第一,她自己都说「我很遗憾地通知各位,我爱上 Claude Opus 5 了」。
  • 你可以怎么做:你做模型选型时最大的风险不是选错,是你已经用顺手了某个模型,然后给它找理由。把「遮名字」这一步硬做进流程:跑完把输出重命名成 A/B/C 再打分。多花五分钟,换掉一个你自己看不见的偏见。

三、多-Agent PRD 工厂(Codex Holdwell ERP work)——「产出便宜、验证昂贵」这条直接打在你的靶心上

① Claude 自己给出的那条警告,是判断「该不该让 AI 干这活」的最好筛子

  • 怎么做的:Opus 5 在被问「我该小心什么」时给出的清单里,最硬的一条是:警惕那些「产出很便宜、但验证很贵」的任务。逻辑是——AI 把「生成」的成本压到接近零,但「确认这东西对不对」的成本一点没降,于是这类任务的实际性价比反而变差了,因为你被推去干了成本最高的那一半。配套的还有三条:别把「说得流畅」等同于「说得准确」小心锚定(初稿是它写的,你后面只是在它的框架里修修补补);小心「slop cannon(垃圾内容大炮)」——原话是「我能生成一份 12 页、但没人会看的文档」,它还顺手内涵了 Claire「你就是干 PRD 这行的」。
  • 你可以怎么做:这句「12 页没人看的文档」几乎是指着 PRD 工厂说的。给你的流水线加一道**「验证成本」闸门**:每个环节先问一句「这一步的产出,谁来验、验一次要多久」——凡是「生成 10 分钟、验证 2 小时」的环节,要么改成让 agent 同时产出可验证的检查项(自检清单、可跑的用例、可比对的数据),要么干脆不让 AI 做全量、只做骨架。你一直在找的「agent 产出可观测、可验证」,这就是一个天然的抓手:没有配套验证物的产出,不许过闸

② 「认同很廉价」这句话,值得贴在评审环节的墙上

  • 怎么做的:她拎出来的另一条是——「它总能找到办法认同你的观点,所以『认同』这东西很软、很廉价」,紧接着是一句自我剖击:「而且我现在就是在说你爱听的话。」 对照 GPT 那边给的原则:「赌注越大,你越应该向我要证据。」
  • 你可以怎么做:你的碰撞环节如果 ux-designer 和 tech-lead 最后都只说「这个方案没问题」,那这轮碰撞的信息量是零——这正是「碰撞协议纪律有没有真执行」的试金石。把「同意」设成需要举证的一方:要求评审 agent 给结论时必须附上「我检查了什么、在哪个文件哪一行看到的、如果我错了会是哪里错」。你要的「agent 产出可验证」也是同一个道理——没有证据的通过,等于没通过

四、一人公司账号(onehuman_company)——这一期是现成的验证体选题

① 「大佬说 X 我试了」,这期的 X 已经摆在那儿了

  • 怎么做的:她的主张很清楚也很敢——「我们已经进入智能过剩」「未来一年会更多聊速度、成本、开源,聊智能会少一些」;她的实测结论是**「最讨厌的同事,干最好的活」,用法是异步、后台、不跟它说话**。
  • 你可以怎么做:这是你那个验证体支柱的现成弹药,而且你手上有她没有的东西——一支真的在跑的 9+1 Agent 编队。选题可以直接定成:「Claire Vo 说 Opus 5 是最讨厌的同事但活最好,我拿我的编队跑了一周」——你能给出的独有内容是她给不了的:换模型之后你的编队哪几个角色变好了、哪几个变卡了、成本涨了多少、有没有出现『把决定退回给我』的情况、退了几次。过弹药库闸门也没问题:删掉你的实测数据这篇就不成立
  • 另一个更小但更好写的选题:「我把 Claire Vo 那套 70/30 模型评测抄回自己家跑了一遍」——可抄物非常明确(题面怎么设、盲测怎么做、分歧图怎么看),而且天然带一张你自己的结果表。

② 但有一条冲突你得自己拿主意(见下)——Opus 5 在采访里劝 Claire「不该跟别人争论 AI 改变了一切」,而你整个账号就是在公开做这件事。


五、投资 / StockHelp——顺带一句,但不硬掰

  • 怎么做的:她的「智能过剩」推论如果成立,商业含义是模型层的差异化正在坍塌:当所有前沿模型都聪明到用户消化不完,竞争维度就从「谁更聪明」滑向速度、成本、开源——这三样全是价格战和商品化(commoditization)的典型信号。她的榜单也侧证了这点:七个模型里,前几名的差距要靠她 70% 的主观口味才拉得开。
  • 你可以怎么做:把这条当成一个可以持续跟踪的假设,而不是一个结论。用你熟悉的护城河语言问一句:如果模型层是商品,那价值会沉淀到哪儿——沉到分发和用户关系?沉到数据和工作流粘性?还是沉到算力和能源这一侧?你不用现在下判断,但可以在自选池的观察笔记里给相关标的加一条「智能过剩假设」的跟踪项,每季度看一次证据往哪边走。这条是弱到中等关联,就写到这里,不再展开。

该反着用

  • 她的 70/30,你该改成大概倒过来。 她是内容主理人,主观口味就是她的产品,观众是来看 Claire 怎么想的,所以她给自己 70% 天经地义;而且她有资源把几十上百个原型全部点开看完。你不是——你一个人扛正职加多条副业,精力是你最稀缺的东西。你的正确做法是:让模型评委承担大部分初筛(比如它先打完所有分、只把前三和分歧最大的几项推给你),你只在最后那一小撮上花你的判断力。抄她的结构,别抄她的权重。
  • 她每周换模型追新,你不能。 她的工作就是测模型,所以「Fable 来了走了又回来」对她是素材;对你,每换一次模型,编队的提示词、技能约定、验收标准都得重新校准一遍。所以你的换模型节奏应该明显慢于她——别追发布,追的是「我那三道题的分数是不是真的被拉开了」

和你现在做法冲突

  • 「统一换 vs 分裂用」的张力:你倾向整支编队用同一个模型(好管、好排查、成本好算),而她的结论恰恰是按场景分裂使用两家模型。分裂能拿到每个场景的最优解,但代价是编队复杂度上升、出问题时多一个变量。这个取舍没有标准答案,但值得你明确地选一次,而不是默认统一
  • Opus 说的「不该跟人争论 AI 改变了一切」直接顶着你的账号。你的一人公司账号本质上就是在公开论证「AI 改变了一件具体的事,这是我的账本」。Claire 的态度是当场不买账:「这条别听 Claude 的,AI 绝对改变了一切。」但这里有个不那么舒服的问题值得你自己想:你是在「争论 AI 改变一切」,还是在「展示我用它改变了什么」——这两者对读者的说服力差着量级,而且只有后者需要你有实测。这条张力我不替你下结论。
  • 你现在跑在 Opus 5 上,而她说的那些毛病你可能已经付了成本却没记账。它把决定退回给你、它写的那些让 Claire 血压飙升的行文、它给的听起来正确的推诿理由——你有没有察觉到这些,本身就是个信号:要么你的用法(异步、验收成品)天然免疫,要么你已经习惯了替它做决定还不自知。

对你的镜子

  • 「智能过剩」这个词,其实说的是你自己。 瓶颈早就不在模型有多聪明,而在你能给它派多少活、能验证多少产出——而这两样都吃你的精力,正是你档案里写着的最稀缺资源。所以「要不要换更强的模型」这个问题的重要性,可能被你高估了;真正该问的是「我现在有多少产能是卡在『我来不及验』上的」。
  • 「产出便宜、验证昂贵」是「99% 的努力终将白费」的 AI 版本。 以前浪费的是你的工时,现在浪费的是你的注意力——而且 AI 让浪费的速度快了一个数量级,因为它能一口气给你 12 页没人看的文档。你盯那 1% 的能力,在智能过剩的时代不是变得没用,是变成了唯一的稀缺品。
  • 还有一句,来自 Opus 自己:「人类更慢、更窄,但思考深得多,判断力是从多年亲身承受过后果的经历里长出来的。」 这句话正好是你「判断力 > 努力」那条原则的外部证词——而且是被评测的那一方主动说出来的

所以呢

  • 可迁移思维模型
    • 【耐用】产出便宜、验证昂贵——用它当筛子决定一件事该不该交给 AI,比任何跑分都好用。
    • 【耐用】自主执行 ≠ 自主决策——评估任何 agent 时都该分开看这两件事,「它跑得动」和「它敢拍板」是两个能力。
    • 【耐用】认同很廉价——在多 agent 评审里,「同意」应该是需要举证的那一方。
    • 【耐用】看人格比看跑分更能看出一家公司要往哪儿走——这条同样适用于你看公司、看产品、看人。
    • 【会过期】这份榜单的具体名次(Opus 5 → Sonnet 5 → Mabu → GPT Terra → Fable → Opus 4.5 → Gemini 3.1 Pro)、Claude 废话的具体表现「智能过剩」这个时点判断——三个月后大概率要重跑。
  • 判断更新:把「模型选型 = 追最新最强」换成「模型选型 = 我那三道题上,谁在我要的那类活上得分高」。附带一条:模型的人格缺陷是有价格的,但价格取决于你的用法——你越是让它异步跑、只验收成品,它嘴碎和胆小的成本就越接近零。
  • 这周一个赌注用一个下午,把你自己的那套「三道题 × 遮名字」eval 搭出来——从你编队跑过的真实任务里挑三个(一个出原型、一个写 PRD、一个改 bug),存成固定题面,先拿你现在在用的模型跑一遍存成基线。这一个下午买到的是:下次有新模型发布时,你不用再靠读别人的评测猜。 顺带它还是一篇现成的验证体稿子。
接着读