ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.122
第 122 期 · AI 产品 · 收录于 2026 年 8 月 15 日

终结AI垃圾内容

TC
Thais Castello Branco · AI Engineer
视频 16:13 原文约 1.8 万字 预计阅读 12 分钟 来源视频 ↗ 中英对照全文
TL;DR · 三句话
  1. AI 擅长写代码,这不是模型的属性,是代码的属性。 代码能拆解、能验证、能执行,所以好训;设计和写作难,难在没人把它拆开过——"你怎么拆解它?怎么验证它?怎么判断它到底好不好?"→ 详细
  2. 让「品味」变得可处理的动作只有一个:拆解。 把一个品牌拆成颜色、字体排版、动效、动画、质感,这张拆解表本身就成了 ground truth(基准答案);然后派 agent 做一个贴合品牌但完全净新的页面,拿拆解表打分,不拿原件打分——判"像不像原件"会把创新判成错误。→ 详细
  3. 只带走一条的话,带走这条:把事情往可验证那一侧拽。 主观领域是一条谱系,一端(对齐、排版)能程序化验证、适合 RL,另一端(创造力、风格契合度)只能靠人;你的活儿是把中间那截成文化、可观测化,主动把边界往验证域挪一截。→ 详细
01

Taste Labs 是谁:给「主观」这件事做数据和基础设施层

  • 讲者 Thais Castello Branco 是 Taste Labs 创始人,公司几周前才从 stealth(隐身开发状态)出来,使命一句话:怎么终结 AI slop(AI 批量生产出来的、一眼假的低质内容)。她的判断是 AI 在写代码、做数学上已经相当强,但在设计、创意写作、人格、情商这些事上"还差得远",而要啃这些领域,得换一套跟客观领域不一样的打法。→ 详细
  • 两条业务线:一条跟前沿实验室(frontier lab)合作,帮他们给模型做 eval 和 benchmark(评测与跑分)、找出模型在哪儿崩,并判断每类问题该用哪种方法修——哪些该做成 RL 环境(强化学习环境,即给模型一个能反复试错并被自动打分的场子),哪些该当成 post-training(后训练)的数据问题;另一条跟 agent、应用层公司合作,处理那些"本就不该在基础模型层解决"的问题,用 context(上下文)和理解用户意图来解。她赌的世界是:几十亿个不是专家的人开始做创作,所以"读懂用户想要什么"跟"把模型做强"同等重要。→ 详细
02

「AI 擅长写代码」其实是代码的属性,不是模型的属性

  • 这是全场最锋利的一次翻转。我们习惯说"模型很擅长写代码,因为我们把它训得很擅长写代码",她说不对——这其实是代码本身的属性:代码可以拆解、可以验证、可以执行,所以在这些领域上训练模型才容易得多。换成设计或写作呢?"你怎么拆解它?怎么验证它?怎么判断它到底好不好?"难的从来不是模型,是这件事从没被拆开过。→ 详细
  • 由此引出两个根本难点。第一,能力跟着可度量性走(capability follows measurability)——所以只要把"可度量"这个问题解决掉哪怕一部分,就等于啃下了这些领域里很大一块。第二,向均值坍缩:在主观领域里,均值并不等于最优(第 8 节展开)。→ 详细
03

「什么是好设计」这个问题里,藏着三个追问

  • 她的破题方式是把问题反问回去:你说的好,是对哪类人好?对哪种 taste(品味)好?在哪种场景下好? 同一页 slide,"如果你是一家创业公司,可能好得不得了;但如果你是一家金融机构,就完全不合适"。所以第一条性质是:好是依赖 context 的→ 详细
  • 第二条性质是别的领域没有的:它会随时间变化。今天算好的跟五年前不一样、也跟五年后不一样;而代码和数学"在时间上要稳定得多"。这句的实际含义是:任何一套"什么算好"的标准都有保质期,必须能被重新校准。→ 详细
04

品牌是你手上现成的秘密武器

  • 她把话题落到一个所有人都遇过的场景:你在公司里用过 coding agent,多半已经上线过一个内部 dashboard 或者一个内部落地页,然后你会琢磨——这玩意儿到底是 slop,还是真的做得不错? 她说你手上其实有件秘密武器,就是你们公司的设计师们为定义品牌所投入的那全部工作:什么时候算好、为什么选这几种颜色的搭配、这套字体排版、这套间距、这种质感——这些都已经被人一条条想清楚、写下来过了。→ 详细
  • 关键的一句转折:"做点很棒的东西出来"非常难,但"做点符合品牌调性(on brand)的东西"就好定义多了——因为品牌是可以被拆解的东西。这一步不是修辞游戏,是把一个无法判定的目标,换成一个可以判定的目标。→ 详细
05

拆解:让品味变得可处理的那个核心动作

  • 具体怎么拆:她拿 Reduct 的品牌当例子("因为我挺喜欢他们的网站"),把它拆成颜色、字体排版、动效、动画、质感五块。"突然之间,你就有了一堆非常明确、成文的东西,可以拿来逐条对照验证。"对照之下,笼统地去验证"这东西是不是 on brand"——她建议你自己试试让一个 LLM 当 judge(裁判)去判——是相当难的。差别不在模型,在你有没有把"好"拆成具体元素。→ 详细
  • 这套拆解本身,就成了 ground truth(基准真相 / 判卷答案)。她给出的完整任务形状是:先给一个 agent 派活——做一个全新的页面,要贴合 Reduct 的品牌,但内容完全是净新的、跟原来不一样;然后是最容易做错的那一步——你要拿这套拆解表给它打分,而不是拿它跟原件对比打分。理由很实在:它可能会想出全新的方式来使用这些元素,"这些用法依然成立,只是跟原件不一样"。判"像不像原件"会把创新判成错误;判"合不合标准"才判得对。→ 详细
  • 顺带两个警告。其一,LLM as a judge 未必总是最好的办法——"我们知道那里有大量的 reward hacking(钻奖励函数的空子),也知道那里存在一些挺有意思的幻觉模式"。其二,整个问题里最难的部分是任务设计本身:"怎么把一个看上去很模糊的东西,变成真的能拿去做 RL 的东西"——不是模型难,不是算力难,是把题出对最难→ 详细
06

一条谱系,和一个路由问题

  • 她把设计这类问题看成一条条谱系:一端是视觉对齐、字体排版这类靠近客观、能程序化验证的元素;沿着这条谱往上走,是风格契合度、创造力——"你怎么去判断和度量'创造力'?那就难多了"。→ 详细
  • 于是这变成一个路由问题(routing problem):怎么理解这个庞大又模糊的问题,把它拆成更小的组件,然后针对每一个组件找出最合适的解法——有的组件该做成 RL 环境,有的该做成数据问题,有的老实交给人判。别用同一种方法去判所有元素,这才是这条谱系真正的用处;而最有价值的活儿,恰恰落在两端之间的中段。→ 详细
07

「把事情往验证那一侧拽」——只带走一条就带这条

  • 她自己划的重点,原话是**"如果今天你只带走一条,就带走这一条":一件事越接近可验证、尤其是可以程序化验证**,就越适合用 RL 来做;反过来,越依赖 context、越受那个时间因素影响、越取决于偏好上的差异,就越往"需要人类判断"那一端偏。→ 详细
  • 她最喜欢的比喻是**「把事情往验证那一侧拽」**:品牌一致性这件事本身很难判,交给人判大概比交给 LLM 裁判或某种确定性方法靠谱得多;但通过把它成文化、搞清楚哪些部分真正重要、再把这些部分变成可观察、可度量的东西,你就能把它往验证这个领域里拽一截。这不是二选一,是主动挪动边界——原本必须靠人拍脑袋的东西,被你拽进了能自动判的范围。→ 详细
  • 但她同时把话说死:在真正主观的那一端,"人类判断的水准仍然远高于任何 LLM as a judge"。拽是手段,不是幻想全自动。→ 详细
08

slop 到底从哪来:向均值坍缩

  • 机制说得很清楚:模型本质上在预测"下一个最可能出现的结果",并且默认那个最可能的结果就是理想的结果→ 详细
  • 对数学和代码,这成立——你问 2 加 2 等于几,那个"平均答案"同时就是正确答案、最优答案。但对写作和设计,最可能 ≠ 最优。她的原话:"很多伟大和创造力其实发生在分布的两端,它不是最可能出现的那个结果。恰恰是当你主动打破规则、主动跳出模式的时候,你才能做出既有主观性又真正出彩的东西。" 我们觉得被 slop 包围的那种感觉,根源正是这种向均值坍缩,以及由此带来的重复感→ 详细
  • 所以真正要解的是 mode collapse(模式坍缩):怎么从均值里跳出来,"但跳得是有意为之的"。注意这里问题的性质变了——一旦谈"有意为之地偏离",问题就转移到了不那么容易验证的东西上,那些更多是人类偏好和判断的问题,可能用数据来解会比用环境来解更合适→ 详细
  • 他们撑开分布的实际做法:跟一个设计师社区合作,一千多位专家,各自擅长不同的媒介、不同的风格;在拆解问题的时候刻意去把分布撑开,就是为了不掉进 mode collapse。→ 详细
09

偏好向量:世界是多偏好的,别取平均值

  • 过去的偏好数据(preference data,让人在两个结果之间选哪个更好、拿来训模型的数据)为什么会失效?因为**"你是从一大堆人那里收上来的,却没搞清楚他们是谁、喜欢什么、为什么喜欢、什么时候喜欢"**——不把这个问题相应地拆开,最后拿到的就是一堆互相打架的偏好,然后又坍缩回均值。→ 详细
  • 她的立场很硬:现实世界里本来就有人更喜欢这种风格而不是那种,"这不代表其中哪一种是错的,也不代表最好的答案就是这两个人喜好的平均值"——世界是多偏好(multi-preference)的,要做的是把匹配做对,不是取平均。取平均在多偏好世界里是最差的选择,它同时得罪所有人。→ 详细
  • 解法是为一个人建立类似**「偏好向量」的东西,并把它挂到偏好数据上,这样训练时就能有意识地容纳偏好的多元性,而不是让这些数据变成噪音**。同一份分歧数据,有了归属就是信号,没有归属就是噪音→ 详细
10

数据质量:死盯那些你完全能控的部分

  • 她坦白说这类领域的数据"很难说清到底什么才算好",所以策略是只死盯可控的部分。第一个抓手是 problem decomposition(问题拆解):怎么让数据真实反映现实世界里的分布?怎么保证在不同的类别上都选到真正的专家?她强调这些"完全在你的掌控之内——你能看到这些专家是谁,你可以把筛选标准定得非常严,你可以把问题拆开来",而且"对最后实验结果好不好帮助极大"。→ 详细
  • 第二个抓手是流程与路由:你怎么判断该把哪个问题路由到哪个解法上(接第 6 节那条谱系)。→ 详细
  • 第三个抓手是 QA(质量检查),她给了两条很具体的判据。其一是「具体程度」:当你让一个专家判断某样东西好还是不好、让他给出背后的推理,甚至围绕他怎么评判一件作品建立一整套观察体系时,"他语言的具体程度、描述得有多精确,直接决定了这份数据的质量"。含糊的好评等于没有数据。→ 详细
  • 其二是把点评绑定到具体组件——这条最实操。一位专家评判一个 landing page,"他可能就写一段话把它描述一下",但模型其实很难把代码的某一块和视觉上的效果真正对应起来。所以"如果你能找到一种办法,把专家的这段点评精确绑定到那个代码组件上,你的数据一下子就噪声小得多、也清晰得多了"。同样一句点评,挂在整页上是噪音,挂在具体那一块上是信号。→ 详细
11

人工 QA 的两面:哪种分歧是缺陷,哪种分歧是金子

  • 她特意点出人工 QA"在这里挺棘手的,因为它有两面"。一面好办:比如你在收集一堆关于 slide 设计的偏好数据,人工 QA 可以判断这算不算高质量数据、符不符合规范——这类事情多数人都能达成一致→ 详细
  • 另一面才是关键:当你要的是专家共识、让第二位专家去看他同不同意最初那位设计师的投票时,分歧就会冒出来。她给的判别法非常干净——看他们分歧在什么上。如果分歧的是对齐这类"相当客观"的事,"专家在这上面还有分歧就有点奇怪了",这说明数据本身有缺陷;但如果他们分歧的是风格、是审美,"那这就未必是坏数据,反而是好数据,它恰恰说明人的偏好本来就有分野"。→ 详细
  • 所以人工 QA 的设计目标是双份的:既能在基本功层面把关,又能有意识地用好共识这件事——不是把分歧一律消灭,而是先判断这条分歧属于哪一类。→ 详细

本场是纯演讲,没有闪电问答,也没有现场提问环节。收尾她给了两件事:

一、为什么这么执着于"能控的部分"

  • 跟各家 lab 打交道时情况复杂得多,"我们往往拿不到那个反馈闭环,不知道到底是什么造成了什么结果"——正因为拿不到因果,所以只能死盯自己这一侧能完整衡量的东西,也就是数据质量。这不是保守,是在反馈信号断掉的地方,选择在你还能量的地方用力。→ 详细

二、今天的核心信息:主观领域,质量优先于数量

  • 她的原话:"尤其是在这些主观领域,我主张质量优先于数量。" 做高质量数据"很贵,也很难,需要你对某个具体领域有非常深的理解";但由那些在这个领域里 taste 极高——"你想怎么叫都行"——的人做出来的高质量数据,效果远远好过堆一大堆嘈杂的、混乱的数据,那些数据"往往做得并不用心,也没有我们刚才讲的那些问题拆解"。→ 详细

三、还有一半没讲

  • 本场只覆盖模型训练侧;她说明第二天在 design track 还有一场,会讲他们在 agent 一侧的做法(也就是开场提到的 context、用户意图那条线)。想要完整版的人得看那一场。→ 详细

台上没有留邮箱、社交账号,也没有出现二维码。片中可循的线索只有三条:

  • 讲者 Thais Castello BrancoTaste Labs 创始人;公司几周前刚从 stealth 模式出来,做的是主观领域的数据与基础设施层。→ 详细
  • 片中唯一点名的品牌案例是 Reduct(她拿它的网站做拆解示范,理由是"我挺喜欢他们的网站")。→ 详细
  • 她提到自己第二天在 design track 还有一场分享,讲 agent 侧——想接着往下听的,线索在那里。→ 详细
🎯 于你何益 为你定制 · 非通用结论

这一期表面在讲怎么给前沿模型做"品味数据",实际上从头到尾在回答你手上三件事共同卡着的同一个问题:「好」到底怎么判?

你现在有三套低配版的答案——去 AI 腔那套六定式(把 AI 味拆成六条逐条判定)、PRD 工厂的 5 个评审镜头加质量闸门、两个内容号的选题和封面把关(外加那个从参考素材提炼设计系统的技能)。它们做的是同一件事:拿一套标准去判一件主观的东西。她给的,是这套东西的方法论升级版。所以这段写厚。

两个内容号(家居号 + 一人公司号)· 去 AI 腔技能

一、六定式判的是"有没有毛病",缺的是"像不像你"

  • 怎么做的:她说笼统地验证"这东西是不是 on brand"相当难,但一旦你把"好"拆成颜色、字体排版、动效、动画、质感这些具体元素,它"突然就变成了一个可以成文、可以验证的形状"。而这张拆解表本身,就成了判卷用的基准答案。
  • 你可以怎么做:你的六定式已经走对了一半——你确实把"AI 腔"拆成了能逐条判定的东西,那层"换主词测试"(整段抽掉主词放任何同类主题也成立就重写)尤其漂亮,那已经是她说的那种拆解了。但这半张表全是负面清单:它能告诉你哪里不像人写的,不能告诉你哪里不像"你"写的。补另一半:把"家居号的味道"和"一人公司号的味道"各自拆成 5-6 个可分别打分的正向元素(句子长短的节奏 / 第一人称出现密度 / 具体到数字和金额的细节有几处 / 有没有一处认账的翻车 / 结尾落在动作还是落在感慨)。然后照她的用法用它:让 agent 写一篇你从没写过的新话题,拿这张表逐项打分——你会立刻知道,你以为的"我的风格"里有多少其实是能写下来的规则。

二、判"贴不贴标准",别判"像不像上一篇爆款"

  • 怎么做的:她派 agent 的活是"做一个全新的页面,要贴合品牌,但内容完全是净新的、跟原来不一样",并且明确要求产出"不只是拿去跟原件对比打分,而是拿这套 ground truth 来打分"——理由是 agent"可能会想出全新的方式来使用这些元素,这些用法依然成立,只是跟原件不一样"。
  • 你可以怎么做:这条直接命中你那个"从参考素材提炼设计系统"的技能立身之本——「把参考当灵感、不照搬」。那个技能产出的风格指南和设计契约,就是拆解表;但你在评审新稿的时候,很可能还是把参考图摆在旁边比"像不像"——那等于把创新判成错误。改成两步:先提炼拆解表,然后评审环节里参考图不再出现,只拿表判。封面同理:判的应该是"主标字号层级对不对、信息密度在不在区间、色调是不是家居号那一挂",而不是"像不像上一张数据好的封面"。只跟爆款比,你就永远只能复刻上一次的均值。

三、slop 的根源是向均值坍缩——所以"去 AI 腔"只做了减法那一半

  • 怎么做的:她的诊断是,模型在预测"下一个最可能出现的结果"并默认它就是理想结果;对 2+2 成立,对写作不成立。原话:"很多伟大和创造力其实发生在分布的两端……恰恰是当你主动打破规则、主动跳出模式的时候,你才能做出既有主观性又真正出彩的东西。" 被 slop 包围的感觉,来自向均值坍缩加上重复感。她的解法不是"清洗",是有意为之地偏离均值
  • 你可以怎么做:这是对去 AI 腔技能最有价值、也最不舒服的一条——六定式的动作绝大多数是删除:删套话、删壳、删对举、删罐头结尾。文本会变干净,但干净的均值仍然是均值。 你那条"防假人味自查"其实已经嗅到了这件事(发现"去 AI 味时被加上去的另一种 AI 腔"),但它还是一道防守闸门,不是一个进攻条件。给这个技能加一个正向环节:定稿前问一句"这篇有没有一处是别人不会这么说的?"——一个反常识的判断、一笔具体到元的成本、一次认账的翻车。**没有这一处,删得再干净也还是 slop。**而这一处正好就是一人公司号那道弹药库闸门要的东西:删掉你的实测和判断还成立的,不发。两条规则本来就是一条。

四、两个号是两个偏好向量,别在它们中间取平均

  • 怎么做的:她说过去的偏好数据坍缩到均值,是因为"从一大堆人那里收上来的,却没搞清楚他们是谁、喜欢什么、为什么喜欢、什么时候喜欢";而且**"最好的答案不是这两个人喜好的平均值"**——世界是多偏好的,要做的是匹配,不是折中。解法是给人建"偏好向量"、把它挂到数据上,让分歧从噪音变回信号。
  • 你可以怎么做:家居号(决策型生活记录者)和一人公司号(build-in-public)面对的是两群完全不同的人,而危险在于你只有一个"我觉得好"——两个号共用一套审美,结果两边都拿到平均值,两边都不够锋利。做法很轻:给每个号写一张一页的偏好向量卡(读者是谁 / 他点开这条时在解决什么问题 / 什么标题他会直接划走 / 什么细节他会截图保存),把它当成该号所有选题、标题、封面评审的第一段上下文。顺带一句:家居号那个空着的指标盘,也该按号分开看——两个号的数据混在一张表里,就是自己给自己造噪音。

Codex Holdwell ERP work(PRD 工厂 · 三驾马车 + 碰撞协议)

一、把碰撞环节的评审点按"离可验证有多远"重排一次

  • 怎么做的:她的核心框架是一条谱系加一个路由问题——一端是视觉对齐、字体排版这类靠近客观、能程序化验证的元素,另一端是风格契合度、创造力这类只能靠人判的;中间那截才是最值钱的战场。"针对每一个组件找出最合适的解法",而"如果只带走一条",就是把事情往可验证那一侧拽
  • 你可以怎么做:你三驾马车的碰撞现在大概率是同一种方法判三遍:让每个 agent 读完对方初稿写一段意见。照她的路由逻辑重排:像"必填字段齐不齐、异常流有没有分支、术语在六条产品线之间口径一不一致、验收标准有没有可判真假的断言"——这些属于客观端,根本不该由 agent 写评语,该由脚本硬判、不过就不给过;像"这个需求是不是真解决了业务的问题""优先级排得对不对",属于人类判断端,agent 只能给素材、由你拍板。剩下中间那截(比如"验收标准写得够不够具体")才是你该花力气成文化、往可验证侧拽的地方。你担心的"碰撞纪律是否真被执行",多半就得靠这个——客观端的东西一旦写成评语就拦不住人,脚本能。

二、评审意见必须绑定到 PRD 的具体那一段

  • 怎么做的:她说模型很难把代码的某一块和视觉效果对应起来,所以他们专门下功夫把专家点评精确绑定到那个代码组件上——"你的数据一下子就噪声小得多、也清晰得多了"。同时她强调"专家语言的具体程度、描述得有多精确,直接决定了这份数据的质量"。
  • 你可以怎么做:把碰撞环节交的三件(补强/修正/第 3 案)的输出格式从"一段评语"改成"定位 + 断言":哪一节、哪一条,期望应该出现什么,现在出现的是什么。好处是双份的——一是作者能直接改,不用猜;二是这些意见立刻变成可复用的资产:攒够一批就是你评审环节的用例集,也是"真人评审意见回炉难闭环"最省力的解药(这一版拦下几条、下一版回炉后消掉几条,就是闭环证据本身)。

三、agent 之间意见打架时,先分类再处理

  • 怎么做的:她的人工 QA 判别法极干净——看分歧在什么上。分歧在"对齐"这类相当客观的事上,"专家在这上面还有分歧就有点奇怪了",说明数据有缺陷;分歧在风格、审美上,"反而是好数据,它恰恰说明人的偏好本来就有分野"。
  • 你可以怎么做:三驾马车碰撞一定会出现两个角色结论相反,你现在多半是"再叫一个 agent 仲裁"或者干脆自己拍。换成她的分法先问一句:打架的是不是本该有唯一答案的事?(字段口径、状态流转、依赖关系——是的话,多半是六条产品线之间的口径没对齐在发作,去把那个词在各条线里的定义钉死,这就是最省力的跨线对齐入口)还是本来就该有分歧的事?(方案取舍、优先级——那就把两种意见都留在 PRD 里交给决策人,别硬合成一条中庸方案)。把该消灭的分歧和该保留的分歧分开,比造一个仲裁 agent 有用得多。

app_incubator(造 App 链路 · 设计系统技能)

一、"设计稿即工程契约"缺的不是更细的描述,是一张能分项打分的表

  • 怎么做的:她整套方法的落点是——拆解表本身就是基准答案,拆完"你就有了一堆非常明确、成文的东西,可以拿来逐条对照验证"。
  • 你可以怎么做:你那个设计系统技能已经在产设计契约和 token 文件,还带了硬约束(对比度过 WCAG AA、点击区 ≥ 44pt、正文 ≥ 16px)——这就是拆解表的雏形,而且这三条恰好落在她说的"靠近客观、能程序化验证"那一端。差的是这张表还没被用来判卷。把它接成造 App 链路里的一道自动闸门:出图/出码之后按 token 和这几条硬约束逐项跑,不过就打回。最容易拿的分不自动化,等于白拆。

二、把"该做什么"前移到 agent,先前移的应该是标准,不是任务

  • 怎么做的:她反复强调**"任务设计本身其实才是整个问题里最难的那部分"**——怎么把一个看上去很模糊的东西,变成真的能拿去训、能拿去判的东西。不是模型不行,是题没出对。
  • 你可以怎么做:你想把"该做什么"前移到 agent,但第一件该前移的不是决策,是判卷标准。给激活/首屏这个痛点写 3-5 条能判真假的断言("冷启动后第一屏必须存在一个可点的具体动作""空状态不能只出现一句欢迎语"),放进 agent 的任务定义里当交付条件。标准先前移,任务前移才有意义;否则你只是把拍脑袋的位置从你自己挪到了 agent。

StockHelp(投资)

一、"卓越生意"也是一条谱系,能拽一截进可验证

  • 怎么做的:她说品牌一致性本身很难判,但"通过把它成文化、搞清楚哪些部分真正重要、再把这些部分变成可观察、可度量的东西,我们就能把它往验证这个领域里拽一截";剩下真正主观的那一端,老实交给人——"人类判断的水准仍然远高于任何 LLM 裁判"。
  • 你可以怎么做:你选股里的"卓越生意"就是个典型的模糊词,跟"好设计"同构。把它拆成两栏:能程序化算的(ROIC 趋势、毛利率稳定性、自由现金流转化率、PE 五年分位、离公允价还有多远)——这些全进看板自动算、自动更新;只能你判的(管理层的资本配置品格、护城河还能撑几年、这行会不会被重新定义)——这些做成一张每次都得手写一两句的问答卡,写不出整句就说明你没看懂这门生意。看板的价值不在于把主观量化掉,而在于把客观那截自动化掉,好让你的判断力全花在真正需要判断的地方——这跟你自己那条"判断力 > 努力"是同一件事的两种说法。

Personal Thinking(第二大脑)

一、"什么算一篇好总结"也该有一张拆解表

  • 怎么做的:她收尾的核心信息是主观领域质量优先于数量,而且高质量数据必须由"在这个领域里 taste 极高的人"来做;同时"专家语言的具体程度直接决定数据质量"。
  • 你可以怎么做:你的总结模板已经有了密度梯度这条规则(益项写厚、其余紧凑),那本身就是一次拆解,方向是对的。再往前一步:把"一篇好总结"拆成 5 条可分别打分的元素(覆盖有没有漏、具体数字和人名有没有留、跳转锚点准不准、于你何益有没有落到具体项目、有没有硬掰),每期跑完自评一次并记下分数。你现在提高信噪比靠的是少收内容,其实更管用的是把"什么算好"写下来——少收只能减少噪音,写下来才能增加信号。

该反着用

她要撑开分布,你要收窄分布。 她整套方法建立在"要覆盖所有人的偏好"这个前提上——给通用模型做训练数据,就必须刻意撑开分布,为此养了一千多位不同媒介、不同风格的专家。你的处境正好相反:你的两个号、你的 App、你的第二大脑,基准答案只有一个人,就是你。所以别学她"多找几种审美来防坍缩",那是她的问题不是你的问题;学她"给每个人建一份偏好向量"这一半,然后只建你自己那一份,越窄越好——越窄,agent 判得越准,也越不容易退回均值。你的稀缺不是多样性,是清晰度。

第二处:她的成本结构比你差,别被"很贵很难"吓住。 她说做高质量数据"很贵,也很难,需要对某个具体领域有非常深的理解"——那是因为她要把一千个人的品味封装成产品。你只需要把一个人的品味写成一页纸。这件事你一直没做,多半不是因为它难,是因为它不像"再造一个新技能"那么有成就感。

和你现在做法冲突

拆解是前置成本,跟你"精力最稀缺、杠杆 > 工时"直接顶牛。 拆一次品牌/一次文风,得坐下来把元素一条条写清楚,当天不产出任何内容。你的习惯是靠直觉一次判一篇——快,但每次都从零开始,判断力不积累。张力就在这儿:你愿不愿意先停一次产,把"我觉得好"写成一张表?这个不替你下结论,但有个很便宜的验法:只拆一个对象(先拆家居号封面,别碰文案、别碰 PRD),做完看下一批封面出得快不快、你有没有少纠结。用一次最小实验回答"这份前置成本值不值",比想象靠谱。

第二处更直接:她说"LLM as a judge 未必总是最好的办法",有大量钻奖励空子和幻觉。 而你现在的三驾马车碰撞评审、去 AI 腔判定,本质上全是大模型当裁判。她给的替代方案不是"换个更强的模型当裁判",而是把能程序化判的部分抽出来,别让模型判。这对你正在扩张的 agent 数量是一次降温:多一个评审 agent,通常不如多一条脚本硬判的规则。

对你的镜子

你手上三样东西,其实是同一件事的三个低配版。 去 AI 腔的六定式、PRD 工厂的碰撞加评审、两个号的选题封面把关——你一直把它们当三件事在各自迭代、各自打补丁。这一期照出来的是:它们缺的是同一样东西——一张写下来的、能分项打分的拆解表,加上"拿标准判、不拿原件判"这一个动作。 补这一样,三处一起升级;继续各修各的,就是同一份劳动做三遍。

第二面镜子:你说自己精力最稀缺,可你每判一篇文案、一版 PRD、一张封面,都在重新调用一次全量判断力。 她那句"能力跟着可度量性走"反过来对你也成立——**你没把标准写下来,所以你的判断力无法被复用,只能一次次现场消耗。**这不是勤奋问题,是资产化问题。

所以呢

可迁移思维模型

  • 【耐用】可验证性是任务的属性,不是工具的属性。 一件事 AI 做不好,先别问"换哪个模型",先问"这件事被拆到可验证了吗"。这条对带人也成立——下属做不好一件事,多半是"什么算好"从没被说清楚过。
  • 【耐用】拆解是把主观变可处理的唯一通用动作,而拆解表本身就是标准。 拆完你会发现,你以为的"品味"里有一大半其实是可以写下来的规则,剩下的那一小半才是真的品味——而那一小半,才值得你亲自花时间。
  • 【耐用】判"合不合标准",别判"像不像原件"。 拿原件当标准,最好的结果也只是复刻;拿标准当标准,才允许出现比原件更好的东西。
  • 【耐用】多偏好世界里,平均是最差的答案。 两个人喜好不同,正确动作是分开匹配,不是折中。这条对内容定位、产品取舍、团队意见分歧、甚至你的持仓风格都成立。
  • 【耐用】分歧要先分类:本该有共识的地方出现分歧是缺陷,本就该有分歧的地方出现分歧是信号。 这一条能省掉你大量"到底听谁的"的内耗。
  • 【会过期】"大模型当裁判不够可靠、会钻奖励空子"——这是 2026 年这个时点的模型状态,判卷能力正在快速变强,两年后这笔成本取舍可能要重算。

判断更新

把"提高质量"从**"再加一道评审"换成"把'好'拆成能分别打分的元素,然后按元素路由:能自动判的自动判,只能人判的老实交给人,中间那截想办法拽过来"**。判断一套质量把关好不好,不看它输出的意见多不多,看它有没有一部分是你不在场也能拦下东西的

这周一个赌注

家居号的封面这一件事下注(范围最小、反馈最快、正好接上你"封面标签激活"那个卡点)。照她的五要素法拆一张表:把"好封面"拆成 5-6 个能分别打分的元素(主标字号层级 / 信息密度 / 色调是不是家居号那一挂 / 有没有一个具体到能截图的细节 / 留白比例 / 一眼能不能读出"这是个决策")。然后做两件事:① 把你已经发过的封面按这张表逐项打分,看得分高的是不是就是数据好的——对得上,这张表就是你的基准答案,对不上就说明你拆错了元素;② 下一批封面只用这张表判,不摆旧爆款比像不像。一周后只看一个数:出一张封面的决策时间有没有变短。 变短了,就把同一套动作复制到文案(给去 AI 腔补正向表)和 PRD(碰撞评审点重排);没变短,说明你拆的那几个元素不是真正决定好坏的,换几个再拆一次——这个失败很便宜,一小时就能重来。

接着读