这一期表面在讲怎么给前沿模型做"品味数据",实际上从头到尾在回答你手上三件事共同卡着的同一个问题:「好」到底怎么判?
你现在有三套低配版的答案——去 AI 腔那套六定式(把 AI 味拆成六条逐条判定)、PRD 工厂的 5 个评审镜头加质量闸门、两个内容号的选题和封面把关(外加那个从参考素材提炼设计系统的技能)。它们做的是同一件事:拿一套标准去判一件主观的东西。她给的,是这套东西的方法论升级版。所以这段写厚。
两个内容号(家居号 + 一人公司号)· 去 AI 腔技能
一、六定式判的是"有没有毛病",缺的是"像不像你"
- 怎么做的:她说笼统地验证"这东西是不是 on brand"相当难,但一旦你把"好"拆成颜色、字体排版、动效、动画、质感这些具体元素,它"突然就变成了一个可以成文、可以验证的形状"。而这张拆解表本身,就成了判卷用的基准答案。
- 你可以怎么做:你的六定式已经走对了一半——你确实把"AI 腔"拆成了能逐条判定的东西,那层"换主词测试"(整段抽掉主词放任何同类主题也成立就重写)尤其漂亮,那已经是她说的那种拆解了。但这半张表全是负面清单:它能告诉你哪里不像人写的,不能告诉你哪里不像"你"写的。补另一半:把"家居号的味道"和"一人公司号的味道"各自拆成 5-6 个可分别打分的正向元素(句子长短的节奏 / 第一人称出现密度 / 具体到数字和金额的细节有几处 / 有没有一处认账的翻车 / 结尾落在动作还是落在感慨)。然后照她的用法用它:让 agent 写一篇你从没写过的新话题,拿这张表逐项打分——你会立刻知道,你以为的"我的风格"里有多少其实是能写下来的规则。
二、判"贴不贴标准",别判"像不像上一篇爆款"
- 怎么做的:她派 agent 的活是"做一个全新的页面,要贴合品牌,但内容完全是净新的、跟原来不一样",并且明确要求产出"不只是拿去跟原件对比打分,而是拿这套 ground truth 来打分"——理由是 agent"可能会想出全新的方式来使用这些元素,这些用法依然成立,只是跟原件不一样"。
- 你可以怎么做:这条直接命中你那个"从参考素材提炼设计系统"的技能立身之本——「把参考当灵感、不照搬」。那个技能产出的风格指南和设计契约,就是拆解表;但你在评审新稿的时候,很可能还是把参考图摆在旁边比"像不像"——那等于把创新判成错误。改成两步:先提炼拆解表,然后评审环节里参考图不再出现,只拿表判。封面同理:判的应该是"主标字号层级对不对、信息密度在不在区间、色调是不是家居号那一挂",而不是"像不像上一张数据好的封面"。只跟爆款比,你就永远只能复刻上一次的均值。
三、slop 的根源是向均值坍缩——所以"去 AI 腔"只做了减法那一半
- 怎么做的:她的诊断是,模型在预测"下一个最可能出现的结果"并默认它就是理想结果;对 2+2 成立,对写作不成立。原话:"很多伟大和创造力其实发生在分布的两端……恰恰是当你主动打破规则、主动跳出模式的时候,你才能做出既有主观性又真正出彩的东西。" 被 slop 包围的感觉,来自向均值坍缩加上重复感。她的解法不是"清洗",是有意为之地偏离均值。
- 你可以怎么做:这是对去 AI 腔技能最有价值、也最不舒服的一条——六定式的动作绝大多数是删除:删套话、删壳、删对举、删罐头结尾。文本会变干净,但干净的均值仍然是均值。 你那条"防假人味自查"其实已经嗅到了这件事(发现"去 AI 味时被加上去的另一种 AI 腔"),但它还是一道防守闸门,不是一个进攻条件。给这个技能加一个正向环节:定稿前问一句"这篇有没有一处是别人不会这么说的?"——一个反常识的判断、一笔具体到元的成本、一次认账的翻车。**没有这一处,删得再干净也还是 slop。**而这一处正好就是一人公司号那道弹药库闸门要的东西:删掉你的实测和判断还成立的,不发。两条规则本来就是一条。
四、两个号是两个偏好向量,别在它们中间取平均
- 怎么做的:她说过去的偏好数据坍缩到均值,是因为"从一大堆人那里收上来的,却没搞清楚他们是谁、喜欢什么、为什么喜欢、什么时候喜欢";而且**"最好的答案不是这两个人喜好的平均值"**——世界是多偏好的,要做的是匹配,不是折中。解法是给人建"偏好向量"、把它挂到数据上,让分歧从噪音变回信号。
- 你可以怎么做:家居号(决策型生活记录者)和一人公司号(build-in-public)面对的是两群完全不同的人,而危险在于你只有一个"我觉得好"——两个号共用一套审美,结果两边都拿到平均值,两边都不够锋利。做法很轻:给每个号写一张一页的偏好向量卡(读者是谁 / 他点开这条时在解决什么问题 / 什么标题他会直接划走 / 什么细节他会截图保存),把它当成该号所有选题、标题、封面评审的第一段上下文。顺带一句:家居号那个空着的指标盘,也该按号分开看——两个号的数据混在一张表里,就是自己给自己造噪音。
Codex Holdwell ERP work(PRD 工厂 · 三驾马车 + 碰撞协议)
一、把碰撞环节的评审点按"离可验证有多远"重排一次
- 怎么做的:她的核心框架是一条谱系加一个路由问题——一端是视觉对齐、字体排版这类靠近客观、能程序化验证的元素,另一端是风格契合度、创造力这类只能靠人判的;中间那截才是最值钱的战场。"针对每一个组件找出最合适的解法",而"如果只带走一条",就是把事情往可验证那一侧拽。
- 你可以怎么做:你三驾马车的碰撞现在大概率是同一种方法判三遍:让每个 agent 读完对方初稿写一段意见。照她的路由逻辑重排:像"必填字段齐不齐、异常流有没有分支、术语在六条产品线之间口径一不一致、验收标准有没有可判真假的断言"——这些属于客观端,根本不该由 agent 写评语,该由脚本硬判、不过就不给过;像"这个需求是不是真解决了业务的问题""优先级排得对不对",属于人类判断端,agent 只能给素材、由你拍板。剩下中间那截(比如"验收标准写得够不够具体")才是你该花力气成文化、往可验证侧拽的地方。你担心的"碰撞纪律是否真被执行",多半就得靠这个——客观端的东西一旦写成评语就拦不住人,脚本能。
二、评审意见必须绑定到 PRD 的具体那一段
- 怎么做的:她说模型很难把代码的某一块和视觉效果对应起来,所以他们专门下功夫把专家点评精确绑定到那个代码组件上——"你的数据一下子就噪声小得多、也清晰得多了"。同时她强调"专家语言的具体程度、描述得有多精确,直接决定了这份数据的质量"。
- 你可以怎么做:把碰撞环节交的三件(补强/修正/第 3 案)的输出格式从"一段评语"改成"定位 + 断言":哪一节、哪一条,期望应该出现什么,现在出现的是什么。好处是双份的——一是作者能直接改,不用猜;二是这些意见立刻变成可复用的资产:攒够一批就是你评审环节的用例集,也是"真人评审意见回炉难闭环"最省力的解药(这一版拦下几条、下一版回炉后消掉几条,就是闭环证据本身)。
三、agent 之间意见打架时,先分类再处理
- 怎么做的:她的人工 QA 判别法极干净——看分歧在什么上。分歧在"对齐"这类相当客观的事上,"专家在这上面还有分歧就有点奇怪了",说明数据有缺陷;分歧在风格、审美上,"反而是好数据,它恰恰说明人的偏好本来就有分野"。
- 你可以怎么做:三驾马车碰撞一定会出现两个角色结论相反,你现在多半是"再叫一个 agent 仲裁"或者干脆自己拍。换成她的分法先问一句:打架的是不是本该有唯一答案的事?(字段口径、状态流转、依赖关系——是的话,多半是六条产品线之间的口径没对齐在发作,去把那个词在各条线里的定义钉死,这就是最省力的跨线对齐入口)还是本来就该有分歧的事?(方案取舍、优先级——那就把两种意见都留在 PRD 里交给决策人,别硬合成一条中庸方案)。把该消灭的分歧和该保留的分歧分开,比造一个仲裁 agent 有用得多。
app_incubator(造 App 链路 · 设计系统技能)
一、"设计稿即工程契约"缺的不是更细的描述,是一张能分项打分的表
- 怎么做的:她整套方法的落点是——拆解表本身就是基准答案,拆完"你就有了一堆非常明确、成文的东西,可以拿来逐条对照验证"。
- 你可以怎么做:你那个设计系统技能已经在产设计契约和 token 文件,还带了硬约束(对比度过 WCAG AA、点击区 ≥ 44pt、正文 ≥ 16px)——这就是拆解表的雏形,而且这三条恰好落在她说的"靠近客观、能程序化验证"那一端。差的是这张表还没被用来判卷。把它接成造 App 链路里的一道自动闸门:出图/出码之后按 token 和这几条硬约束逐项跑,不过就打回。最容易拿的分不自动化,等于白拆。
二、把"该做什么"前移到 agent,先前移的应该是标准,不是任务
- 怎么做的:她反复强调**"任务设计本身其实才是整个问题里最难的那部分"**——怎么把一个看上去很模糊的东西,变成真的能拿去训、能拿去判的东西。不是模型不行,是题没出对。
- 你可以怎么做:你想把"该做什么"前移到 agent,但第一件该前移的不是决策,是判卷标准。给激活/首屏这个痛点写 3-5 条能判真假的断言("冷启动后第一屏必须存在一个可点的具体动作""空状态不能只出现一句欢迎语"),放进 agent 的任务定义里当交付条件。标准先前移,任务前移才有意义;否则你只是把拍脑袋的位置从你自己挪到了 agent。
StockHelp(投资)
一、"卓越生意"也是一条谱系,能拽一截进可验证
- 怎么做的:她说品牌一致性本身很难判,但"通过把它成文化、搞清楚哪些部分真正重要、再把这些部分变成可观察、可度量的东西,我们就能把它往验证这个领域里拽一截";剩下真正主观的那一端,老实交给人——"人类判断的水准仍然远高于任何 LLM 裁判"。
- 你可以怎么做:你选股里的"卓越生意"就是个典型的模糊词,跟"好设计"同构。把它拆成两栏:能程序化算的(ROIC 趋势、毛利率稳定性、自由现金流转化率、PE 五年分位、离公允价还有多远)——这些全进看板自动算、自动更新;只能你判的(管理层的资本配置品格、护城河还能撑几年、这行会不会被重新定义)——这些做成一张每次都得手写一两句的问答卡,写不出整句就说明你没看懂这门生意。看板的价值不在于把主观量化掉,而在于把客观那截自动化掉,好让你的判断力全花在真正需要判断的地方——这跟你自己那条"判断力 > 努力"是同一件事的两种说法。
Personal Thinking(第二大脑)
一、"什么算一篇好总结"也该有一张拆解表
- 怎么做的:她收尾的核心信息是主观领域质量优先于数量,而且高质量数据必须由"在这个领域里 taste 极高的人"来做;同时"专家语言的具体程度直接决定数据质量"。
- 你可以怎么做:你的总结模板已经有了密度梯度这条规则(益项写厚、其余紧凑),那本身就是一次拆解,方向是对的。再往前一步:把"一篇好总结"拆成 5 条可分别打分的元素(覆盖有没有漏、具体数字和人名有没有留、跳转锚点准不准、于你何益有没有落到具体项目、有没有硬掰),每期跑完自评一次并记下分数。你现在提高信噪比靠的是少收内容,其实更管用的是把"什么算好"写下来——少收只能减少噪音,写下来才能增加信号。
该反着用
她要撑开分布,你要收窄分布。 她整套方法建立在"要覆盖所有人的偏好"这个前提上——给通用模型做训练数据,就必须刻意撑开分布,为此养了一千多位不同媒介、不同风格的专家。你的处境正好相反:你的两个号、你的 App、你的第二大脑,基准答案只有一个人,就是你。所以别学她"多找几种审美来防坍缩",那是她的问题不是你的问题;学她"给每个人建一份偏好向量"这一半,然后只建你自己那一份,越窄越好——越窄,agent 判得越准,也越不容易退回均值。你的稀缺不是多样性,是清晰度。
第二处:她的成本结构比你差,别被"很贵很难"吓住。 她说做高质量数据"很贵,也很难,需要对某个具体领域有非常深的理解"——那是因为她要把一千个人的品味封装成产品。你只需要把一个人的品味写成一页纸。这件事你一直没做,多半不是因为它难,是因为它不像"再造一个新技能"那么有成就感。
和你现在做法冲突
拆解是前置成本,跟你"精力最稀缺、杠杆 > 工时"直接顶牛。 拆一次品牌/一次文风,得坐下来把元素一条条写清楚,当天不产出任何内容。你的习惯是靠直觉一次判一篇——快,但每次都从零开始,判断力不积累。张力就在这儿:你愿不愿意先停一次产,把"我觉得好"写成一张表?这个不替你下结论,但有个很便宜的验法:只拆一个对象(先拆家居号封面,别碰文案、别碰 PRD),做完看下一批封面出得快不快、你有没有少纠结。用一次最小实验回答"这份前置成本值不值",比想象靠谱。
第二处更直接:她说"LLM as a judge 未必总是最好的办法",有大量钻奖励空子和幻觉。 而你现在的三驾马车碰撞评审、去 AI 腔判定,本质上全是大模型当裁判。她给的替代方案不是"换个更强的模型当裁判",而是把能程序化判的部分抽出来,别让模型判。这对你正在扩张的 agent 数量是一次降温:多一个评审 agent,通常不如多一条脚本硬判的规则。
对你的镜子
你手上三样东西,其实是同一件事的三个低配版。 去 AI 腔的六定式、PRD 工厂的碰撞加评审、两个号的选题封面把关——你一直把它们当三件事在各自迭代、各自打补丁。这一期照出来的是:它们缺的是同一样东西——一张写下来的、能分项打分的拆解表,加上"拿标准判、不拿原件判"这一个动作。 补这一样,三处一起升级;继续各修各的,就是同一份劳动做三遍。
第二面镜子:你说自己精力最稀缺,可你每判一篇文案、一版 PRD、一张封面,都在重新调用一次全量判断力。 她那句"能力跟着可度量性走"反过来对你也成立——**你没把标准写下来,所以你的判断力无法被复用,只能一次次现场消耗。**这不是勤奋问题,是资产化问题。
所以呢
可迁移思维模型
- 【耐用】可验证性是任务的属性,不是工具的属性。 一件事 AI 做不好,先别问"换哪个模型",先问"这件事被拆到可验证了吗"。这条对带人也成立——下属做不好一件事,多半是"什么算好"从没被说清楚过。
- 【耐用】拆解是把主观变可处理的唯一通用动作,而拆解表本身就是标准。 拆完你会发现,你以为的"品味"里有一大半其实是可以写下来的规则,剩下的那一小半才是真的品味——而那一小半,才值得你亲自花时间。
- 【耐用】判"合不合标准",别判"像不像原件"。 拿原件当标准,最好的结果也只是复刻;拿标准当标准,才允许出现比原件更好的东西。
- 【耐用】多偏好世界里,平均是最差的答案。 两个人喜好不同,正确动作是分开匹配,不是折中。这条对内容定位、产品取舍、团队意见分歧、甚至你的持仓风格都成立。
- 【耐用】分歧要先分类:本该有共识的地方出现分歧是缺陷,本就该有分歧的地方出现分歧是信号。 这一条能省掉你大量"到底听谁的"的内耗。
- 【会过期】"大模型当裁判不够可靠、会钻奖励空子"——这是 2026 年这个时点的模型状态,判卷能力正在快速变强,两年后这笔成本取舍可能要重算。
判断更新
把"提高质量"从**"再加一道评审"换成"把'好'拆成能分别打分的元素,然后按元素路由:能自动判的自动判,只能人判的老实交给人,中间那截想办法拽过来"**。判断一套质量把关好不好,不看它输出的意见多不多,看它有没有一部分是你不在场也能拦下东西的。
这周一个赌注
挑家居号的封面这一件事下注(范围最小、反馈最快、正好接上你"封面标签激活"那个卡点)。照她的五要素法拆一张表:把"好封面"拆成 5-6 个能分别打分的元素(主标字号层级 / 信息密度 / 色调是不是家居号那一挂 / 有没有一个具体到能截图的细节 / 留白比例 / 一眼能不能读出"这是个决策")。然后做两件事:① 把你已经发过的封面按这张表逐项打分,看得分高的是不是就是数据好的——对得上,这张表就是你的基准答案,对不上就说明你拆错了元素;② 下一批封面只用这张表判,不摆旧爆款比像不像。一周后只看一个数:出一张封面的决策时间有没有变短。 变短了,就把同一套动作复制到文案(给去 AI 腔补正向表)和 PRD(碰撞评审点重排);没变短,说明你拆的那几个元素不是真正决定好坏的,换几个再拆一次——这个失败很便宜,一小时就能重来。