本期为叙事型节目,无正式闪电问答环节。收尾即主题 13 东尼"从结果到过程"的自述。
本期与你的相关度:高。 主线"模型能力趋同后、靠品味/判断力立差异化"正好压在你两个内容号、PRD 工厂和投资母题的正中央。挑最强的三条对。
怎么做的:这期把"品味/语感/共情"这种一直被当成"只可意会不可言传"的东西,硬拆成了可定义、可打分、可训练的工程——给"好"下定义、隔离变量、"7 分和 10 分差在哪就解释那 3 分"、建一整套评估体系(见主题 3、5)。东尼那句"我们设计的是人类的观感"、Bianca 那句"把是什么让《纽约客》成为《纽约客》说清楚",说的就是你两个号的命门:momorain 靠"决策型生活记录者"的判断力做差异化,onehuman 靠"一个 PM 开公司"的实测判断供血——两者卖的都是别人抄不走的判断。
你可以怎么做:把你现在凭手感判断"这篇能不能发"的过程,仿照内容工程师落成一张 rubric(评分表)。momorain 可以把"决策感"拆成几项(有没有真实取舍、有没有可抄物、封面标签是否激活),每篇打分、低于某分不发——这正好戳你两个没在动的痛点:"指标盘空着"和"封面标签激活"。onehuman 的"弹药库闸门(删掉我的判断和实测还成立就不发)",本质就是节目里"7 分和 10 分那 3 分"——把它写成一句能打分的判据。而且东尼这段本身就是 onehuman 的现成选题:"一个没代码基础的前媒体人用 few-shot 而非堆 prompt 调出击败原生模型的 agent——我拿 drizzle tech 的 9+1 Agent 实测:堆 system prompt vs 喂 few-shot 金标准,哪个赢?"——自带实测,过得了弹药库闸门。
更深一层(镜子):这期最锋利的一刀是 Bianca 说"只靠共识训练不会产生伟大艺术,人之所以为人恰恰不来自共识"。你若把判断全 rubric 化、都去追"眼前一亮的合格回复",会不会反而滑向平均数、丢掉那个"凌晨两三点发疯文学"式、只有你有的表达?规则化是为了托住下限,不是替代那格 10 分。留一条不打分的路。
所以呢:把"我觉得这篇好"翻译成"好在这 3 项、差这 3 分",是两个号从"手感"走向"可复制产能"的关键动作——但别把 10 分那格也交给 rubric。
怎么做的:内容工程师干的事,和你的 PRD 工厂是同一件事的两面——把专家(编辑/记者)脑子里的判断,逆向工程成 agent 能执行、可评估的规则。最直接的映射是东尼调语音 agent 的三步踩坑(主题 8):纯 system prompt 堆限制→聊到第三句就忘、崩了;再叠一堆 agent(意图 agent + 情感 agent)过度约束→还不如空 prompt;最后靠 few-shot(喂几条真实好案例当参考)才打开。外加 Bianca 的"隔离变量、一项项拆开打分、建评估体系"。
你可以怎么做:你两个痛点正好对上。"agent 产出缺可观测/可验证"对应节目里的"评估体系(eval)"——别让碰撞与真人评审停在人肉判断,学内容工程师把"好 PRD"拆成可打分项、设一个"低于某分不放行"的硬闸门。另一条对应东尼的教训——与其给三驾马车堆更长的 agent 定义 / system prompt(他证明了会崩、会互相干扰),不如把几份你认可的历史 PRD/实体定义当"金标准案例"few-shot 注进去,比写一万字规则更管用。
更深一层(冲突):东尼"加越多限制、AI 越崩"是对你这套重管线的一记警告——三驾马车 + 六步碰撞协议已是重编排,他的实验却说过度编排会让产出还不如朴素基线。值得做个对照:一份 PRD 用全套碰撞协议跑,一份用"单 agent + few-shot 金标准"跑,看哪个产出更经得起验证(正对你自列的痛点:agent 产出缺可观测/可验证)。
所以呢:把判断固化成 agent 的正确姿势,也许不是"写更多规则",而是"建评估闸门 + 喂金标准案例"——正好戳中你"agent 产出可观测/可验证"这个最要命的洞。
怎么做的:全期暗线就是你最关心的护城河问题——当模型能力趋同(参数不再是差异),留住用户的不再是参数,而是"它懂不懂你",而这个"懂"要靠稀缺的人(前记者/编辑的判断力)反向工程进产品。翻成投资语言:大模型这一层大概率会商品化(commoditize、打价格战),真护城河下沉到"数据 / 品味 / 人才 / 产品语感"这些难复制的软资产。
你可以怎么做:给 StockHelp watchlist 里的 AI 相关标的加一条定性判据——"这家的护城河是参数/算力(会趋同、会打价格战),还是数据 + 品味 + 分发(难复制)?"节目给了现成检验点:谁能把"《纽约客》之所以为《纽约客》"说清楚、谁攒了"娱乐界垂直小模型"、谁请了懂内容的人把关,谁就有下沉护城河;反过来,纯拼模型指标的公司要警惕估值透支(节目里"5000 亿美金砸向 AI 基建"那种热度)。
更深一层(镜子):这也照你自己的价值投资操作系统——"卓越生意"的质量恰恰藏在不可量化处(品味、判断、组织默契),和 StockHelp 现在只显示 PE / 分位 / 比率这些可量化指标形成张力。Phase 2/3 做信号时,也许该留一栏"定性护城河备注",提醒自己别被纯数字骗了(正如节目说"只看一个信息流就看不到反方")。
所以呢:模型趋同的年代,护城河从"参数"下沉到"品味和数据"——把这条写进你给 AI 标的估值的定性清单。
app_incubator 只沾一点边:东尼证明"没代码基础也能用 few-shot + 品味调出胜过原生的 agent",提示你的造 App 链路里值得设一个"内容/语感把关点",且用金标准案例而非堆 prompt——一行带过。Chief of Staff 本期无直接可借鉴,略。