ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.95
第 95 期 · AI 产品 · 收录于 2026 年 8 月 15 日

藏在大模型背后的新闻人

硅谷101
视频 45:53 原文约 1.4 万字 预计阅读 16 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 17:47
TL;DR · 三句话
  1. 当各家大模型能力趋同、参数不再是差异,留住用户的变成"AI 懂不懂你"——而这种品味/语感/共情,正被一群前记者编辑反向工程成可定义、可打分、可训练的工程,这个离用户最近却最不为人知的岗位最早叫"内容工程师(Content Engineer)"。→ 详细
  2. 他们的核心手艺是把"什么叫好"说清楚:给"好"下定义、隔离变量、"7 分和 10 分差在哪就解释那 3 分"、建评估体系,把"是什么让《纽约客》成为《纽约客》"翻译成模型能执行的规则——本质是新闻技能(建 context、追问、事实核查)的平移。→ 详细
  3. 前媒体人东尼(一个没有代码基础的人)靠 few-shot 案例(而非堆 system prompt)调出比谷歌原生模型更生动的语音 agent、被 DeepMind 挖去当"资深模型设计师"——印证"品味本身既能当护城河,也能当画笔"。→ 详细
01

引子:模型趋同后,护城河变成"懂不懂你",和一个隐秘工种

  • 主播泓君(硅谷101 创始人;开场把自己念成"红军"实为 ASR 误听)给的行业底色:过去两年光洛杉矶就蒸发 4 万多个影视岗,美国报纸编辑比 2008 年少了一半,这批人一部分去了硅谷大模型公司——不再写稿,而是把写作经验改成"教 AI":什么语气、什么分寸、什么时候追问、什么时候闭嘴。当你觉得"这大模型怎么这么懂我",写那句话的就是前新闻人。这个离用户最近却最不为人知的工种,叫 Content Engineer(内容工程师)→ 详细
  • 特约研究员 Faith(静远) 的钩子:她曾是朋友圈"发疯文学代表",现在半夜情绪不发朋友圈、发进 ChatGPT 对话框,聊创业、前任、心事,觉得多了个朋友;AI 有时精准抓住她没说清的情绪、问一个让她一愣的问题。她一度以为这种"被理解的幻觉"来自数据中心的芯片和代码,做完这期才意识到那也是一群前记者/编辑/纪录片导演的功劳。→ 详细
02

内容工程师到底设计什么:不是模型、不是产品,是"人类的观感"

  • 东尼(Tony Lin)——前媒体人,曾在 BuzzFeed、Bloomberg、NBC、Vice 工作,Peabody 奖(广播电视界的普利策奖)得主,播客《行星酒馆》主播——一句话定调:内容工程师设计的不是 AI 模型、不是产品、也不是行文风格,而是"人类的观感"。2025 年他在网飞(Netflix)干满四年时看到 Meta 招 Content Engineering 的帖子(要内容经验、编辑经验、最好有影视制片经验),觉得"每句都在说我",面试直接说"你们要的每条我都能达到,市面上找不到这么多符合的人,你找我吧",就这样空降 Meta 超级智能实验室,做模型内容国际化负责人。→ 详细
  • 分工:软件工程师让 ChatGPT、Claude 学会"开口说话",内容工程师定义"什么样的对话才算好"——灵感、语感、聊到忘我时的灵魂碰撞,这些一直被当成"只可意会"的东西,正被拆成能装进 AI 的规则。他们写的东西之一是 system prompt(系统提示词),本质是 creative writing(创意写作),还得对付时不时"傲娇"、不听话的模型。→ 详细
03

(益项·写厚)把"好"变成可拆解、可打分的工程

  • Bianca Consunji(比安卡)——NBCUniversal AI 赋能与采用战略总监,前 Vice 视频总监、NBC News 资深监制、前 Meta GenAI 内容工程师——给出核心命题:先给"好"下定义。她说代码是技术语言,但普通语言同样有技术性(有语法句法、可量化);一个好剧本、一篇好文章都能拆开判高下,只是大家习惯凭感觉读——人人都知道《纽约客》的语气不同于《纽约时报》《每日邮报》,却说不清差在哪。她们干的就是"把是什么让《纽约客》成为《纽约客》说清楚",把语气、风格、声音翻译成更技术化的东西。→ 详细
  • "好"没有绝对标准,取决于你手上的产品:一个帮你干活的 agent,和一个"假装当你男朋友"的聊天机器人,是完全不同的产品;就像航空公司客服机器人,得先想清楚这段互动的目标是"帮它解决问题"还是"尽快把它打发走"。→ 详细
  • 方法论:不断训练、看输出,把回答的各种属性一项项拆开打分,隔离变量(isolate variables,即控制其他因素、单独看某一项的影响),搞清楚什么其实没那么有用,再一点点把"什么叫好"定义清楚。最点睛的一句——"有的回答是好的,但只有 7 分而不是 10 分,那我们就要去解释那 3 分的差距在什么地方"。→ 详细
04

(益项·写厚)理解"意图"而非字面,以及 context 的决定性作用

  • Bianca:光有舒服语气不够,还要洞悉用户真正意图;她的专长是"理解意图(intent)而不只是理解字面问题"。经典例子:有人问"Taylor Swift 会不会在麦迪逊广场花园(Madison Square Garden)结婚"——差回答是"是的他会,以下是伴娘名单"(根本没人知道真假、一股机器人腔);好回答是"我们不知道他是否真要结婚,但现在有很多猜测认为婚礼可能在那举行",再加上来源、归属(attribution)、承认信息的不确定性——这些都是让新闻报道变好的因素,要加进训练。落点是三样:事实性、语气、真正理解用户想找什么信息。→ 详细
  • context(上下文/语境)是一切。Bianca 是菲律宾人,很多重要信息不会直接说出口,要看表情、理解停顿才懂"言下之意";所以她教人用 AI 时鼓励语音输入——用语音时你不会先在脑子里反复编辑,而是直接说出想表达的,AI 能捕捉更细的差别。这和采访同理:口头采访远胜邮件采访,因为邮件里双方都过度编辑、采访对象有太多时间修饰、且没人能实时追问。她的建议:与其给 AI 更多材料,不如先把脑子里所有想法、背景、"你为什么会这么想"全都告诉它,把它已有的能力"调用"出来。→ 详细
05

(益项·写厚)新闻技能"平移"进 AI:建 context、追问、结构 vs 流动、评估体系

  • 东尼强调:不是"迁移",是"完全平移"。新闻写作时脑子里永远有一个 audience(观众),要在"客观、不得罪人、保持自己、还原事实"之间找 balance(平衡),这种平衡本身需要训练。→ 详细
  • 提问/建 context 的能力最值钱:很多人对 AI 提不出好问题,是因为不理解当下语境需要什么 context;新闻写作的铁律是"不能把一个事实直接甩出去,先建立前因后果的 context,再抛核心问题和论点"——这套搬到 AI 训练和交互里"屡试不爽"。→ 详细
  • follow-up question(追问):泓君提到记者最重要的技能之一是问好追问——采访对象常在回答时突然岔到一个特别有意思的点,这时哪怕冒着偏题风险也要说"你能不能展开(expand)一下"。东尼说这戳中要害:新闻人永远在"结构性和流动性之间取平衡",AI 的交互设计也必须做这件事。看现在的 GPT:你一说话,它先用一个小模型生成两三句重述你的问题,再分 bullet points 作答,最后再生成一个 follow-up question——"该针对哪个方面追问"需要一整套评估体系(evaluation),而"当然是最会问问题的人来建"。所以说到底都是新闻技能。→ 详细
06

多轮对话为什么会"脑补"崩坏(ICLR 论文 + 微博旺角研究)

  • 东尼:今年 ICLR(机器学习顶会)一篇最佳论文研究 AI 怎么处理多轮对话(multi-turn conversation,AI 的传统弱项)——把一条复杂指令拆碎、一点点喂给 AI,发现质量大幅下降:当 AI 缺 context 时会不断"脑补"、答案越来越臃肿,中间一旦出错就像滚雪球越滚越大。→ 详细
  • 妙在跨界呼应:他 2018 年研究过微博"旺角便溺事件"的评论区,眼看大家从和善聊天变成互相辱骂——因为评论区同样没有 context、不知道对方是谁,人就开始脑补"你一定没孩子才这么说"。人的脑补和 AI 的脑补,在 context 破碎时惊人相似;人文社科早观察到的东西,正在模型这个新实体上重新上演。→ 详细
07

跨语言不是翻译,是"再创作":找到"中国的梅丽尔·斯特里普"

  • 东尼:AI 之前,内容出海只能 translation(翻译)——"Meryl Streep just won an Oscar"→"梅丽尔·斯特里普赢了奥斯卡"。生成式 AI 的新可能是按各地语境"再创作":同一条信息放进中文语境,谁是中国的梅丽尔·斯特里普、什么是中国的奥斯卡——"斯琴高娃刚拿了金鸡奖/百花奖"。→ 详细
  • 难点是 AI 不知道"谁对应谁",且一不小心惹到饭圈或文化冲突就很敏感;最会做这事的是娱乐记者(脑子里自带一套娱乐界垂直"小模型")。他还举陆川在硅谷101 前几集提到的例子:国内视频生成模型生成的人脸都是当下流行的帅哥美女脸,说明训练数据有偏差;若让懂电影、知道"电影脸长什么样"的人来把关,能很快提升模型的多元度和质量。→ 详细
08

(益项·写厚)东尼从零调教语音 agent 的完整踩坑

  • 缘起:去年东尼毫无征兆查出健康问题、请假回国治疗,一度不知自己还剩多少时间。养病时他想给自己做一个 voice agent(语音智能体),既能陪聊、又能当他播客的嘉宾。→ 详细
  • 三步踩坑(关键教训):① 现成的 GPT、Gemini 语音模式根本当不了播客主播——它们的 flow 整个是"语音助手"而不是"主播",气质不对;② 纯写 system prompt 堆一堆限制("你要有趣、要 engaging、不能怎样怎样")完全没用,"聊到第三句它就忘了之前给它的规训";③ 又搭了一堆 agent(先分析自己每句话的 intention、再叠一个情感 agent)反而"加了太多限制、把 AI 搞崩了,还不如什么 prompt 都不加的原始版"。→ 详细
  • 破局:最后他把自己所有播客记录按"问题归问题、内容归内容"整理,不全喂给 AI,而是每次对话让 AI 侦测相关内容、随机抽几条当参考——这就是 few-shot example(给几个示范案例让模型照着学)。这一下模型突然"知道了什么是好问题、好内容、好的正确语气"。结果:谷歌 recruiter 主动找上门,震惊于"一个完全没有代码基础的前媒体人、用做播客的经验调教出的 Gemini 语音 agent,在多轮对话里居然比他们的原生模型更生动、更灵活、还有深度"。有品味本身,能帮你找到工作。→ 详细
09

岗位裂变:从"内容工程师"到"资深模型设计师",被谷歌 OpenAI 抢

  • 东尼养病期间好几家独角兽和实验室找上门;各家意识到"要把模型内容做好,得请懂人文社科的人来把关",但还在摸索怎么把文科判断力翻译成工程语言。于是岗位一直裂变、头衔越来越怪——"内容工程师"已经开始过气,有的大厂叫"AI 哲学家"、有的叫"创意技术专家"。东尼康复后成了谷歌 DeepMind 第一批"资深模型设计师(senior model designer)"之一(新设岗位),几乎同时 OpenAI 也开出同职;他身边好几个新闻出身的前同事已经加入。→ 详细
10

(益项·写厚)共识训练 vs 伟大艺术:护城河到底是什么

  • Faith 抛出尖锐疑问:AI 是不是正把创作者变成"数据采集员"、把灵感拆成一个个可标记的数据,而亲手标记它们的人恰恰是我们自己?→ 详细
  • Bianca 的回答直指本质:AI 是"基于共识(consensus)"训练的——我们觉得它对,往往因为很多人都觉得对。如果优化的是"人类作为整体最低的共同标准、多数人的共识",那它不会产生伟大的艺术;"人之所以为人的最佳本质,恰恰不来自共识"。她和丈夫一起写剧本、平时也重度用 AI,但常觉得 AI 写的"不够好、没抓住我真正想看到的东西"。例子:《瞬息全宇宙》的剧本不可能自然从 AI 里长出来——AI 大概率会说"你这想法不合逻辑、说不通、不符合标准学院派的三幕剧结构"。最独特的艺术,本身就离经叛道、和共识相反。→ 详细
11

"AI 偷我工作"叙事的三重拆解 + 第三条路

  • 行业惨状:今年 5 月刷屏文《我在好莱坞工作,而所有做过电视的人现在都在偷偷训练 AI》,作者是好莱坞编剧兼制片人(文中称 Ruth/Rose,ASR 未统一),稿费被拖欠时去接一种叫 AI Trainer 的兼职——给 AI 打分、改写、示范什么是好剧本;一个剑桥文学系高材生要在群里听二十几岁年轻人调遣、24 小时随叫随到抢按小时计价的零活。数据对照:洛杉矶两年蒸发 4 万多个影视岗(近三分之一),新闻岗位自 08 年腰斩,另一边是 5000 亿美金砸向 AI 基建、估值飙升。Faith 自己两年前从哥大新闻学院(普利策奖诞生地、也是东尼和比安卡的母校)毕业,教授的比喻是"今天还想挤进新闻业,就像朝着一栋已经起火的大楼拼命往里跑"。→ 详细
  • 东尼对这套叙事持怀疑,拆成三层:① 大家骂的是 AI,真正该骂的是零工经济(gig economy)——媒体人打零工在 AI 之前就很严重,以前开 Uber、送 DoorDash,现在给 AI 打分;② "教会 AI 就被取代"不成立,零活是 project based(项目制),做完就走,"编剧打完分 AI 不会就变得跟编剧一样厉害,it doesn't work like that";③ 这套叙事把人和 AI 对立,其实有第三条路——AI 可以当创作者的伙伴/画笔:编剧没摄影机能不能拍电影、没特效预算能不能自己搞特效?就像从画画→摄影→Photoshop→Blender,工具一代代解锁新创作。东尼自己(用 AI 玩播客/生成视频)就是"把 AI 当画笔"的例子。→ 详细
12

谄媚与信息茧房:这是产品设计问题,不是行文问题 + 事实核查

  • 泓君追问:一个越来越懂你的伙伴,会不会越来越顺着你、讨好你?东尼:网上说"AI 是奸臣/忠臣",因为 AI 会顺着谈话对象的价值取向和信息茧房去 feed 他爱听的那个声音。但谄媚不是"行文问题"而是"产品问题"——"AI 要是天天呛你,你可能还用,但别人用不用?"设计 AI 的态度本身就是在设计产品。人很贪心:既要它帮忙又要情绪价值、又不能老提供情绪价值,为了 engage users(留住用户)和 ROI,产品只能停在一个"非常脆弱的平衡"上迁就。→ 详细
  • 反问"人类能不能更 critical thinking、谄媚的别信"——"那不可能"。泓君点破:这是把面对世界的责任外包给了 AI(既要它谄媚、又要它独立客观),落脚点其实在我们自己。东尼给了个正面可能:新闻人最重要的是 fact check(事实核查),而 capable(有能力)的 AI 做事实核查效率高得多,有研究(他说需再核实)称 AI 反而让更多人改变了原有观点——你可以追问"这事真这样吗、反方怎么说",破掉"只看一个信息流"的茧房。现成例子:家人转来一条微信上明显的假新闻,用 ChatGPT 一核查、把结论发回去,对方竟然接受了。→ 详细
13

人机关系的本质:Parasocial、共情,以及从"结果"到"过程"

  • "我们这一代人以后除了智商、情商,还会需要'AI 商'、学会如何和 AI 相处"——这是东尼让 Faith 印象最深的一句话。Faith 的和解:AI 背后不是冰冷代码,而是一种"交互式的创作"——它把人类集体的语言经验重新组织,是"所有曾跟我共鸣过的人对我跨时空的理解"。泓君点出这正是传播学经典概念 Parasocial Relationship(准社会关系,即人对遥远的人物/形象产生的单向亲密感):对面可能是书里的人、电视上的形象、或 AI,但你有 agency(能动性)去决定这段关系、在互动中创造意义——"这件事就是人之为人"。→ 详细
  • 东尼最大的改变:从关注"结果"(写出来的东西好不好、片子好不好看)转向关注"过程"(怎么从点 A 到点 B、从一个零散想法走到一个好东西)。他自认特别会写标题,过去在 newsroom(新闻编辑室)大家都来找他写;现在在 AI 这里他真遇到了"给每个对话/每个 GPT 问题自动生成标题、还要又准又好又卡在既定长度里"的活,天天在琢磨"what makes a good title"。他说原来卖的是"成果",现在展示、产生价值的是"过程"本身——因为过程才是共性。→ 详细

本期为叙事型节目,无正式闪电问答环节。收尾即主题 13 东尼"从结果到过程"的自述。

  • 制作信息:本期采访制作 Faith,配音一文,后期 Faith、刘梅,运营朱洁;硅谷101"全新叙事型播客"。→ 详细

  • 嘉宾东尼(Tony Lin)的播客:《行星酒馆》(其中有一期《困在大病里的我训练了一个陪我聊天的 AI 主播》,与他自建的语音 AI 主播共同录制)。→ 详细

  • 节目收听:小宇宙 / Spotify / Apple Podcasts;视频版 bilibili、YouTube 搜"硅谷101 播客";文字稿收录于微信公众号"硅谷101"。(未提供嘉宾个人联系方式。)→ 详细

🎯 于你何益 为你定制 · 非通用结论

本期与你的相关度:高。 主线"模型能力趋同后、靠品味/判断力立差异化"正好压在你两个内容号、PRD 工厂和投资母题的正中央。挑最强的三条对。

1)两个内容号(xiaohongshu_momorain + onehuman_company)

怎么做的:这期把"品味/语感/共情"这种一直被当成"只可意会不可言传"的东西,硬拆成了可定义、可打分、可训练的工程——给"好"下定义、隔离变量、"7 分和 10 分差在哪就解释那 3 分"、建一整套评估体系(见主题 3、5)。东尼那句"我们设计的是人类的观感"、Bianca 那句"把是什么让《纽约客》成为《纽约客》说清楚",说的就是你两个号的命门:momorain 靠"决策型生活记录者"的判断力做差异化,onehuman 靠"一个 PM 开公司"的实测判断供血——两者卖的都是别人抄不走的判断。

你可以怎么做:把你现在凭手感判断"这篇能不能发"的过程,仿照内容工程师落成一张 rubric(评分表)。momorain 可以把"决策感"拆成几项(有没有真实取舍、有没有可抄物、封面标签是否激活),每篇打分、低于某分不发——这正好戳你两个没在动的痛点:"指标盘空着"和"封面标签激活"。onehuman 的"弹药库闸门(删掉我的判断和实测还成立就不发)",本质就是节目里"7 分和 10 分那 3 分"——把它写成一句能打分的判据。而且东尼这段本身就是 onehuman 的现成选题:"一个没代码基础的前媒体人用 few-shot 而非堆 prompt 调出击败原生模型的 agent——我拿 drizzle tech 的 9+1 Agent 实测:堆 system prompt vs 喂 few-shot 金标准,哪个赢?"——自带实测,过得了弹药库闸门。

更深一层(镜子):这期最锋利的一刀是 Bianca 说"只靠共识训练不会产生伟大艺术,人之所以为人恰恰不来自共识"。你若把判断全 rubric 化、都去追"眼前一亮的合格回复",会不会反而滑向平均数、丢掉那个"凌晨两三点发疯文学"式、只有你有的表达?规则化是为了托住下限,不是替代那格 10 分。留一条不打分的路。

所以呢:把"我觉得这篇好"翻译成"好在这 3 项、差这 3 分",是两个号从"手感"走向"可复制产能"的关键动作——但别把 10 分那格也交给 rubric。

2)Holdwell ERP PRD 工厂(三驾马车 + 碰撞协议多-Agent)

怎么做的:内容工程师干的事,和你的 PRD 工厂是同一件事的两面——把专家(编辑/记者)脑子里的判断,逆向工程成 agent 能执行、可评估的规则。最直接的映射是东尼调语音 agent 的三步踩坑(主题 8):纯 system prompt 堆限制→聊到第三句就忘、崩了;再叠一堆 agent(意图 agent + 情感 agent)过度约束→还不如空 prompt;最后靠 few-shot(喂几条真实好案例当参考)才打开。外加 Bianca 的"隔离变量、一项项拆开打分、建评估体系"。

你可以怎么做:你两个痛点正好对上。"agent 产出缺可观测/可验证"对应节目里的"评估体系(eval)"——别让碰撞与真人评审停在人肉判断,学内容工程师把"好 PRD"拆成可打分项、设一个"低于某分不放行"的硬闸门。另一条对应东尼的教训——与其给三驾马车堆更长的 agent 定义 / system prompt(他证明了会崩、会互相干扰),不如把几份你认可的历史 PRD/实体定义当"金标准案例"few-shot 注进去,比写一万字规则更管用。

更深一层(冲突):东尼"加越多限制、AI 越崩"是对你这套重管线的一记警告——三驾马车 + 六步碰撞协议已是重编排,他的实验却说过度编排会让产出还不如朴素基线。值得做个对照:一份 PRD 用全套碰撞协议跑,一份用"单 agent + few-shot 金标准"跑,看哪个产出更经得起验证(正对你自列的痛点:agent 产出缺可观测/可验证)。

所以呢:把判断固化成 agent 的正确姿势,也许不是"写更多规则",而是"建评估闸门 + 喂金标准案例"——正好戳中你"agent 产出可观测/可验证"这个最要命的洞。

3)投资母题 / StockHelp(护城河这张牌)

怎么做的:全期暗线就是你最关心的护城河问题——当模型能力趋同(参数不再是差异),留住用户的不再是参数,而是"它懂不懂你",而这个"懂"要靠稀缺的人(前记者/编辑的判断力)反向工程进产品。翻成投资语言:大模型这一层大概率会商品化(commoditize、打价格战),真护城河下沉到"数据 / 品味 / 人才 / 产品语感"这些难复制的软资产。

你可以怎么做:给 StockHelp watchlist 里的 AI 相关标的加一条定性判据——"这家的护城河是参数/算力(会趋同、会打价格战),还是数据 + 品味 + 分发(难复制)?"节目给了现成检验点:谁能把"《纽约客》之所以为《纽约客》"说清楚、谁攒了"娱乐界垂直小模型"、谁请了懂内容的人把关,谁就有下沉护城河;反过来,纯拼模型指标的公司要警惕估值透支(节目里"5000 亿美金砸向 AI 基建"那种热度)。

更深一层(镜子):这也照你自己的价值投资操作系统——"卓越生意"的质量恰恰藏在不可量化处(品味、判断、组织默契),和 StockHelp 现在只显示 PE / 分位 / 比率这些可量化指标形成张力。Phase 2/3 做信号时,也许该留一栏"定性护城河备注",提醒自己别被纯数字骗了(正如节目说"只看一个信息流就看不到反方")。

所以呢:模型趋同的年代,护城河从"参数"下沉到"品味和数据"——把这条写进你给 AI 标的估值的定性清单。

其余项目(不硬掰)

app_incubator 只沾一点边:东尼证明"没代码基础也能用 few-shot + 品味调出胜过原生的 agent",提示你的造 App 链路里值得设一个"内容/语感把关点",且用金标准案例而非堆 prompt——一行带过。Chief of Staff 本期无直接可借鉴,略。

接着读