本期为大会 keynote(20 分钟单人演讲),无问答/闪电轮环节。收尾即主题 11 的"看不见的金子"+"激动人心的时代就在前方"。→ 详细
字幕中未提供嘉宾联系方式。身份信息:Benoit Schillings,Google DeepMind 研究副总裁(VP of Research),前 Google X 出身。→ 详细
他怎么说:Benoit 的整场演讲其实是在给"哪些能力贬值、哪些能力升值"划线。贬值端说得毫不留情:语法生成已是超人水平,"你可以争辩、可以找反例,但那个时代已经过去了"。升值端他点了三样,全都是判断力而非执行力:① 规格化能力——"写代码容易,但把一个问题真正需要什么讲清楚,难得多";② 归纳式思维——在宏观上下文里看系统、发现模式、据此决策;③ 架构级判断——Jeff Dean 那种"怎么设计系统让你十年后不追悔莫及"的思考。注意他的措辞:这些不是"人类永远的堡垒",而是"至少近期"人类占优——他连自己 45 年的手艺都承认看走眼过("英语不是编程语言……我错得离谱")。
你可以怎么做:你 2021 年写下"判断力 > 努力"时是价值观,这期把它变成了可操作的职业资产负债表——把你日常工作按他的三条升值线归类:写 PRD 里"这个功能到底解决什么问题、边界在哪"是规格化;从客户杂音里看出"这类跨境卖家都卡在同一个流程"是归纳;"这个模块这样设计,两年后接新业务不用推倒"是架构判断。凡是落在这三条线上的活,是你该 all-in 的"编码下注";凡是能被"吐 token"完成的活(初稿、格式化、翻译需求为字段),主动让 AI 干、且干得越早越好——他那句"承认语法之战已结束,才能看清剩下的仗在哪打"对 PM 同样成立。
更深一层(镜子):Benoit 的鄙视链自白(汇编→怀疑编译器→看不起 GC→今天用 vibe coding)是一面很准的镜子——每一代专业者都把"我熟练的那层"当成"真正的专业"。你此刻对某些 AI 产出的不信任,有多少是判断、有多少是"汇编工程师看编译器"?他的解法不是放弃怀疑,而是把怀疑升维:不再检查每行输出(没人看编译器的汇编了),而是把验证机制建在更高层(测试、护栏、评测)。
他怎么说:他描述的软件新流程和你的 PRD 工厂结构惊人同构:代码(≈你的 PRD 产出)近乎免费、量会爆炸、没人会逐字读——他预测一年内没人看模型生成的代码,就像没人检查编译器的汇编。那怎么保质量?他的答案不是"人回去读",而是三件事:① 主动护栏(active guardrails)——但他警告"检测→修补"是永无止境的猫鼠游戏,圣杯是让生成方从一开始就写对(他团队正攻关此事,承认"非常难,因为高度依赖上下文");② 教模型做正确的规划/问题分解——"哪种分解方式带来最好的清晰度";③ 改评测——SWE-bench 只测"能不能跑通"所以"臭名昭著",要加开放式问题。
你可以怎么做:对照你的碰撞环节和真人评审:如果评审是"生成后逐份人审",那就是他说的"检查汇编输出"——量一上来必然失守,这正是"真人评审意见回炉难闭环"的深层原因。照他的三件事迁移:① 把最常见的评审驳回理由前移成生成时的硬约束(agent 定义里的护栏),而不是留给事后评审去挑;② 他说圣杯是"让生成方从一开始就写对"、难在"高度依赖上下文"——你让 tech-lead 对着隔壁真实代码仓干活正是这个思路;六条产品线的跨线领域事实同理,模型写不对往往是因为没有可依赖的事实层;③ 你的评审别只测"PRD 格式齐全"(≈SWE-bench 式跑通),要加开放式质检——比如让另一个 agent 拿 PRD 反推"这功能上线后哪里会出岔子"。app_incubator 的"设计稿即工程强制契约"同理:那就是他说的"把正确性负担压到生成方身上"的一种语言设计。
所以呢:人不留在"读产出"层,留在**定义"什么叫对"**的层——写护栏、备好领域事实层、设计评测。
他怎么说 → 可迁移的思维模型:① "瓶颈迁移"史观:软件三时代的划分逻辑是"每个时代的稀缺资源不同——机器算力→人脑 7-9 token 的工作记忆→规格与验证"。这是一个通用透镜:任何行业剧变,先问"旧稀缺是什么、新稀缺是什么",价值总是流向新瓶颈。② "关屋子喂披萨"self-play 模型:变强 = 给自己出可自我验证的挑战并反复打磨——对个人学习同样成立,你的复盘/看板若没有"可验证"这一环(预测→对答案),就只是记录不是训练。③ "看不见的金子":人类的直觉是丛林进化训练出来的,"不是用来搞量子计算的"——对"什么是好解法"的强烈直觉本身可能就是偏见,这和你"接受现实、不抗拒"的操作系统同源,但更进一步:主动借用一个非人类视角(AI、数据、外部人)去照自己看不见的角落。
所以呢:入库时建议挂 mental-models 主题,"瓶颈迁移"和"self-play 可验证挑战"两条最值得做成原子笔记。
StockHelp / 投资、小红书号与本期无直接关联(通篇是软件工程与模型研究,无商业模式/估值/内容视角),略过不硬掰。
怎么做的:Benoit(DeepMind 研究 VP,写了 45 年代码)敢预测"一年之内,模型生成的代码将没有人真正去看——就像今天没人检查编译器输出的汇编";他的保质量答案不是人回去读,而是护栏前置、教模型正确分解问题、改评测——"人留在定义'什么叫对'的层"。
你可以怎么做:这是给新号的一篇高含金量 C 类——候选标题《DeepMind VP 说"一年内没人会读 AI 写的代码",我在自己的 AI 公司试了:两周一行不读,只靠验收放行》:把 drizzle tech 的质检从"你翻代码"切成"QA 角色 + 验收清单放行",记录漏网 bug 数、返工成本、你省下的小时数,最后给判断(含诚实反驳:什么规模以下这样做是作死)。可抄物是那份验收清单。删掉实测就只剩转述预言——不发。
怎么做的:他给行业算的账:"整个软件工程文化建立在一个假设上:写代码是最难、最贵的部分。而现在写代码已经免费或近乎免费了。"升值的三样全是判断力:规格化、归纳、架构——"写代码容易,把一个问题真正需要什么讲清楚,难得多。"
你可以怎么做:这是一篇 D 类观点短评的骨架,立场句现成——"一人公司最贵的成本从来不是开发,是想清楚。"(引 Benoit 的假设崩塌论做背书)用你自己的账坐实:晒一个月的 API 账单 vs 你花在"定义什么叫对"上的时间分布,可抄物是"一人公司成本结构表"。这个立场可反驳(获客比想清楚更贵的人大有人在),正好符合 D 类要有对立面的要求;而且它同时是你"验证派/想清楚"定位的定桩文——值得排进 Phase 0 存稿。
对你的镜子:他的鄙视链自白(汇编→怀疑编译器→今天 vibe coding)也照向办号者——你对"AI 写的内容/代码不放心"的那部分怀疑,别用逐行检查解决,用更高层的验证机制解决;这本身就是你新号最该反复讲的工作方式。
所以呢(总):这期最值钱的不是任何一个技术预测,而是一位写了 45 年代码的人当众演示"如何优雅地承认自己那层手艺贬值、然后把赌注挪到上一层"——你在 PM 这行正站在同一个楼梯口,他挪注的方向(规格化、护栏、评测、架构)就是你 PRD 工厂和职业下注可以直接抄的方向。