ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.74
第 74 期 · 思维模型 · 收录于 2026 年 8 月 15 日

未来工程师的判断力

AO
Addy Osmani · AI Engineer
视频 18:25 原文约 1.7 万字 预计阅读 11 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 17:53
TL;DR · 三句话
  1. 当写码被 agent 自动化,工程师的价值从"产出代码"转向"选择什么值得做、并为结果负责"——未来的工程师由"能选择什么值得做的人"来定义,掌握证据、理解与最终裁决。→ 详细
  2. 生成变便宜不等于评审变便宜:agent 能交付的远超人能评审的量,稀缺资源变成"有证据支撑的判断力";速度、记忆、验证甚至品味都会随模型前沿推进而衰减,唯有"可问责性(answerability)"——署在工作上的那个签名——半衰期最长。→ 详细
  3. 一条可操作的铁律:解释不了就别上线(Explain it or don't ship it);自动化只是抬高所有人的地板,瓶颈从"能不能做出来"挪到"该不该存在、能不能为它负责"——把工厂建起来,让灯亮着,守住裁决权。→ 详细
01

未来工程师的定义:能选择"什么值得做"的人(标题即论点)

  • Addy 开场就把落点放在"人"而非架构:"未来的工程师,将由能够选择什么事情值得做的人来定义。" 他们要掌握三样东西——证据(evidence)、理解(understanding)、以及最终裁决(verdict);面对越来越多由 agent 完成的自动化工作,这些都得由人来负责。→ 详细
  • 他特意澄清"裁决"不是当法官,而是为生产决策负责:这东西要不要上线?要不要拦下来?转向、还是接受风险?——写码这件事本身正被自动化,但"拍板"这件事不能被外包。→ 详细
  • 一句话点破价值迁移的机制:"质量只是产出证据,而裁决是分配责任。" 稀缺的不再是把任务做完,而是知道该做什么、谁担责。→ 详细
02

answerability(可问责性):从哲学话题变成工程硬要求

  • 全场的核心新词。白话:出了事,谁能站出来为这个决定解释、背书、担责。 Addy 的原话——"可问责性正是让我们能够为一个裁决背书的东西。"→ 详细
  • 为什么现在变硬?因为 AI 生成 / 辅助的代码正在变成"普通代码"。他引 Sonar 2026 调研:AI 辅助代码已不再是边缘现象,在代码库里占比越来越大。"一旦到了这个地步,可问责性就不再是个哲学话题,而变成了一项工程需求。"→ 详细
  • 它要能回答一串"硬问题":模型到底有没有碰过这个文件?那项工作受什么约束引导?产出了什么证据?接受了什么风险?谁为结果负责?——这些正是 answerability 要落地成的东西。→ 详细
03

角色围绕"工作本身"重组

  • 引 Boris Cherney 的语言:旧职业边界正变模糊,角色围绕工作重新组合;重要问题从"你的头衔是什么"变成**"你能拥有(own)系统的哪一部分"**。他喜欢的分类:prototype(原型)/ build(构建)/ sweep(清扫)/ grow(增长)/ maintain(维护)五种真实工程模式,agent 都能帮,但稀缺的是知道产品需要哪种模式、适用什么质量标准、谁为结果负责。→ 详细
04

为什么会发生:harness → loop → software factory

  • harness engineering(挽具工程):coding agent = 模型 + 套在外面的 harness(上下文、工具、文件系统、Git)。白话——harness 就是那层"外壳 / 挽具",把"智能"变成你能放心委托出去的东西。→ 详细
  • loop engineering(循环工程):不再只提示一次运行,而是设计能持续提示、检查、记忆、并决定下一步的系统;到这一步 agent 开始"像基础设施"。三者合起来 = software factory(软件工厂):agent 在内循环里跑、产出证据,而生产决策仍由人做。→ 详细
  • 他对风向的判断很关键:"风向并没有把我们从循环中吹走,而是把人类判断推向了杠杆率最高的检查点。"→ 详细
05

clean code 也是在帮"下一个 agent"(附数据)

  • 过去讲究干净代码是为下一个人读得懂;现在它还帮下一个 agent。Sonar 研究:干净仓库和混乱仓库通过率大致相同,但干净代码消耗 token 更少、返工更少——可维护性能实实在在转化成"工厂"的效率。→ 详细
06

生成变便宜 ≠ 评审变便宜:不信任却没带宽

  • 一组扎心数据:96% 的人不完全信任 AI 代码,却只有约一半会在提交前坚持验证——Addy 称之为"有不信任,却没有带宽(distrust without bandwidth)"。→ 详细
  • 他的解法不是喊口号,而是工程:"安全感来自于让验证变得更便宜、更清晰、更难被跳过。" 视角从单个评审者拉到整个组织——当治理(governance)跟不上、采用速度远快于任何公司制定政策的速度时,评审与验证就会变成瓶颈→ 详细
  • 关键升级:当任务从 30 秒的一次运行,变成小时级 / 天级的长程(long horizon)工作流、还并行跑很多个时,"评审就不能只是最后瞄一眼——它必须变成一整套控制系统。"→ 详细
07

alpha 与 decay:你的优势有一个倒计时

  • 两个借自投资的术语。alpha = 你今天能做到、而当前模型还做不到的那段"能力差"(投资里指超额收益);decay(衰减) = 悬在这段差距头上的倒计时。→ 详细
  • 冷酷的规律:"如果让你与众不同的是某种能力,那么前沿(frontier)终究会追上它。" 这也是"品味(taste)"这个词不断被提起的原因。→ 详细
  • 引 Paul Graham:"当任何人都能做出任何东西时,选择做什么就变得非常重要。"但 Addy 立刻提醒:"品味很容易变成一个魔法词,用来指代工作中我们暂时不想解释清楚的那部分。"→ 详细
08

品味不是永恒护城河——它也是 alpha,会衰减

  • 更好的定义(Mitchell Hashimoto):"品味,是在尚不存在客观度量标准的地方,做出高质量定性判断的能力。" 它把品味放在了 benchmark 之前、市场充分投票之前。→ 详细
  • 但品味同样会衰减——随着模型从示例和偏好中学习会被"重置"。所以它最好的形态不是故弄玄虚,而是"做出更好的决策,并留下你的团队和系统都能学习的示例"→ 详细
  • 衰减测试(decay test):速度衰减了、记忆力衰减了(harness 有 memory 了)、验证在被搬进 evals / 静态检查 / 模型自我批评;连判断力"在某种程度上也是一个斜坡,而不是一堵墙"。正确策略不是死守某一项能力,而是"不断把我们的优势往上挪一个层级"。→ 详细
09

战略问题换向:不是"agent 能做什么",而是"什么只有人能负责"

  • "'agent 能做什么'不再是最好的战略问题——因为 agent 做不了的事情清单只会越来越短。" 更好的问题是:什么事情只有人类能够为之负责(answerable)?→ 详细
  • 不是因为人有什么魔力,而是因为有些决策确实需要所有权(ownership):需要上下文、需要接受风险、需要在工作上线之后继续担责。这就是为什么"工程师"这个词得变得再严格一点。→ 详细
  • 他顺势扩了"工程师"的定义:不只是"会写代码、能把东西做出来"的人,而是能对系统推理、思考约束、为权衡辩护、管理风险、出事时被找得到的那个人。→ 详细
10

三个要避免的坑:认知负债 / 认知投降 / 编排税

  • ① 认知负债(cognitive debt):你对"如何解决问题"的理解与记忆被侵蚀——用 agent 越多越明显(Addy 说"我自己就深有体会")。落到代码上就是委托负债(delegation debt):构建通过了测试、PR 能合并,但团队逐渐丧失解释"自己正在上线的这个系统"的能力→ 详细
  • ② 认知投降(cognitive surrender):盲目接受 AI 的回答。委托是"把活干了,给我看足够证据让我判断"——判断仍在我手里;投降是"在我形成任何看法之前,你的答案就已经是我的答案"。Wharton 研究亮了盏警示灯:AI 答错时,73% 的人依然选那个错答案,而且反而觉得更有把握——失败模式不是"用 AI",而是"借来的自信(borrowed confidence)"。→ 详细
  • ③ 编排税(orchestration tax):并行跑几百上千个 agent,不等于"你"变多了。"你的认知带宽是无法并行化的。" 你创建的每个 loop 都带来更多要路由、合并、验证、集成的决策。解法不是减少 agent,而是**"像设计系统一样设计你的注意力:你在哪里介入、要求什么、复用什么。"**→ 详细
11

signature(签名)的半衰期,比任何一项能力都长

  • 职业发展的"数学题":一项优势的半衰期,可能就是一次模型发布——速度、记忆、验证、甚至品味,都随前沿推进而移动。但你的签名(signature)——信誉、专业声望——半衰期要长得多。→ 详细
  • 签名 = 署在工作上的名字:那个人、那个团队、那个机构,为实际交付的东西背书的主体。一句收束:"技能能赢得杠杆,而问责能把杠杆转化为信任。"→ 详细
12

内循环=能力,外循环=能动性;顶端动作是"辨别力"

  • "执行和责任是两码事。agent 可以照着你的 runbook 走,但它无法继承后果。" 出问题时要问:谁理解那条政策?谁接受了那个风险?谁为爆炸半径(blast radius,即故障波及面)负责?→ 详细
  • 高能动性(high agency) 不是"所有事我亲自干"(根本没法 scale),也不是表演式拼命(hustle theater),而是**"附带判断力的所有权"**:知道何时委托、何时检查、何时叫停、何时把名字签上去。能动性阶梯(agency ladder)顶端最稀有的动作是辨别力(discernment)——发现问题后判断它值不值得投入,不值得就放手。→ 详细
  • 落成运作模型:内循环(调查 / 实现 / 测试 / 汇报)交给 agent = 能力(capability);外循环(决策 / 验证 / 批准 / 担责)仍是工程 = 能动性(agency)。 边界不是"人类看一眼 AI 输出",而是——agent 返回证据(diff、测试、日志、trace、截图……),"然后真正的工程才开始:决定这活值不值得做、验证证据够不够、批准或转向或为进入生产的东西负责。"→ 详细
13

一条铁律与一个乐观结论:Explain it or don't ship it

  • 可操作规则:"解释不了,就别上线(Explain it or don't ship it)。" 不是要人手敲 / 手读每一行,而是必须有人对这份工作理解到足以为它辩护。类比大型 / 企业代码库的 owners 文件:你的每一块架构到底由谁负责?→ 详细
  • 临近结尾要记住的一点:"自动化抬高的是所有人的地板。" 工程会继续往上走一层,新工作可能是 loop 设计、证据设计、存量系统(brownfield)守护——敲键盘变少不等于工程变少,而是有更大的面需要品味、验证、所有权,归根结底是"用心(care)"。→ 详细
  • 乐观的历史规律:每次让写软件变得更容易(高级语言、框架、云、低代码),人们都预测世界会需要更少软件,结果恰恰相反——成本一降,潜在需求就冒出来。agent 会做同样的事:不消灭工程工作,而是把瓶颈从"我们能不能做出来"挪到"这东西该不该存在、我们能不能为它负责"→ 详细

本片为个人主题演讲(AI Engineer 大会闭幕 keynote),无 lightning round。收尾是 Addy 的三句箴言式行动号召:"把工厂建起来,让灯一直亮着,守住最终裁决权(Build the factories, keep the lights on, own the verdict)。" 一句话浓缩全场——工厂交给 agent 建、系统交给 loop 维持,但那个"拍板"永远是你的。→ 详细

演讲中未留联系方式。Addy Osmani 为 Google Chrome 团队工程负责人、《Learning JavaScript Design Patterns》等书作者(公开身份),本片系其在 AI Engineer 大会的闭幕演讲。

🎯 于你何益 为你定制 · 非通用结论

这一片跟你的相关度是满格。它几乎是一句一句在讲你正在做的事:你不是在"看别人怎么想 AI 时代",而是在照镜子——Addy 描述的"工程师",和你 2021 年给自己写的那套操作系统、以及你手上两条 Agent 造物流水线,是同一个东西的两种说法。所以这段写满。

🪞 镜子(先看这个):标题就是你操作系统的工程版

Addy 全场的中轴——"未来的工程师是能选择什么值得做的人""瓶颈从'能不能做出来'挪到'该不该存在'"——跟你 2021 写下的三条几乎逐字对应:"判断力 > 努力""问'该不该做'先于'做多快'""99% 的努力终将白费,盯那 1%"。他那句 "能动性不是追逐每一条路径,而是决定哪些路径配得上你的所有权和注意力",就是你"盯那 1%"的工程版原话。你不用被这片说服,你只需要确认:你五年前凭直觉写下的东西,现在成了一个 Google 工程负责人在大会上收尾的论点。这条线("PM / 工程师在 AI 时代的价值")从此有了工程侧的权威镜像,可以直接引。

Holdwell ERP · 多-Agent PRD 工厂(最硬的落点)

他怎么做的:把 agent 工厂拆成一条清晰边界——内循环 = 能力(agent 调查 / 实现 / 测试 / 汇报),外循环 = 能动性(人来决策 / 验证 / 批准 / 担责);两者之间流动的是"证据",而放行的闸门是一条铁律——"解释不了就别上线(Explain it or don't ship it)"。他还搬出企业代码库的 owners 文件:每一块到底"由谁 answerable"。

你可以怎么做:你的痛点表上写着**"碰撞协议纪律是否真执行""真人评审意见回炉缺闭环""agent 产出可观测/可验证 + 跨线对齐"**——Addy 这场演讲基本是逐条给你钥匙:

  • 纪律的强制点 = "Explain it or don't ship it" 落成一道显式关卡。 你的碰撞协议每一步产出(独立初稿、碰撞三件、合成定稿),都必须附一个"证据包"(他列的 diff / 测试 / rationale / trace,翻译到 PRD 就是:决策依据、碰撞记录、风险与接受项、owner 签名)。解释不清 / 证据不全 = 不放行。 这比"提醒要评审"硬,因为它把"通过"重新定义成"有人能为它辩护"。
  • "真人评审意见回炉缺闭环" = 他说的"evidence design"。 他反复讲评审不能是"最后瞄一眼",而要变成"一整套控制系统"——你的真人评审就是那个 outer loop,把"意见按归属回炉、全量快照重出"焊成不可跳过的硬步骤而非事后走查,闭环证据自然就有了(证据是被流程逼出来的,不是补出来的)。
  • 六条产品线强耦合、跨线对齐难,本质是"这块由谁 answerable"没定。 直接搬 owners 文件模型:给每条产品线 / 每个跨线共享的实体指定一个 answerable owner,跨线联动的"乱"很多时候是"无主"的症状。

app_incubator · 7-Agent 造 App(这里有个冲突,值得反着用)

你的痛点写着要**"把'该做什么'前移到 agent"。Addy 的框架在这一点上会踩你一脚刹车**,而这脚刹车恰恰有用:他把"该不该存在(should this exist)"这个 discernment 决策,明确划进外循环、留给人——"agent 能选择、能路由、能上报,但执行和责任是两码事,它无法继承后果。"

怎么用这个冲突:把"该做什么"拆两层——可委托层(枚举方案、生成 10 个首屏变体、跑测试、出证据)尽管前移给 agent,越前移越好;但裁决层("这 10 个里哪个配得上存在""接受什么风险上线首屏")保留在人手里,并显式产出证据。你已经在做的"设计稿即工程强制契约",用 Addy 的话说正是一种证据设计——契约就是那个可问责的证据载体,方向完全对。别把裁决层也一起前移了,那不是自动化,是 Addy 说的"认知投降"。

StockHelp · 价值投资(alpha/decay 本就是投资语言)

Addy 直接借了投资术语讲能力:"一项优势的半衰期可能就是一次模型发布,但签名(信誉 / 护城河)的半衰期长得多。" 这跟你选股时问的是同一个问题:一门生意的"边",是会被一次技术 / 政策发布抹平的临时 alpha,还是半衰期很长的 signature(真护城河)

可迁移进 StockHelp 的选股心智:在看板 / 笔记里显式区分标的的"临时领先"与"结构性护城河"——只为后者付估值溢价,前者给折价甚至回避。另外他那条"借来的自信"(AI 答错时 73% 的人反而更笃定)是投资里最贵的心态;你坚持的能力圈 + 安全边际,正是对冲"借来的自信"的护城河——别让一个跑得飞快的 agent / 一份漂亮的研报,替你完成本该你自己做的判断。

职业 / 本人精力(元约束——第二强命中)

"编排税"这一段是直接冲着你来的:"跑更多 agent 不等于'你'变多了,你的认知带宽无法并行化。" 你一个人扛正职 + ERP 工厂 + app_incubator + StockHelp + 小红书 + CoS + 这本第二大脑——本质就是在给自己叠加编排税:每开一条线,都多出一批要你路由 / 合并 / 验证 / 拍板的决策。

他的解法就是你的"杠杆 > 工时""每周留一天思考"的操作化"像设计系统一样设计你的注意力:你在哪里介入、要求什么、复用什么。" 把它当成多线管理的硬指令——不是砍项目,而是在每条线上明确**"我只在裁决点介入"**,其余交给 agent / 流程,且刻意复用(一套 gate、一套证据模板跨项目共用)。还有一个安慰剂式的真相:你是 PM 不是 coder,而 Addy 全场论证的那个"半衰期最长的 signature"——answerability、判断力、选择什么值得做——本就是 PM 的母语。AI 把工程师往你这边推,对你是顺风,不是逆风。

One Human Company 新号(2026-07 回填)

怎么做的:Addy Osmani(Google Chrome 工程负责人)给 agent 工厂立了一条铁律——"解释不了,就别上线(Explain it or don't ship it)":不是人手读每一行,而是必须有人对这份工作理解到足以为它辩护;agent 交回证据(diff、测试、日志),"然后真正的工程才开始"。

你可以怎么做:一篇现成的 C 类——《Addy Osmani 说"解释不了就别上线",我把它写进了 AI 员工的下班规则》:给 drizzle tech 的交付节点加一道"证据包不全 = 不放行"的关卡,跑两周,交前后返工率、被拦下的真实案例和 API 账单变化。这同时是 B 支柱最独占的"绩效制度"素材(AI 员工的 KPI 不是产出量,是证据质量)。闸门自检:没有你的被拦案例和数字,这篇只是转述 keynote,不成立。可抄物:交付证据包清单。

怎么做的:他借投资语言讲职业——alpha(你比模型强的那段差)自带衰减倒计时,"一项优势的半衰期可能就是一次模型发布";半衰期长得多的是 signature(签名/信誉):为交付的东西署名背书的那个主体。配套的扎心数据:"生成变便宜 ≠ 评审变便宜",96% 的人不信任 AI 代码、只有一半会验证。

你可以怎么做:这是给你"办号"本身的定位背书——你的验证派独占词「想清楚/决策」,押的正是 signature 而不是能力 alpha:AI 让"写内容"免费之后,账号里唯一不衰减的资产就是"momorain 验过、momorain 为结论署名"这个签名。落成经营动作:每篇 C 类结尾固定署一句"我的判断 + 我接受的风险",把签名做成栏目资产;存稿期选题也用这把尺子筛——只写"以我的实测为证据"的题,不写会被下次模型发布抹平的技巧贴。

怎么做的:他警告的头号翻车是**"认知投降 / 借来的自信"**——Wharton 研究:AI 答错时,73% 的人依然选那个错答案,而且反而觉得更有把握。委托是"给我看证据、判断在我";投降是"你的答案直接成了我的答案"。

你可以怎么做:一句现成的 D 类立场句候选:"AI 时代最贵的成本不是 token,是借来的自信"——用 73% 这个数字开头,配你自己一次"照收 AI 初稿结果翻车"的真实返工案例(B 类翻车账素材同源),立场可反驳、案例独占,闸门稳过。

所以呢(一句收束 + 一个立即动作)

这片子的一句话标签:"你的操作系统 · 工程版。" 如果只做一件事——把 "Explain it or don't ship it" 写进 Holdwell PRD 工厂的评审环节,作为"碰撞纪律与评审回炉缺闭环"的补丁:产出附不上能为其辩护的证据,就不放行。它一箭双雕——既让工厂的评审真正有强制力,又是你个人精力的护栏(只在裁决点署名,其余放手),顺带把"该不该做先于做多快"从一句价值观,变成一条系统里真正拦得住东西的规则。

接着读