

转折前是"还算有帮助"而非"惊艳"。过去一年 Karpathy 一直在用 agentic 工具(参照物是"类似 Alpha Code 那一类"——能自主写代码的 AI),原话:"它在生成一段段代码(chunks of code)这件事上已经做得很好了。有时候会出错,你得自己去改,但总体还是挺有帮助的。"——一个"能用但要盯着"的阶段。→ 详细
2025 年 12 月是"明确的转折点(clear point)",触发条件很具体:他在休假、时间更多。体感是层层递进的——"用最新这些模型,生成出来的那一段段代码就是没问题。然后我接着让它生成更多,结果还是没问题。然后我想不起来上一次去纠正它是什么时候了。再然后,我就越来越信任这套系统。然后我就开始 vibe coding 了。"注意这条因果链:质量稳→敢加需求→不用改→信任度上升→彻底放手。他特意在 Twitter/X 上反复强调"你得重新看一眼":"很多人去年体验的 AI 更多像 ChatGPT 那类,但你真的需要再重新看一眼,而且得从十二月这个时间点去看,因为情况已经发生了根本性的变化(changed fundamentally),尤其在这种 agentic 的、连贯的工作流(agentic coherent workflow)上,它真的开始能跑通了。"结果是一头扎进"无穷无尽的副项目(infinity side project)"兔子洞——"我的副项目文件夹现在塞得满满的,里面全是各种乱七八糟的东西,我就是一直在写代码。"→ 详细

编程范式三跃迁:1.0 人写显式代码(每条规则一行行写清);2.0 用数据"训"出权重——"我其实通过创建数据集、训练神经网络来'编程',编程某种程度上变成在组织安排数据集,可能再加上一些优化目标(objectives)和神经网络架构";3.0 LLM 本身变成一台"可编程的计算机"——"如果你在足够庞大的一组任务上训练这些 LLM,本质上是隐式地(implicitly)训练,因为你在整个互联网上训练、不得不同时处理(multitask)所有那些任务,这些模型某种意义上就变成了一种可编程的计算机。"于是"你的编程现在变成了写 prompt,而 context window 里的内容就是你操纵那个'解释器'(interpreter)的杠杆,这个解释器就是 LLM"。把 LLM 类比成 CPU/解释器、prompt 类比成程序,是理解整场对话的总钥匙。→ 详细
Open Claw 安装:按 1.0 直觉装软件该是 bash/shell 脚本,但"为适配很多平台、很多电脑,这些脚本通常越来越臃肿、极其复杂";3.0 的方式是"把一大段文本复制粘贴给你的 agent……它就会帮你装好"——"你不必精确写清每个细节,agent 有它自己的智能,去看你的环境、执行一系列智能操作让事情跑起来,并在循环中自己调试问题(debugs in the loop)"。他一句点破新范式:"要复制粘贴给你 agent 的那段文本是什么?这才是现在的编程范式。"MenuGen(更极端):痛点是"去餐厅菜单没图片,大概 30% 甚至 50% 的菜我不知道是什么";旧范式(他真写的 app)= 上传照片→跑 Vercel→OCR 出菜名→图像生成器配图→重渲染整份菜单;3.0 版本 = "拍下照片交给 Gemini,说'用 Nano Banana 把这些叠加到菜单上',它就返回一张图、把不同菜品真的渲染进了像素里(into the pixels)"。结论很重:"我整个 MenuGen 都是多余的(spurious),那个 app 根本就不该存在。"3.0 的形态"要原始得多(a lot more raw)——神经网络承担越来越多工作,你的 prompt/context 就是那张图片,输出也是图片,中间根本不需要 app"。更普遍的洞见:这不是"编程变快",是"信息处理(general information processing)整体可自动化"——以 LLM 知识库 项目为例,"让 LLM 为你的组织或个人创建 wiki,这甚至不是一个程序,是以前根本不可能存在的东西",可以"拿这些文档用另一种方式重新'编译'(recompile)、重排,创造全新的东西"。他强调真正兴奋的不是"现有东西变快"而是"以前根本不可能的全新事物","我甚至觉得那些更让人兴奋"。主持人追问引出下一段:2026 年的"相当物"会是什么(像九十年代做网站、2010 年代做 app、上一个云时代做 SaaS)——"有什么东西事后看会显得理所当然、但今天基本还没人去做(mostly unbuilt today)?"→ 详细
把 MenuGen 推到底是"完全由神经构成的计算机"——"喂原始视频/音频进一个基本上是神经网络的东西,用 diffusion(扩散模型)渲染出一个 UI,这个 UI 为那个特定时刻而独一无二定制(unique for that moment)",界面不再写死、由模型实时"画"出来。历史类比:"计算早期人们对'计算机会像计算器还是像神经网络'有些困惑,五十、六十年代走哪条路并不明显,最后走上了计算器那条路、构建出经典计算(classical computing),神经网络现在是虚拟化地跑在现有计算机之上的。"他预测这会"反转"——"神经网络变成'宿主进程'(host process),CPU 变成某种'协处理器'(co-processor)",依据是台上那张图"智能计算正向神经网络转移,将成为占主导地位的算力支出(dominant spend of flops)"。终局:"神经网络承担大部分繁重工作,把工具调用(tool use)当作历史遗留的附属物(historical appendage),只用来处理某些确定性任务。"他诚实补一句:这是"极其陌生(extremely foreign)"的终点,"我们大概会一点一点走到那里",但"那个演进过程还有待观察(TBD)"。→ 详细

主持人追问:品味和判断会不会随时间变得没那么重要,还是上限会一直抬高?Karpathy 的诊断——现在审美差,是因为它"不在 RL 里":"我是希望它会变好的。它现在之所以没变好,原因还是同一个:它不是 RL 的一部分。大概没有什么'审美'的代价或者奖励(no aesthetics cost or reward),或者说还不够好。"(接第五节:"可验证性"——审美难以被自动判分,所以训练里没法给奖励、这块就弱。)他看 agent 代码"心脏病发作":"有时候我会有点心脏病发作的感觉(a little bit of a heart attack),因为它并不总是超级惊艳的代码,非常臃肿(very bloated)、有大量复制粘贴、还有一些笨拙脆弱的抽象(awkward abstractions that are brittle),能用,但真的很难看(really gross)。" micro GPT 项目·"像拔牙":那个项目里他想把 LLM 训练简化到尽可能简单,"模型很讨厌这件事(hate this),它们做不到。我一直试图 prompt 它再简化一点,它就是做不到。你会感觉自己处在 RL 的电路之外(outside of the RL circuits)……很明显你是在'拔牙'(pulling teeth)。"但他强调这不是天花板:"没有什么根本性的东西在阻止它变好。几乎就是实验室还没去做这件事而已。"→ 详细
框架来源:Karpathy 写过一篇"很发人深省"的文章,核心是"我们不是在构建动物(building animals),我们是在召唤幽灵(summoning ghosts)"——这些是参差不齐形态的智能,"由数据和奖励函数(reward functions)塑造,而不是由内在动机、乐趣、好奇心或掌控感(intrinsic motivation, fun, curiosity, empowerment)塑造,而后面这些某种程度上是通过进化产生的"。为什么这框架重要:"如果你对它们'是什么、不是什么'有一个好的模型,那你在使用它们时就会更有胜任力(more competent)。"他坦诚自己也不确定这框架"是不是真有什么实在的威力",承认"有点哲学思辨的味道"。实操含义:接受它们不是动物智能——"你冲它们吼,它们不会因此干得更好也不会更差,根本没有任何影响。它们其实就是一堆统计性的模拟电路(statistical simulation circuits),底层是预训练(也就是统计),然后在这之上又栓上了 RL(RL bolting on top)。"——一个生动的两层结构:地基是"统计"(预训练),上面"栓"着一层强化学习。这套框架的价值不在于给"五个明显办法",而在于"对它保持一种警惕(being suspicious of it),随着时间慢慢摸索出来"。→ 详细

本场为单一主题的炉边对话,无独立 lightning round(闪电问答),收尾停在教育话题(见第十五节)。Karpathy 的收尾金句(带着自嘲与好奇):"我很期待过几年再回到这里,看看我们是不是已经被彻底自动化、踢出了这个环路(fully automated out of the loop),而它们真的连'理解'也一并搞定了。"——把全场两条暗线收在一起:一边是"自动化一切"的乐观外推,一边是"理解暂时无法外包"这道人类护城河;他想看的是这道护城河几年后还在不在。→ 详细
"我想不起来上一次去纠正它是什么时候了。"——12 月转折的体感临界点。→ 详细
"要复制粘贴给你 agent 的那段文本是什么?这才是现在的编程范式。"——软件 3.0 一句话定义。→ 详细
"我整个 MenuGen 都是多余的,那个 app 根本就不该存在。"——旧范式被端到端模型抹平。→ 详细
"传统计算机自动化你能用代码指定的,这一轮 LLM 自动化你能验证的。"——可验证性总纲。→ 详细
"怎么可能 Opus 4.7 一边能重构十万行代码、找 zero-day 漏洞,却告诉我走路去洗车场?这太离谱了。"——jagged intelligence 画面。→ 详细
"10 倍并不是你能获得的加速幅度。"——顶尖玩家远超 10x。→ 详细
"我们不是在构建动物,我们是在召唤幽灵。"——理解 AI 本性的框架。→ 详细
"你可以外包你的思考,但你没法外包你的理解。"——全场题眼。→ 详细
vibe coding(凭感觉编程,抬高下限)|agentic engineering(智能体工程,守住质量底线)|软件 1.0/2.0/3.0(人写代码 / 训神经网络 / LLM 当可编程计算机)|context window = 操纵解释器的杠杆
可验证性总纲「传统计算机自动化你能用代码指定的,LLM 自动化你能验证的」|RL 环境 + verification rewards|jagged entities(参差不齐)/ circuits(电路,在 RL 电路里就 fly、否则吃力)/ 国际象棋数据进预训练集|受实验室所做之事的摆布
Open Claw 安装(复制粘贴给 agent)/ MenuGen(Gemini + Nano Banana 渲进像素,整个 app 多余)/ LLM 知识库·wiki·recompile / 信息处理整体可自动化
神经网络成宿主进程(host process)、CPU 成协处理器(co-processor)/ dominant spend of flops / 工具调用是历史附属物 / diffusion 实时渲 UI
10x 被严重低估、峰值远超 10 倍|招聘反转:别出谜题、给大项目 + 10 个 Codex 5.4 x high 攻破当验收 / Twitter clone for agents|人负责审美·判断·品味·监督,agent"填空"/ MenuGen 用邮箱交叉关联资金的 bug / 持久用户 ID / 不喜欢 plan mode 但偏执守 spec / 张量·实习生记忆力
审美不在 RL 里所以弱 / 看 agent 代码"心脏病发作"(臃肿·脆弱抽象)/ micro GPT"像拔牙"|召唤幽灵 vs 构建动物 / 奖励函数 vs 内在动机 / 统计模拟电路 + RL bolting on top
agent native:一切都得重写 / 文档还是写给人 / 传感器·执行器 / legible to LLMs / 一句 prompt'build MenuGen'从零到上线全程不碰 = 试金石 / 人和组织都有 agent 代表|外包思考但没法外包理解 / 人是导演(director)/ becoming a bottleneck
人物:Andrej Karpathy(联合创办 OpenAI、让 Tesla autopilot 跑通、造 vibe coding 一词);主持人为 Sequoia 合伙人;提及 Sam Altman。个人项目:MenuGen、LLM 知识库/wiki、micro GPT
这期几乎是为你而录的。Karpathy 这一年踩的坑、立的规矩,正好是你两套多-Agent 工厂(Holdwell PRD 工厂、app_incubator)每天在打的仗,连他形容的"看代码像心脏病发作"都和你担心的"碰撞协议纪律会不会走空"是同一种焦虑。下面按项目拆,每条都给你"他怎么做的 + 你这周能动的一件事"。
① 招聘的反转,就是你评审的反转:别出谜题,给大项目 + 自动攻破当验收
② "强大但易错且随机的一群 agent,如何协调而不降质"——这就是你工厂的学科定义
③ 他不喜欢 plan mode,但偏执地守 spec——这条和你"加流程"的直觉有张力
④ "把该做什么前移到 agent",他给了你一个具体试金石:一句 prompt 从零到上线、全程不碰
⑤ "为什么还在告诉我该怎么做?我该把哪段复制粘贴给 agent?"——这是你设计稿即契约的灵魂
⑥ "AI 原生"不神秘,就是肯花功夫把工具用到极致 + 在自己的 setup 上投入
⑦ "可以外包思考,但没法外包理解"——你作为单兵的护城河,和你正在变成的瓶颈
该反着用:Karpathy 的语境是"资源足、能休假腾出整块时间扎进 vibe coding、单一项目可以反复磨"。你的语境完全相反——精力是元约束、多线并行、没有整块时间。所以他"一头扎进无穷副项目、文件夹塞满"的状态对你是反面教材:你要的不是"我也开 N 个副项目 vibe coding",而是反过来——用同样的工具,去砍掉你已有项目里需要你亲自做的部分,把腾出的精力守在"理解/判断"这唯一不可外包的环节上。他在做加法(无穷探索),你该做减法(聚焦守门)。
和你现在做法冲突:你在 Holdwell 的本能是"加环节、加评审来保质量";Karpathy 的暗示是"质量由最前面那份 spec 决定,后面的关卡只是补救"。你越严的流程,可能越是在掩盖"spec 一开始没抠清"这个真问题。张力留给你自己掂量。
对你的镜子:Karpathy 这个"参与造了现代 AI、又亲手写 MenuGen 还被部署坑到崩溃"的人,公开承认"我正在变成瓶颈"。这面镜子照出来的不是"你不够强",而是——当工具强到能外包思考,瓶颈一定会移到'理解'上,而那恰恰是只有你能站的位置。你不是在和 agent 比谁写得快,你是在抢那个"导演"的椅子;你最近的疲惫,可能不是因为做得太慢,而是因为你还在亲自做太多本可以丢给 agent 的"思考与执行",反而没腾出脑子做"理解与判断"。
① C 类候选:「vibe coding 抬下限 vs agentic engineering 守底线」——一人公司两头都得占,拿实测账验证
② B 支柱:给 AI 员工做绩效,别问它"你行吗",派红队去攻它
③ 办号的地基:「可以外包思考,但没法外包理解」——这就是你弹药库闸门的理论版
可迁移思维模型:
判断更新:如果你之前认为"多-Agent 工厂的质量靠把流程关卡做厚",这期该给你松一颗螺丝——质量的上游在 spec / 实体口径,不在关卡数量;给跨线实体立一页共享 spec,可能比任何一道新评审都更值得这周投入。
这周一个赌注:挑 Holdwell 一个高频业务实体(订单或 SKU),把它写成一页跨线共享的"实体 spec",并让一个独立"红队 agent"拿三驾马车各自的职责清单去攻破一份已定稿的 PRD。 一个动作同时验证两件你最缺的东西——"有锚之后跨线是否更好对齐"和"碰撞能不能从提意见升级成攻破式验收、产出第一份闭环证据"。赌注小、可证伪、这周做得完。