ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.50
第 50 期 · AI 产品 · 收录于 2026 年 8 月 15 日

5篇论文看清AI研究走向

Y
YC · Y Combinator
视频 76:55 原文约 8.3 万字 预计阅读 47 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 46:22
TL;DR · 三句话
  1. 这是一场 YC 办的 AI 研究 meetup(线下小聚),组织者 François 开场抛出他认定的「AI 还剩两大未解问题」——intelligence per sample(每个样本能榨出多少智能)和 intelligence per watt(每瓦电能榨出多少智能)——再用一张「AlphaGo(被人类棋谱偏置、东游西荡)vs AlphaZero(不被人类偏置、纯自博弈)」的对比图框定全场基调;他的核心断言是:只在人类生成的数据子空间 H 上训练,无论投入多少可行量级的算力,都没法采样到完整解空间 F 里那块「人类没碰过」的 F−H,所以真正通往更强智能要靠 self-play、形式化验证这类「能自己造监督信号、自己去采样 F−H」的方法。→ 详细
  2. 5 位讲者的 5 篇论文,正好沿这条主线一字排开:①蛋白质生物学里 bitter lesson(苦涩教训:堆算力堆数据的通用方法终将打败手工堆领域知识)也兑现了——ESM Cambrian 只看单条序列就逼近甚至打平 AlphaFold 3;②self-play 跑久了会撞 60% 平台期,SGS 用「相关题锚定 + guide 第三角色评判」破局,让一个 7B 小模型花 8 倍算力追平 670B 大模型;③streaming RAG 让语音 agent 在用户说话过程中就提前检索,延迟降 0.5/1.5 秒;④Lean/verified intelligence 把数学和代码都纳入「机器可形式验证」(连 flash attention 等价标准 attention 都能证);⑤把 agentic 编程当即时战略游戏(RTS)打——orchestrator + work tree + dangerously skip permissions,把每工程师月 PR 提到 3.5 倍后再 +60%。→ 详细
  3. 一条贯穿全场的暗线:当人类数据不再是瓶颈、或不再可信时,「scale + 可验证的自监督信号」就成了下一阶段研究的共同方向——蛋白质有演化 40 亿年攒下的数据、self-play 自己造任务、Lean 自动可验证;而工程侧(Luke Orthwine)把同一逻辑推到极致,落成「让 AI 把活一路推到底、人只做高层纠偏」的极致并行工作流。→ 详细
01

开场框架:intelligence per sample / per watt + AlphaGo vs AlphaZero(组织者 François)

全场暗线一图蔽之:左「模仿/行为克隆」只在人类生成子空间 H 里打转(learns how humans solve),右「第一性原理搜索」靠 search→update→evaluate 自循环采样到 F−H 的新解(learns what solves)

  • 本场定位与讲者阵容:François 说本场据反馈会「much more applied bent(更偏应用)」,逐一介绍 5 位讲者——Yas Beg 讲 AI for biology(蛋白质,他「最喜欢的合作研究者之一」)、Tatsu 实验室 Luke Bailey 讲「AlphaZero 式 self-play for LLM」(他「super excited」)、Giga 研究员 Arnob Matei 讲 stream RAG(实时语音 agent)、Robert George 讲 Lean for science、「the AI token maxer himself」Luke Orthwine 讲 agentic 编程。并「征集分享」,点名 memory 是过去一年半头号热门,列了 mem zero、recursive language models、本实验室的 cartridges、H-Net、dynamic chunking 等论文欢迎上台讲。→ 详细
  • 核心论断:人类数据把你困在「典型集 H」里:François 提及几周前录的 Noam Brown 播客——Noam 仍持「只要在人类子空间 H 上训练,靠 test-time compute(推理时多花算力反复想)+ recursive self-improvement 就能算出去、改出去触达 F−H」的乐观观点;François 强烈不认同,原话「it's just not probable that we'll sample all of that(不大可能把那一整片都采样到)」。严谨表述:完整解空间为 F,在人类解上训练只把你限在典型集 typical set H(人类走熟的惯常区域)里,无论多少可行量级算力都采样不到 F−H 全貌,除非无限算力,「but we don't have infinite」。收束金句「life's a POMDP, and this is a finite horizon MDP(人生是部分可观测 POMDP,我们处在有限视界 MDP 里)」——现实里时间算力都有限,不可能穷举。→ 详细
  • AlphaGo(左)vs AlphaZero(右)的隐喻:左侧 AlphaGo 被人类对局数据偏置、像在解空间里「meandering(东游西荡)」;右侧 AlphaZero 完全不看人类棋谱、纯自博弈。François 认为正是「unbiased by humans meandering」的 AlphaZero 才是通往「much more intelligent systems, maybe even dare say AGI」的路,恰是 Luke Bailey 的 self-play 方向。→ 详细
  • 未解问题之一:intelligence per sample(每个样本能榨出多少智能):即「拿到新例子能从中学多少」。François 实测:常规 ICL(in-context learning,把例子塞进上下文现学)随样本数并不单调改进、会「bob and weave(忽上忽下)」,最后撞 context length「悬崖」直接卡死;换 LoRA(轻量微调,只动很小一块低秩参数)低 rank 少样本时「impressively well」但同样很快乏力,最终还得靠全量 SFT/GRPO。怪结论:最优做法一路在变,可人不是这样——「Magnus Carlsen 棋下得越多就一直变强」,用「同一套算法(the same algo)」单调变好。所以他笃定存在某种 intelligence per sample 高得多的学习过程。→ 详细
  • 未解问题之二:intelligence per watt + 替代反向传播:per watt 即「每瓦电换多少智能」(他实验室 Ivonica 和 John 在做),论点「从 per watt 看更小模型有时反而更好」。他还对替代 back-prop(反向传播,当前标准训练算法)上头——几乎没证据表明大脑会「取权重矩阵的转置」(反向传播恰要做这步),故一定存在别的学习过程,他对不靠梯度的 SPSA 感兴趣、向听众征集替代方案。引出 Yas Beg(专注 bio、总发他「鸟类靠肝脏里的铁来导航」这类疯狂 bio 论文)。→ 详细
02

论文 1 · AI for biology:「bitter lesson 来自生物学」(讲者 Yas Beg)

论文 1 的赌注幻灯片「Will Scaling Solve Protein Biology?」:左为论文,中间两条 scaling law 曲线(Test Loss 对 Compute、对 Dataset Size,均呈幂律)+「?」+ 右侧蛋白质结构

  • 讲者与论文背景:Yas Beg 是 François 同门二年级博士生,斯坦福 Steve Quake 联合指导(Quake「直到不久前还是这篇工作出处 Biohub 的主任」);论文上周才出自湾区 Biohub。他自嘲 François 总带来「very out of distribution ideas」。分享命名「The bitter lesson comes from biology」——bitter lesson(苦涩教训) 是 Richard Sutton 名论:70 年 AI 史里笑到最后的总是「通用、堆算力+数据」的方法,而非手工堆人类领域知识,典型如 AlphaGo「inordinately scaled compute」先输专家系统后反超。他要拷问这条规律在蛋白质里成不成立。→ 详细

  • 任务设定:把蛋白质当语言来训:「四分之一张幻灯片的全部所需生物学知识」——三大类生物大分子是脂质/碳水/蛋白质;一个蛋白质是一串氨基酸(共 20 种),「序列唯一决定三维形状,形状决定它干什么活」。论文训 ESM C(Evolutionary Scale 团队第三/四代,最早在 Meta、后自立、现在 Biohub):把上亿年演化序列当训练集,mask 掉几个 token 用大 BERT 风格 transformer 仅凭附近 token 预测被掩位置——「除了序列本身从不告诉它任何信息」,套 NLP 老话「you'll know a word by the company it keeps(观其伴而知其词)」。→ 详细

  • 三个待答问题 + 类比映射表:一张「自然语言→蛋白质」映射表——token→氨基酸、互联网→全部演化序列库、mask token prediction 不变、语言模型「涌现能力」→蛋白质模型涌现「对结构与功能的理解」、表底放 mech interp 的 SAE(稀疏自编码器)。三问:(1) 会不会随 scale 学习?(2) 能否替代手工特征(即 bitter lesson 成不成立)?(3) 表征以可解释方式编码了什么?代理指标 P@L(long-range contact precision,长程接触精度):近程接触太显然,能预测长程接触才说明真懂结构,是个「clean unsupervised readout」不用额外标注。→ 详细

  • 问题一答案:scaling law 成立,且靠「数据规模化」破墙:ESM Cambrian 的 300M/600M/6B 三档上 P@L 对算力呈漂亮对数线性,仅从「低算力小跑批」拟合的 compute-optimality「extrapolates very cleanly」到大模型。关键:上一代 ESM2(紫线)曾撞墙「加参数却收益递减」变平;ESM Cambrian(绿线)「keeps climbing with no plateau」。破墙的「不是什么巧妙归纳偏置」,纯是 data scaling——训练样本从 ESM2 约 5000 万推到 28 亿,主靠拉入 metagenomic(宏基因组)数据(从泥土/海洋/人类肠道测序、没人培养过的生物体序列)。这是「LM 那场 data wall 的蛋白质版本」,只是「是演化用 40 亿年生成训练数据、而非人类近 30 年」,且「我们才采样了已知蛋白质多样性的不到 1%」。→ 详细

  • 问题二答案:单序列模型逼近/打平 AlphaFold 3(最 bitter lesson 的部分):对照组是拿诺奖的 AlphaFold,其威力来自手工搭的 MSA(multiple sequence alignment,多序列比对)——找一个蛋白质「成百上千个进化表亲」堆叠,跨家族共变模式编码了结构信息。Yas 评 MSA 是「beautiful domain engineering」,也正是 bitter lesson 声称「最终应输」的人工偏置(类比早被淘汰的 HOG 特征),且「构建慢、且恰在你最想要它处缺席」(如抗体设计)。ESM 把 MSA 整个扔掉,只拿输入序列、把逐残基 embedding 直喂结构预测器。架构亮点:基于校友 Dan Fu 工作的 looped model(循环模型)——靠参数共享在推理时「让表征反复过层不断精炼、不必重训」,即蛋白质版 test-time compute(类比 diffusion steps)。→ 详细 DockQ Pass Rate 结果:在抗体-抗原(n=172)与蛋白-蛋白(n=278)两组上,单序列 ESMFold2(无 MSA)逼近 AlphaFold3;抗体设计任务上反超(约 50 vs 47)。结论:无 MSA 拐杖也近乎平手、抗体设计更优

  • 关键结果数字(DockQ pass rate)DockQ pass rate 衡量结构预测质量(两个会贴合的蛋白质预测形状有多大比例接近真实、到对现实有用)。结果:一般蛋白质-蛋白质复合体上,单序列无 MSA 的 ESMFold 2 落在 AlphaFold 3「约 3 个点」内——「near par without the crutch」;在人们真正在意的抗体(单克隆抗体 MAB、所有现代抗体类药物的 modality) 设计任务上,单序列 ESMFold 2 反超,约「50 versus 47」。生物学解释:已知抗体空间序列变异量小得多,手工堆 MSA 帮不上。头条结论不是「MSA 已死」,而是「手工特征只在本就充裕处帮得上、恰在药物设计者最需要处消失」。补充:给 MSA 时也能 scale test-time compute(多跑 loop 有回报);且单表征「比构建 MSA 快得多」,关心吞吐/延迟时很值钱。→ 详细

  • 问题三答案:表征可解释、自发组织成生物学层级:借 mech interp(如 Anthropic)的 sparse autoencoder / sparse coding 工具分析激活,能找到 mono-semantic(单一语义) 方向(一个方向对应一个概念)。纯完形填空式预训练让隐空间「分解成对应真实生物学概念的干净特征」,由 LM agents 自动标注,自发组织成层级:单个氨基酸→结构基序→蛋白质结构域→功能位点→整个蛋白质角色,「none of this was supervised, which is crazy」。例子:一个特征对应 nucleophilic elbow(亲核肘)——多种酶催化用的催化结构域、「在彼此不相关的蛋白质里独立演化出现多次」,模型能在「四个结构相当不同的蛋白质」里一致识别,说明它「learned to look at the right thing not just memorizing similar sequences」,是「更深层次的直觉」。→ 详细

  • 蛋白质 Google Maps + 临床意义:他们折叠/分析了「约七十亿个蛋白质」,构建「现存最大蛋白质结构图谱」(比 AlphaFold 约 10 亿个还大),按 SAE 空间铺成「protein space family map」,可见 CRISPR Cas 类酶 清晰家族聚簇——「all as a byproduct of the model」、de novo 免费拾起进化与功能关系,「像 a Google Maps for proteins」。回答总问题:bitter lesson 扩到生物还没完美——「部分分析仍需大量手工特征、尚未完全有竞争力,但已非常接近」。应用:模型在序列空间做 inverse design(逆向设计) 并在 wet lab 验证潜在蛋白质药物,例子是 结合 PD-L1 的药物(免疫治疗巨大成功、已帮大量癌症患者,过去针对这蛋白质开发药物极难)。他安利 bio 的模型「还非常年轻、数据每年指数级增长且增速本身在上升、不受数据限制」,是做 ML 的好领域。→ 详细

03

论文 2 · Self-play for LLM:「Scaling Self-Play with Self-Guidance」(讲者 Luke Bailey)

  • 讲者与论文:Luke Bailey 是 Tatsu 和 Tengyu 实验室二年级博士,「刚从英国过来」,此前哈佛 CS、做过 adversarial robustness(对抗鲁棒性,让模型不被刻意构造的输入骗倒),现做 post-training 里的 self-play,「directly in the spirit of this AlphaZero kind of mindset」。论文几个月前放出,叫 《Scaling Self-Play with Self-Guidance》(SGS),合作者含 Caillou、Kan 及导师 Tatsu、Tengyu。→ 详细

  • 背景:post-training 的长 RL 正逼近/超过预训练算力:训练栈=预训练(网页文本 pre-train)+ post-train。Luke 指出 post-train 现把巨量算力花在「large scale long RL runs」上——收集编程/数学/软件任务让 agent 在环境里拿 reward、「给好的 rollout 加权、坏的降权」(rollout 即跑一遍任务的完整轨迹),这块算力「正逼近甚至超过 pre-training」。引 cursor Composer 2 技术报告 那张「really beautiful plot」:RL 任务多到「模型对每个任务只见过一次」,横轴 scaling training step(log scale),eval set 和真实编程下游 benchmark 都「reliably improving」。但 RL 任务「得靠人工收集」、且「我们最终希望模型超越我们能给它的任何问题」——于是 self-play 问:能否自动生成新 RL 任务、训练、再重复。→ 详细

  • self-play 的两类范式:symmetric vs asymmetric:self-play 里模型同时生成 RL 任务 + 尝试解任务且两件都训。symmetric(对称):以 AlphaGo 为例,有规则棋盘但「那不是可交互 RL 环境、我需要对手」,于是用「一个旧版本的自己」当对手生成任务(两次都扮棋手,故对称)。asymmetric(非对称):近期在 LLM 兴起、源自更早控制问题——用 conjecturer(猜想者/出题者) 生成一整个 RL 任务,让 solver(求解者,即 agent) 去解(如 conjecturer 出编程题+单元测试,solver 进环境 rollout 拿 reward 再训)。→ 详细

  • 为何对 self-play 兴奋 + 残酷现实(平台期):第一点「in principle nothing bounds learning(原则上没东西约束学习上限)」——纯人类演示训练「永远不会超过那些演示」;常规 RL 有两条死路(「全做满分就再变不好」「连 reward 都拿不到也变不好」);而 self-play「不断用新任务生成新学习信号、一直改进 hopefully forever」,围棋上确实「超越人类并持续提升」。对 LLM 的许诺:训到人类水平再「跑大量 self-play 远超之」。但他坦白:「unfortunately, this is not how it works」——跑很久「it plateaus, the model stops improving」,和跑 RL 一模一样,「尽管我一直想告诉你里面有一堆秘诀,它实际上并没兑现」。→ 详细

  • 诊断:vanilla self-play 撞 60% 平台期、reward 被钻空子:baseline——从 conjecturer 采合成任务(conjecturer 与 solver「是同一模型、只取两个不同名字」),solver 解、用 reward 验证,「只在所有正确 rollout 上更新 solver」;关键是 conjecturer 的 reward:解不出为 0、否则「1 减去 solver 的解题率」,即「conjecturer 唯一要做的就是产出对 solver 很难的题」,理论上能不断在「能力边界(frontier of capability)」出题。实验用约 3000 道 Lean 形式化数学题(陈述和证明都用 Lean 写、可自动验证):最好 RL 基线趋平「asymptotes at like 60%」;填入 vanilla self-play 后「conjecturer 越来越擅长在边界出题、看起来真好,yet these tasks are completely useless——并不比普通 RL 更好」。→ 详细

  • 病根 + SGS 解法:related 锚定 + guide 第三角色评判:病根——因「奖励刁钻题」,而「产出刁钻题最简单的办法就是堆人为复杂(artificially complex)」。他展示后期生成的一道题(「if anyone's using Lean, this is horrific——一条极其复杂、过度繁琐、堪称灾难的陈述」),绝妙类比「想让你解题率落 50%,大可丢你一道三页长高中微积分题,你总会某处犯个小错」——但对真正关心的任务完全没用。SGS(self-guided self-play) 两部分:其一(锚定) 对每道「我们解不出的题」prompt conjecturer 产一道 related(相关) 题,把合成分布「锚定在一个至少认为不错的题目分布上」;其二(第三角色) 引入模型扮 guide(引导者)「真的去评判——看合成题及其源自的目标题,判断是否真相关、是否没有过度复杂」,更新 conjecturer 改用双重 reward「仍要题目刁钻(solver 才有 RL 信号),再乘以这个 guide 分数」。论文里还有「a bunch of subtleties」及他大量做的「largeish scale RL 基础设施」因时间跳过。→ 详细 SGS 头条结果:累计解题率 vs 代数(generations),SGS(ours) 越过 RL Baseline / Parallel Sampling,并向约 670B 大模型(DSPv2 671B pass@4)的 60.3% 渐近线靠拢——即 7B 小模型花 8× 算力追平老大哥

  • 关键结果:7B 用 8× compute 追平 670B(pass@k):头条图把 RL 基线、与之「exactly in line」的标准 self-play、parallel sampling 一并画出,SGS 确实更好。落到实处:用 7B 参数模型、花 8 倍 compute 做 self-play,在 pass@k(前 k 次通过率) 上达到其「big brother、约 670B」大模型水平——「花多得多算力让 7B 选手做得和大模型一样好」。但他诚实强调「not at 100%、the work is by far not done」(题会被「吃光」还有大堆 future work),自嘲「好在博士读得很长,我有时间继续做」。→ 详细

04

论文 3 · Streaming RAG:实时语音 agent 的低延迟检索(讲者 Arnob Matei,Giga)

论文 3 的目标设定:Input Query →「Conversational Voice AI Agent」→ Output,且要做到 No Hallucination——语音场景下幻觉更难当场抓出,这正是 RAG 要解决的,难点在低延迟

  • 讲者与定位:Arnob Matei 是 Giga(YC 增长最快公司之一、「市值大概 3-4 亿」)研究员、华盛顿大学博士、专注 bandit learning(赌博机学习,研究在多选项间反复试探、平衡探索与利用的决策)。讲的是 Meta 团队约一年前的论文,但明说「我的目标不是讲论文细节,而是凸显他们识别出的那些好问题」,因为它「相当贴近我自己在生产环境里做的事」。→ 详细
  • 问题:RAG 降幻觉,但语音场景下延迟致命:LLM 直接答易 hallucination(幻觉,一本正经地编造)RAG(检索增强生成) 是降幻觉大功臣(把查询交检索系统找相关信息喂 LLM)。语音 AI 对幻觉更不能容忍——「听的时候比读文字更难当场抓出幻觉」,但直接套 RAG 引入大量延迟「要花 10 秒才回答一点都不自然」。论文巧点子:「与其等问题说完再激活 RAG,不如开始分析用户正在说出的词、在问题还在被说出的过程中就运行 RAG」。例子「hey, what's the weather today, I want to decide whether I want to go out」——「主要问题在前半句,后半句可能无关(irrelevant)」,需机制判断「何时去调 RAG 并拿到正确信息」。→ 详细
  • 方法一:fixed-interval streaming RAG(固定间隔):把音频切成若干 block(块),每块到达就跑一次 RAG(第 B 块→R_B)。核心难题「which block to consider(该用哪一块)」。简单做法利用「RAG 由很多小组件构成、有些跑得快」:先快速取一批文档,然后「比较『整个查询的 top 文档』和『中间这个还没说完的查询的 top 文档』是否匹配」,匹配就「拿这个中间查询往下跑完整流水线」。他反复强调「想强调的不是方法本身」,而是「当你以分块拿到输入时,在哪个时间点可以停下说『这块对我超级相关』」——一个「active question(很活跃的开放问题)」。→ 详细
  • 方法二:fine-tune 模型自触发 + 伪查询 post-training:「每 chunk 都调 RAG 计算上很浪费」,故可 fine-tune 一个模型自触发——某 chunk 到达时判断「这 chunk 是不是关键新信息、是否该生成新查询,还是已有查询已够好」。post-training 流水线:对「说了一半的不完整问题」用某 LLM 生成 pseudo queries(伪查询),在其上跑 RAG 看检索文档,「据此判断这个不完整查询是新东西、还是已有有用材料」,本质「基于到目前为止不完整问题的检索质量做决策」。他补充「不一定是唯一方式」——也可看问题语义(semantic)仅凭看问题判断是否已够答,正是值得研究处。→ 详细
  • 关键结果:延迟降 0.5 / 1.5 秒,准确率持平:论文约一年前、用「一些较小开源模型」把一个 RAG benchmark「转成音频」。结果:合成数据集延迟降约 0.5 秒、人类说出的数据集降「将近 1.5 秒」;准确率「比较『在最终查询之后做 RAG』和流式 RAG 二者基本一致」。收尾要点「there are some interesting small problems here, but if you can crack the small problems it can lead to huge gains in production(攻克这些小问题能在生产带来巨大收益)」。→ 详细
05

论文 4 · Lean for science:verified intelligence(讲者 Robert George,Caltech)

  • 讲者与主题:Robert George 是 Caltech 三年级博士、做 AI for math and science,承接 Luke 提到的 Lean 更深入讲——主题是他眼中的「new era of verified intelligence(可验证智能的新时代)」,还和 François 插科打诨「我哥哥也在 Caltech 拿的博士」。→ 详细

  • 数学突破时间线 + 形式化验证入 loop:2024 年 IMO 上「OpenAI、甚至 DeepMind 拿到金牌」;一份「非常有名的未解 Erdős 问题清单」随新模型「一直在被攻克」;「两周前 OpenAI 宣称又攻克一个 80 年历史的 Erdős 问题」(陶哲轩 Terry Tao 在 OpenAI 有宣传视频「把这类事讲得非常好」);「上周 DeepMind 又发布成果、还解了其他领域问题」——而「this paper is cool because they also use formal verification in the loop(在 loop 里用了形式化验证)」。对比:本科的非形式化数学「very flexible」(甚至「proof by intimidation 靠唬人来证明」、许多步骤没完整写出);formal world(形式化世界) 必须「fully explicit、一步都不能含糊」。→ 详细 定理证明谱系:左「自动定理证明器」(TLA+/E/Z3/CVC5,人力投入少但表达力有限)— 中「大语言模型」(能自动学习、但形式数学很难)— 右「交互式定理证明器」(Rocq/Lean,基于依赖类型论、表达力强但需大量人力)

  • 为什么是 Lean(vs 自动定理证明器):两点——「非常容易检验证明对不对,you cannot fool this theorem prover」;且「scalable」。谱系:左端 automatic theorem provers(自动定理证明器) 如 SMT solvers「人投入极少、但表达力非常有限」;右端 interactive theorem provers(交互式定理证明器)Lean、Rocq、Isabelle「至少一些基于 dependent type theory(依赖类型论)、表达力强得多但需人投入多得多」。Mathlib 是 Lean 里「十年来人们一直贡献」的著名库、「probably at least a million lines」高质量数学(从拓扑学到代数几何),是「现存最酷最大的形式化数学库」。scalable 还因「不仅前沿实验室、全世界也在投」,数据越来越多(要么合成、要么很多人做 manual formalizations 手工形式化)。→ 详细

  • Lean 既是证明器也是编程语言:讲者反驳 Luke 说的「Lean 是门很乱的语言」,认为它「a very beautiful language、very fast」。重点:「人们只把它当 theorem prover,但它其实也是 functional programming language(函数式编程语言)」、compile-checking,统一了「proofs and programs」,支持 meta programming、宏、自定义自动化(「甚至见过有人用 Lean 做游戏」),还有 foreign function interface 做外部库绑定(如绑 CUDA)。示例:VS Code 里 info goal 视图显示 sub goals(子目标,goal 即这步想证的东西);证明每行叫一个 tactic(策略)proof search 就是「在 tactic 空间里搜索」(另一维度是 full-proof generation 整证生成)。学习曲线陡但「某种意义比 C++ 还好上手」,证完一个 theorem「会非常开心——因为你没法 handwave 或骗过 Lean kernel,必须 100% 完全确定」。→ 详细

  • 形式化突破谱系与各家成果:首个工作是「2020 年 OpenAI Ilya 和 Stan 的 GPT-f——第一个用于自动定理证明的生成式语言模型」;miniF2F 是「奥林匹克级别竞赛集」、进展「近乎指数级」、玩家「中美加乃至全世界」。去年 IMO「DeepMind 声称没用 Lean,但 OpenAI 解答里有某种 Lean 的 DSL」;中国的 Seed Prover 也拿 IMO 金牌;还有 AxiomProverHarmonic AI(其 Aristotle 最近在 Putnam(普特南竞赛) 把「12 道题全解出来了」)、Math Inc「类似菲尔兹奖级别的工作」、Google DeepMind 等。如今「当人们声称用 AI 给出某个解时也会去证明它,用比如 Harmonic 的 Aristotle」。→ 详细

  • 从数学扩到 program verification(另两个 bubble):他个人心里还有「two other bubbles」。其一 program verification(程序验证):「bugs 真的非常昂贵、是个上万亿美元的庞大产业」,「vibe coding(凭感觉写代码)突然很好用、人人生成代码,but I want code that needs guarantees」。核心三概念:「人类总对『想让代码做什么』有某种 specification(规约),一个 proof 基本就是说『这段代码满足那个 specification』」。他的工作 Verina——「把 Lean 当函数式编程语言用,去更好 elicit(引导)LLM 证明这类代码」。引 Max Tegmark「我们应从 vibe coding 转向 verified coding」,号召为 CSLib(源自斯坦福 Clark Barrett 团队、含 DeepMind 等人)贡献 CS 概念。其二 AI for science——涉及「reproducibility(可复现性)」等问题。→ 详细

  • torch(在 Lean 里写神经网络)+ flash attention 等价性 + 非确定性 + 收尾torch 是「第一个用来在 Lean 里真正写出神经网络的统一框架」——「一套完整的、类似 PyTorch 风格的 tensor 系统,所有东西编译到一个共享 IR(中间表示)」,能证 spec 性质:「verified floating-point arithmetic(经验证的浮点运算)」、「neural network verification 如 certified robustness(认证鲁棒性)」。最酷例子:「可证 flash attention 至少在 spec 层面等价于普通标准 attention(flash attention 是省显存跑得快的实现,证它和标准实现算出来一样)」;还有「不加位置编码时 attention 是 permutation invariant(排列不变)」。他甚至「在 Lean 里完全原生训了一个 GPT-2 风格模型(Karpathy 那套),直接在 torch 里跑并证各种性质」。Thinking Machines Lab 去年博客指出「即使 temperature 设 0,LLM inference 仍有非确定性——微小浮点运算可在 batch 里翻转最终 argmax(翻转选出的那个 token)」,他把「这整套系统在 torch Lean 里形式化、一路做到几乎 GPU 那种 CUDA 级别的 kernel 验证」,以证「真的可以做现实世界软件验证」。收尾愿景:「我看到一个未来——科学、甚至代码都能通过大量基础构件被形式化验证」,是他对这堵「formal/AI 大墙」的「微薄贡献」。→ 详细

06

论文 5 · 重新思考 agentic 编程:把编程当 RTS 打(讲者 Luke Orthwine,Channel AI)

  • 讲者与公司:Luke Orthwine 被介绍为「the antithesis of lean and token maxing to the max(Lean 的对立面、把 token maxing 推到极致)」、「probably the most unhinged technical CEO that I know(我认识的最不按常理出牌的技术型 CEO)」——Harvard CS,2012–2015 年在微信广告(WeChat ad)做增长(人称「the lion of Hong Kong,香港之狮」),现做消费级娱乐(consumer entertainment)AI 公司 Channel AI,目标是「尽可能自动化的不只是软件开发,还有内容开发——做出一套端到端、纯 AI 的系统,让人愿意付钱并持续保持参与(stay engaged)」,并称「到目前为止做得还挺扎实的」。→ 详细

  • 核心隐喻:编程从「象棋」变「即时战略(RTS)」:过去编程像下象棋(chess)——「很线性、想预测未来、想非常深思熟虑地设计出鲁棒、正确的系统」;哪怕想糙做,「仍是单线程过程,任一时刻只操心眼前这一件事」。而用 agentic 系统「feels exactly like playing real-time strategy games(就完全像在玩即时战略游戏,如魔兽/星际)」——关键差别是「看高水平对局,没有任何单一方面是你做到完美就能赢的(no single aspect you can do perfectly and succeed),你必须同时平衡很多东西:让经济一直运转、生产一直运转、单位一直在做有产出的事、一直在交战」。一句话提炼:「how do you maximally parallelize both what your systems are doing and your attention(怎么最大化地并行——既并行系统在做的事,也并行你的注意力),以便随着地图被揭开、及时补上必要的纠正性反馈」。落地工具是 LW = linear work trees(linear 工作树),基于 git work trees:「过去你是唯一开发者时,机器上一个 repo 就行;现在你需要机器上有非常非常多的 repo,全在并行开发、各自独立编译、互不干扰(not stepping on each other's toes)」。整体是个组合:work trees + 任务管理软件 + 让工作本身可移植(portable,即「team 那一块」)+ 往工作流里塞一个或多个自主 agent。→ 详细

  • orchestrator agent + 让 worker 把活推到底:交付方式是有一个 orchestrator agent(编排者 agent),「通常由 Claude 来跑,但也可能是 Codex 2」,尽量「以最少的击键次数(minimal keystrokes)从『这有个需要修的点子』到『工作开始干起来』,因为我之后可以再纠偏」——类比「在 RTS 里抓起一个单位、直接点到地图另一头,等会儿再回来让它干好活」。状态追踪 = 「盯着你的 mini map(小地图)」看 spawn(孵化)出来的所有 worker 在干什么。worker 被指示「try to go as far as they can, put a really low premium on their time and effort and a high premium on yours(尽可能往前推,把它们的时间精力看得很轻、把你的看得很重)」——「哪怕会出错、之后要纠正,让它们在求反馈前尽量往前推仍是更好的,这样你就能让一大堆并行跑,even if it's wasteful from a per-token standpoint, it's saving you a lot of time(即便从每 token 看很浪费,却给你省了大量时间)」。worker 一路推到 PR、「不只是 PR,还附一份 summary(摘要)」,再把每个完成者的结果「反馈回系统让系统学习、变得更好」。但他强调这不是「spawn 出 20 个 agent、然后指望它们替我解决问题、不犯任何错、最后就跑通——because that doesn't actually happen in production(因为那在生产环境里根本不会发生)」。→ 详细

  • 通用做法:cloud instances + portability + dangerously skip permissions:①「尽量让几乎一切都从云端实例(cloud instances)跑,including scripts(包括脚本)——因为有时候脚本比全靠 LLM 直接做要好得多、也更省 context 空间」,能避免就「never typing anything outside of it(绝不在它之外打字)」。②保持 portability(可移植性):「很多时候你卡住的真正原因是队友、或另一台机器;也许你本地跑着、然后『哦我得回家了,但想让它跑一整夜(run overnight)』;也许它需要更多算力/内存」——所以要让任务「非常容易挪到别处、让别人接手」。③「尽可能始终在 dangerously skip permissions(危险跳过权限) 模式下跑;不能的话就搭个 sandbox(沙箱)让自己能这么跑」,否则「if you're having to give feedback at any regular pace, you're going to go really slow(你得以任何常规节奏不停给反馈,就会跑得非常慢)」。→ 详细

  • worker 不死守 spec + 预烤已知弱点 + 知识库优于代码:worker「总是奔着 PR 去,不严格死守你给的 spec(because your specs will be wrong,因为你的 spec 会有错),而是边做边学边适应;让它们做点假设也没关系,because you can correct them as you catch them(抓到了就能纠正)」。前端开发把一切「预先烤进(pre-baked into)worker 的 spawn」:「启动本地 dev server、自己跑测试、就绪待命,这样人类只要打开一个指向正确端口的浏览器标签页就能尽快测」,最小化人类步骤和点击。还要把「那些我们很可靠地知道 agent 会做得很糟的事」预烤进去——「不只烤进 CLAUDE.md 文件,还烤进你拥有的那张范围更大的 MD 文件图谱(broader reaching graphs of MD files)」。典型例子:「今天 Claude 超级不擅长的一个明显例子就是预估耗时——你问它『这要花多久』,它会说『大概一个工程师两周的工作量』,可实际上一个 prompt、20 分钟它就搞定」;原因是「它是基于『人类做这些事要花多久』训练的,that's all it's basis for training data;这些系统出现时间还不够长、还没法更新这一点,而且我觉得它们大概会永远落后(always be behind)」——所以要告诉它「no no, never trust yourself in these ways(在这些方面永远别信你自己)」。另一条原则:「代码确实是 source of truth(真相之源),但对 agent 来说是『a really expensive source of truth(一个非常昂贵的真相之源)』——从里面抽 context 很费劲」;而「尤其当所有 context 已加载进内存时,去激进地把东西文档化是非常便宜的」——所以「不只在代码里写注释,还要写结构化的、带链接的、wiki 风格的知识库文件,让未来的 agent 用起来很轻松」,这也「提升了人类的可见性和可审计性(auditability)」。→ 详细 论文 5 核心原则幻灯片「Macro by default, micro when it counts」(配魔兽 3 实战截图):macro=让一大批 worker 同时产出;纯 macro 也是陷阱(fire-and-forget);两者都要、关键使能项是 high visibility

  • RTS 原则:macro by default, micro when it counts + 高可见性 + 音频提示:核心原则「macro by default, micro when it counts(默认宏观、关键处再微操)」——「一局 RTS 如果你只是非常擅长操控单个单位通常赢不了,because if you didn't make any units, you'll just lose(因为你压根没造兵就会输)」。所以「对真正关键的东西深挖、钻进去(tunnel vision)是重要的,有些 ticket 确实要花很长时间」;但每当你钻进某事时,「都该一直想:我怎么再 spawn 出尽可能多的、不怎么占我认知带宽的小事,把它们也往前推」,从而「把认知容量拉满(maxing out your cognitive capacity)」。他点出反直觉的一点:「things can wait(很多事能等),三天后再回头、直接问 Claude『remind me what the hell I was doing(提醒我之前到底在干嘛)』,这些都很便宜;真正昂贵、却感觉不出昂贵的,是『不去同时做这些事(not doing these things at the same time)』」。高可见性(high visibility):「不要像那种把一堆 agent 藏起来、你得费劲钻进去才看得到它们在干嘛」;要像 RTS 里「点几个按钮就立刻跳到地图不同关键点」那样随时审视,「because they're going to make mistakes all the time, go in wrong directions(它们会一直犯错、朝错误方向跑),越早抓到、修掉、纠偏越省时间省价值」。音频(audio) 是 RTS 一大件:「管理整张地图上一支大军唯一的办法就是有大量音频提示,like your base is under attack(比如『你的基地正遭受攻击』)」——「你不必盯着看,听到就知道该把注意力放哪」,这些音频是很好的「pneumatic/mnemonic devices(助记装置)」。→ 详细

  • 个人骚操作:tmux 会话映射魔兽/星际单位 + APM tracker(按 tool calls):他把「每一个 agent 的 tmux 会话都映射成不同的魔兽争霸(Warcraft)/星际争霸(Starcraft)单位,按 ticket 类型做配色和主题区分,并播放真正的单位音效」,于是「立刻就能在视觉上识别、甚至不用读,就知道这个标签页需要注意」——而这些「都是 Claude 很快帮他做的,就当一张抽空在做的边角 ticket,他同时还在干另外八件事」。他评价游戏行业「很懂什么是好的 sound design(音效设计),知道怎么让提示令人难忘、抓住注意力」,所以「狂热使用颜色、图标,任何能让你更快读取、处理的东西」。内部还造了 APM tracker(每分钟操作数追踪器)——他展示的是「魔兽争霸 3,职业 RTS 里对 APM 要求较低的一款」,要点是:「APM 不是那种你拉满就成世界第一的东西,but nobody is good who doesn't have high APM(但没有谁是高手却没有高 APM 的)」,可当心智标尺自问「如果这是比赛,我慢吞吞地想、慢吞吞打字,真会是最强的吗?我真需要在每件事上花那么多时间吗?」。关键:这里的 APM 不是『点击数』(对 agent 不是好指标),而是 tool calls(工具调用数)——「你的 agent 这一分钟、这五分钟、这一小时、这一天、这七天做了多少次 tool call,how do you max all those numbers(怎么把这些数字全拉满)」。更高效用 token 的简单办法就是「大量并行、同一 agent 做不同事、不同 agent 并行——对复杂任务几乎必然比单干结果更好」;像 RTS 一样「never have your Claude tokens sitting unused, that's really inefficient economy, use them all(绝不该让 Claude token 闲置,那是非常低效的经济模式,把它们全用起来)」。→ 详细

  • knowledge base 自举 + satisficing + 关键数字 PR 3.5× 再 +60%:他坦白「这整场 presentation 本身就是用做 ticket 的方式做的」——「我去找 Claude,把 François 让我讲的内容粘进去,说『看看我们的 knowledge base 和我们怎么做事』,让它基于里面沉淀的理念整理出一份 PPT;它没一次搞定(didn't oneshot it),but I maybe did like 15 edits(我大概改了 15 次)才做成」,再「把整个过程喂回 knowledge base,让它把我给过的所有建议和更正都固化进去」。为什么靠 knowledge base:「相互链接的文档能被 LLM 更快地处理(linked docs are much faster diverse/digested by LLMs),可以把一切编码进去包括业务知识;而 Claude 和 Codex 只要对你的业务了解得足够多,就真的很擅长想出各种功能」。一串原则:「everybody should be full stack all the time(所有人都应随时是全栈的)、be reactive(要主动响应);即便 agent 做得比你差/慢,让它做仍更划算,因为搞砸了很容易改回来」;「satisficing(满意即可) 是经济学里的词,意思是把事做到足够好就行、而非追求完美——a really really key principle for everything(对一切都极其关键的原则)」;「把不同大小的 ticket 同时混着做(mix different ticket sizes)」。关键数字:「我们已经把每个工程师每月的产出(PR 数)提升到了原来的三点五倍(three and a half x)——一方面是 LLM 让我们自身变强了;但更关键的是,上个月当我们在团队里让所有人都广泛采用这套做法之后,每工程师每月 PR 又增长了 60%」。收尾金句:「you're not going to get a lot smarter, but the thing you can train on yourself is how do I act like people who are good at these things, like RTS pro players(你不会一下子变聪明很多,但你能在自己身上训练的,是怎么像 RTS 职业选手那样去做事)。」→ 详细

本场无独立 lightning round(闪电问答轮),收尾由组织者 François 主持:

  • 现场福利与散场:现场准备了曲奇(cookies)、冰淇淋、冰棒(popsicles)和 mochi donuts(麻薯甜甜圈)——François 还现场问了一句「mochi donut 是个啥?」自答「很好吃」。他感谢大家到场、说「玩得很开心(it was a lot of fun)」,会发一份反馈表(feedback form)征集想法。→ 详细
  • 后续安排与征集:下一批论文分享「大概在两周后,安排已经排满(fully slated)」;七月的第一场「也还想填满」,想做分享的可联系他;同时重申开场的「征集分享 / 征集点子」——memory 方向、可一起发布的 AI benchmark、俱乐部挑战赛、想一起开搞的开源项目等。→ 详细

原视频未给出讲者具体联系方式。可循以下线索定位:组织者 François(YC AI research meetup 主理人);讲者及机构——Yas Beg(Stanford,François 同门,Steve Quake 联合指导,AI for biology)、Luke Bailey(Stanford,Tatsu & Tengyu 实验室,self-play / SGS)、Arnob Matei(Giga,University of Washington 博士,streaming RAG)、Robert George(Caltech,Lean / verified intelligence,博客在其个人网站)、Luke Orthwine(Channel AI 创始人/CEO,agentic 编程)。论文关键词:ESM Cambrian(Evolutionary Scale / Biohub)、Scaling Self-Play with Self-Guidance(SGS)、Meta 的 streaming RAG、Lean / Mathlib / torch / Verina / CSLib。

🎯 于你何益 为你定制 · 非通用结论

这是一场偏学术/前沿的 YC 研究小聚——5 篇论文里,蛋白质 scaling、self-play RL 内核、流式 RAG、Lean 形式化数学这 4 篇,跟你手头任何一个项目都不沾边,纯属"看个热闹、知道前沿在往哪走",不硬掰对到你的活上。真正能落地的只有两块:第 5 位讲者 Luke Orthwine 把 agentic 编程当即时战略游戏打的那套方法论(直接砸中你的造 App / 多-Agent PRD 工厂),以及全场那条暗线作为你判断"该押注 AI 哪个方向"的镜子。所以下面只写这两块,外加投资视角顺带一问。

给 app_incubator + Holdwell 多-Agent PRD 工厂

这是本期对你唯一高相关的部分。你正在搭"7-Agent 造 App 链路"和"三驾马车 + 碰撞协议的 PRD 工厂",痛点写的是"把'该做什么'前移到 agent、激活/首屏体验、碰撞协议纪律是否真执行"——Luke 这套是同一个战场上一个已经跑出真实数字的人的打法。

  • 怎么做的:Luke 的核心隐喻是"编程从下象棋变成了玩即时战略(RTS)"。象棋是单线程、一次只想一步、追求把一个系统设计到完美;RTS 是"没有任何单一方面你做到完美就能赢——你必须同时让经济运转、生产运转、单位都在干有产出的事、一直在交战"。他给的一句话提炼:"how do you maximally parallelize both what your systems are doing and your attention(怎么同时并行系统在做的事 + 你自己的注意力)"。落地工具是 git work trees——"过去一个人开发,机器上一个 repo 就够;现在你要机器上有非常多 repo,全在并行开发、各自独立编译、互不踩脚"。 你可以怎么做:你的 7-Agent 链路现在大概率还是"一条主线、agent 之间排队"。把它重框成 RTS——你(或 orchestrator)是指挥官,每个 Figma/Chrome/Notion agent 是一支并行部队,各自在自己的 work tree / 沙箱里独立推进。下一次跑 App 孵化时,刻意让 2-3 个子任务(比如"出设计稿""搭前端骨架""写 Notion PRD 段落")同时起,而不是串行等。

  • 怎么做的:他有个 orchestrator agent("通常跑 Claude,也可能 Codex 2"),原则是"以最少击键次数从'这有个要修的点子'到'活已经开始干',因为我之后可以再纠偏"——类比"RTS 里抓起一个单位直接点到地图另一头,等会儿再回来让它干好"。worker 被明确指示"try to go as far as they can,把它们的时间精力看得很轻、把你的看得很重","哪怕会出错、之后要纠正,让它们在求反馈前尽量往前推仍是更好的"。但他重重强调:这不是"spawn 20 个 agent 然后指望它们零失误跑通——because that doesn't actually happen in production(生产环境里根本不会发生)"。 你可以怎么做:你痛点里写"把该做什么前移到 agent"——Luke 的答案恰恰是"先让 agent 往死里推,人只做高层纠偏",但配套是 orchestrator 兜底 + 你随时能抓回来改。给你的 orchestrator 写一条硬规则:"worker 遇到不确定不要停下来问,按合理假设推到 PR + 附一份 summary,把假设写在 summary 里待我审"。这正好对上你的碰撞协议——初稿阶段不该"卡住等人点头",而该是"各角色推到底、产出物到了碰撞与真人评审环节才被批量审"。

  • 怎么做的:他反复讲"知识库优于代码"——"代码确实是 source of truth,但对 agent 是个 a really expensive source of truth(非常昂贵的真相之源),从里面抽 context 很费劲";而"当 context 已加载进内存时,激进地把东西文档化是非常便宜的"。所以他不只在代码里写注释,还写"结构化的、带链接的、wiki 风格的知识库文件",而且要把"agent 已知会做得很糟的事"预烤进去——"不只烤进 CLAUDE.md,还烤进你那张范围更大的 MD 文件图谱(broader reaching graphs of MD files)"。最绝的自证:这整场 PPT 就是他让 Claude"看看我们的 knowledge base 和我们怎么做事"做出来的,"没一次搞定,我大概改了 15 次",然后把整个修改过程喂回 knowledge base 固化你可以怎么做:你的痛点写"六条产品线强耦合、跨线对齐"——这就是你的 knowledge base 还没喂厚。别把它当"以后补的文档",当成agent 的燃料来建:把 ERP 领域实体、PRD 模板约定、各角色反复犯的错(比如某个 agent 老是漏掉某字段),全写成相互链接的 MD 图谱,让三驾马车每个角色起手就加载。每次人工纠正一个 agent、或真人评审打回一条意见,顺手把"这次教它的"沉淀回知识库——一个月后这就是你这套工厂的复利。

  • 怎么做的:他把 worker 的衡量指标从"点击数"换成 tool calls——自造了一个 APM tracker(每分钟操作数),但"APM 不是点击数(对 agent 不是好指标),而是你的 agent 这一分钟/这小时/这七天做了多少次 tool call,how do you max all those numbers"。配套金句:"never have your Claude tokens sitting unused(绝不让 Claude token 闲置),那是非常低效的经济模式,把它们全用起来。"还有个反直觉点:他说真正昂贵、却感觉不出昂贵的,是"not doing these things at the same time(不去同时做这些事)"。 你可以怎么做:你的元约束是"精力与聚焦是最稀缺资源"——Luke 给的是一把尺子:衡量你的 Agent 工厂效率,别看"我盯了多久",看"单位时间里 agent 帮我推进了多少步(tool calls / PR)"。给你的 PRD 工厂加一个最朴素的计数:一次跑下来,几个 agent 并行干了多少活、产出多少段 PRD/多少个 ticket。如果你发现 agent 大量时间在闲等你点头,那就是"token 在 sitting unused",是该改的信号。

  • 关键数字(直接当锚):他们把每个工程师每月 PR 提到了原来的 3.5 倍,"一方面是 LLM 让我们自身变强;但更关键的是,上个月让全团队广泛采用这套做法后,每工程师每月 PR 又涨了 60%"。你可以怎么做:注意这个拆解——3.5× 来自"工具变强",+60% 来自"方法论被团队真正吃下去"。对你一个人扛多线的处境,迁移过来就是:光接上更强的模型只是第一层,第二层、也是更大的一层,是你自己把这套并行 + 知识库 + 满意即可的工作方式练成肌肉记忆。这一周可以挑你最熟的那个项目(比如 StockHelp 加一个小功能),刻意用"3 个 work tree 并行 + orchestrator 兜底"跑一遍,体感一下这个 +60% 是不是真的。

给你本人 · 当作"AI 在往哪走"的先验更新

不是可动手的事,是一面镜子——你长期方向是"不断扩充多元思维模型",这场给你一条很清的当下主线。

  • 怎么做的:组织者 François 全场的核心断言是——"只在人类生成的数据子空间 H 上训练,无论投入多少可行量级的算力,都采样不到完整解空间里那块'人类没碰过'的 F−H",原话"it's just not probable that we'll sample all of that"。所以他认定下一阶段要靠能"自己造监督信号、自己去采样新区域"的方法:self-play、形式化验证(Lean)、演化数据(蛋白质)。整场 5 篇论文正好沿这条线排开,暗线一句话:"当人类数据不再是瓶颈、或不再可信时,'scale + 可验证的自监督信号'就是下一阶段研究的共同方向。" 你可以怎么做:把这条当成一个可以挂在脑子里、未来 12 个月反复验证的先验——下次你再看任何 AI 进展(新模型、新论文、某公司发布),问一句"它是在'人类数据'里再榨,还是找到了某种'自己造可验证信号'的法子?"后者才是 François 这帮人押注的真增量。这条对你判断"哪些 AI 公司/方向值得长期看"直接有用(见下)。

投资视角 · AI 方向→押注谁受益

你是价值投资者、自建 StockHelp,看到 AI 内容要顺带问"对我的投资有什么用"。这场不是讲股票,但抛了几个**"哪个方向有真护城河/真大市场"的信号**,可当选股的方向性线索(不是买入建议,是观察清单)。

  • 怎么做的:① 蛋白质讲者反复说 bio 的 AI"还非常年轻、数据每年指数级增长、增速本身在上升、不受数据限制",且只采样了"已知蛋白质多样性的不到 1%"——这是个"数据远未见底"的赛道特征。② Lean 讲者点名 program verification 是"a huge trillion dollar industry(上万亿美元产业),bugs 真的非常昂贵",并喊"从 vibe coding 转向 verified coding"——一个还没被 AI 充分吃下、但痛点和钱都巨大的方向。③ Giga 被介绍为"YC 增长最快的公司之一"、做实时语音 agent,市值"3-4 亿"量级——语音 agent 的低延迟工程是个正在被攻克的"小问题、但攻克了在生产带来巨大收益"的点。 你可以怎么做:这三条都不是"现在买啥",是给你的能力圈加几个观察标签。下次扫美股/港股时,留意:谁在"AI for bio / 蛋白质 + 药物设计"上下注且有数据壁垒(讲者举的是免疫治疗、PD-L1 靶点这类已被验证有巨大临床价值的方向);谁在做"可验证代码 / 形式化验证"工具链(万亿级市场、AI 渗透率还低)。把它们丢进你的 watchlist 候选池慢慢看基本面,符合你"找卓越生意 + 长期持有"的打法。⚠️ 这是会过期的方向性噪音,不是估值判断——真要动手仍得回到你 StockHelp 那套 PE/分位/安全边际去验。

更深三个角度

  • 该反着用:Luke 那套"per-token 很浪费没关系、把 token 全烧起来、绝不让它闲置"是建立在"Channel AI 有团队、有云端实例预算、有商业回报兜底"的语境上。你是一个人扛多个副业、精力和(可能的)API 预算都紧。所以正确的借鉴是反过来:不是"无脑并行烧 token 求快",而是"在你真正在推进的那 1-2 个项目上并行,其余克制"。他的"maxing out cognitive capacity(把认知容量拉满)"对有团队的 CEO 是优势,对你可能是过载——你的 RTS 地图要比他小得多,别学他同时开八条战线。

  • 和你现在做法冲突:Luke 说 worker 要"don't strictly adhere to your spec,因为你的 spec 会有错,让它边做边学边假设、抓到了再纠正",还要"dangerously skip permissions、绝不在常规节奏给反馈"。这和你 Holdwell PRD 工厂强调的"独立初稿互不可见、碰撞协议、真人评审回炉"是直接对着干的——你在往"更多控制点、更多守门"走,他在往"更少打断、放手让 agent 跑"走。这个张力是真的:太多关卡会让你的 agent 工厂慢成"串行等人点头",太少又回到你担心的"agent 产出不可观测、不可验证"。点出这个张力,结论你自己下——大概率答案是分层:探索/草稿阶段学 Luke 放手,收口/交付阶段守住碰撞与真人评审。

  • 对你的镜子:Luke 最后那句——"you're not going to get a lot smarter, but the thing you can train on yourself is how do I act like people who are good at these things, like RTS pro players(你不会一下子变聪明很多,但你能在自己身上训练的,是怎么像 RTS 职业高手那样做事)"。对你这个"判断力 > 努力、杠杆 > 工时"的人,这句是面镜子:你纠结的"该 all-in 哪个编码下注",本质不是"我还不够聪明",而是"我还没练成那种'同时管多支部队、该放手放手、该深挖深挖'的指挥手感"。这是可训练的,不是天赋问题。

One Human Company 新号(2026-07 回填)

「把 agentic 编程当 RTS 打」是一篇高辨识度的 C 类验证体——他有 3.5×/+60% 的数字,你可以出自己的

  • 怎么做的:Luke Orthwine(Channel AI CEO)把编程从「下象棋」重框成「打即时战略」:orchestrator 派单、worker 在各自 work tree 里「把自己的时间看得很轻、把你的看得很重」推到 PR+summary,「macro by default, micro when it counts」,绝不让 token 闲置。他的数字很硬:每工程师每月 PR 提到 3.5 倍,全团队吃透方法论后又 +60%——工具只是第一层,工作方式才是更大的一层。
  • 你可以怎么做:候选标题:「YC 那位 CEO 说要把 AI 编程当星际打,我用 drizzle tech 的 9+1 员工试了一周:并行 vs 串行的真实账」——同一个功能包,串行跑一遍、RTS 式并行(2-3 个 work tree + 「推到底再审」规则)跑一遍,晒 PR 数、返工数、token 账和你的判断(对一人公司,并行到几路是甜点、几路开始过载——这个「过载拐点」恰是 Luke 这种有团队的 CEO 给不出的、你最独占的结论)。可抄物:「一人公司 RTS 派单规则」三条。闸门自检:对照数据 + 过载拐点是你的一手判断,过。本期另外 4 篇论文(蛋白质/self-play/流式 RAG/Lean)对新号无直接可写点,不硬掰。

所以呢

  • 可迁移思维模型

    • 【耐用】macro by default, micro when it counts(默认宏观、关键处再微操)——一局 RTS 你只会精操单个单位却不造兵,必输;但真正关键的少数事仍要钻进去深挖。这是"杠杆 > 工时"的一个极锋利的操作化版本,对你管多个副业、多个 agent 都适用,且不会过期。
    • 【耐用】satisficing(满意即可)——Luke 说这是"对一切都极其关键的原则",做到足够好就走、不追完美。这和你操作系统里"99% 的努力终将白费、盯那 1%"是同源的,可以焊死。
    • 【会过期】"scale + 可验证自监督信号是下一步" 这条研究方向判断——现在很可能对,但 AI 范式 18 个月就换一茬,当先验用、别当信仰。
  • 判断更新:你原本可能觉得"多-Agent 工厂的瓶颈是模型不够强 / 框架不够全"。这场给的反例是——Luke 用同样的 Claude,靠工作方式(并行 + 知识库当燃料 + 放手让 agent 推到底 + 满意即可)把团队 PR 又提了 60%。瓶颈更可能在你的'指挥手感'和'知识库厚度',而不在工具本身。

  • 这周一个赌注:挑你最熟的一个项目(StockHelp 加个小功能 / app_incubator 跑一次孵化),刻意用 Luke 的 RTS 打法跑一遍——开 2-3 个 work tree 并行、给 orchestrator 写"先推到 PR + summary 再求审"的规则、把这次教 agent 的东西沉淀回一份 wiki 风格 MD。一周后回看:是不是真比你平时串行干快、且你没被拖进过载。赌它成立——成立的话,这就是你那个"+60%"的入口。

接着读