本期无 lightning round。留几句最值得记的原话:
"很多 AI 系统生成答案,而 Apodex 验证它们。"(Apodex 产品邮件标题)
"顶级科学家不看发了多少 paper,看最好那篇 paper 的质量有多高。"(Simon 杜少雷)
"模型能取代我今天做的事,但不一定能取代我五年之后做的事。"(贝斌)
"我们的品味只是一个 warm start,以后 AI 会有自己的品味。"
"AI 行业一周可能相当于传统行业一个月甚至一个季度。"
"(把你蒸馏了担心失业吗)说不担心肯定是假的,但即使担心,我其实还是乐观的。"(贝斌)
嘉宾:Simon 杜少雷(华盛顿大学计算机系副教授,Apodex 首席科学家 · 训练与推理方向);贝斌 Beibin Li(Apodex 首席科学家 · 代码与自进化方向,此前微软研究院、Meta、xAI,做 AI for Science 十余年)。
公司:Apodex——陈天桥出资创立并亲自主导,定位 Heavy Duty Solver / Discovery Model,只做"解决最难科学问题",不做聊天/图片/视频生成。
主持:泓君。
收听/观看:小宇宙、苹果播客、喜马拉雅、蜻蜓 FM、Spotify;视频版在哔哩哔哩、YouTube 搜"硅谷101播客"。
本期直接相关度:高。整期在讲的"让多个 agent 分工、其中一个专门验证另一个、用冗余 + 全局裁判把关、后训练里自诊断→定配方→训练→复验的闭环",几乎是你那套多-Agent PRD 工厂的同构问题;"品味/拍马屁/对冲"则正对你在意的"怎么让 agent 有判断力"。以下按你的项目逐条落。
① app_incubator + Holdwell ERP 多-Agent PRD 工厂
怎么做的:Apodex 的验证不是"让同一个 agent 自己检查自己",而是拆成两个上下文隔离的 agent——一个解题、一个专门验证解题者的产物,"拆开效果好很多";再加冗余(多个 agent 解同一题)+ 一个全局 agent 当裁判挑最准那份;训练时裁判和模型一起学,专门防"钻评分空子(reward hacking)"。
你可以怎么做:你 PRD 工厂现在的痛点是"agent 产出缺可观测/可验证、碰撞纪律难保真"。把"验证"从"生成 agent 顺手自检"升级成独立的验证 agent(与写 PRD 的 agent 分开、上下文隔离),只让它干"挑毛病 / 核对契约"这一件事;你的碰撞协议(UX 与 tech 互不可见各出初稿再互看)天然就是"冗余多裁判",可以再加一个"全局裁判 agent"把碰撞三件(补强/修正/第 3 案)的意见汇总成一个通过/打回的判定,而不是靠人肉合议。
怎么做的:他们的后训练是个自诊断闭环——先诊断"我哪里不达标",据此定训练配方,再训练自己,每一步都 verify,然后回到诊断重来;"脚手架和后训练像左脚右脚交替往前踩"。
你可以怎么做:这正是你"真人评审意见回炉"缺的闭环形态。给每轮 PRD 加一条诊断→修复→复验的最小回路:每跑完一版,先让一个 agent 产出"这版哪条没达标"的诊断清单(对着评审意见归属和各角色的职责契约),据此回炉,再复验——把"改了什么、复验过没有"变成可留痕的一环,比一次性产出更能攒下闭环证据。
怎么做的:他们反复强调"生成答案容易,验证答案难——价值和护城河都在验证",还把这句写进了公司名。
你可以怎么做:给团队一个可复述的判断口径——PRD 工厂的质量不取决于"生成得多顺",取决于"验证得多狠"。资源优先砸在"验证 / 评审"这一侧,而不是继续加生成花样。
② 你的职业 & 操作系统(杠杆 > 工时、判断力 > 努力、该 all-in 哪个"编码下注")
③ StockHelp / 价值投资视角
④ Chief of Staff / 元约束(聚焦)
更深三角度
所以呢