这期对你高度相关:表面是模型公司聊大模型,内核全是「一个人 / 一支小队怎么用多个 AI Agent 把活干完、还干得可靠」——正好压在你 app_incubator、Holdwell 多 Agent PRD 工厂、StockHelp 三条线上。下面按项目对。
app_incubator(7-Agent 造 App 链路)
1. 多模型系统:别让每个 Agent 都用最贵的模型
- 怎么做的:张佳圆说他们工作流里「大量场景可以 Pipeline 化(批量自动流转)」,并不是所有环节都要用最高级模型;他们每人好几个 Claude Code + Codex + Cursor 账号、每月上千刀 token,成本逼着他们做「多模型系统」——让便宜的 M3 专心写代码,再用 Opus / GPT 给它做 review、当 mentor(复核者),「让不同的活交给不同的模型」,达到「花费 vs 产出」的平衡。
- 你可以怎么做:你那 7 个 Agent 现在大概率同一个模型跑到底。把链路里「便宜也能干」的环节(拉 Figma 变量、套模板、生成占位文案、跑 lint)换小模型 / 便宜档,把贵模型只留给「设计稿转代码、跨 Agent 对齐」这种真要脑子的步骤;再单设一个「审查 Agent」专挑上一个 Agent 的错。一条「每条产线花了多少 token」的成本线,就是你看板上的新指标。
2. 把踩过的坑「蒸馏成 skill」喂给 Agent,而不是每次重讲
- 怎么做的:何涛说这代模型「太有魅力」,会让你以为它是魔法棒,但它常「讨巧」、甚至你本来是对的它也顺着说「你说得对」。他的做法是把踩过的坑「蒸馏成一个个 skill,或配上 Google / Amazon 的 Best Practice + 你的偏好喂给 Agent」,还说「每个人写出来的代码,跟他性格都挺像」。
- 你可以怎么做:这正是你那套 skill 体系在做的事,但他给了个增量动作——每当某个 Agent 犯了一个你来回纠正过两次以上的错,就当场把它固化成一条 skill / rule(一句「不要 X、要 Y」),让 skill 库随着踩坑长大,而不是停在最初设计的那批。
3. 「别说是 Agent 做的、不怪我」——产出永远是你的责任
- 怎么做的:何涛最重的一句——「我特别讨厌有人说『这是 Agent 做的所以别怪我』;只要是用你的账号、你的 credit 提交上来的,背后就是你的责任心和你对世界的态度,要 take it seriously(认真对待)。」
- 你可以怎么做:多 Agent 工厂最容易滑向「反正是 agent 生成的」。在链路末尾加一个人工签字位:上线前由你、或一个固定的「负责人 Agent」对整包产出签字背书,而不是默认「Agent 出什么就是什么」。
4. 「老婆掉发」案例 = 你 app_incubator 的「激活」样板
- 怎么做的:何涛用 Codex 给焦虑掉发的老婆搭了个「她专属的 LLM」——把体检报告、吃过的药、连她和某 Chatbot 的聊天记录全导进去,接到她的飞书里,让她问「下次看医生该问什么」,结果她和医生的沟通明显更顺畅。一个很小的个人 app,却真解决了一个真人的真烦恼。
- 你可以怎么做:你一直纠结 app_incubator 的「激活 / 首屏体验」——这案例就是模板:最好的第一个 app 不是炫技,是给一个具体的人解决一件具体烦心事。拿你身边某个人的某个真痛点做 demo,首屏第一步就让他把自己的数据 / 情境喂进去,价值当场可感。
Codex Holdwell ERP work(多 Agent PRD 工厂)
1. 「生成」暴涨、「验证 / review」严重掉队——要给验证配同等力气
- 怎么做的:MiniMax 内部的观察——大厂里一个人现在能一次提一个「巨大的 PR,看起来是对的,但没人敢上线」,因为 QA / 验证速度根本没跟上,「review 这一环是缺失的」。结论原话:「应该在『验证』上投入到接近『研发生产』的力度,否则项目就会崩。」
- 你可以怎么做:这几乎是冲着你「agent 产出缺可观测/可验证」来的。你的 PRD 工厂同样是「生成端」很猛、「验证端」靠人自觉。把碰撞与真人评审从「靠自觉」升级成硬门:每个环节配一个必须跑过的「验证 Agent」+ 一份机器可查的 checklist,跑不过就卡住,不靠人记得。
2. 「写代码是 engineering,不是一次性交付」——你的 PRD 也是
- 怎么做的:何涛批评 SWE-bench 这类基准「全是一次性解决一个问题」,模型变成「使命必达」的卷王,干完「Just so-so」,而且「你后面接着它做根本做不下去」。他给 engineering 的定义是「能长期交付、持续有生命力」,不是一次性产物。
- 你可以怎么做:你「真人评审意见回炉难成闭环」的痛点,根子就在这——一份 PRD 被当成「一次性交付物」,产出就完事。改一条判收标准:一份 PRD / 一份 agent 产出的价值,看「下一个人 / 下一个 Agent 能不能接着它往下做」,把「可被接续」明确写进碰撞与评审的检查项里。
3. 10X 专家计划:什么是「好」,要由领域专家定义,不只是流程
- 怎么做的:IO 讲数据观转变——从「数据标注」转向「请真专家带路」。逻辑是:算法同学能搭出模型和评测框架,但「什么算好」得让真正的领域专家来定(他还举例 Anthropic 招核物理学家,专门测模型「能不能被用来造核武器」);coding 因此从 2 个角色(算法 + 工程)演化到 3 个角色(+ 领域专家)。
- 你可以怎么做:你的 PRD 工厂「角色 / 流程」很全,但「ERP 业务到底对不对」最终得有跨境电商 ERP 的真专家把关。给评审明确加一个**「领域专家视角」**(哪怕是你自己戴上业务专家的帽子,或拉一位真业务),让它有权否决那种「流程上完美、业务上错」的 PRD。
StockHelp(投资)
1. AI 在金融的价值是「筛信息 + 降门槛」,不是替你选股
- 怎么做的:虞扬说用户问得最多的就是「帮我选几个股」,可这题谁也答不了;同行的通病是「你问一只股,它罗列一大堆信息,然后……就没有然后了」。AI 真能做的是两件事:① 筛信息;② 降门槛——把「市盈率这个数字是大了还是小了、对你意味着什么」用大白话讲清。而且他们「给用户的输出不带投资建议,只在内部用回测算胜率」。
- 你可以怎么做:这给 StockHelp 看板指了个方向——先别做「替你拍板买哪只」的信号,先把「解释」做厚:每只股的 PE / 5 年分位旁边,自动配一句白话「现在算贵还是便宜、为什么、对你这种价值投资者意味着什么」。你 Phase 1「只看数据」的克制,和虞扬「不输出投资建议」是一个道理。
2. 「应对」比「预测」更重要 + 创始人们「只投资我自己」
- 怎么做的:被追问「要不要辞职 all-in 炒股」,虞扬说炒股不是生成一段文字——信息 / 画像 / 状态都得对、还实时变化、随时来黑天鹅,「真正重要的不是预测它会怎么走,而是事情真发生时你怎么应对」。而 IO、张佳圆、何涛三位创始人不约而同地说「我只投资我自己和我自己的公司 / 不推个股」。
- 你可以怎么做:把 StockHelp 的 Phase 2/3 信号设计成**「应对预案」而非「预测涨跌」**——比如「跌破你设的安全边际就提醒你回头复核基本面」,而不是「预测下周会涨」。这跟你价值投资「安全边际、能力圈、别追涨杀跌」的心态是一路的。
Personal Thinking · 本人精力
- 怎么做的:张佳圆(自认「AI 降临派」,认定 AI 终将比人强)说人都有惰性、有了 AI 就爱「把思考外包给 AI」;他的对策是「和 AI 一起探索,但把『思考』这个最重要的部分留给自己」。IO 也反复强调「智能最终是要为人服务的」。
- 你可以怎么做:你这本第二大脑最大的风险,就是退化成「让 AI 替你想」的外包站。守住一条线:AI 负责检索 / 转写 / 起草(像这篇就是),但「这条对我有什么用、该不该做」这步永远你自己来——这正是你「判断力 > 努力」操作系统的具体执法点。
更深三角度
- 该反着用:MiniMax 是资源充足、要连追两代上 10T 的前沿实验室;你是一人多线、精力是最稀缺资源。别学它「追规模」,要学它 M2 那个更狠的动作——只押注 coding + agent、主动放弃人人都在刷的 Arena 排行榜。 翻译到你身上:砍掉「虚荣指标」(小红书的点赞数、看板里花哨但没人用的功能),把精力压在一个能带来「真实使用」的点上。
- 和你现在做法冲突:何涛主张「一开始残缺、会被喷,接受被喷,先把覆盖面铺出来」;你的操作系统却是「该不该做先于做多快、盯那 1%、判断力 > 努力」。这是一处真张力:到底是先糙快猛铺面、用「被喷」来迭代(尤其你那个空着没跑的小红书指标盘、还有 StockHelp),还是先想透、只做对的那 1%?这期不给标准答案,但值得你为每条线明确选一边——别两边都想要。
- 对你的镜子:三位创始人都说「我只投资我自己和我自己的公司」「把思考留给自己」。对一个把精力当元约束、还在纠结「该 all-in 哪个编码下注」的人,这是面镜子——你最大的一笔投资,可能也该是「集中下注在你自己 + 那一个最该赢的项目」上,而不是雨露均沾地同时维护六条线。
One Human Company 新号(2026-07 回填)
「多模型分工 + 便宜模型干活、贵模型 review」——一篇自带成本账的 C 类选题
- 怎么做的:张佳圆说他们每人好几个 Claude Code + Codex + Cursor 账号、每月上千刀 token,成本逼出了「多模型系统」:让便宜的 M3 专心写代码,再用 Opus / GPT 当 review / mentor,「让不同的活交给不同的模型」求花费和产出的平衡;MiniMax 内部还观察到「生成暴涨、验证掉队——巨大的 PR 看起来对但没人敢上线」。
- 你可以怎么做:这是你 B 支柱(AI 员工管理 / 成本账,你最独占的赛道)的天然弹药:候选标题《MiniMax 团队说"别让每个 AI 员工都用最贵的模型",我给 9 个 AI 员工重排了工资表》——把 drizzle tech 流水线里各角色现在用什么模型、每月 API 账单摊开,按「便宜模型干活 + 贵模型 review」重排一轮,晒重排前后的账单和返工率,给判断:哪个岗位降档翻了车、哪个岗位贵模型纯属浪费。可抄物是那张「岗位 × 模型档位」工资表模板。闸门自检:没有你的真实账单和翻车记录,这篇只是转述圆桌观点,不成立——等账期跑满一个月再发,能过。
- 对你的镜子:何涛那句「我特别讨厌有人说『这是 Agent 做的所以别怪我』」正是你新号的人设底线——一人公司里所有产出都签你的名,这句可以直接当一篇 D 类立场句:「AI 员工翻车,锅永远是老板的。」
所以呢
- 可迁移思维模型【耐用】:「生成 vs 验证,要等量投入」——别只在「做出来」上堆力气,「验证它对不对、能不能被接着用」要配同等力气。这条不只管代码,管你所有产线:PRD 工厂的关卡、StockHelp 的解释、小红书的复盘,乃至这本知识库的信噪比。
- 判断更新:以前你可能默认「多 Agent = 效率」;这期把它修正成「多 Agent = 生成效率暴涨,但责任和验证全压回你一个人」——所以下一步的杠杆不在「再加 Agent」,而在「加验证、加签字」。
- 这周一个赌注:在 app_incubator 或 Holdwell 工厂里挑一条产线,给它加一个独立的「验证 / review Agent」+ 一个一句话签字位,同时把链路里至少一个便宜环节换成小模型。一周后看两件事:错漏是不是少了、token 成本是不是降了。