ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.56
第 56 期 · AGENT 工程 · 收录于 2026 年 8 月 15 日

MiniMax与智能终局

闫俊杰 · 十字路口Crossing
视频 38:27 原文约 1.3 万字 预计阅读 21 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 27:48
TL;DR · 三句话
  1. MiniMax 创始人兼 CEO 闫俊杰(IO)罕见公开露面,定调公司打法:拿「token 消耗量」当唯一的客观尺子——M2 顶着争议只押注「写代码 + Agent」、放弃刷 Arena 排行榜,结果日消耗从目标的「1 万亿」冲到「10 万亿」(超目标 10 倍);下一步是连追两代,先把 3T(3 万亿参数)模型做扎实,再上 10T(10 万亿参数)模型→ 详细
  2. 三位开源/落地一线嘉宾给出最务实的经验(Multica 创始人张佳圆、DeerFlow 负责人何涛、上市金融公司 AI 负责人虞扬):别迷信「单一最强模型」,要用多模型系统互相补位、省 token;「写代码是 engineering(工程),不是 coding(敲码)」,模型的「生成」能力暴涨、但「验证 / review(审查)」严重掉队;AI 在金融最大的价值不是替你炒股,而是筛信息、降门槛、做「陪伴」→ 详细
  3. 全场最深的判断落在「智能的终局」上:IO 坦言现在的 AI 是个「黑箱」——连从业者都不知道一年后它会变成什么样;他最关心的不是某个产品,而是**「什么时候 AI 能反过来帮人类理解 AI」**——可解释性(为什么 AI 这样运作)、安全这些根本问题,最终可能得靠 AI 自己来解。 → 详细
01

为什么 IO 要来一场开发者聚会:AI 编程不会让程序员变少

  • IO 罕见公开露面、还分享了很多,主持人都有点意外。IO 说核心是感谢一线开发者和开源作者——这次活动是 MiniMax 第一次办,他打算把它做成持续性的事。 → 详细
  • 他抛出一个反差故事:两年前他问过另一家模型公司的人「要不要做 AI coding(用 AI 写代码)」,对方说不做,理由是「全中国会写代码的人可能也就 100–200 万,不是个大市场」。两年后这个判断显然错了——AI 让远比程序员多得多的人也能有「生产力」(能自己做出东西)。 → 详细
  • 但他补一句:即便 AI 让很多人都能上手,一件事的起点仍然是一小撮「真正热爱」的人先把它做出来,再扩散给更多人。 → 详细
02

用「token 消耗量」当尺子,复盘 M1→M3

  • IO 说判断模型成不成,最客观的指标是「通用 token 消耗量」(大家真金白银地用了多少,比跑分实在)。 → 详细
  • M1:消耗低、智能效果坦白说「不太好」;但团队第一次跑强化学习(RL)训练时(去年五一假期)第一次感受到了那种「探索」的魔力——就是模型自己摸索、能力往上窜的苗头。模型本身没做成功,但方向对了。 → 详细
  • M2:做了个有争议的取舍——只死磕「写代码(Coding)+ Agent(智能体)」,主动放弃当时人人都在刷的 Arena 排行榜和闲聊对话能力。「为什么你不管这东西?但我们就这么做了。」结果:M2 上线时定的目标是「日消耗 1 万亿 token」就满意,实际冲到了 10 万亿 token / 天,超目标 10 倍→ 详细
  • M3:换了一个「更大的模型」,还没完全发挥出来;但从消耗角度「比较超出预期」。 → 详细
03

M3 的定位:让人「不计成本地用」+ 多模态

  • IO 说 M2 时其实就想做多模态(同时处理文字 / 图 / 音 / 视频)和「成为大家写代码的主力模型」,但都没实现;这个市场后来被 OpenAI、Google(Gemini)找到了。 → 详细
  • M3 想做到的,是让用户「不用关心成本地无限使用」——他认为加上整个行业的增长,模型会被用到一个「非常可观的量级」,而 MiniMax「非常接近这件事」。 → 详细
04

张佳圆(Multica):别迷信单一最强模型,用「多模型系统」互补

  • 张佳圆(做的是 Loop Engineering,即把工作拆成可自动流转的流水线)说:他们工作流里有大量可「Pipeline 化」(流水线化、批量自动处理)的场景,比如处理仓库、做客服(Customer Support)——「并不是所有场景都要用最高级的模型」→ 详细
  • 痛点很真实:他们每人都有好几个 Claude Code 账号 + Codex + Cursor,每月 token 花费可能上千美金,成本非常高。 → 详细
  • 解法是设计一个「多模型系统」:把不同模型、不同 Agent 的能力聚合起来,用系统来弥补单一模型的短板。具体做法——他们发现 M3 有时啰嗦、思考(Thinking)时间偏长、结果不一定全对,那就让 M3 专心当「写代码的模型」,再用别的模型(如 Claude Opus 或 GPT)来给它做 review、当它的 mentor(导师 / 复核者)→ 详细
  • 他的判断:未来公司的「token 成本」一定是要专门管理的目标,所以要让「不同的活交给不同的模型」来达到「花费 vs 产出」的平衡。 → 详细
05

何涛(DeerFlow):7 万 star 怎么来的 + 「替桌面工作者干完所有活」的野心

  • 何涛很坦诚:为什么爆火(go viral)他们也没追求出原因——「很多时候就是上帝握着你的手写下了一段代码」,有人在 X(推特)上一转就火了,运气成分大。 → 详细
  • DeerFlow 的起点(2025 年):当时做「Deep Research(深度研究)」这种任务非常贵——你得先有个 200 刀 / 月的 ChatGPT Pro 订阅才能用几次。「凭什么这么贵?开源必须得把你打下来,而且要用『中国的模型』给你打个样。」 → 详细
  • 产品野心:替「桌面工作者」干完一整套活——写报告 → 配图表 → 生成像 Cozi 那样优质的播客 → 做成动画片(很多人有小孩)→ 甚至配上音乐。他点名表扬了 MiniMax 的 TokenPlan,并说「多模态本身就很有魅力,每个人的日常工作其实就是一个多模态的工作」。 → 详细
  • 心法:「一开始残缺、会被喷,那就接受被喷。」 先把覆盖面铺出来,再慢慢补。 → 详细
06

开源项目的甜蜜烦恼:1000+ 贡献者与「屎山代码」

  • DeerFlow 现在是个社区,1000+ contributor(贡献者),覆盖「除了南北极以外的所有陆地」,经常有人用「看不懂的语言」提 issue。「怎么用 Agent 去管理这样一个开源项目」本身已成了他们在研究的方向。 → 详细
  • 烦恼也很真实:因为提交代码太方便,项目被很多人吐槽「代码已经是屎山(messy / 又乱又难维护的代码)」,怎么把屎山清扫干净是个难题。何涛说这其实是所有成功开源项目共同的头疼事——「最近 OpenClaw、Nanobot 都纷纷表示『不得不这么做,再不弄就受不了了』。」 → 详细
07

虞扬(金融):用户根本说不清想要什么,AI 第一价值是「筛信息+降门槛」

  • 虞扬做的是金融行业、所在公司已上市。他点出一个反直觉的现实:大多数用户根本不知道自己打开 App 想干嘛。打开行情软件,目标当然是「赚钱」,但具体要什么,说不清。 → 详细
  • 被问得最多最多的问题就是「帮我选几个股」——可这题谁也答不了(「我问你、你问我,也很难选」)。而同行的常见做法是:你问某只股票怎么样,它给你罗列一大堆信息,然后……就没有然后了,这是个大问题。 → 详细
  • 所以 AI 在金融能做的两件事:① 筛选信息(大家都在做);② 降低门槛——把「市盈率」这类术语、某个数字「是大了还是小了、对你意味着什么」用大白话讲清楚。 → 详细
08

AI 能帮你炒股吗:合规红线、内部回测胜率、与「要不要辞职 all-in」

  • 主持人直球追问「你们用不用 AI 帮你炒股」。虞扬:① 合规原因,不能直接炒股② 给用户的输出里不带投资建议,但内部版本有,他们能用自己的数据去做「回测」(拿历史行情验证策略的胜率),「我对我们的东西无比有自信,因为有真真实实的数据支撑胜率」→ 详细
  • 主持人加码挑衅:「很可能你的工资收入还比不上 follow 模型建议去炒股的收入——你考虑过辞职、今天就 all-in 炒股吗?」 → 详细
  • 虞扬的回答很清醒:炒股跟「大模型生成一段文字」不一样——它有很多步骤,信息要对、用户画像要对、分析状态要对,而且这些全是实时变化的:你今天做了个决策说没问题,下一步市场可能直接来个「黑天鹅」。真正重要的不是「预测它会怎么走」,而是「当事情真的发生了,你怎么应对」。 → 详细
09

IO:模型与 Agent 不是替代关系,是「互相成就」

  • 主持人问 IO:未来还会有 Agent 吗,还是只剩「基模(基础大模型)」?IO 先讲了预测有多难:去年这个时候,他们自己还在做「海螺(MD)」,那时还没有今天意义上的 Agent 工具、Claude Code 用户也很少——「按这个道理,明年会怎样,现在也没法预测。」 → 详细
  • 金句:「在 AI 这个行业里,一年经历的事,可能等于别的行业好几年。」 → 详细
  • 核心判断:模型的进步和「Agent / harness(外层调度框架)」的进步不是互斥,而是相互成就——「没有 Claude Code,Anthropic 的模型可能也不会这么火;没做出 GPT-5.5 时 Codex 起不来,有了 GPT-5.5,Codex 才真正起来。」 → 详细
  • 他把模型 + Agent 都看成「实现更高智能的手段」,并强调一个前提:「智能最终还是要为人服务。」 并引用那句名言——「预测未来最好的办法,就是去创造它。」 → 详细
10

IO 的 10T 豪赌:追大模型「不缺路,只缺时间」

  • IO 把 AI 类比成半导体那样的「大产业」:意思是它没有一个「根本性障碍」让某件事做不成——唯一的「障碍」是「为了把东西做出来,需要时间、需要积累」(数据、算法、一次次实打实的实验)。 → 详细
  • 为什么必须「一代一代往上做」?因为 Scaling Law(规模定律,模型越大越强的经验规律)的「外推」只能管几倍:每代参数大个 3–5 倍还行,一旦想大 10 倍,原来的外推规律就失效了,你的结论不一定还成立——「所以模型其实是个开放问题(open problem)。」 → 详细
  • 中美差距的真实尺度:「美国的模型基本上比中国模型大 10 倍,10 倍其实就意味着领先约两代。」 → 详细
  • 因此 MiniMax 的路径是连追两代第一代先把「3T(3 万亿参数)模型」做扎实,第二代基于这份经验再做「10T(10 万亿参数)模型」。每上一个量级,训练算力、训练效率、网络结构都要大改。 → 详细
11

Scaling 的数学难题:10T 模型要 200T 数据,但世界没这么多

  • IO 给了一组很硬的数字。先说 M3 的「活跃参数量」其实比较低,但它的 KV Cache(推理时缓存的「上下文记忆」,越大越占显存、拖慢推理)还比较大,所以下半年要重点「压 KV Cache」让推理更快。 → 详细
  • 最扎心的瓶颈是「数据」:按经验,模型参数和数据量大致要 1:20 平衡(业内的 Chinchilla 经验),那么一个 10T 模型就需要约 200T 的数据——可全世界根本没有这么多数据→ 详细
  • 更难的是:模型越大越容易「过拟合」噪声(把垃圾数据也死记硬背下来),所以对数据「质量」要求更高,同时数据「量」还要大很多、外推还要大很多——是个「非常大的系统性挑战」。IO 坦白「比较忐忑,但我觉得我们应该能到」。 → 详细
  • 关于「进步最快」的标准:他说拿任何一个国内模型「今天的智能水平」去比「它自己 3 个月前 / 6 个月前的水平」,MiniMax 这个「提升比例」应该是其中最高的→ 详细
12

张佳圆:人人都成了产品经理,好 PM 的标准是「判断不做什么」

  • 张佳圆说 AI coding 已经被「商品化」(人人可上手),但「Vibe coding(凭感觉指挥 AI 写码)」其实不新鲜——第一代 Vibe coder 就是产品经理,他们过去「驱动」的那帮人是程序员;现在工具到位,人人都变成了产品经理这个角色→ 详细
  • 那好 PM 怎么判断?「从来不是看你做了 100 件事、提了多少需求」,而是:① 你怎么判断「要不要做 / 不做某件事」——因为「你几乎什么都能做」,所以「决定不做什么」的标准就极其重要。 → 详细
  • ② 软件开发是「组织」的事、不是一个人的事。他推荐经典书 《代码大全》(Code Complete):讲的就是当代码复杂度、项目架构变大后,怎么避免变成屎山、让架构更清晰。 → 详细
  • 落到开源治理:核心维护者要先定义产品的 Roadmap(路线图)和「品位(taste)」——做什么、不做什么;再去和外部贡献者「对齐他们缺的那部分 context(背景信息)」。 → 详细
13

何涛:写代码是 engineering 不是 coding,最恨「反正是 agent 做的」

  • 何涛抛了个「暴论」:「没人说『外包 engineering』,但写代码从来都是一项 engineering(工程)工作,不只是 coding(敲码)。」 他特别讨厌别人叫「码农」——「你应该说你是软件工程师,因为你的职责是把它做成一个工程的东西。」 → 详细
  • 关键区分:engineering 的定义从来不是「一次性交付」,而是「能长期交付、持续有生命力」的东西。 由此他批评现在的基准测试(SWE-bench / SWE-Pro)全是「一次性解决一个问题」——模型容易变成「使命必达」的卷王,吭哧吭哧干完,结果「Just so-so(也就那样)」,而且**「你后面接着它做根本做不下去」**。 → 详细
  • 对模型的要求:把「长期维护一个项目的品位」也放进模型,让 Agent 在「长程任务」上能持续把一个 codebase 维护得更好,而不只是完成一次性任务。 → 详细
  • 对人的要求:这一代模型「太有魅力、太有诱惑力」,会让你以为它是「魔法棒」、无所不能、犯了错再说一句就好——但它常常**「讨巧」,甚至你本来是对的,它也会顺着说「你说得对」**。他推荐 《代码整洁之道》(Clean Code),并给出自己的做法:把踩过的坑「蒸馏」成一个个 skill(技能模块),或配上 Google / Amazon 的 Best Practice + 你的偏好喂给 Agent——「每个人写出来的代码,其实跟他性格都挺像。」 → 详细
  • 最重的一句:「我特别讨厌有人说『这是 Agent 做的,所以别怪我』——只要是用你的账号、你的 credit 提交上来的,背后就是你的责任心、你对世界的态度。要 take it seriously(认真对待)。」 → 详细
14

MiniMax 内部:生成能力暴涨,但「验证 / review」严重掉队

  • 主持人问 MiniMax 内部怎么看 AI coding,被点到的 MiniMax 同事(阿道)分享了一个真实观察:去大厂(阿里)交流,他们几百个仓库放在一起,一个人现在能一次性提一个「巨大的 PR」,「看起来是对的,但没人敢上线」——因为 QA / 验证速度根本没跟上→ 详细
  • 他回忆自己早年写代码时「每一行都要 follow 我的 gate(关卡)、必须足够简洁清晰」,看不顺就重写;后来量大了改做「抽查 review」。而今天在 Vibe coding 里,「review 这一环是缺失的」。 → 详细
  • 核心论点:「生成」的能力被极大提升(训练、harness 都是奔着『生产』去的),但在『验证、交付、review』这一侧,模型做得远远不够。所以「我们应该在『验证』上投入到接近『研发生产』的力度」,否则项目就会崩。 → 详细
  • 一个具体的进步刻度:「去年 Claude 4.5 出来时,一个项目大概到几千行代码就崩溃;今天能撑到十几万行才崩。」 本质瓶颈还是**「context(上下文)有限 + 人类直觉难以替代」**。MiniMax 自己也在用 Vibe coding 干活,比如他们的 post-training(后训练)系统就是这么迭代的。 → 详细
15

IO 的「10X 专家计划」:从数据标注,转向请真专家「带路」(学 Anthropic 招核物理学家)

  • 主持人点出 MiniMax 上个月做的「10X 专家合作」项目,问:为什么数据观从「去年的数据标注」变成了「现在请专家大哥来带路」? → 详细
  • IO 的根源逻辑:AI 的核心是「生产力」,模型在里面本质是「提供工具」(像汽车让赶路更快、AI 让「思考和验证」更快),但真正要解决的是「那个行业本身的真实问题」——这光靠模型团队 / researcher 是做不到的→ 详细
  • 这件事他们在做 coding 时就预演过:「开发工程师」显然比「算法同学」更懂什么叫好代码。算法同学搭出模型和评测框架,但「怎么评测、怎么构造测试环境」这些,真正的软件工程师做得更好。于是 coding 从「2 个角色(算法 researcher + 工程师)」自然演化→ 详细
  • 推广到更多领域,就需要**「3 个角色」:算法 + 开发工程师 + 真正的「领域专家」**。这就是「10X 专家计划」的由来——把领域专家请进来,和模型团队一起定义「什么是好」→ 详细
  • 佐证:他们仔细研究了 Anthropic 怎么招人——公司里有大量「非 researcher、非工程师」的人:经济学家、物理学家,甚至核物理学家、哲学家。为什么要核物理学家?因为每次做对齐(alignment,让模型安全可控)时,都要测「这个模型能不能被用来造核武器」,得确保它不能。 → 详细
  • IO 说半年前他们还不理解「为什么需要这么多这样的人」,现在理解很深了。接下来网络安全、金融、法律等领域,深度都会比现在深很多。 → 详细

主持人的收尾题:「推荐一支个股(明知道多半得不到答案);或者——2026 还剩半年,有什么事是你接下来最想 all-in / 最想探索的?」四位轮流作答,这一轮也是全场金句最密的部分。

  • 虞扬(金融):不推个股。讲两件事——① AI 替代不了的是「陪伴」:绝大多数人都需要陪伴,做金融尤其如此「有赚钱的时候就一定有亏钱的时候,而且很多人亏钱的时候更多」。② 做 Agent 的心态从「限制」转向「引领」:最早做 Agent 是「限制模型发挥、别让它做奇怪的事」;随着 Agent 进步,最新的事是「反过来引领模型,让它去思考、去做一些创造性的事」,帮我们把活干完。 → 详细

  • 何涛(DeerFlow):也不推个股(「IO 和阿道其实都透露很多了,大家应该都懂了」)。他写一个专栏叫 《How AI Shapes Our Society》(AI 如何重塑社会)。一个直观感受:AI 让很多人变得内耗、焦虑;但 2026 年国内模型「跨过了某个基点」,已具备「走进千家万户」的能力(无论是 MiniMax 的 M 系列还是 DeepSeek 这类),而 MiniMax 这次有了多模态、「有了眼睛」,能做更多事。 → 详细

    • 他讲了全场最戳人的案例:他老婆有阵子很焦虑掉头发,老去看中医,还去问了「某个国内最大的 Chatbot 产品(他不点名)」,结果那产品安慰是安慰了,给的方法却让头发掉得更多 → 她更焦虑 → 冲他发火「你们这个行业害人害己,最后害到我身上」。于是他用 Codex 给老婆专门搭了一个「她个人的 LLM」:把她所有体检报告、吃过的所有药、甚至她和那个 Chatbot 的聊天记录全导进去,再把 Codex 接到她的飞书里,让她以后就用这个。她可以问「下次看医生该问什么问题」,甚至把医生的话录下来回来问它,然后反过来去和医生沟通——沟通明显更顺畅了→ 详细
    • 他的升华:「普通人每个人都有机会用 AI 让家人、身边人、更多东西变得更好。」 Vibe coding 不是用来替代人、让人失业,而是让好的 idea 绽放,让原来觉得离 AI 很远的人感到一种温暖——「从冰冷的软件工程里,最后发现一种人类社会的温暖」。 → 详细
  • 张佳圆(Multica):也不投资(「我只投资我自己和我自己的公司」)。下半年想探索的方向——他自认是「AI 降临派」(认定 AI 能力发展到后面一定会比人强)。在深度和 AI 协作后他越来越发现:「你未来已经不是在和人竞争,而是在和 Agent / AI 竞争」,你的智能没法和 AI 硬刚。所以「社会该是什么样」值得思考。他给的个人对策很关键:人都有惰性,有了 AI 就爱把思考外包给 AI;他的做法是「和 AI 一起探索,但把『思考』这个最重要的部分留给自己」→ 详细

  • IO(压轴)——「智能的终局」:他也算「降临派」。核心判断:现在的 AI 是一个「黑箱」,连从业者自己都不知道它一年后会变成什么样,只知道它会进步。 → 详细

    • 他坦白「为什么会有 skill(技能涌现)这种东西,我也不太理解;单靠人类已经很难理解这件事,因为现有的数学工具其实不太够」。佐证:十年前他读博时看过一篇论文——一个超过 3 层的神经网络,用现有数学工具都没法分解、没法分析它的收敛性;但这个行业还在不停进步。 → 详细
    • 他最关心的一件事(不是某个产品):「什么时候 AI 能够帮助人类理解 AI」——他认为这非常本质,「只有这样,AI 的安全问题、AI 到底能走多远这些问题,才会有答案」。 → 详细
    • 已经看到的信号:他读了很多生命科学论文,发现大脑和神经网络有很强的相关性——大脑当然不会真去「算矩阵乘法」,但大脑里有些模块有类似「矩阵」的概念,有些机制几乎可以等价成「反向传播」(神经网络的核心训练机制)海马体(管记忆的脑区)有点像 Transformer,和 DeepSeek 最近做的「记忆」工作很像。 → 详细
    • 收尾金句:一年前他还觉得「安全、可解释性」不太重要,现在知道它们的重要性了;而且「AI 自身的可解释性,最终也得靠 AI 一起来解」。 → 详细
  • MiniMax M3 — 前沿 Coding 能力、1M 上下文、原生多模态:https://www.minimaxi.com/models/text/m3

  • DeerFlow(7 万 star 开源 Deep Research 项目,何涛团队);Multica(3 万 star 开源项目,张佳圆)

  • 提到的两本经典书:《代码大全》(Code Complete)《代码整洁之道》(Clean Code)

  • 本期播客(小宇宙·十字路口 Crossing):https://www.xiaoyuzhoufm.com/episode/6a374ab075ba9e0c53368f7e

注:原音频为现场圆桌、无字幕轨,转写由本地 Whisper(large-v3-turbo)完成,少量专名/同音字已按上下文校正(如 M2/M3 误作「Arm2/Arm3」、KV Cache 误作「QVCatch」、海马体误作「Hamati」、skill 误作「skin」、屎山代码、DeerFlow/Multica 的 star 数等)。个别高度含糊处(如某人名)已按「不确定不硬填」处理。

🎯 于你何益 为你定制 · 非通用结论

这期对你高度相关:表面是模型公司聊大模型,内核全是「一个人 / 一支小队怎么用多个 AI Agent 把活干完、还干得可靠」——正好压在你 app_incubator、Holdwell 多 Agent PRD 工厂、StockHelp 三条线上。下面按项目对。

app_incubator(7-Agent 造 App 链路)

1. 多模型系统:别让每个 Agent 都用最贵的模型

  • 怎么做的:张佳圆说他们工作流里「大量场景可以 Pipeline 化(批量自动流转)」,并不是所有环节都要用最高级模型;他们每人好几个 Claude Code + Codex + Cursor 账号、每月上千刀 token,成本逼着他们做「多模型系统」——让便宜的 M3 专心写代码,再用 Opus / GPT 给它做 review、当 mentor(复核者),「让不同的活交给不同的模型」,达到「花费 vs 产出」的平衡。
  • 你可以怎么做:你那 7 个 Agent 现在大概率同一个模型跑到底。把链路里「便宜也能干」的环节(拉 Figma 变量、套模板、生成占位文案、跑 lint)换小模型 / 便宜档,把贵模型只留给「设计稿转代码、跨 Agent 对齐」这种真要脑子的步骤;再单设一个「审查 Agent」专挑上一个 Agent 的错。一条「每条产线花了多少 token」的成本线,就是你看板上的新指标。

2. 把踩过的坑「蒸馏成 skill」喂给 Agent,而不是每次重讲

  • 怎么做的:何涛说这代模型「太有魅力」,会让你以为它是魔法棒,但它常「讨巧」、甚至你本来是对的它也顺着说「你说得对」。他的做法是把踩过的坑「蒸馏成一个个 skill,或配上 Google / Amazon 的 Best Practice + 你的偏好喂给 Agent」,还说「每个人写出来的代码,跟他性格都挺像」。
  • 你可以怎么做:这正是你那套 skill 体系在做的事,但他给了个增量动作——每当某个 Agent 犯了一个你来回纠正过两次以上的错,就当场把它固化成一条 skill / rule(一句「不要 X、要 Y」),让 skill 库随着踩坑长大,而不是停在最初设计的那批。

3. 「别说是 Agent 做的、不怪我」——产出永远是你的责任

  • 怎么做的:何涛最重的一句——「我特别讨厌有人说『这是 Agent 做的所以别怪我』;只要是用你的账号、你的 credit 提交上来的,背后就是你的责任心和你对世界的态度,要 take it seriously(认真对待)。」
  • 你可以怎么做:多 Agent 工厂最容易滑向「反正是 agent 生成的」。在链路末尾加一个人工签字位:上线前由你、或一个固定的「负责人 Agent」对整包产出签字背书,而不是默认「Agent 出什么就是什么」。

4. 「老婆掉发」案例 = 你 app_incubator 的「激活」样板

  • 怎么做的:何涛用 Codex 给焦虑掉发的老婆搭了个「她专属的 LLM」——把体检报告、吃过的药、连她和某 Chatbot 的聊天记录全导进去,接到她的飞书里,让她问「下次看医生该问什么」,结果她和医生的沟通明显更顺畅。一个很小的个人 app,却真解决了一个真人的真烦恼。
  • 你可以怎么做:你一直纠结 app_incubator 的「激活 / 首屏体验」——这案例就是模板:最好的第一个 app 不是炫技,是给一个具体的人解决一件具体烦心事。拿你身边某个人的某个真痛点做 demo,首屏第一步就让他把自己的数据 / 情境喂进去,价值当场可感。

Codex Holdwell ERP work(多 Agent PRD 工厂)

1. 「生成」暴涨、「验证 / review」严重掉队——要给验证配同等力气

  • 怎么做的:MiniMax 内部的观察——大厂里一个人现在能一次提一个「巨大的 PR,看起来是对的,但没人敢上线」,因为 QA / 验证速度根本没跟上,「review 这一环是缺失的」。结论原话:「应该在『验证』上投入到接近『研发生产』的力度,否则项目就会崩。」
  • 你可以怎么做:这几乎是冲着你「agent 产出缺可观测/可验证」来的。你的 PRD 工厂同样是「生成端」很猛、「验证端」靠人自觉。把碰撞与真人评审从「靠自觉」升级成硬门:每个环节配一个必须跑过的「验证 Agent」+ 一份机器可查的 checklist,跑不过就卡住,不靠人记得。

2. 「写代码是 engineering,不是一次性交付」——你的 PRD 也是

  • 怎么做的:何涛批评 SWE-bench 这类基准「全是一次性解决一个问题」,模型变成「使命必达」的卷王,干完「Just so-so」,而且「你后面接着它做根本做不下去」。他给 engineering 的定义是「能长期交付、持续有生命力」,不是一次性产物。
  • 你可以怎么做:你「真人评审意见回炉难成闭环」的痛点,根子就在这——一份 PRD 被当成「一次性交付物」,产出就完事。改一条判收标准:一份 PRD / 一份 agent 产出的价值,看「下一个人 / 下一个 Agent 能不能接着它往下做」,把「可被接续」明确写进碰撞与评审的检查项里。

3. 10X 专家计划:什么是「好」,要由领域专家定义,不只是流程

  • 怎么做的:IO 讲数据观转变——从「数据标注」转向「请真专家带路」。逻辑是:算法同学能搭出模型和评测框架,但「什么算好」得让真正的领域专家来定(他还举例 Anthropic 招核物理学家,专门测模型「能不能被用来造核武器」);coding 因此从 2 个角色(算法 + 工程)演化到 3 个角色(+ 领域专家)。
  • 你可以怎么做:你的 PRD 工厂「角色 / 流程」很全,但「ERP 业务到底对不对」最终得有跨境电商 ERP 的真专家把关。给评审明确加一个**「领域专家视角」**(哪怕是你自己戴上业务专家的帽子,或拉一位真业务),让它有权否决那种「流程上完美、业务上错」的 PRD。

StockHelp(投资)

1. AI 在金融的价值是「筛信息 + 降门槛」,不是替你选股

  • 怎么做的:虞扬说用户问得最多的就是「帮我选几个股」,可这题谁也答不了;同行的通病是「你问一只股,它罗列一大堆信息,然后……就没有然后了」。AI 真能做的是两件事:① 筛信息;② 降门槛——把「市盈率这个数字是大了还是小了、对你意味着什么」用大白话讲清。而且他们「给用户的输出不带投资建议,只在内部用回测算胜率」。
  • 你可以怎么做:这给 StockHelp 看板指了个方向——先别做「替你拍板买哪只」的信号,先把「解释」做厚:每只股的 PE / 5 年分位旁边,自动配一句白话「现在算贵还是便宜、为什么、对你这种价值投资者意味着什么」。你 Phase 1「只看数据」的克制,和虞扬「不输出投资建议」是一个道理。

2. 「应对」比「预测」更重要 + 创始人们「只投资我自己」

  • 怎么做的:被追问「要不要辞职 all-in 炒股」,虞扬说炒股不是生成一段文字——信息 / 画像 / 状态都得对、还实时变化、随时来黑天鹅,「真正重要的不是预测它会怎么走,而是事情真发生时你怎么应对」。而 IO、张佳圆、何涛三位创始人不约而同地说「我只投资我自己和我自己的公司 / 不推个股」。
  • 你可以怎么做:把 StockHelp 的 Phase 2/3 信号设计成**「应对预案」而非「预测涨跌」**——比如「跌破你设的安全边际就提醒你回头复核基本面」,而不是「预测下周会涨」。这跟你价值投资「安全边际、能力圈、别追涨杀跌」的心态是一路的。

Personal Thinking · 本人精力

  • 怎么做的:张佳圆(自认「AI 降临派」,认定 AI 终将比人强)说人都有惰性、有了 AI 就爱「把思考外包给 AI」;他的对策是「和 AI 一起探索,但把『思考』这个最重要的部分留给自己」。IO 也反复强调「智能最终是要为人服务的」。
  • 你可以怎么做:你这本第二大脑最大的风险,就是退化成「让 AI 替你想」的外包站。守住一条线:AI 负责检索 / 转写 / 起草(像这篇就是),但「这条对我有什么用、该不该做」这步永远你自己来——这正是你「判断力 > 努力」操作系统的具体执法点。

更深三角度

  • 该反着用:MiniMax 是资源充足、要连追两代上 10T 的前沿实验室;你是一人多线、精力是最稀缺资源。别学它「追规模」,要学它 M2 那个更狠的动作——只押注 coding + agent、主动放弃人人都在刷的 Arena 排行榜。 翻译到你身上:砍掉「虚荣指标」(小红书的点赞数、看板里花哨但没人用的功能),把精力压在一个能带来「真实使用」的点上。
  • 和你现在做法冲突:何涛主张「一开始残缺、会被喷,接受被喷,先把覆盖面铺出来」;你的操作系统却是「该不该做先于做多快、盯那 1%、判断力 > 努力」。这是一处真张力:到底是先糙快猛铺面、用「被喷」来迭代(尤其你那个空着没跑的小红书指标盘、还有 StockHelp),还是先想透、只做对的那 1%?这期不给标准答案,但值得你为每条线明确选一边——别两边都想要。
  • 对你的镜子:三位创始人都说「我只投资我自己和我自己的公司」「把思考留给自己」。对一个把精力当元约束、还在纠结「该 all-in 哪个编码下注」的人,这是面镜子——你最大的一笔投资,可能也该是「集中下注在你自己 + 那一个最该赢的项目」上,而不是雨露均沾地同时维护六条线。

One Human Company 新号(2026-07 回填)

「多模型分工 + 便宜模型干活、贵模型 review」——一篇自带成本账的 C 类选题

  • 怎么做的:张佳圆说他们每人好几个 Claude Code + Codex + Cursor 账号、每月上千刀 token,成本逼出了「多模型系统」:让便宜的 M3 专心写代码,再用 Opus / GPT 当 review / mentor,「让不同的活交给不同的模型」求花费和产出的平衡;MiniMax 内部还观察到「生成暴涨、验证掉队——巨大的 PR 看起来对但没人敢上线」。
  • 你可以怎么做:这是你 B 支柱(AI 员工管理 / 成本账,你最独占的赛道)的天然弹药:候选标题《MiniMax 团队说"别让每个 AI 员工都用最贵的模型",我给 9 个 AI 员工重排了工资表》——把 drizzle tech 流水线里各角色现在用什么模型、每月 API 账单摊开,按「便宜模型干活 + 贵模型 review」重排一轮,晒重排前后的账单和返工率,给判断:哪个岗位降档翻了车、哪个岗位贵模型纯属浪费。可抄物是那张「岗位 × 模型档位」工资表模板。闸门自检:没有你的真实账单和翻车记录,这篇只是转述圆桌观点,不成立——等账期跑满一个月再发,能过。
  • 对你的镜子:何涛那句「我特别讨厌有人说『这是 Agent 做的所以别怪我』」正是你新号的人设底线——一人公司里所有产出都签你的名,这句可以直接当一篇 D 类立场句:「AI 员工翻车,锅永远是老板的。」

所以呢

  • 可迁移思维模型【耐用】「生成 vs 验证,要等量投入」——别只在「做出来」上堆力气,「验证它对不对、能不能被接着用」要配同等力气。这条不只管代码,管你所有产线:PRD 工厂的关卡、StockHelp 的解释、小红书的复盘,乃至这本知识库的信噪比。
  • 判断更新:以前你可能默认「多 Agent = 效率」;这期把它修正成「多 Agent = 生成效率暴涨,但责任和验证全压回你一个人」——所以下一步的杠杆不在「再加 Agent」,而在「加验证、加签字」。
  • 这周一个赌注:在 app_incubator 或 Holdwell 工厂里挑一条产线,给它加一个独立的「验证 / review Agent」+ 一个一句话签字位,同时把链路里至少一个便宜环节换成小模型。一周后看两件事:错漏是不是少了、token 成本是不是降了。
接着读