worth of 语法不通,几乎确定是 north of(超过)的误识;金额 300 亿美元逐字保留,仅"超过"二字为推断。这一期是你 All in AI 投资线上分量最重的一份原始材料——不是研报转述,而是这轮 AI 资本开支潮里花钱最凶的那几家公司之一的财务一号位,用 76 分钟把算力采购、分配机制、单位经济、定价哲学、融资结构、投资人尽调问题全部摊开自述。密度极高,且几乎每一条都能直接进你的估值框架。
更重要的是:它和第 162 期(OpenAI CFO Sarah Friar)构成一组几乎完美的对照实验——同一时点、同一行业、竞争最直接的两家公司的财务一号位,各自讲同样的几件事。你在 162 期的笔记里已经给自己下过一个"这周赌注":做一张两家 CFO 的并列对照表。这一期到齐了,那张表现在可以动手了。 而且两人在几个关键点上口径明显不同,差异本身就是最有价值的信息(下面逐条点出)。
怎么做的:他给了一把和 Sarah Friar 完全不同口径的尺子。Friar 用的是"1 吉瓦 ≈ 每年 100 亿美元收入、立起 1 吉瓦全口径约 500 亿美元"的产能换算法;Krishna 拒绝任何单点估计,只谈**"整个算力信封的总回报"——"如果我服务推理,那是支持今天的收入;如果我做模型开发,它可能带来一个解锁 TAM 的能力,那是驱动六个月后的收入"。他还明确否掉了变动成本这个会计范式**:"这种'每多服务一个客户就多一笔变动成本'的想法不太适合我们的生意,它是在试图把我们套进一个软件公司的范式。" 证据很硬:收入从 90 亿跳到 300 亿的那个季度里,根本没有新上一批算力。
你可以怎么做:给 StockHelp 里所有 AI 相关标的加一条估值口径备注:用软件公司的毛利率去看模型公司,结论会系统性失真。 真正该问的三个数是——① 这家公司锁定了多少算力、什么时候到货;② 它把算力变成收入的效率(可用"年化收入 ÷ 在役吉瓦"做粗略代理);③ 它多快能把新到的异构算力投入生产(他把这条当核心竞争力,见下条)。这比追某一季的毛利率数字更接近生意本身。顺手加一栏可跟踪字段:「锁定吉瓦数 / 合约起始年份 / 合约金额」——本期给了 Anthropic 的确切值(谷歌+博通 5 吉瓦、2027 年起;亚马逊 Trainium 最高 5 吉瓦;合计承诺超 1000 亿美元),配上 Friar 那边的对应数字,这一栏就能横向比了。
怎么做的:"算力的吞吐能力本身就是竞争力"是本期最容易被忽略、也最可投资的一个洞见。 他说一两年前"异构算力空投"会很难消化,而今天**"多给一大批算力,会非常快地被部署到这些不同用途上……我们已经能非常快地把几乎任何类型的算力拉起来。这一点我们认为是一个真正的优势。"** 底层是三样东西叠出来的:三平台可互换 + 自建编排层 + 自己写编译器,结论那句是**"在我们组织内部,一美元的算力比在别处任何地方走得都远"**。
你可以怎么做:这给了你一条区分"卓越生意"与"只是买得多"的判别式:在算力普遍稀缺时,谁的算力→产出转化效率更高,谁就能用更少的资本买到同样的前沿位置。对你的选股清单意味着两件事:① 评估模型公司时,"绑死单一芯片供应商"应该被记为风险扣分项——他和 Friar 在这点上罕见地完全一致(Friar 的原话是"只绑一种芯片,就必然会有某个时刻你没法待在前沿");② 对芯片厂与云厂,"客户是否具备跨平台迁移能力"直接决定它们的长期议价权——像 Anthropic 这样能三平台互换的客户,对任何单一供应商的粘性都比表面上低得多。
怎么做的:定价这一段和市场共识是反的,值得单独存档。 公司成立五年多、去年三月才是第一美元收入的三周年、2024 年 3 月才有真正的前沿模型,而定价基本没动过;唯一一次大调整是降价——发布 Opus 4.5 时把 Opus 系列价格下调,原因是**"相对于 Opus 级模型的能力,它被低估使用了,人们常常把一个 Opus 级的问题硬塞进 Sonnet 里"。结果是杰文斯悖论**:"我们降了价,但消费量上升的幅度远远超出你原本的预期。"而且他把定价稳定性当成产品特性——Opus 4.6 发布时直接替换、价格不变,客户不用重做工作流的经济账。
你可以怎么做:这条给你一个看 AI 公司定价动作的解读器。市场习惯把降价读成"价格战 / 商品化",但这里的降价是产能自信 + 使用错配修正,带来的是消费量的超线性上升。判别方法很实用:看降价之后总消耗量的变化幅度——如果消耗量涨幅显著超过降价幅度,那是杰文斯效应(利好),不是价格战(利空)。另外请注意与 162 期的方向性差异:Friar 讲的是"标价翻倍但客户单 token 成本降 20–30%",Krishna 讲的是"标价下调、消耗量暴涨"——两家在同一时期采取了方向相反的定价动作,这个对比本身就该进你的对照表,而且是那张表里最能引出判断的一行。
怎么做的:融资口径这句要划重点:"自我加入以来我们已经融了 750 亿美元,未来还有另外 500 亿美元来自上个月和亚马逊、谷歌的交易",紧接着是那句定性——"我们融这笔钱,更多是因为那个不确定性锥,而不是为了给业务的亏损补窟窿。" 他还给了不确定性锥的操作定义:在指数增长里,月度增长率上极小的差异会复利成天差地别的结果,所以只做情景不做点估计,并且维持**"极低的更新门槛"**——"一个季度预测一次、下次董事会再看,在我们这门生意里行不通"。
你可以怎么做:"为不确定性融资、而不是为亏损融资"这个说法,本身需要你带着怀疑去验证——它非常漂亮,也无法从外部证伪。把它变成一个可检验的问题放进你的 AI 投资备忘录:这家公司的融资额,是与"已签约的算力承诺"对应,还是与"经营性现金缺口"对应? 前者是提前锁产能(他的说法),后者是补窟窿。Anthropic 的"1000 亿采购承诺 vs 1250 亿融资"这个比值是可跟踪的。这也正好接上你在 162 期记下的那条判别式:"远期收入是签约锁定的,还是从算力量反推的?"——两期合起来,你现在有了一对互补的判别式:一条查收入端,一条查资金端。
怎么做的:他直接给了一份尽调清单(主持人问"如果把你塞进投资人的位子,你会问什么"):① 算力的整体 ROI 是多少、什么时候到、形状如何;② 客户的 ROI 是怎样的、是在测试还是真上量;③ 你未来的算力从哪来、供应商自用与外售的平衡会怎么变。他自家的答案是三组硬数据:NDR 年化超过 500%、财富 10 强中的 9 家、"来的路上我在 Uber 车里签了两笔两位数百万美元的合同,车程大概 20 分钟",并补了一句"我们是在被世界上最老练的买家评判,他们在市场上有选择,而他们选了我们"。
你可以怎么做:把这三问原样抄进 StockHelp 的"AI 标的尽调模板",它比通用的护城河问卷更贴这条赛道。特别是第二问——"是测试还是真上量"——给了你一个可外部观察的代理指标:NDR(净收入留存率)。这是财报里常有、但你之前可能没重点看的数;在 AI 应用/模型公司上,NDR 是"客户到底有没有真拿到 ROI"最诚实的单一指标(老客户续费还加钱,比任何新签数字都可信,也比"客户 logo 墙"可信)。建议给看板加这一栏。
怎么做的:这是本期第二大益项,信号相当硬。 他描述 Anthropic 今天的产品开发形态:"已经不是一个产品经理带两个工程师、花三个月发一个东西了。它每天都在发布,而且有一支 agent 舰队在公司里针对具体任务工作。所以每个人某种程度上都变成了管理者。" 佐证是光一月份就有 30 次产品与功能发布、公司 90% 以上的代码由 Claude Code 写。而下一站"虚拟协作者"的四个要件——组织内上下文、能用你所有的工具、有记忆能从错误中学习、能在长时间跨度上针对一个想法而非一个任务工作——基本就是一份未来 PM 要管的对象说明书。
你可以怎么做:这条直接回答了你"看不见前沿公司 PM 在变成什么样"的缺口,答案是:PM 的工作单位正在从"需求 → 排期 → 交付"变成"配置一支 agent 舰队 + 每天验收"。 有两个可立刻做的动作:① 把"每个人都变成管理者"当成你个人的能力盘点表——你现在管三驾马车(product-manager / ux-designer / tech-lead)其实已经在做这件事了,缺的不是工具而是"验收"这一环:一支 agent 舰队每天出活,你靠什么判断今天这批比昨天好?这正好指向你自己列的痛点"产出可观测、可验证"。② 把"虚拟协作者四要件"当成你自建体系的路线图——对照一下,你的三驾马车目前有上下文、有工具,但"记忆(从上次评审的错误里学)"和"长跨度针对一个想法而非一个任务"这两件基本是空的。补这两件,比再加一个 agent 角色值钱得多。
怎么做的:财务团队那一整段是"非技术职能怎么被 agent 化"的完整样本,比任何方法论文章都具体:所有法律实体的法定财务报表都用 Claude 生成(人复核);有个实时数据平台 AntStats;一个公共仓库里放着 70 多个财务专用 skill,人人可取;在其之上有一个 MFR(月度财务复盘)skill,成品度 90%–95%;周报从几小时压到 30 分钟。他对价值的定性极准:"Claude 不只是在播报天气,它还在帮我们思考驱动因素——这个数字为什么会这样变。" 而 token 排行榜的结果反直觉:用得最多的是最资深的人,第一名是税务主管,不是那个懂编程的年轻人。
你可以怎么做:"70 多个共享 skill + 一个组合式的复盘 skill"这个结构,可以原样搬进 Codex Holdwell ERP work。 你现在的三驾马车是角色型组织(按人格分工),他们是能力型 + 组合型(细粒度 skill 沉在公共仓库,上层用一个 skill 把它们编排成一份成品)。这两种可以叠加:把 6 条产品线里反复要做的动作(对账规则校验、字段口径比对、跨线影响面扫描)各沉成一个 skill 进公共仓库,再写一个"评审前自检"skill 把它们串起来跑一遍——这既是"跨线对齐"的机械化,也是"评审回炉闭环"的前置拦截。而"成品度 90%–95%、剩下的交给人判断"这个交付标准,比"agent 全自动"更现实,也更容易验收。
另一条是对你个人的:"最资深的人 token 用得最多"这个事实,和你在 162 期记下的"Codex 在 OpenAI 内部起飞最快的是 GTM 而非研发"是同一个规律的两面——agent 的扩散不是沿技术能力走的,是沿"谁手上重复判断最多"走的。在 Holdwell 找提效证据时,去看财务对账、客服、跨线协调这些线,而不是只盯产研。
怎么做的:算力分配会那一段其实是一套"多方争抢稀缺资源"的治理机制,可迁移性很强:① 文化前提——"这里没有诸侯,它是以非常协作、而非零和的方式进行的";② 机制——每个团队陈述"拿到这块资源我会拿它做什么",然后就 ROI 公开辩论;③ 一条硬地板——模型开发的算力有绝不下穿的水位,即使短期让服务客户变难;④ 决策后的纪律——"一旦做出决定,就真的对齐,没有事后质疑,没有政治和山头。"
你可以怎么做:这套东西几乎是给你的碰撞协议写的说明书,尤其第 ③ 和第 ④ 条。你的痛点里有一条是"碰撞纪律是否真执行"——他的做法给了两个可抄的补丁:(a)给碰撞协议加一条"地板"——无论这轮 PRD 多赶,独立初稿互不可见这一步不能被跳过(它对应他的"模型开发算力不下穿":短期最贵、长期最值的那件事必须有硬保护);(b)碰撞之后要有一个明确的"对齐时刻"——合成定稿一旦出来,三个角色不再各自退回自己的初稿立场。他那句"决定之后没有事后质疑",正是把"碰撞"和"扯皮"区分开的那条线。
怎么做的:"客户的卡点就是我们的训练目标"这套反馈闭环,是他讲研发优先级最清楚的一段:客户说"我希望模型在这方面更好"或"我在这里卡住了",这些卡点就直接变成训练目标;而他们给客户的回应是**"就按那个去做产品,因为我们会在研发端把它做上去"。同时他们内部持续拿不同训练快照互相比、也跟客户的真实反馈比,并且明说很多公开基准已经饱和,"我们真正的度量是客户告诉我们什么"**。
你可以怎么做:"基准已饱和、真正的度量是客户告诉我们什么"这句,可以直接当成你"产出可观测、可验证"的口径校正。 你现在要验的是 agent 产出的质量,很容易滑向自建一套评分指标;他的提醒是——当自建指标开始普遍拿高分时,它就已经不再有区分度了。更耐用的做法是建一个"真人评审卡点台账":每次评审真人提出的每一条意见都记一行(哪条产品线、哪个角色的初稿出的问题、属于哪一类),这个台账既是你的评测集,也是下一轮该补哪个 skill 的优先级排序。这一条同时打中你"评审回炉闭环"的痛点——回炉的产物不该只是一份改好的 PRD,而应该是台账上多出来的那几行。
该反着用:他的整套打法建立在**"用资本和冗余买不确定性下的容错"上——三个芯片平台、千层蛋糕式的多批次算力、1250 亿融资、"极低的更新门槛"。但这是资本极度充裕方的解法。 你的元约束正好相反:精力是你唯一稀缺的资源,多线并行不是冗余而是漏水。 所以正确的反用方式是:把"多平台冗余"换成"单点深耕 + 可退出设计"——他用钱买"随时能换芯片",你只能用取舍买"随时能停掉一条线而不塌"。具体一点:他那条"模型开发算力有绝不下穿的地板"在你这儿的等价物不是多开一个项目,而是给"每周留一天思考"设一条同样不可谈判的地板**——那正是你自己那 1% 的来源。
和你现在做法冲突:他最反直觉的一条是"极低的更新门槛"——"一个月前成立的事今天可能就不成立了,那会打破你的模型,你得回去更新它",并明说季度预测节奏在他们这门生意里行不通。这和你操作系统里的"判断力 > 努力""接受现实、不抗拒"是同源的,但和"每周留一天思考 + 季度回望"的节奏有张力:他的做法是持续小步重估,你的做法是定期集中重估。值得掂量的问题是:你的哪些判断是"季度级别才会变"的(价值观、长期方向、投资的能力圈),哪些是"月度甚至周度就会失效"的(AI 工具选型、agent 架构、内容号打法)? 前者按季度回望没问题,后者用季度节奏就是明确的滞后。这个分类你自己做一次,比照搬任何一方都值。
对你的镜子:最锋利的一面镜子是那句"如果我们自己都不是超级用户、都不去顶它的极限,你怎么能指望客户去这么做?",加上"token 排行榜第一名是税务主管"这个事实。你是 ERP 产品经理,同时是一个 AI 工具的重度自建者——但你的 Holdwell 同事和用户,是否见过你把这套东西用在你自己的日常业务判断上? 第二面镜子更具体:他们把财务部的重复动作沉成了 70 多个可复用 skill 放进公共仓库;而你的第二大脑里,大量内容是"写完就搁下的档案",而不是"每天被调用的工作台"(这一条你在 162 期已经照过一次镜子了,同一个问题连着两期被两位 CFO 从不同角度点到,说明它不是偶然)。可检验的问题还是那句:你的知识库和 skill 目录里,有多少在过去 30 天真的被某次决策或某个 agent 调用过?