这一期是行业统计,不是个人方法论——但正因如此,它对你的相关度反而更高。 它给的不是"某个人怎么做",而是"1,048 个正在做同一件事的人,此刻做到哪一步、卡在哪里、为什么花钱"。你手上那几摊——ERP 那条多角色的需求流水线、造 App 的那条链路、决策外脑、选股看板、这本第二大脑、还有那个 build-in-public 账号——每一摊都能在这份调研里找到自己的坐标,而且是带百分比的坐标。所以这一期的用法是:先定位自己在曲线的哪一段,再决定该追、该等,还是该写成内容。
(家居内容号这一摊这期没命中:一份 AI 工程调研跟家居选题之间没有真实关联,硬掰只会污染你的选题池,略过。)
Codex Holdwell ERP work · 那条多角色的需求流水线
1)全行业控制 agent 的手段只有两招,你不必等更好的方案
- 怎么做的:agent 今年真的落地了——95% 的人在用(约去年两倍);用 agent 的人里 89% 的 agent 拥有写权限(去年才 52%);全体样本中"在用带写权限 agent"的比例同比涨了三倍多。但控制层完全没跟上:排前两位的手段是人在回路的审批和权限门禁,Barr 的评价很锋利——"这些直觉是对的,但基本上就是你拿来管一个实习生的那套工具";再往下答案就散开成任务拆解、检索、记忆、沙箱,"大家什么都在试。还没有人把 agent 的控制层给定下来。"→ 详细 → 详细
- 你可以怎么做:你那条流水线最疼的一处是纪律靠自觉——碰撞协议写在文档里,「独立初稿互不可见」有没有真做到没人保证。这份数据等于给你一张许可证:别再等更优雅的范式,全行业也就这两招,你把其中一招用满就已经在中位数之上。 挑权限门禁这一招(因为它不消耗你的注意力,而审批消耗),本周把三驾马车各自的可写可见范围列成一张表:独立初稿阶段 ux-designer 和 tech-lead 互相拿不到对方的稿,评审环节只读。凡是"其实用不到、但当初顺手给了"的权限,一律收回。粗糙没关系——缺的从来不是精巧,是它到底有没有在执行。
2)出事先怀疑上下文,别先怀疑接口
- 怎么做的:agent 出问题"通常出在'思考'上,而不是'管道'上"——约三分之二的人说最抓狂的是幻觉,或者任务做到一半就把上下文丢了。Barr 本人盯得最紧的一项正是记忆与持久化上下文,她判断"未来一年它会有很大的演进"。→ 详细
- 你可以怎么做:你的跨线对齐总对不齐、agent 产出总拿不出可核验的证据,大概率不是编排的问题,而是链路跑到后半段时,前面定过的约定已经被挤出上下文了。第一步不是加角色也不是加校验,而是给每一步定一份必须随身携带的最小清单:这一步要交付什么、上一步定死了哪几条不能违反、术语去哪查;每一步开工前强制复述一遍。同时把"先查上下文,再查接口"定成你排错的默认顺序——这一条能省掉你大量花在错误方向上的排查时间。
3)越靠近你的独特逻辑,越只能自己造——跨线共享的实体定义没人替你做
- 怎么做的:调研把技术栈拆成八层分别问自建还是外购,结论很清晰:买得最多的是推理与模型服务("很多人不想自己搭推理基础设施,这也很合理");自建最多的是提示词管理,61% 自己做,越靠近产品逻辑的层——提示词、检索、评估——越倾向留在内部;微调是最明确的"还没到时候",大多数人压根没做。而且路径依赖极强:"买了现成方案的人,就不太想自己造;自己造过的人,也不太想去买。"→ 详细 → 详细
- 你可以怎么做:你六条产品线强耦合、跨线联动频繁,最需要一份共享的业务实体定义,而这份数据解释了为什么它没有现成方案——它恰好属于最不可能买得到的那一层,只能自己砌。既然这个决定反悔率极低,就趁早把界线画死:模型和推理一律外购(别折腾),提示词、检索、评估、实体定义一律自建并进版本库。这周先挑"被三驾马车反复引用的那几个业务概念",写成一份大家共同引用的定义,哪怕只有五个词条——地基不是一次砌完的,是被引用出来的。
4)头号难题连年是评估,而主流解法还停在肉眼看
- 怎么做的:Barr 每年都问"你技术栈里最大的挑战是什么",第一名每一年都是 evals;今年的新变化是它领先的优势非常小、差距还在缩小。而评估方法里排第一的,"一如既往"是凭感觉人工过一遍。她还把心照不宣的话说破:"有 96% 的人的技术栈是有问题的,你们只是在'到底是哪个问题'上达不成一致而已。"→ 详细 → 详细
- 你可以怎么做:你那套三驾马车碰撞 + 真人评审,本质上就是结构化版的"凭感觉过一遍"——这已经强过行业主流了,问题只在纪律有没有真被执行。所以别急着造自动评估:先做更便宜的一件事——挑一小组固定的真实需求当回归卷子,每次改流水线就重跑一遍、把结果存档。行业头号难题的主流解法都还停在肉眼看,你的差距不在方法先进,在有没有一份能重复跑的卷子。有卷子,"agent 产出可观测、可验证"这条才有得治。
app_incubator · 造 App 的那条链路
1)成本已是一等约束,而且是这 12 个月里新长出来的
- 怎么做的:"无限的智能背后,还是有一张按用量计费的账单。"40% 说成本经常影响他们用 AI 时能有多激进,另有 36% 说有时候会——合计约四分之三的人在按成本调整用量。它还渗进了运维层:生产监控项里,成本与 token 用量排第二,仅次于质量本身,"已经像 SLA 一样被盯着了"。Barr 特意强调这是新的:"12 个月前并不是这样。"→ 详细 → 详细
- 你可以怎么做:七个 agent 串起来的造 App 链路是典型的 token 大户,而你现在大概只在月底看账单。把成本从"事后知道"挪成"跑的时候知道":每跑完一轮,记一行——这轮花了多少、哪个角色花得最多、产出有没有用上。跑五轮你就有了一张单位成本表,才谈得上"哪一步值得上最贵的模型、哪一步该降级"。这张表还能直接喂给你那个一人公司账号的成本账支柱——同一份记录,两处使用。
2)模型层别锁死,工具层要收敛
- 怎么做的:87% 的团队在用不止一个模型,原话是"这恰恰是标准化的反面";分配方式最常见的是按任务类型做路由,其次是同时跑多个模型对比输出,也有人按成本路由。但与此同时,超过一半的组织已开始在更少的 AI 工具上做标准化。核心结论是:"我们正处在平台和工具大标准化的早期,而不是模型的标准化。"→ 详细 → 详细
- 你可以怎么做:对到你这条链路,含义很直白——契约和工具链要收敛,模型别锁死。 设计稿即工程契约这条你已经做对了,那就是工具层的标准化;模型层要反过来做,给七个角色按任务分档:出图、写文案这类用便宜快的,定契约、写核心逻辑用最强的。第一步只做一件事:把"这一步用哪个模型"从各处硬写改成一处配置,换模型不用动流程。这一步不做,后面所有成本优化都没有下手的地方。
3)真正决定选型的是质量、工具调用能力和成本,可靠性已掉出前列
- 怎么做的:生产里 94% 用闭源模型、45% 用开放权重模型,而且用开放权重的人里超过 90% 同时也在用闭源——它们是补充不是替代。更大的反差是:尽管开源与闭源之争占了绝大部分话题量,只有 5% 的人把它列进选模型的前三考虑。真正决定选型的是质量遥遥领先,其次是 agentic 能力(比如工具调用)与成本并列;可靠性只有五分之一的人提到,Barr 猜测它已经变成门槛型要求。→ 详细 → 详细
- 你可以怎么做:你这条链路要连设计工具、浏览器、笔记工具,工具调用稳不稳,对你比"模型总体聪明度"更重要——行业把它排在第二正是这个道理。选模型别看榜单总分,跑一道你自己的考题:让候选模型连续调用 10 次你真实用到的那几个工具,数它错几次。另外那个 5% 值得单独记下来:在网上吵得最凶的那个维度,往往是最不影响真实决策的维度——这条对你选工具、选框架,甚至选股票,都成立。
StockHelp · 看板,以及你本人的价值投资
1)这份调研本身就是一张"钱往哪一层流"的产业地图
- 怎么做的:八层技术栈的自建/外购分布画出了一条清晰的分界:推理与模型服务是大家买得最多的一层;越靠近产品逻辑越自建(提示词管理 61% 自建,检索和评估同理);微调则是大多数人压根没做。→ 详细
- 你可以怎么做:直接翻译成投资语言——被"买"的那一层才存在第三方生意,被"自建"的那一层不存在第三方生意。 拿这张图去过一遍 watchlist 上跟 AI 沾边的公司:它卖的东西落在哪一层?落在推理这类"大家愿意买"的层,需求是真的,但也最像大宗商品、迟早拼价格;落在提示词、评估这些层的公司,得先回答一个尖锐问题——为什么客户不自己做(61% 的人就是自己做的)。这一问比任何叙事都硬。
2)路径依赖,就是"转换成本"在真实调研里的样子
- 怎么做的:Barr 的原话是"买了现成方案的人,就不太想自己造;自己造过的人,也不太想去买",这个决定的反悔率极低。→ 详细
- 你可以怎么做:给你的选股清单加一栏:这家公司的客户,要换掉它得重做什么? 如果答案是"重写一堆自己攒下来的东西",路径依赖就站在你这边;如果是"改个配置",那它的定价权是假的。这一栏比毛利率更早暴露护城河的真伪,而且不看财报也能问出来。
3)一个卖点掉出采购前三,通常意味着它已经商品化
- 怎么做的:可靠性只有五分之一的人提到,Barr 的解读是它变成了门槛型要求——候选模型都够可靠了,于是决策往上走一层,去比质量、能力和成本。→ 详细
- 你可以怎么做:这条可以直接搬进你的投资判断:当一个曾经的核心卖点掉出买方的决策前三,往往不是它不重要了,而是它已经好到不用比了。 反过来用最有价值——如果一家公司今天还在拿"我们更稳定"当主要卖点,而它的客户已经不愿为这个额外付钱,那它的差异化正在蒸发。给看板加个提问位也行:每只票写一句"它今天卖的,还是不是买方真正在比的那个维度"。
onehuman_company · 一人公司 build-in-public
这一期对这个账号是弹药级的,因为整份调研全是可引用、可证伪的断言。
1)你就是那 17%——这份调研给了你一个有名有姓的坐标
- 怎么做的:81% 表示 AI 正在模糊工程师与产品、设计、市场之间的界线(Barr 原话:"这些数据让我很震惊");超过三分之一的团队已有非开发人员在发布功能,17% 说非开发人员经常在整个技术栈上发布面向客户的功能——"这一点让我觉得挺离谱的";即便不做发布,也有三分之一的团队看到非开发人员做出真正有用的原型和前端稿。她的结论是"发布软件已经不再以'你得是个工程师'为门槛"。→ 详细 → 详细
- 你可以怎么做:你这个账号的核心设定是"一个 PM 开了家只有自己一个人类的公司",一直缺一句能立住的外部依据——现在有了:一份 1,048 人的行业调研说 17%,而一位投资合伙人站在台上说这个数字让她震惊。 你不是个例,你是那条曲线的前端。这本身就是一整篇:开头给这个数字,中间给你自己发布过什么、翻过什么车、花了多少钱,结尾给可抄物(一个非开发人员要把功能真正发上线,最少需要哪三样东西)。弹药库闸门也过得去:删掉你的实测就只剩一张柱状图,说明你的判断是必需项,不是装饰。
2)验证体选题的现成矿,一期能供四条
- 怎么做的:这份调研几乎每一段都是一句可实测的断言——控制 agent 的主流手段还停在"管实习生"那套;头号难题的主流解法还是凭感觉过一遍;96% 的人技术栈有问题;约三分之二的人栽在幻觉和半路丢上下文;四分之三的人按成本调整用量。
- 你可以怎么做:你的验证体支柱要攒到四篇以上,这一期一次就能供出四条:①"调研说 96% 的人技术栈有问题——我把自己那套 agent 数了一遍,我的问题是这几个";②"全行业控制 agent 还在用管实习生那套,我给我的 AI 员工做了张权限表,第一周被拦了几次";③"三分之二的人栽在半路丢上下文,我复现了一次,代价是多少钱";④"四分之三的人按成本调整 AI 用量——这是我一个月的 AI 员工账单明细"。每条都天然自带数字标题和成本账,正好压在你四根支柱里的两根上。闸门提醒:这些选题的价值不在转述调研,而在你自己那一栏数字——没有那一栏就别发。
3)"更开心"和"在担心"是同一批人,这个并存就是你的差异化角度
- 怎么做的:97% 报告 AI 对组织有净正面影响,而且最主要的红利不只是快,是"试一试"这件事几乎变成零成本;但同时超过十分之九的人感受到某种负面下游影响,最常见的两项是深层技术能力的退化和对代码库理解的退化;押注题里,76% 说 AI 提升了工作满意度,59% 担心今天 AI 写出的代码会留下长期隐患——两条并存,说明是同一批人。→ 详细 → 详细 → 详细
- 你可以怎么做:市面上"我让 AI 全自动干了 X"的爽文太多,而同一批人里 76% 更开心、59% 在担心——这个并存本身就是你的位置。写一篇《我用 AI 造了一年 App,退化的是我哪部分能力》,把你自己也不确定的地方老实写出来。可抄物是一份自检清单:哪几件事你规定必须自己动手、不交给 agent。 这正好落在你那个"每篇要有可抄物、要讲清楚翻什么车"的定位上,也是别人最难抄走的那类内容。
Personal Thinking · 这本第二大脑
- 怎么做的:两个可以直接搬走的东西。一是 Barr 自创的"采用意愿比"——她每年真正盯的不是"多少人在用",而是"还没用的人里有多少打算用":音频从去年 37% 涨到今年 56%;而真正跳升最大的是图像生成,从 18% 翻倍到 36%,那正是意愿变成事实的那一年。二是她做这件事的动机原话:穿透噪音,退一步看看大家到底在做什么。→ 详细 → 详细
- 你可以怎么做:你这本第二大脑卡在摄入 SOP 和信噪比,而"采用意愿比"是一个可以直接抄的领先指标思路:光看"我记了多少条"没用,要看"我记下来、明确打算用、但还没动手的有多少"。给你的巡检加一格:每次列出这批里"打算用还没用"的,下次巡检先回头结这笔账。没结掉的意愿,比新增的笔记更能说明你的信噪比问题。 另外,这一期本身就是"退一步看整体"的范本——你的知识库已经堆了一百多期同类内容,缺的正是这样一份年度回看:一年做一次带数字的年度总结,而不是凭印象。
Chief of Staff apps · 决策外脑
- 怎么做的:Barr 明确点名她盯得最紧的一层是记忆与持久化上下文,"未来一年它会有很大的演进";而当下失败模式的大头恰恰是任务做到一半就把上下文丢了(约三分之二)。控制手段那边,人在回路的审批依然排第一。→ 详细
- 你可以怎么做:你这个外脑的全部价值押在一件事上——记得住你写过的原则,并在对的时刻把它放回你眼前,也就是行业公认最没解决、且被一位投资合伙人公开点名"明年会大变"的那一层。两个含义:一是别急着追新框架,这一层还在动,现在锁死技术选型大概率会白做;二是你反而有主场优势——这一层最难的其实是"知道该记住什么",而你有一部现成的宪法,等于自带一份记忆清单。这周做件小的:把宪法里的原则压成十条以内的短句,让它每次给建议之前,先复述命中的那一条。先解决"想得起来",再解决"记得住"。
你本人的精力 · 元约束
- 怎么做的:三个数放一起看很说明问题:97% 说净正面、最大红利是试错几乎零成本;超过九成的人同时有负面下游影响;四分之三的人在按成本调整用量。还有一条连续三年不变的规律:受访者偏资深但接触 AI 短——软件从业超过 10 年的人里,超过一半 AI 经验在三年以内。→ 详细 → 详细
- 你可以怎么做:"试错变便宜"对你是双刃的——试错成本塌了,意味着开一个新项目的成本也塌了;而你的稀缺资源从来不是试错成本,是注意力。 你手上同时推的这七摊,多半就是这条红利的副产品。给自己立一条对称的规矩:每开一个新的,必须同时点名一个降级为"这一季不投注意力"。另外那条"资深但接触 AI 短"是给你的定心丸:这个行业里绝大多数人的 AI 经验也就三年以内,你不是落后,你和所有人一样在实时学一门新范式——这一格没有老手,只有先动手的人。
更深三个角度
该反着用。 这份调研的样本是有团队、有预算、有报销卡的公司——Barr 自己就开玩笑说,不受成本影响的那四分之一"可能是有公司报销卡"。你没有报销卡,账单就是你自己的钱。所以有些数字对你要反过来读:他们说"成本正在成为产品决策的一部分",对你是"成本从第一天起就是产品决策本身";他们能靠人在回路的审批控制 agent,是因为回路里有别人,而你的回路里只有你一个人——人在回路对你不是护栏,是瓶颈。你越把审批当成控制手段,你越会变成自己流水线上的堵点。正确的借鉴是反过来:审批降到最低,权限门禁和不可逆动作清单做到最狠,让不该发生的事根本发生不了,而不是发生前来问你。
和你现在做法冲突。 两处。一处轻:87% 的团队在用不止一个模型、按任务类型路由,而你多半是一个模型打天下图省事——行业已经用脚投票说模型各有所长,你省下的那点事,换来的是成本和质量两头都不占优。另一处很硬:你的操作系统里写着"判断力 > 努力""问该不该做先于做多快""99% 的努力终将白费,盯那 1%",而这份调研公认的最大红利是"试一试几乎变成零成本"。 当试错便宜到极致,"先想清楚该不该做"这条原则的性价比是下降的——有些问题,直接并行试三个版本,比想三天更快拿到答案。这是真冲突,不替你下结论,但你得回答一句:在哪一类问题上,你愿意把判断力换成试错次数? 把这条线划出来,比继续两边都信要值钱得多。
对你的镜子。 这份调研里最像你的那一格,不是"AI 工程师",是那 17%——非开发人员,经常在整个技术栈上发布面向客户的功能,而一位投资合伙人看到这个数字的反应是"挺离谱的"。你一直把自己框成"一个会用 AI 的产品经理",但按这份数据,你的身份已经变了:你是正在把"发布软件"这道门槛拆掉的那批人之一,而且站在前面那一小撮里。 还有一句更冷的镜子:Barr 说 96% 的人技术栈是有问题的,他们只是在"到底是哪个问题"上达不成一致。你也在那 96% 里,唯一的区别是——公司里的人可以互相吵,你没人可吵,那个答案只能你自己给。 你手上七摊,最大的问题究竟是哪一个,这道题没人替你做。
所以呢
可迁移的思维模型
- 【耐用】采用意愿比:判断一个东西的未来,别只看"现在多少人在用",要看"还没用的人里有多少打算用"。这条对模态、对工具、对一家公司的用户增长、甚至对你自己那份待办清单都成立——它是一切渗透率叙事的领先指标。
- 【耐用】门槛型要求:一个维度掉出决策前三,通常不是它不重要了,而是它已经好到不用比了。用它去区分"这家公司不必再证明的优势"和"这家公司正在失去的优势"。
- 【耐用】买与造的路径依赖:买过的不想造,造过的不想买——这个决定反悔率极低,所以要早想清楚。原则是越靠近你的独特逻辑越自己造,越靠近通用基础设施越买。这跟 AI 无关,换个行业照样成立。
- 【耐用】先怀疑思考,再怀疑管道:多数不靠谱不是接口断了,是它想岔了或者忘了。这是排错顺序,也是管人的顺序。
- 【会过期】所有具体百分比(95%、89%、61%、17%……)。这是一份年度快照,Barr 自己都说做幻灯片的过程中领域已经变了。这些数字的正确用法是"今天的坐标",不是"规律";引用时永远带上年份,明年就得换一套。
判断更新
- 之前你大概默认"控制 agent 一定有更成熟的方案,只是我还没找到";这份调研的答案是全行业都没有,前两位手段就是审批和权限门禁。别再等范式,先把这两招粗糙地用满。
- 之前你可能把成本当成后期优化项;现在它是行业公认的一等约束,而且是12 个月内新长出来的。对一个自掏腰包的一人公司,它比对他们更早、更硬。
- 之前你大概认为多 agent 的难点在编排和接口;数据说约三分之二的痛苦来自幻觉和半路丢上下文——难点在记忆和上下文,而这正是一位投资合伙人公开点名"未来一年会有很大演进"的那一层。你在这一层的投入不会白费。
- 再补一条心态更新:软件从业十年以上的人里,超过一半 AI 经验不到三年。这个领域没有真正的老手,你那点落后感大部分是错觉。
这周一个赌注
把这份调研变成一人公司账号的第一篇验证体,选题就用你自己那个坐标:《一份 1,048 人的调研说 17% 的非开发人员在发线上功能——我就是那 17%,这是我的账单和翻车记录》。为什么押这个、而不是先去改流水线:它一次解决三件事——账号最缺的验证体存稿有了第一篇;为了写它,你必须先把这个月的 AI 花销和一次真实翻车记清楚,那份记录本身就是造 App 链路的成本表;而"行业数据 + 我的实测 + 可抄物"这个结构一旦跑通,后面三篇验证体全部照抄同一个模板。成功标准定得很低:这周之内写完一篇,带上至少三个你自己的数字。 三个数字,就是这一期从别人的柱状图变成你的资产的全部代价。