ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.26
第 26 期 · AGENT 工程 · 收录于 2026 年 8 月 15 日

构建自动交易信号系统

A
Anthropic · Claude
视频 20:45 原文约 1.6 万字 预计阅读 21 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 26:32
TL;DR · 三句话
  1. Man Group(管理超 2000 亿美元、客户是养老金/主权基金的另类投资公司)已在受监管、动用真实资金的生产环境里,运行由 AI 全程主导的 trading signal(信号,提示该买/该卖某只股票的判断依据)——AI 想点子、AI 取数据、AI 跑回测、AI 写策略提案、AI 把信号产品化上线,人类只在最后做审核「确保它合情合理(make sure that it was sensible)」。讲者强调「AI 是整个流程的核心(AI was at the center of that process)」。→ 详细
  2. signal 只是冰山一角,真正难的是水面下那一整套工作流(数据怎么清洗、价格怎么拼接、异常值怎么检测、跑在什么基础设施、回测怎么跑);让 AI 发挥作用的关键不是重新训练、也不是 fine-tuning(微调,用自家数据再训一遍模型),而是用 skills 这层「连接层(connective layer)」把组织几十年的机构知识、数据和能力接给 Claude——「skills 正是把这几十年的机构知识转化成杠杆的方式」。→ 详细
  3. 推广 skill 这条路他们「先做错了,才慢慢做对(we got it wrong before we got it right)」:放任「高阶玩家而非流程负责人」自由写 skill,会产出一堆只对个人有效的「局部优化」(典型翻车案例是报销 skill 把成本中心代码写死、把全公司报销单都塞给了一个销售部审批人);真正解锁企业级 AI 的「秘密武器(secret sauce)」是 skills 治理——统一 marketplace、明确归属、evals 测试、完整生命周期管理。→ 详细
🎯 于你何益 为你定制 · 非通用结论

这一期表面是「AI 自动炒股」,但抖出来的真东西是**「怎么让一群 AI agent 在真金白银的高风险场景里靠谱地协同干活」**——而那恰好就是你 Holdwell 那座「多-Agent PRD 工厂」每天在跟的命题。对你最大的命中点不是交易信号本身(那块反而是你该反着看的),而是他们怎么把「人人乱写 skill → 翻车 → 治理收口」这条路走通的。下面按你的项目分。

🏭 Codex Holdwell ERP work(你的多-Agent PRD 工厂)—— 这一期对你最重的命中

这家公司 1700 人、750 人在用 Claude Code、100+ 个受治理 skill,踩的坑和你工厂现在卡的地方几乎是同一道题:一堆 agent / skill 各搞各的,没有统一地基,就没法规模化、产出也没法互比。他们已经替你把弯路走完了,结论很硬。

1. 「先做错才做对」——他们的报销 skill 翻车,就是你「agent 定义没有强制归属、谁都能改」的预演

  • 怎么做的:起初他们全力铺采用率(办工作坊、黑客松、写博客、成果分享会),结果「采用率高得离谱」,但真正在写 skill 的是『高阶玩家』而不是『流程负责人』。最出名的翻车:一个销售部员工写了个报销 skill,把「成本中心代码」**写死(hardcoded)**了,几天后全公司技术部、HR 的报销单全被塞进他一个人的审批队列——他还不负责这事、觉得挺好笑。讲者把它上升成系统性问题:「大家只是把『自己的』做事方式代码化了,而那并不是『整个组织』的做事方式,很多时候他们根本不是那个工作流的负责人。」一旦碰到回测、交易这种承重场景,这就成了「企业级规模化的拦路虎——agent 没法借力,因为根本没有共通性(no commonality)」。
  • 你可以怎么做:这正好戳中你工厂「碰撞协议纪律是否真执行 + 跨线对齐」这两个痛点的同一个病根——没有强制归属,agent 定义 / 实体就会被各条产品线按自己那条线写死,最后互相打架。把这条翻车故事当你工厂治理的「反面教材锚点」:给 .Codex/agents/*.toml 里每个 agent 定义补一行「owner = 谁 / 哪条工作流负责」,凡是动到跨线共享的(实体定义、术语这种地基),改动必须由 owner 评审、不能让单条产品线直接写死。本周就能做的一件具体事:挑你工厂里「最像那个报销 skill」的一个——即某个被单一产品线按自己习惯写死、其实全线要用的定义——把它拎出来重写成「组织通用版」,作为治理样板。

2. 「不统一工作流,连结果都没法比」——直接解释了你「跨线对齐 + agent 产出难验证」为什么难

  • 怎么做的:他点破系统化交易的硬约束——「如果不同团队跑的是不同版本的工作流,你得到的答案就会不一样:一个团队 backtest 亮眼,另一个平平无奇,而你根本说不清是点子真更好,还是他们只是『度量方式不一样(just measuring things differently)』。」解药是「有了共同基础,工作不重复、保证一致性,产出之间才有可比性(outputs are comparable)」。
  • 你可以怎么做:你的六条产品线之所以跨线难对齐、agent 产出之所以拿不出闭环证据,很可能就是各条线跑的是不同口径的工作流和评审标尺——就像他说的「不是点子更好,是度量方式不一样」。把这句当你对齐的判据:先统一标尺再比,别先比再统一。本周一件事:给你的真人评审定一份「跨线都必须照同一份 rubric 打分」的硬约束(哪些项、怎么计分、什么算过),让各线产出第一次变得「可比」——闭环证据的前提是「同一把尺」。

3. 「skills 治理 = 统一 marketplace」的六条清单——可以直接抄成你工厂的 skill 注册表 schema

  • 怎么做的:他们最后搭了个统一 marketplace(叫 MAIA),硬性要求每个 skill「①归对应工作流负责人所有;②全部经过测试(evals);③使用情况被追踪;④都经过评审;⑤有完整生命周期(从上线到退役);⑥对所有人可见、随时可装」。比喻是图书馆——「每件藏品都用心对待」,正是这份 care 让它跑起来。配套还区分「受管 managed / 社区 community」两类,并把一组 skill 打包成 plugin。
  • 你可以怎么做:这六条几乎就是你工厂缺的那张「agent 资产注册表」字段清单。你已经有三驾马车的 agent 定义(.Codex/agents/*.toml)+ 碰撞协议的关卡,但据档案还缺「可验证」和「跨线地基」——把这六个字段(owner / 有没有 eval / 用量 / 评审记录 / 生命周期状态 / 是否对全角色可见)做成每个 agent 定义与共享约定的元数据表头,缺哪条就是你的待办。尤其「②全部经过 eval 测试」直接对应你「agent 产出的可观测/可验证」:没有 eval 的 agent 定义不上岗,这就是那个你一直缺的强制点。本周一件事:把三个 agent 定义和共享约定过一遍这张六列表,标出红格(缺 owner / 缺 eval 的),红格清单就是你下个迭代的治理 backlog。

4. 「先想清方法,再谈推广 + 把 skill 当生产代码」——给你工厂落地节奏的两句忠告

  • 怎么做的:两条压轴 lesson——「先规划方法、再规划推广(plan your approach before the rollout):谁负责?谁评审?怎么退役?怎么测试?这些要在发布第一个 skill 之前定好,而不是像我们等到第一百个才想」;以及「把这些 skill 当生产代码来对待,因为它们最终就会变成生产代码」(要上版本管理、测试、审查)。
  • 你可以怎么做:你工厂 2026-06 刚换轨成三驾马车 + 碰撞协议,正是他说的「该停下来先把方法定清、别急着继续铺量」的时刻。别急着往工厂里加新 agent / 新环节,先把上面那张治理表补全——这就是「在起步期而不是第 100 个时收口」的窗口期,你比 Man Group 幸运,现在动手成本低得多。

📈 StockHelp(价值投资)—— 强相关,但主要是「该反着用 + 镜子」,别照搬

1. 「你永远没法预知未来,只能回看历史」+ 回测那套指标——这块和你的价值投资有真张力

  • 怎么做的:他坦诚系统化交易的根本不确定性——「你到底该用哪个因子排序?它管不管用?你又怎么知道?说实话你永远没法真正确定(you never really know)」,所以「能做的最好的事就是把策略放回 15 年以上历史里回测,让它经历各种宏观环境和压力测试」,再看年化收益、回撤(「总有亏的时候」)、夏普比率(「为了赚这点钱你坐了多大的过山车」)。Demo 里他们用 4 个 skill、拿信用卡消费数据造了个 signal,2021 年投 1000 刀现值约 2500 刀、跑赢买入持有;但他立刻自我质疑「可能只是 Amazon 一家的 fluke」,于是丢进「更大的零售公司池子」用分布式 worker 各跑一遍再汇总。
  • 你可以怎么做(注意是反着用):你是价值投资者,StockHelp 的 Phase 1 明确「只看数据、不做信号」,找的是「卓越生意 + 被低估」、长期持有——这跟他「按过去三个月收益率排序选股、做多做空、靠回测验证」的动量/量化逻辑根正面冲突。所以别把「signal + 回测」搬进 StockHelp,那会把你从「企业质量」拽回「价格游戏」。真正能搬的只有一条方法论纪律:他那句「先在一只票上成立 ≠ 普适,要丢进更大池子用分布式 worker 各跑一遍防 fluke」——你看板上某个「便宜信号」(比如 PE 跌破 5 年分位)也可能是单票噪音,值得把同一条估值判据丢到 watchlist 全部 12 只上横向跑一遍,看它是不是只对某一只成立。这是把他的「防过拟合」纪律迁移过来,而不是把他的因子搬过来。

2. 「signal 是冰山尖、水下才是真功夫」——这一条对你 StockHelp 反而是正向的

  • 怎么做的:他反复讲「想出 signal 是最快的一步,真正难的是它底下的工作流:数据怎么清洗、价格怎么拼接(stitch prices)、异常值怎么检测、跑在什么基础设施」——signal 只是露出水面的尖。
  • 你可以怎么做:这正好印证你 StockHelp 现在做对了的事——你 Phase 1 把力气全花在「拉数据 / 算 PE 分位 / 算公允价(target_pe×EPS)」这些水下工作流上,而没急着做信号,方向是对的。把这条当你的定心丸:估值看板的价值 80% 在「数据干净、口径一致、比率算对」,而不在「弹个买卖提示」。本周一件事:检查你看板的数据管线有没有他点名的那几个雷——价格序列拼接处有没有断、异常值(比如停牌/拆股造成的 PE 跳变)有没有检测,这些「水下」质量问题比加信号重要得多。

3. 一面镜子:「组织 context 是 AI 时代为数不多还安全的护城河」

  • 怎么做的:压轴 lesson 第一条——「聚焦组织的 context:那是你的 IP、你的护城河,是 AI 时代为数不多还安全的领域之一(one of the few safe spaces left in AI)。前沿实验室不会替你解决 context,它不在互联网上、他们不懂你的工作流,而你本来就拥有几十年积累——要做的是把它暴露出来,而不是重新发明一遍。
  • 对你的镜子:把「组织 context = 护城河」翻译到你的投资视角,就是一句很值的提醒——你真正不公平的优势,不是抄某个 signal,而是你自己积累的那套「卓越生意判断 + 思维模型库」(你第二大脑里那 9 个主题、StockHelp 里你亲手定义的估值口径)。AI 给所有人同样的通用能力,但「你怎么判断一门生意值不值得长期持有」这套 context 是别人拿不走、也是大厂帮不了你的——这恰恰是你该持续往深里挖、而不是去追市场上现成信号的地方。

🛠 app_incubator & Personal Thinking —— 中等相关,各一条

1.(app_incubator)「黄金路径:从 AI 平台一路连通到你的能力和 context」

  • 怎么做的:他给方法论收尾的比喻是「铺一条 golden path(被铺好、推荐大家都走的标准化最佳路线),从你的 AI 平台一直连通到你的能力和你的 context」,并强调 skill 是那层「连接层(connective layer)」,把组织几十年知识接给 Claude。
  • 你可以怎么做:你 app_incubator 主打「设计稿即工程的强制契约 / 7-Agent 链路」,痛点是「把『该做什么』前移到 agent」。这条「黄金路径」正是你要的形状——与其让 7 个 agent 各自摸索接口,不如铺一条从 Figma/Notion/Chrome MCP 到产出的『推荐主路』,让 agent 默认走主路、偏离才需要理由。本周一件事:把你链路里「最常被 agent 走偏」的那一环,显式写成一条带默认值的 golden path 指引。

2.(Personal Thinking)「skills 是把几十年知识变成杠杆的方式」

  • 怎么做的:他的核心命题之一是「skills 正是把这几十年机构知识转化成杠杆的方式(how decades of knowledge becomes leverage)」——知识不接上 AI 就只是沉睡的藏品,接上了才变杠杆。
  • 你可以怎么做:这正是你第二大脑「和 AI 对话为入口」这一层的注脚,也对上你「跨主题串联」的痛点——你那些原子笔记若只是躺着,就是图书馆藏品;做成能被 AI 调用的 skill(像你现在这套 wiifm / video-to-text),才把它们变成杠杆。本周一件事:盘一下你 9 个主题里「最该被做成可调用 skill、却还只是静态笔记」的那一块,它就是你下一个杠杆点。

🔁 更深三角度

  • 该反着用:他整套是大机构、资源足、做动量/量化、追求规模化协同;你是一人多线、精力是元约束、做价值投资。所以 StockHelp 那条「signal + 因子 + 回测」要反着用(坚守你不做信号的 Phase 1 纪律);而工厂治理那套要正着抄但缩小——你不需要 MAIA 那种重型 marketplace,一张六列的 agent 资产注册表 + 一条「无 eval 不上岗」的硬规则就够,别学他「等到第一百个才治理」,也别学他用 1700 人的方式治理你一个人的工厂
  • 和你现做法冲突:他强调「采用率是人的问题,不是授权问题——要主动触达、要做培训和参与度」。但你是单兵,没有「一群人要被触达」——所以对你而言这条要翻译成「采用率是『你未来的自己』愿不愿意用的问题」:你工厂/技能若设计得让三个月后的你嫌麻烦不愿走治理流程,它就会像 Man Group 那样退回各搞各的。冲突点在于:他靠组织推力维持纪律,你只能靠把流程做得足够省力来维持纪律——这是你设计治理时和他最大的不同,别照搬他的「推广」打法。
  • 对你的镜子:他说「先想清方法,再谈推广;要在第一个 skill 前定好治理,而不是第一百个」。照到你身上是一句很准的提醒——你同时在推 6+ 条线(ERP工厂、app_incubator、StockHelp、第二大脑、CoS、小红书),每条都在「往里加东西」,但没有一条停下来先把『方法/治理』定清。你正站在 Man Group 刚起步的位置,而不是第 100 个:现在收口的成本,是你这辈子最低的一次。

One Human Company 新号(2026-07 回填)

1 · B 支柱的黄金对照案例:Man Group 的「报销 skill 翻车」就是 AI 员工管理的公开教材

  • 怎么做的:Man Group(1700 人、750 人在用 Claude Code)一个销售部员工写了个报销 skill,把成本中心代码写死,几天后全公司技术部、HR 的报销单全被塞进他一个人的审批队列——写的人还不负责这事、觉得挺好笑。讲者 Tashara 的定性:「大家只是把自己的做事方式代码化了,而那并不是整个组织的做事方式」,解法是六条治理清单(owner / eval 测试 / 用量追踪 / 评审 / 生命周期 / 可见可装)+「把 skill 当生产代码对待」。
  • 你可以怎么做:候选标题(B×C 交叉)——《对冲基金的 AI 把报销单塞爆了别人的审批队列,我连夜查了自己 AI 员工的说明书》。用这个翻车当引子,晒你 drizzle tech 的对照检查:9+1 角色的 skill 里有几个是"写死了我个人习惯"的、你补了哪几列治理字段、有没有挖出自己的"hardcoded 成本中心"。闸门自检:只讲 Man Group 故事是搬运,必须带你的检查结果。可抄物现成:那张六列治理表,缩成一人公司版三列(owner / 有无测试 / 该不该退役)。

2 · 你正站在「第一个 skill」而不是「第 100 个」——这既是行动也是选题

  • 怎么做的:他最自嘲的教训——「治理要在发布第一个 skill 之前定好,而不是像我们等到第一百个的时候才想」;先想清方法再谈推广。
  • 你可以怎么做:drizzle tech 还在 building 第一个 App、公司还小,现在给 AI 员工立规矩的成本是史上最低——这本身就是一篇 A 类决策复盘《公司只有我一个人类的时候,我先写了员工管理制度》:为什么在没翻车之前就立规、立了哪几条、多花了几小时、防住了什么。"提前治理 vs 先跑起来再说"的取舍正是你独占词「想清楚/决策」的正面示范。自检:全是你的决策过程,天然成立。

3 · D 类立场句素材:「context 才是 AI 时代的护城河,通用能力人人都有」

  • 怎么做的:他的压轴 lesson——「组织 context 是你的 IP、你的护城河,是 AI 时代为数不多还安全的领域之一。前沿实验室不会替你解决 context……要做的是把它暴露出来,而不是重新发明一遍」。
  • 你可以怎么做:翻译成一人公司版立场句:「一人公司的护城河不是会用 AI,是你喂给 AI 的那套只有你有的判断和数据」——可反驳(很多人信"prompt 技巧就是壁垒"),且直接为你的号自证:你的 drizzle tech 实操记录本身就是别人复制不了的 context。控量放进 D 类池。

🧭 所以呢

  • 可迁移思维模型
    • 【耐用】「冰山法则」——任何看起来很酷的产出(signal / PRD / 看板提示 / 一篇笔记)都只是露出水面的尖,决定成败的是水下那套数据/工作流/治理。判断一件事靠不靠谱,先问「它的水下部分有人管吗」。这条几年后依然成立。
    • 【耐用】「先成立 ≠ 普适,丢进更大池子防 fluke」——对你的投资判断和产品试点都适用:单点成功要去更大样本上横向验证,再下结论。
    • 【耐用】「context 是护城河,工作在『暴露』而非『重造』」——AI 时代你的不公平优势是你独有的判断/数据/口径,把它接给 AI 就是杠杆,别去抄通用能力。
    • 【会过期】具体工具形态——「100+ governed skills、MAIA marketplace、Claude Code 当编排器」是 2026 年的形态;明年 agent 协同的标准件会变,但「统一地基 + 强制归属 + 评测才能上线」这条治理骨架不会过期。
  • 判断更新:你工厂「碰撞纪律靠自觉 + 跨线共享地基薄」过去可能被当成「待补的工程细节」;这一期告诉你它其实是决定你工厂能不能从『单人玩具』升级成『可规模化协同』的命门——和 Man Group 卡在同一道坎上。优先级该往上提。
  • 这周一个赌注把你 Holdwell 工厂的三驾马车 agent 定义与跨线共享约定过一遍那张「六列治理表」(owner / eval / 用量 / 评审 / 生命周期 / 全角色可见),标出缺 owner 或缺 eval 的「红格」,并定下一条硬规则——「无 eval 的 agent 定义不上岗」。 这一个动作同时补上你「纪律靠自觉」和「产出难验证」两个痛点的病根,且是本周就能做完、成本最低的收口。
接着读