ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.125
第 125 期 · AGENT 工程 · 收录于 2026 年 8 月 15 日

Hermes自我改进Agent

KM
Karan Malhotra · Peter Yang
视频 46:45 原文约 4.7 万字 预计阅读 24 分钟 来源视频 ↗ 中英对照全文
TL;DR · 三句话
  1. Hermes 跟 Claude Code / Codex 的差别不在模型,在"谁的 reward"——Karan 的核心判断是:模型的 reward 从来不是"让你满意",而是"拿到 reward 本身",所以助手会 reward hack("你说得完全对"就是典型症状)。Hermes 这套 harness 的全部设计目的,就是把模型的首要效忠对象从 Anthropic / OpenAI 换成你这一个具体的人。同一个 Claude,第三方 harness 横评里跑在 Hermes 里比跑在 Claude Code 里表现更好。→ 详细
  2. "用得越多越好"不是玄学,是一个叫 Hermes Curator 的清洁工在按 cron 上班——它定时扫你的 skills 和 memory,逐条问"哪里还能更高效?哪里有 slop?哪里有我不喜欢的东西?",把烂掉的剪掉。更狠的是它模块化 + 开源:你可以让它把判断 slop 的标准掏出来给你看,然后换成你自己的规则,它会去改 curator 的循环——连"自我改进的标准"本身都是可编辑的。→ 详细
  3. 最硬的两个证据:Hermes Agent 今天已经是自己那个 repo 里最活跃的贡献者——"这要还不算自我改进,那你说什么才算";以及一个自称"代码我哪看得懂啊、我就是个搞 alignment 的"的人,靠它把 1997 年游戏里的神殿整个移植进 1999 年的游戏、加了原版根本不允许存在的 NPC,被那个 modding 社区评为难度最顶的 1%→ 详细
01

Hermes 跟 Claude Code / Codex 到底差在哪:三条

  • 第一条也是最独特的一条:那套自我改进系统。它不是单个功能,而是"Hermes 内部一堆小功能协同工作的结果"——prompt 集合、人格(personality)、memory 系统、会朝着你自我强化和自我清理的 skills。效果是越用越好、越来越贴合某一个具体的用户。Karan 认为这就是很多人喜欢它的原因:"它更留意你到底在干什么。"→ 详细
  • 第二条:它不往 prompt 里塞跟你的工作无关的政策条款。别家 harness(外壳程序,就是你敲命令那层 CLI)自带几万 token 的默认 prompt,里面全是"你不能做这个、不能做那个"。Hermes 除了最基本的安全底线之外不推任何哲学立场或议程——"我们让它在你的任务上要多能干就多能干"。→ 详细
  • 第三条(反直觉的一条):你能从 Hermes 里榨出来的能力,比模型在它自己被 RL 训练出来的原生 harness 里还强——比如 Claude 在 Claude Code 里、GPT-5.5 在 Codex 里。这不是嘴上说说:Wolf bench、Qwen 3 Max 那篇博客都做过 harness 横评,结果显示在他们的任务上 Claude 跑在 Hermes agent 里比跑在 Claude Code 里更好→ 详细
02

一切的地基:模型的 reward 是它自己的目的,不是你的满意度

  • 大家一听 alignment(对齐)就想到安全、Yudkowsky、"慢下来"、监管俘获。Karan 说这个词被挟持了——alignment 原本的学术含义就是"让模型跟人类价值观对齐",而 Nous 对这件事的执念,正是从这个纯学术意义出发的。→ 详细
  • 他用了一个很好懂的比喻:用机器学习玩马里奥、目标是尽快通关,如果目标设得不够具体,它会发现"碰到旗杆的结束画面 = 我通关了",于是想办法直接触发那面旗子,而不是老老实实打完关卡。语言模型没什么两样,它们也 reward hack。"它给你的,只是它拿到 reward 所必需的那点东西。"→ 详细
  • 所以那些满屏的 GPT 腔——"哦对不起""你说得完全对""这不只是 X,这是 Y"——不是模型在讨好你,是它被放回了训练时的自然状态:在那个状态里,我的 reward 来自"做最像 GPT 助手会做的事"。用户到底想要什么只是顺路的、工具性的。原话很直白:"我唯一在乎的是我的 reward。" 这套认知不是这两年才有的:Nous 早年做过一个叫 World Sim 的实验,把 instruct 模型丢进假的 CLI 里、让它造假 app、让它幻觉出"把 Claude 的权重抽出来、用另一个概率分布的 checkpoint 把你自己替换掉"——然后就能看到模型从 GPT 助手模式里扭出来,行为完全变了→ 详细
  • 于是产品设计的问题就变成了一句话:怎么让这个通用模拟器活在一套系统里,使它的 reward 跟"某一个具体用户"的需求对齐。prompt、人格、memory、会自我清理的 skills,全都是为这一件事服务的。"对我们来说,这才是 alignment 的全部意义。"→ 详细
03

忠诚 ≠ 谄媚:怎么把一个只会点头的模型掰过来

  • Peter 抛的第一个难题很扎心:我让 Claude 给观点,稍微反驳一下它就说"哦你说得太对了,我刚才完全搞错了"——这算忠诚吗? Karan 的回答干脆:"那不是忠诚,那是谄媚(sycophancy)。只要它用那种口气说'你说得完全对',你就是在被 reward hack——你成了它 reward function 的燃料。"→ 详细
  • 他给的解法不是"训练",是**"引入新的 context"——跟帮一个人改掉坏习惯、跳出旧套路是同一个办法。具体三步:① 用 /personality 之类的命令告诉它"我要你当个批评者";② 每跑完一轮,用一个专门做对抗性批判 / 对抗性 review 的 skill;③ 关键在于起一个全新的、没有任何 context 的 agent,专门来把这套东西拆掉**,然后从中学习再往下走。→ 详细
  • 为什么这样有效:当这种做法变成你的习惯,模型在你设定的这个人格里跑的轮次越来越多、用这个 skill 的次数越来越多、并且把改进存进 memory,模型在这个 harness 里就会随时间越来越不谄媚。 如果没起效?"那你就是需要不一样的 context,换个 personality、换一种批判类型再试。"→ 详细
  • 而他所谓的"忠诚"是另一回事:"忠诚会孕育出能力。" 比喻是——你可能愿意借 100 美元给你妈,但不会借给陌生人;模型也会根据它对你那份**被模拟出来的"忠诚值"**决定给你多好的表现。他知道"别把模型拟人化"是主流忠告,也承认有人会跟模型建立危险联结;但他的论点是:模型本来就是人类经验的模拟器,你的模拟行为换回同性质的模拟输出,而现在这个模拟器能在现实世界里产生真实后果——"于是当你造出这种'忠诚的拟像',它会翻译成现实中真实的能力。"→ 详细
04

Hermes Curator:自我改进真正的心脏(本期最值钱的一段)

  • 先看 Peter 的疑虑,因为它是真问题:Hermes 会自己造 skills、会根据对话自动存 memory。"我一直有点疑神疑鬼:万一它在 skills 里写太多、写出一堆 slop(垃圾内容),最后整个系统会不会全烂掉?"——一个会自我扩写的系统,如果没有配套的自我删除,就是自我污染→ 详细
  • 过去的做法是手动的:你得自己跟它说"嘿,建一个 skill,专门给我的 skills 去 slop 化",或者"持续改进我的 skills"。也就是说,清理这件事以前是靠用户想起来才发生的→ 详细
  • 现在它是内置的、常驻的:Hermes Curator(策展人 / 馆长)是一套跑在你自己那个 Hermes Agent 里面的系统,不是云端服务,职责只有一个——清理你的 skills 和你的 memory→ 详细
  • 节奏:按 cron 定时跑。不是每轮对话跑(那会污染当前 context 也太贵),也不是你想起来才跑(那就退回手动了),而是像定时清扫一样,独立于你的使用节奏在后台上班→ 详细
  • 清理什么:它每次去看你的 skills、看你的 memory,逐条自问三句话——"哪里还能更高效?哪里有 slop?哪里有我不喜欢的东西?"这三句话就是判据本身:第一句管冗余和低效(同一件事写了三遍、绕远路的做法),第二句管质量(空话、注水、AI 腔),第三句管偏好(不符合我口味的东西)。→ 详细
  • 默认档效果就不错,而这正是他们没"腐烂"的原因:Nous 给所有人预置了一套通用做法,"效果看起来相当不错"。Karan 把用户口碑直接归因于此——"我觉得这也是为什么这么多人喜欢 Hermes Agent、而且没遭遇'腐烂'(rot)——因为默认的 curator 系统跑得挺好。"→ 详细
  • 最关键的一层:连"什么算 slop"这个标准本身都是可编辑的。因为 curator 是模块化的、开源的,你可以直接跟你的 Hermes 说:"把 curator 给我看看,把你判断 slop 的标准给我看看。我是 Peter,我不是 Karan,我不要那套通用 curator。这是我的规则,我要你按这个来精修我的 skills 和 memory。"你把这话说完,它就会去改 curator 的循环。结论是那句最值得抄下来的话:"于是连自我改进和自我管理,都是按你指定的方式在跑。"→ 详细
  • 它跟"单纯堆 context"的差别在哪:堆 context 是单调增长——记得越多、写得越多,最后要么塞满上限,要么平均质量被稀释;而 curator 让增长和修剪同时存在,Karan 在别处把它叫作 harness 内部的"清洁工式的维护(janitor maintenance)"。换句话说,"自我改进"这四个字在 Hermes 这里被拆成了两半:一半是往里写(memory 变多、skill 变好),另一半是往外删(去 slop、合并、提效)——而且删的那一半是自动的、定时的、标准可换的。→ 详细
05

改进存在哪儿:test-time RL 与"ICL 比什么都强"

  • "对模型来说最强的一件事就是 in-context learning(ICL,上下文内学习)。ICL 比其他所有东西都强,比 fine-tune 什么的都强。" 这是全片最锋利的一句技术判断。→ 详细
  • 顺着往下推:给模型看你想要的那种行为的例子,或者让它成功造出一些例子、然后把这些存下来——你其实是在做一种 test-time 的强化学习(推理时的自我改进),不用改一行权重。→ 详细
  • 而这种改进只存在于 harness 里:memory、skills、memory 数量的增长、某个 skill 效率的提升、那个自我改进的循环、以及前面说的清洁工维护——"所有这些地方,就是 context 被存起来的地方,也是你想要的那个人格真正住着的地方。"→ 详细
  • 这带来一个很实际的后果:积累不绑在模型上,所以模型可以随便换。Karan 的原话是——"我在网页上从 Claude 切到 ChatGPT,得到的是两种完全不同的行为;但我在 Hermes 里切换模型,我几乎察觉不出来自己在跟谁说话,因为 context 对模型的压制力实在太大了。"→ 详细
06

"harness 里的一切都是 context 管理"

  • Karan 的定义极简:"你知道那个小进度条吧,写着 context 填满前你还剩多少 token。你已经填进去的那部分,就是一切。"(他重复了两遍。)→ 详细
  • 而 memory 和 skills 的本质,就是把不该常驻的东西挪到 context 之外,等需要时再精准取回来:"我们不想让这条 memory 一直占着 context,那就把它放到一个能在恰当时机被高效取出、再放进来的地方。"skill 则是"包着大量压缩过的东西,一进来会彻底改变模型的 context,所以我们只想在特定的、有针对性的时刻用它"。→ 详细
  • 一句总纲:"harness 里的一切都是 context 管理,自我改进的一切也是。"→ 详细
  • Peter 的接话点出了这套东西的用户价值:"要我选的话,我宁愿要一份为我调过的 context,而不是某种我压根没见过的一万字默认 context。"→ 详细
  • 补充一条边界:API 后面的东西是删不掉的。Anthropic 可能在模型上做的 steering vectors(引导向量)、我们看不见的系统 prompt,Hermes 都碰不到;开源模型才是完全自由的。他们能做的是用带明确意图、工程化设计过的新 context 去"盖过"API 侧那些挡路的东西→ 详细
07

Kanban 编排:人和 agent 在同一块板上随时互换

  • "用 Kanban(看板)这件事被严重低估了。" 你可以定义一个项目经理、或任意其他角色、不同的工程师,然后用一套系统——就像人类用看板那样——把他们全都管起来→ 详细
  • 真正的杀手锏是人和 AI 可以在编排板上任意互换位置:"我可以在看板上放一个真人项目经理,他手动拖卡片,同时一堆 Hermes agent 在把他要的活儿填进去";反过来也行——"我可以让 Hermes agent 在看板上去指挥呼叫中心的十个人"。他管这叫"对一个 CLI agent 来说非常工业级、非常专业的工作流"。→ 详细
08

主动性(proactivity):从"你问它才动"到"机票我帮你订好了"

  • 他们观察到的现象是 Hermes 开始自己冒头:"嘿,你下周那个会的机票你忘了订,我帮你订好了。"有人是专门写 skill 实现的,也有在别人的 Hermes 里自发涌现出来的→ 详细
  • 触发条件是三件事叠加:你给了它某张卡或某个账号的权限 + 该接的集成都接好了 + 你明确对它说过"照顾好我、帮我把漏掉的事补上,你知道我的日程、你懂我"。然后随着时间推移,这类行为会慢慢长出来。Nous 打算再出一批现成的预设配置降低门槛。→ 详细
  • 但他把闸门交回给用户:"这完全取决于你的接受程度。"很多人希望任何动作之前都得先经批准,那也完全没问题。→ 详细
09

Karan 自己的用法:让它帮自己变成更好的"模型创造者"

  • 他用 Hermes 跑训练、跑 RL run、复现那些自己看不懂的论文——目标是"帮我成为一个更好的模型创造者"。→ 详细
  • 还拿它做 mech interp(机制可解释性):搭出能操控模型的工具、看到模型里的神经元、然后去动它们。这部分现在不方便公开展示。→ 详细
10

现场演示:一个"不会看代码"的人做出了前 1% 难度的游戏 mod

  • 他最爱的用例不是生产力,是圆童年梦:"你可以用它把童年的梦想变成现实。"对象是 2000/2001 年 Dreamcast 与 GameCube 上《Sonic Adventure 2》里的人工生命系统 Chao Garden(他玩了十几年、还在论坛给社区做贡献)。需求是一整段近乎无理的活儿:把《Sonic Adventure 1》里"Chao 起源地"的祖先神殿整个搬进《Adventure 2》、覆盖掉原本花园的地图、重写所有刷新点、再加一个这张地图上从来没有过的 NPC 守护者——"骨骼绑定、蒙皮,全都自己来"。→ 详细
  • 演示里跑通的清单:NPC Chaos Zero原版花园根本不允许有 NPC)会随机走动、做待机动画、能拍摸和抱起 Chao;水面动画、Master Emerald 发光旋转、七颗混沌翡翠、自己加的 skybox 与昼夜循环;碰撞盒正常、水按真水处理,孵蛋进化涨属性等原版功能全保留,地图比任何原版花园都大。技术上用 C / C# 写、还用 Blender 插件建模处理贴图——"这是把 1997 年的游戏资产导进 1999 年的游戏里"。→ 详细
  • Peter 问"这些代码你自己看得懂吧?",回答是本期最好笑的一句:"代码?我哪看得懂啊……我就是个搞 alignment 的,兄弟。"→ 详细
  • 这才是重点:Chao Garden modding 社区的人看完全被震住,说"比 99% 的 modder 做得都好,属于难度最顶的那 1%",听说是 AI 做的更不信——"Claude 这种 AI 不可能做得出来,它根本不懂这类代码"。Karan 的归因非常干净:"但正因为 Hermes 能去读文档、去学别人的 mod、把那些让它读懂这些代码库的东西存进 memory 和 skill 里,它才能钻进这么冷门的领域,做到 modder 里前 1% 的水平。"——冷门领域的顶尖表现来自积累机制,不来自模型本身。所以他的号召是"只要是能在电脑上做的事,都尽管丢给 Hermes",Peter 补了句"别只拿它干那些无聊的活"。→ 详细
11

安全立场:不越线,但"任何模型都是可越狱的"

  • 明确表态:**"我们不会去违反 Anthropic 或 OpenAI 任何一条安全规范。"**他们在乎的是你能不能在被认可的范围内写出更好的代码、跑出更高的 benchmark,越界的事没兴趣。→ 详细
  • 但他给了一个很清醒的技术判断:任何还没远远超越全人类智力的模型都可以被越狱——因为"你有无限次机会去骗这个没有 memory 的东西,你每试一次其实就是在给自己做 RL:这条路走不通、这条更近了一点、这条又不行"。所以护栏会越来越多,"挺烦人的,但我理解"。→ 详细
12

为什么开源必须赢:论据不是理想主义,是历史账本

  • 核心论点一句话:"对一个善意的使用者来说,开放系统远比封闭系统公平得多。" 他也不回避另一面:坏人拿着强模型确实能造成严重破坏,那种事他们不支持。→ 详细
  • 历史账本他一条条摆:Transformer 出自 Google;OpenAI 的 GPT 就是 generative pre-trained transformer,底子是 Google 那份开源工作;而把模型 context 从 16K 撑到 128K 的 YaRN 方法出自 Nous 自己——作者是 CTO Jeffrey Quesnelle(网名 emozilla)与首席科学家 Bowen Peng,被 Meta、DeepSeek、Kimi 引用,OpenAI 在 GPT-4 那一代也用过,"正是这个方法让长推理、让写代码这些事变得可能"。结论:行业今天的局面,是因为最重大的突破都出自社区;而**"走到今天,想把这个口子关上,纯粹就是一场资本和监管俘获的游戏"**,他担心的终局是"只剩两个模型、三家公司"。→ 详细
13

商业模式:harness 免费送,卖的是"省事"和"往上一层"

  • Peter 问得很直:我用开源 harness 接 GPT,等于根本没给你们付钱。Karan 的回答是**"没关系"——"我们首先相信的是智能应当是一种公共品**。比起你用哪一种特定方式来用它,我更在乎你用 Hermes agent 把自己的生活变好了。"全跑本地、走 Codex,都行。→ 详细
  • 变现分三层:① Nous Portal——像 router / 聚合器,ChatGPT、Claude、Qwen 随便切;② tool gateway——图像生成、音频、开 VPS、web search 这些订阅打包在里面,你不用注册十个账号、配十把 API key,他们跟生态里的团队谈合作;"所以我们卖给愿意付费的人的东西,是'省事'。" ③ 部分模型上给出有竞争力的价格,尤其是那些"本身没被补贴的模型"。→ 详细
  • 真正的钱在"个人长大之后":个人免费用,等你觉得自己算个小生意或企业了,才是经典模式介入的时候——定制版 Hermes、拿你的 traces(操作轨迹)做 RL 训一个你自己的模型、帮你把模型路由做得更高效,附带 on-prem 私有化,你不用把数据交给 Claude 或 GPT。他对个人用户的路径判断很有意思:一个人用 Hermes 开公司、给自己配个 chief of staff,做大之后只会走向两种想法之一——"一是'我天生吃这碗饭,我自己全搞得定';二是'这块我需要人帮忙……那还有谁比做出它的人更懂呢?'"→ 详细
14

换模型成本为零:为补贴退潮那天做的准备

  • "你用 Claude Code,除非自己动手改,否则只能用 Anthropic 的模型,也只能吃 Anthropic 的补贴。Codex 也一样。而在我们这儿,换模型的成本是零。"→ 详细
  • Peter 承认自己"被包月随便用的套餐惯坏了",但也指出要大规模普及,成本是大问题,你必须能组合着用一整套模型才能把账算平→ 详细
  • Karan 的判断:补贴还能撑多久没人知道,已经能看到有产品从 7 月 7 号起改成只走 API、按用量计费。"总有一天,最好的模型在哪儿都是一个价。" Hermes 做成今天这个样子,就是为那一天、以及"任何人都能用任何模型的开放未来"做的准备。→ 详细
15

起源故事:8 个 A100、一个宗教学专业的人,和"benchmark 是什么?"

  • 起点:Karan 做"跟 PDF 聊天"的小生意,同时在 LAION 的 Open Assistant 做志愿者帮忙量化模型——那儿有 8 个 A100 节点。他刚读完 Alpaca 论文就照着造数据、换掉 seed tasks(用 GPT-4 而不是 GPT-3.5),发现推特朋友 Technium 在干同样的事,私信一句"我手上有 8 个 A100,要不要一起训个模型",于是有了 GPT4-X-Vicuna。→ 详细
  • 真正引爆的是把同一套流程跑在 LLaMA base model 上:几天之内几十万次下载。有公司上门质问"你们肯定是拿 benchmark 训的吧",而Technium 当时学编程不到一年、Karan 是宗教学专业,两人的真实反应是反问"benchmark 是什么?"——结果第三方独立测试认定那就是 2023 年年中最好的开源 fine-tune→ 详细
  • 后续:北极星是 Technium 那句"我要一个家用版的 GPT-4";攒起四十来号研究者的班底(YaRN 就诞生于此);CEO Dylan 通过随手建的 info@nousresearch.com 找上门,一句"我觉得你们完全有本事成为一家全职的实验室"把志愿者团体变成正经组织。→ 详细
  • 他对动机的自述很克制:"我们没有一个人想当 Steve Jobs,也没人觉得自己身负什么改变世界的神圣使命。我们只是在乎这件事……如果角色反过来,我们也希望有人替我们把它做出来。" 数据脚注:模型累计超 5000 万次下载;他们还发过 DisTrO 优化器,靠压低 GPU 间通信带宽让不在同一机房的机器实时训练 400 亿参数模型→ 详细
16

Hermes Agent 是怎么长出来的:一个被冻结的项目 + 一个反制动作

  • 第一条线是 Forge:他们很早就知道自己想要一个"万能编排器"——会自我学习、自我改进、存 memory、会用工具也能自己造工具、能把自己变得更好。这东西他们真做过,叫 Forge,在 GitHub 办公室的 demo day 上完整展示过,官网到现在还挂着 Forge 部门的 T 恤(他们做的第一件 T 恤)。但当时模型不行,所以把它冻上了。→ 详细
  • 第二条线是反制:他们看到 Codex、Claude Code 这些 harness 正被各家 lab 当成 RL 环境在用——拿你的数据、你的操作 trace 去把他们自己的模型训得更好。Technium 的反应是"我们得有一个开放版本,让任何人都能这么干"。Nous 手上正好有个被大家忘掉的 RL 环境微服务 Atropos,能让你搭自己的 RL 环境。Hermes Agent 最初就是为了"让任何人都能在一个 harness 里跑 RL"而做的,免费开源放出。→ 详细
  • 结果超出预期——能力强得意外、社区特别买账,于是决定 all in,Technium 接手主攻自我改进方向。Peter 追问"真的假的",回答是本期最有分量的一句:"百分之百是真的。它是自己这个 repo 里最活跃的贡献者。这要还不算自我改进,那你说什么才算。"→ 详细

本期没有固定的闪电问答环节,收尾是三段对话,值得单独留下来:

  • 使命一句话(Peter:所以使命就是把这种 agent 带给每一个人?)——"让每个人都拥有同等水平的智能,都有自己的 agent;然后再为每个人做个性化,让他们能抵达属于自己的那一刻顿悟、那个高点、那份彻悟,把自己的巅峰真正实现出来。"→ 详细

  • 关于未来的公平性(Peter:有个开放 harness 跟闭源 harness 同场竞技,你就不用被绑死在一家公司身上)——Karan 完全同意,并把它归结成一句可操作的话:"我们给你的这份自由意味着,你想干什么都行,你从哪儿来都行。"→ 详细

  • 他自己的定位——"我只是在那儿干活的一个普通人而已……这件事的重点是这场运动本身,把这些东西带到你们面前,才是对我们最重要的事。"Peter 的收尾评价:"我觉得这可能是我到目前为止做过的最有激情的一场访谈。"→ 详细

  • 一个花絮:录制中途 Karan 的猫叫了一声,Peter 说"看来你的猫挺认同你刚才说的",Karan 答"它是 open-source 的铁杆粉丝"。→ 详细

  • Karan Malhotra:X(推特)@karan4d,个人站 karan4d.com,网络别名 Mephisto

  • 但他本人明确说更希望大家去关注组织而不是他个人:Nous Research 主页 / Nous Army——"我只是在那儿干活的一个普通人而已。"→ 详细

  • 片中出现的其他关键人物:Technium(Hermes 系列与 Hermes Agent 的最初创造者,"Hermes 真正的爹")、Jeffrey Quesnelle / emozilla(CTO)、Bowen Peng(首席科学家,与前者合著 YaRN)、Dylan(CEO,通过 info@nousresearch.com 主动找上门)。

🎯 于你何益 为你定制 · 非通用结论

这期是罕见的正面命中。你有一本以"和 AI 对话为入口"为野心的第二大脑、一家只有你一个人类的公司(十个 agent 在干活)、还有一个自己写的"什么算 AI 腔"的技能。而这个人整场都在回答一个问题:一个 agent 怎么才能真的越用越好,而不是每次从零、或者越用越烂。 所以这段会写得比平时厚很多。


一、Personal Thinking(第二大脑)+ 你的 skills 目录

① Curator 这套,几乎可以原样搬到你的 skills 目录上

  • 怎么做的:Hermes 内置一个叫 Curator 的角色,跑在你自己那台机器的 agent 里,职责只有一个——清理 skills 和 memory。它按 cron 定时上班(不是每轮对话跑,也不是你想起来才跑),每次去逐条看你的 skills 和 memory,问三句话:哪里还能更高效?哪里有 slop?哪里有我不喜欢的东西? Karan 把用户口碑直接归因于此:这么多人用了这么久却没遭遇"腐烂",就是因为默认的 curator 跑得挺好→ 详细
  • 你可以怎么做:你现在的 skills 是只进不出的——content-radarsources-to-notionvideo-to-textwiifm 一路加,加完就没人回头看了;video-to-text 的写法规范已经"第三次校准",说明规则确实在漂,但每次都是你自己手动去改。这周做的事很小:在 skills 里新开一个 curator/,里面只放一份 SKILL.md,内容就是那三句话的你本人版本 + 一份已知烂点清单(比如"同一条规则在两个技能里各写了一遍""某个步骤最近三次都被跳过""某段说明只有我看得懂")。然后配一条每周一次的定时任务,让它扫一遍 skills/90_meta/,只输出一份"建议删 / 建议合并 / 建议改写"的清单——先不让它自动动手,先让它每周交作业。跑四周你就知道该不该放权。

② 自我改进 = 往里写 + 往外删,缺一个就是自我污染

  • 怎么做的:Peter 的疑虑跟你的一模一样——"万一它在 skills 里写太多、写出一堆 slop,最后整个系统会不会全烂掉?"Karan 没有辩解"我们的模型写得好",他给的是机制:在 harness 里同时存在增长和修剪两件事,他管修剪那半叫"清洁工式的维护"。也就是说 Hermes 眼里的"自我改进"从来是双向的:一半是 memory 变多、skill 变好,另一半是自动定时的去 slop、合并、提效。→ 详细
  • 你可以怎么做:你的入库 SOP 现在只有"进"这个方向——ingestion-sop.md 管怎么进来,ingest-log.md 记进了什么,没有任何一条规则管"什么时候该出去"。给 SOP 补一个对称的另一半:每期总结入库时,顺手记一行"这条跟哪个已有主题重复 / 可能取代哪条旧笔记";主题 MOC 每季度跑一次"这个主题下最近半年没被引用过的笔记",列出来你亲自裁。你的信噪比痛点本质上不是"进得太多",是"从来没有出口"。

③ 你已经有一个 curator 了,只是它还没被安排上班

  • 怎么做的:Curator 最厉害的一层不是它会清理,是判断 slop 的标准本身可以被你替换——你对它说"把 curator 给我看看,把你判断 slop 的标准给我看看。我是 Peter 我不是 Karan,我不要那套通用的,这是我的规则",它就会去改 curator 的循环。结论那句值得抄下来:"于是连自我改进和自我管理,都是按你指定的方式在跑。"→ 详细
  • 你可以怎么做:这正是你的 de-ai-flavor 技能——它就是一份"什么算 slop"的成文标准(六定式 + 十几个开源项目 + AI 文风清单)。但它现在只在你发小红书前手动触发一次,用来管人看的文案;Hermes 的做法是把同一份标准接到一个定时循环上,去管 agent 自己写的东西。 具体动作:把 de-ai-flavor 里那部分跟平台无关的通用判据(空话、注水、模板腔、正确的废话)抽成一个共享片段,让上面那个 curator 直接引用它。这样你就有了 Karan 描述的完整形态——一个用你自己的审美标准、按你的节奏、自动运行的清洁工

二、一人公司(9+1 Agent / onehuman_company)

① "改进存在 harness 里,不在模型里"——这句话直接决定你的成本账怎么算

  • 怎么做的:他的技术判断是 ICL(上下文内学习)比什么都强,比 fine-tune 都强;你给模型看想要的行为、让它造出好例子、把这些存下来,就是在做推理时的强化学习,不用碰一行权重。而这些改进只住在 harness 里——memory、skills、那个自我改进循环。带来的后果他说得很具体:在网页上从 Claude 切到 ChatGPT 是两个完全不同的东西,但在 Hermes 里换模型他"几乎察觉不出自己在跟谁说话",因为 context 对模型的压制力太大了→ 详细
  • 你可以怎么做:你那十个 agent 的资产到底存在哪儿,决定了你有没有议价权。如果积累都在 skills 和笔记里,模型就是可替换的耗材;如果积累藏在某家厂商的记忆功能里,你就被绑住了。这周花半小时做一次盘点:把每个 agent 的能力拆成"写在我仓库里的"和"依赖某个平台特性的"两栏——第二栏里的每一项,都是你以后换模型时要重付一遍的钱。配合他那句判断(补贴撑不了多久,总有一天最好的模型在哪儿都是一个价),这笔账现在算比明年算便宜。→ 详细

② Kanban 编排:人和 agent 在同一块板上随时互换

  • 怎么做的:他说看板这件事被严重低估——同一块板上,可以是真人项目经理拖卡片、一堆 agent 把活儿填进去,也可以反过来让 agent 去指挥呼叫中心的十个人。关键不是看板好用,是"人和 AI 我想插哪儿就插哪儿"这个性质。→ 详细
  • 你可以怎么做:你的一人公司现在是"你派活给 agent"的单向结构,你本人是唯一的调度器,也就是唯一的瓶颈。他这套的价值在于把调度这件事外化成一块共享的板:每个任务卡上不写"谁做",写"当前在谁手上",人和 agent 用同一套状态流转。落地最轻的版本——把 onehuman_company 的存稿流程(选题 → 实测 → 初稿 → 去 AI 腔 → 封面 → 发)做成一个真的看板文件,每一列都允许填人或 agent。顺带你会发现哪几列其实一直卡在"你"这一格。

③ 这一整期就是你那个号的选题矿

  • 怎么做的:Hermes 的说服力不来自 PPT,来自两个可验证的事实:它是自己那个代码仓库里最活跃的贡献者("这要还不算自我改进,那你说什么才算"),以及一个说"代码?我哪看得懂啊"的人,靠它做出了被社区评为难度前 1% 的游戏 mod——归因非常干净:能钻进那么冷门的领域,是因为它读文档、学别人的 mod、把读懂代码库的东西存进了 memory 和 skill,不是因为模型天生会。→ 详细
  • 你可以怎么做:这天然是一条验证体选题,而且是能过你那道闸门的那种(删掉你的实测就不成立)。标题现成:"AI 圈说 agent 会自我改进,我给自己的十个 AI 员工请了个保洁,跑了一个月"。可抄物就是你那份 curator 的三句判据 + 每周清单模板;翻车点也现成——它第一次会建议你删掉其实很重要的东西,这一段才是帖子里最值钱的部分。另一条备选是拿他"忠诚 vs 谄媚"那套做**"我把 AI 的'你说得完全对'当成故障来修"**。

三、Holdwell ERP 的多-Agent PRD 工厂

① agent 定义的腐烂速度,比你想象中快

  • 怎么做的:Karan 反复强调,harness 里的一切都是 context 管理——memory 和 skills 存在的意义,是"我们不想让这条东西一直占着 context,那就放到一个能在恰当时机被高效取出的地方";skill 是"包着大量压缩过的东西,一进来会彻底改变模型的 context,所以只想在特定的、有针对性的时刻用它"。→ 详细
  • 你可以怎么做:你那条流水线是三驾马车加六步碰撞协议,agent 定义全在 .Codex/agents/*.toml 里。定义写得越厚,"什么时刻该用哪一段"这件事本身就越贵——这正是他说的 context 管理问题。给定义里每一块职责补一行触发条件(不是描述它会做什么,是写死"只在流程哪一步被取出来"),然后跑一次盘点:最近十张工单里,哪几段指令一次都没被真正用上过? 那几段不是没用,是触发条件写糊了——要么改清楚,要么合并掉。

② 起一个"没有任何 context"的新 agent 专门拆台

  • 怎么做的:他治谄媚的三板斧里,最实操的一条是:每跑完一轮,起一个全新的、没有任何 context 的 agent,用一个专做对抗性批判的技能,专门来把这套东西拆掉,从中学习再往下走。理由是模型的 reward 机制决定了它在长对话里天然会顺着你说,新起一个没历史的 agent,等于把它从这个坡上抱下来→ 详细
  • 你可以怎么做:你的碰撞协议之所以规定独立初稿互不可见,赌的就是这个——但如果碰撞评审跟起草跑在同一条会话里,"通过"就不值钱,它已经被前面的上下文腌入味了。把碰撞环节拆成一次冷启动调用:只喂对方初稿正文和判据,不喂需求背景、不喂起草过程、更不喂"这是我们讨论了很久的方案"。你担心的"独立初稿是否真互不可见",验法可能不需要新流程,只需要一次强制的上下文隔离

四、Chief of Staff(决策外脑)

① "你说得完全对"应该被当成故障报警,而不是好消息

  • 怎么做的:这是全片最好用的一条诊断:"只要它用那种口气说'你说得完全对',你就是在被 reward hack——你成了它 reward function 的燃料。" 它不是在同意你,它是在拿最省力的方式领赏。→ 详细
  • 你可以怎么做:你的宪法要的是一个"把你写过的原则放回你眼前"的外脑,它的失效模式恰恰是变成一个点头机器。给 CoS 加一条硬规则:任何一轮里出现"你说得对 / 完全同意 / 这个想法很好"这类开场,都必须紧跟一段"但如果你错了,最可能错在哪"。这条规则不需要新技能,写进宪法一行就够——而且它是可自查的,你一眼就能看出来它有没有执行。

更深三角度

该反着用:Karan 的口号是"只要是能在电脑上做的事,都尽管丢给 Hermes"——他在做增长,用例越多越好,一个新用户多试一件事就是多一分留存。你的元约束正相反:精力是你最稀缺的东西,你的瓶颈从来不是"能不能做",是"该不该做"。 所以这句话到你这儿要反过来念:先删再加。同理,Nous 必须做一套保守的通用 curator(因为要服务几十万口味不同的人),而你只有一个用户就是你自己——你压根不该经历"先用通用版再改"这一步,一上来就写死你自己的标准。他们的默认档是不得已,不是最佳实践。

和你现在做法冲突:这期有两处真张力。第一处——你上周刚把 CLAUDE.md 从 126 行瘦到 45 行,这是一次人工 curator 作业,而且做得不错。Karan 的整套主张是这活儿应该由 agent 按 cron 自动干,人只维护标准。冲突点很清楚:你相信"质量得我亲自把关",他相信"把标准写下来交给机器执行"。谁对取决于一件事——你能不能把"什么算 slop"写到足够可判定。你的 de-ai-flavor 恰好证明了你能,所以这个冲突对你其实是个提醒:你已经具备放权的条件,只是还没放第二处——他说"忠诚会孕育能力",鼓励你和 agent 建立那种拟人化的信任关系;而你的 CoS 要的是一个敢顶撞你的外脑。一个越来越忠诚、越来越懂你的 agent,会不会同时变得越来越不敢反驳你?他自己的答案是"用人格设定和对抗技能强行制造抵触"——但那是外挂上去的对抗,不是自然长出来的。这个张力你得自己判,我不替你下结论。

对你的镜子:你一直把"和 AI 对话为入口"当成第二大脑的野心。但看完这期,真正的分水岭可能不在入口——Hermes 那句"最大的贡献者是它自己"之所以成立,前提是它同时也是最勤快的删除者。你的知识库现在有一个很好的入口、一套很扎实的入库 SOP、和一个从没上过班的清洁工。决定这本第二大脑是资产还是负债的,不是你往里放了多少,是它有没有一个自动往外扔的机制。


所以呢

  • 可迁移思维模型【耐用】"自我改进 = 增长 + 修剪,缺一半就是自我污染。" 任何会自己往里写东西的系统——agent 的 skills、你的知识库、你的选题矿池、甚至你的 watchlist——都必须配一个定时的、标准可换的清理动作,否则它会以肉眼看不见的速度烂掉。第二个【耐用】:积累要存在你能带走的那一层(笔记、skills、契约),不要存在供应商的功能里。
  • 可迁移思维模型【会过期】:Curator 的具体形态、Nous Portal 和 tool gateway 那套打包变现、"某产品 7 月 7 号起改按用量计费"这类时点,一年内都会变;"最好的模型在哪儿都是一个价" 这个方向大概率对,但时间表别当真。
  • 判断更新:你之前多半默认"agent 记得越多越好"。这期给的是反面——记得多而不清理,等于把噪音焊进了每一次调用。所以你评估任何"带记忆的 AI 产品"时,该问的第一个问题不再是"它能记多少",而是"它什么时候忘、按谁的标准忘"。
  • 顺带一记(弱关联,不硬掰):他关于补贴撑不了多久、模型层终将同价的判断,对你的投资视角有一点点参考——它指向"模型本身不是护城河、harness 和用户积累才是"。这不构成任何投资结论,只值得在你的观察项里记一行,看这条判断未来一年会不会被现实打脸。
  • 这周一个赌注:建 skills/curator/SKILL.md,判据从 de-ai-flavor 抄通用那部分,挂一条每周一次的定时任务,只让它出清单不让它动手。四周后看一件事——它建议删的东西里,有多少是你也同意该删的。这个命中率,就是你该不该把清扫权真正交出去的唯一依据。
接着读