ESC
↑↓ 选择↵ 打开esc 关闭⌘K 唤起
← Home NO.104
第 104 期 · AGENT 工程 · 收录于 2026 年 8 月 15 日

Agent只需要HTML

JR
James Russo · AI Engineer
视频 15:13 原文约 1.4 万字 预计阅读 12 分钟 来源视频 ↗ 中英对照全文
双人对谈 · 本期速读电台 00:00 / 18:49
TL;DR · 三句话
  1. HTML、CSS、JavaScript 是 LLM 的「母语」——它们的训练数据里绝大多数就是网页,所以与其教 agent 一门新的 DSL 或你自造的 JSON 结构,不如让它用母语说话,HeyGen 把整个视频生成栈押在了这一点上。→ 详细
  2. 最反直觉的工程结论是「最薄的封装赢了」:往 system prompt 里塞 context、加 skill、包各种 wrapper,全都输给了「纯 HTML + 几个 data 属性做元数据」。→ 详细
  3. 这不是 demo:开源框架 hyperframes 在过去 90 天被开源用户渲染出超过 130 万支视频,26.7 万创作者试过,GitHub 3.2 万 star,任何会写 HTML 的 coding agent 都能直接用。→ 详细
01

开场:做产品已经很容易,把它发出去依然很难

  • 开场视频本身就是「证物」——完全由一个 agent 一次性(single shot,一轮 prompt 跑完不返工)生成,全程用 HTML。讲者 James Russo 是 HeyGen 的 hyperframes 项目共同创造者兼技术负责人。→ 详细
  • 他现场举手调查:有多少人觉得,有了 coding agent 之后,写发布文案、做发布视频反而比把产品做出来还难?有一些手举了起来。coding agent 已把「建造」民主化,但「发布」还是硬骨头。→ 详细
  • HeyGen 的使命是「用视频解决沟通问题」,起点是做出市面上最好的 AI 数字人(avatar,替你出镜说话的虚拟人)。→ 详细
02

一支好视频是分层组合,不是只有一张会说话的脸

  • 数字人只是 A-roll(主镜头素材,即旁白者、角色、片子主体);好视频还得有 B-roll(穿插的图片等媒体素材)、动画、字幕、音乐。→ 详细
  • 每一层都做到位,才算给 agent 一块合适的「画布」。问题于是变成:怎么让 agent 一口气生成并组合所有这些层次?赌注是 HTML。→ 详细
03

核心论点:别逼模型讲外语,HTML 就是它的母语

  • 全场的地基句:「HTML、CSS 和 JavaScript 是 LLM 的母语。」道理很朴素——训练数据里绝大部分是被抓取的网页,而每个网页说到底底层就是这三样。你不是在教它新技能,只是在用它已经泡了几万亿 token 的语言跟它说话。→ 详细
  • 反过来,当你想教模型一门新的 DSL(Domain-Specific Language,领域专用语言,为某个特定场景自造的一套小语法),甚至只是你自己定的一套 JSON 结构,你其实是在逼它讲外语。他的比喻是:「这就像让莎士比亚用日语或中文写诗。」——词能拼对,韵味全无。→ 详细
  • 关键在于这个损耗不是靠给示例能补回来的:「哪怕你给它一堆示例、教它一大堆东西,你也拿不到它最好的输出,因为那不是它的母语。」few-shot 示例能提升格式合规率,但补不回创造力的天花板。→ 详细
  • 观点并非孤例:过去几个月 Tarik 和 Andrej Karpathy 都在讲「HTML 是新的 markdown」——对 LLM 而言这是极好的输出格式,因为它天然自带可视化呈现。Russo 特意声明,他的演讲提案提交于这两条推文之前,「你要是好奇,我待会儿可以拿证据给你看」,几拨人独立收敛到了同一结论。→ 详细
04

一年多的选型弯路:把候选方案放在「质量 × agent 友好」两轴上

  • 他们做了一年多、试过一大堆方案,评估框架就两个维度:产出质量,以及对 agent 是否友好。→ 详细
  • After Effects、Premiere Pro 是创意工作者的黄金标准,质量高但对 agent 完全不友好;即便接了连接器也只是「副驾驶」,帮你顺手做你本来就会的事,给不了创意产出。→ 详细
  • Lottie 和 Rive 本质是用 JSON 或自定义 XML 编码的动效格式,产出不错,但不是 agent 的母语,可编辑性和可控性也不够——「可控性这一层对我们来说是件大事」。→ 详细
  • Remotion(用代码写视频的框架)折腾得比较深,他认为它很好地展示了 LLM 用代码能做到什么程度;但代价是得教框架、教语言、给一堆写法示例,「这最终把创造力消磨掉了很多」。→ 详细
  • 转折点在去年十一月:Gemini 3 等新模型带来阶跃式提升——只要把想要的效果做成示例给它看,模型自然就往 HTML、CSS、JavaScript 上靠。于是定调:「别跟模型对着干,而是想办法让它用母语来表达。」→ 详细
05

减法式上下文工程:最薄的那层封装赢了

  • 他们的验证方法本身就很值得抄:先拿一个很小的模型 Gemini 3 Flash 当「设计伙伴」。逻辑是「如果连小模型都能在一个框架里写出能跑的代码,那大模型和这些 coding agent 就百分之百也能做到」——用最弱的模型当压力测试,把格式设计的难度上限压出来。→ 详细
  • 然后是全场最反直觉的一段:他们在 HTML/CSS/JS 外面套了各种不同的封装层去试,「往里塞大量 context,把 system prompt 越写越长,还加了 skill」。结果——「但让我们意外的是,最后胜出的是最薄的那层封装」,说到底就是纯 HTML,再加几个 data 属性当元数据(data 属性就是 HTML 标签上自定义的小标签,形如 data-start),用来让 agent 和自己都知道时间轴之类的信息。→ 详细
  • 普适版本是:上下文工程不总是「加法」。当你在写越来越长的 system prompt 去教模型一套自造规范时,很可能是格式选错了——抽象层每厚一分,模型的先验知识就被挡掉一分。→ 详细
  • 还有一层时间上的复利:「如果这个更小的模型都能搞定,那随着模型越来越强,效果只会继续变好」,而且随着新训练数据进来,模型对它的理解只会越来越自然。选一个顺着模型演进方向的格式,等于让未来每一代模型免费给你升级——就是在这一刻,他们确认格式选对了。→ 详细
06

hyperframes:HTML 进,视频出

  • 一支 hyperframe 视频长这样:左边是带几个属性的 HTML,右边是渲染出的网页。预览和渲染全在浏览器里完成——「浏览器看到的是哪些像素,你的视频最终看到的就是哪些像素」,没有第二套渲染管线。→ 详细
  • 由此得到 hyperframes:一个把 agent 写的 HTML 变成视频的开源框架。只要是你的 agent 会写的网页,现在都能写进视频里。→ 详细
07

真正的难题在渲染:把天生异步的浏览器「冻」成确定性 MP4

  • 语言问题解决后,下一个坎是把网页变成确定性(deterministic,同样输入必然产生同样输出)的 MP4。这难得多,因为「浏览器天生就是异步的」——它的需求跟视频渲染完全不同,得在各种网络环境和约束下都能工作。→ 详细
  • 冲突具体长这样:浏览器接受字体异步加载,所以随页面加载,文字字体和样式会变;图片、视频等素材也一样,一开始看不见,过会儿才出现。这在网页上叫渐进增强,在视频里就叫穿帮。视频要的是「页面上的所有东西百分之百的时间都在那儿」。→ 详细→ 详细
  • 解法是冻住时钟、逐帧跳转:视频本质就是一连串静态帧串起来形成动态;他们把这个洞察搬到浏览器上——冻住浏览器时钟,确定性地跳到每一帧,等页面全部加载完、确认就绪,截一张图,再跳下一帧,反复直到拿齐所有帧编码成视频。→ 详细→ 详细
  • 收益是「在浏览器里预览的那份输入,和渲染进视频里的是同一份」,预览与成片不会各说各话,这正是 hyperframes 名字的由来。这套「把不确定的运行时冻成可枚举状态再逐个采样」的思路,可迁移到任何要把异步系统产出变成可复现产物的场景。→ 详细
08

浏览器能渲染的,视频里就都能有

  • 这套架构的威力在于白嫖整个 Web 生态:three.js(浏览器 3D 库)、图表、SVG、shader(着色器,GPU 上跑的画面特效小程序)、WebGL、WebGPU、Lottie——凡是浏览器能渲染的,hyperframes 就都能渲染进视频。→ 详细
  • 团队做视频的常规动作也因此变了:上网找灵感,把网页效果当例子改一改,直接塞进视频。→ 详细
09

Skill 只教品味,不教语法

  • 框架和渲染之外,第二个决定输出质量的部件是配套 skill,而它有个明确的分工原则:只写审美和视频门道,不写语法。原话是「因为 LLM 和 agent 本来就会写 HTML、CSS 和 JavaScript,我们不用教它们语言,只需要教它们怎么做出好视频」。→ 详细
  • 他直接点出与同行的差别:「你去看某些框架的 skill,内容其实基本就是:在这个框架里东西该怎么写。」——那些 token 全花在补语法上。自检标准由此而来:如果你的 skill 大半篇幅在教语法,说明抽象层选错了,而不是 skill 写得不够。→ 详细
  • skill 是被持续维护的资产:「很重要的一环,是持续做 eval(评测,给一批标准任务打分看效果有没有变好),并且用 agent 来不断改进这些 skill」。目标是抬高下限——确保一次性 prompt 的基础产出就已经相当不错。不是追求上限惊艳,而是让最差情况可接受。→ 详细
  • 现场演示的是 website-to-video skill 的一次性调用:只给一个网址,skill 告诉 agent 怎么访问网站、抓回需要的所有素材和信息,用 DesignMD(他们叫 FrameMD)还原设计、配色主题和品牌调性,再配上教给 LLM 的基础动效示例,就能跑出不错的成片。→ 详细→ 详细
10

人始终在环里:把「一次生成」拆回可控的工序

  • 他坦白划了条线:「这跟 AI 写代码很像——你随手给一个 prompt,也能拿到还过得去的结果;但想从 agent 那里拿到出色的产出,就需要功力、需要品味,跟 AI 编程出现之前,任何一个软件工程师所需要的那套原则是一样的。」办法还是老话:把问题拆成小块,迭代着往前推。→ 详细→ 详细
  • 他们对重度用户的承诺是「完全掌控」,标准是:「在有 Hyperframes 之前我们怎么做视频,用上 Hyperframes 之后还是怎么做。」——工具接管的是执行,不是流程本身。→ 详细
  • 真实工序是五步:想清叙事、愿景和使命 → 逐帧做分镜、想清每帧承担什么 → 用 HTML/CSS/JS 逐帧加动效 → 合并成连贯的视频 → 在随框架发布的 studio 里做「最后一公里」精修。关键设计是 human in the loop(人在环里):你平时在剪辑软件里的手动拖拽、微调,在这个开源编辑器里一样能做。→ 详细
  • 演讲当天刚发布 keyframes(关键帧):动效设计师能在 studio 里一个关键帧一个关键帧地编排所有动效,目标是让「专业动效设计师在 After Effects 里能做的事,在这里也都能做」。要害在于它把「agent 生成」和「人手精修」接在同一份 HTML 上,而不是让人在两套互不相通的工具间倒腾。→ 详细
11

规模数字:它已经在生产环境里跑了

  • 「所以这不只是个 demo。」Hyperframes 几个月前发布,过去 90 天开源用户一共渲染了超过 130 万支视频→ 详细
  • 其余数字:26.7 万名创作者试过;每天约 1.5 万支视频用这个开源框架渲染;GitHub 3.2 万 star。开源、永久免费,任何人现在就能上手。→ 详细
  • 兼容性上没有绑定:Claude Code、Codex、Cursor 以及屏幕上列的其他一堆,「甚至包括我自己都还不知道的那些」都能配合。判据只有一条:「只要你的 agent 会写 HTML、CSS 和 JavaScript,它就会做 Hyperframes 视频。」——这就是选母语格式带来的零集成成本。→ 详细
12

诚实的短板,以及一个 code-to-video benchmark

  • 愿景一句话:「那个帮你做产品的 agent,同时也能帮你做产品的发布视频。」但他紧接着说了句实话:「模型在创意类的活儿上还是不够好」——他们花了大量时间做 eval,想在 skill 里把这块推得更远。→ 详细

  • 他认为这需要更高一层的改变,所以团队开始做一个 code-to-video benchmark(代码转视频的公开评测基准),想拉上各家 LLM 实验室和所有做视频 agent 的创作者,一起把行业下限抬上去。感兴趣的可以会后找他,或找现场任何一位穿 Hyperframes T 恤的同事。→ 详细

  • 彩蛋:AI Engineer World's Fair 的官方宣传展示视频,就是 HeyGen 与大会团队深度合作、用 Hyperframes 做出来的——留给现场观众的小惊喜,也是「它到底能做到什么程度」的实证。→ 详细

  • 收尾三句:那支片子证明了用 HTML、CSS、JavaScript 能做出什么水准的动态图形;agent 已让「做产品」无比容易,但「把产品发出去」依然相当难;答案是——要做出好视频、把产品推向世界,你的 agent 需要的就只有 HTML。→ 详细

  • 开源仓库:Hyperframes 项目(演讲末页给出链接),欢迎去看、点 star、把 skills 下下来用。→ 详细

  • X:@Reems_Juso —— James Russo 本人;他表示会后就在场外,想聊随时找他。→ 详细

🎯 于你何益 为你定制 · 非通用结论

先说结论:这期跟你的关联度极高,而且不是"讲 agent 的都算相关"那种高。 你手上这七八个项目里,有五个的内核是同一件事——我写一套东西,让 agent 照着干:ERP 那套 PRD 工厂、造 App 的链路、两个自媒体的 agent 班子、第二大脑里这套技能。而这场 15 分钟的演讲,本质上是一个团队花了一年多、试遍市面上所有方案之后,交出来的一份关于"该怎么给 agent 设计接口"的实测报告。更值钱的是:它的结论跟你现在的做法是反的。所以这段会写得比较长。


一、Codex Holdwell ERP work:你的 PRD 工厂正好站在他踩过的坑上

1|别让 agent 讲外语——你那套自定义结构,很可能就是他说的 DSL

他是怎么做的:全场地基句是"HTML、CSS 和 JavaScript 是 LLM 的母语",因为训练数据里绝大部分就是被抓取的网页。反过来,当你教模型一门新的领域专用语言、甚至只是你自己定的一套 JSON 结构,你就是在逼它讲外语。他的比喻是让莎士比亚用日语或中文写诗——词能拼对,韵味全无。最狠的一句在后面:这个损耗不是靠给示例能补回来的,"哪怕你给它一堆示例、教它一大堆东西,你也拿不到它最好的输出,因为那不是它的母语"。

你可以怎么做:把 PRD 工厂里所有"我自己发明的东西"列一张清单——自造的阶段命名、自造的模板字段、自造的产物结构、自造的评审维度名。逐个问一句:模型见过这个吗?没见过的那部分,就是你每次都要花 token 去教、而且教了也换不来最好输出的那部分。能换成模型天天见的通用写法(普通 Markdown 标题、常见需求文档写法、标准 issue 格式、表格)就换掉。这不是让你放弃标准化,是让你把标准化建在模型已经认识的词上。

2|减法式上下文工程:最薄的那层封装赢了

他是怎么做的:他们在 HTML 外面套了各种封装层去试,"往里塞大量 context,把 system prompt 越写越长,还加了 skill"。结果原话是"但让我们意外的是,最后胜出的是最薄的那层封装"——说到底就是纯 HTML,加几个自定义小标签当元数据,用来标时间轴之类的信息。所有加法,全输给了减法。

你可以怎么做:你现在的方向是加法——更厚的 agent 定义、更细的碰撞步骤、更多的约定。挑一条最常跑的链路做个对照实验:一份用现在的完整版,一份砍到只剩最必要的输入加三五个字段的极薄版,同一个需求各跑三遍,另开一个会话盲评哪份产出更好。你的痛点里写着"agent 产出缺可验证证据"——这就是一次成本极低、当天能拿到闭环证据的实验。很可能你会发现,某几步协议和某几层封装是纯消耗。

3|用最弱的模型当设计伙伴,把格式的难度上限压出来

他是怎么做的:他们一上来就拿一个很小的模型当"设计伙伴",逻辑是"如果连小模型都能在一个框架里写出能跑的代码,那大模型和这些 coding agent 就百分之百也能做到"。用最弱的执行者压测格式设计,而不是用最强的模型去掩盖格式的毛病。

你可以怎么做:你的痛点里有"碰撞协议纪律是否真执行"——但在加强制约束之前,先做这个测试:把你的 agent 定义丢给最便宜的小模型跑一遍。跑不通的地方,八成不是模型不行,是你的规范写得只有你自己看得懂。 强制约束是用规则去堵漏,小模型压测是把漏堵在源头。这招还附送一层时间复利,他说得很清楚:小模型现在能搞定,随着模型变强只会更好。反过来,一套只有最强模型才勉强跑得动的规范,是在借未来的债——今天堪堪能用,明天换个便宜模型就塌。

4|技能只教品味,不教语法

他是怎么做的:配套技能有个明确分工——只写审美和视频门道,不写语法,"因为 LLM 和 agent 本来就会写 HTML、CSS 和 JavaScript,我们不用教它们语言,只需要教它们怎么做出好视频"。他还直接点了同行的问题:"你去看某些框架的 skill,内容其实基本就是:在这个框架里东西该怎么写。"那些 token 全花在补语法上了。

你可以怎么做:这是一把可以马上拿去量的尺子。把你 PRD 工厂的每份 agent 定义打开,粗略数一下:多少篇幅在讲"格式怎么写、文件放哪、字段怎么填",多少篇幅在讲"什么才算一份好 PRD"? 如果前者过半,按他的诊断,问题不在定义写得不够细,在你选的抽象层不对。语法应该被格式本身消化掉,技能的字数要全留给品味和判断——那才是模型真不会、也只有你能给的东西。

5|目标是抬高下限,不是追上限

他是怎么做的:他们持续做评测、并且用 agent 来改进技能,目的写得非常明确——"抬高视频的下限,确保一次性 prompt 出来的基础产出就已经相当不错"。不追偶尔惊艳,只让最差情况可接受。

你可以怎么做:一个 8 人 PM 团队要用你这套东西,决定它成败的从来不是最好那次的输出,是最差那次。给工厂定一条下限指标——比如"随便一个同事、随便一个需求,不做任何人工补救,产出的 PRD 能直接进评审"——然后所有改进都对着这条线走。下限稳了才谈得上推广,上限惊艳只够做 demo。


二、app_incubator:契约用母语写,人别退出环外

1|"设计稿即工程契约"——契约本身用的是不是母语?

他是怎么做的:他们淘汰掉的方案没一个是败在效果上的。Lottie、Rive 产出"相当不错";Remotion 更是"很好地展示了 LLM 用代码能做到什么程度"。它们败在同一件事:得教框架、教语言、给一堆写法示例,"这最终把创造力消磨掉了很多"。HTML 的胜出理由只有一个——不用教。

你可以怎么做:你把"设计稿即工程契约"设成强制项,那就得盯住这份契约的载体。如果它是一套自定义中间结构(自造的组件描述、自造的命名体系),agent 每次都要先学一遍你的方言,学费你天天在付。换成 agent 本来就天天在写的东西——常规组件代码、通用 CSS 变量、标准设计稿导出结构——契约的强制力一点没少,教学成本直接归零。

2|他那句"用之前怎么做,用之后还是怎么做",跟你的方向是拧着的

他是怎么做的:他们给重度用户的承诺是完全掌控,标准原话是"在有 Hyperframes 之前我们怎么做视频,用上 Hyperframes 之后还是怎么做"。真实工序五步:想清叙事和使命 → 逐帧分镜、想清每帧承担什么 → 逐帧加动效 → 合并成片 → 在编辑器里做最后一公里精修。工具接管的是执行,不是流程。他还补了句实话:"模型在创意类的活儿上还是不够好。"

你可以怎么做:你的痛点写着"把该做什么前移到 agent"——注意这跟他的选择是反的,他把"该做什么"牢牢留在人手里,只把"怎么做"交出去。可行的折中是把两类活儿分开:判断类的决定(这个 App 解决什么问题、首屏该给用户什么、什么算激活)留在人手里;构造类的动作(生成、组合、渲染、对齐、自检)整体前移。 别把两类混在同一个 agent 里往前推——一混,前移的就不是效率,是责任。

3|白嫖生态:浏览器能渲染的,视频里就都能有

他是怎么做的:选了浏览器当运行时之后,整个 Web 生态白送——3D 库、图表、SVG、着色器特效、WebGL 全都能进视频。他们团队做视频的日常动作因此变了:上网找灵感,把网页效果当例子改一改,直接塞进片子。

你可以怎么做:这条对你的激活/首屏体验痛点是现成弹药。首屏动效不用自己憋,去网上找到你想要的那个效果,把整个页面丢给 agent 让它照着改。选对了运行时,别人的存量就是你的库存——这是"杠杆 > 工时"在工程选型上的具体形态。


三、onehuman_company:这期本身就是一颗现成的子弹

1|它完美符合你那类"大佬说 X,我试了"的验证体

他是怎么做的:Hyperframes 开源、永久免费,判据只有一条——"只要你的 agent 会写 HTML、CSS 和 JavaScript,它就会做视频",Claude Code、Codex、Cursor 都能直接配合。规模数字硬得能当论据用:过去 90 天开源用户渲染了超过 130 万支视频,26.7 万创作者试过,每天约 1.5 万支,GitHub 3.2 万 star。

你可以怎么做这周就把它当选题做掉。 一个 PM 用 Claude Code 加这个框架,给自己的项目做一支 30 秒发布视频——从零开始,记时间、记花了多少钱、记翻了什么车、记最后成片能不能见人。这条天然过得了你那道闸门:删掉你的实测和判断,这篇立刻不成立,剩下的只是一条工具新闻。而且它一次补两处血——你缺的验证体存货,和你造完却发不出去的老问题。

2|他开场那句话,写的就是一人公司的处境

他是怎么做的:开场他举手调查——有多少人觉得,有了 coding agent 之后,写发布文案、做发布视频反而比把产品做出来还难?有人举手。收尾他又说了一遍:"agent 已让做产品变得无比容易,但把产品发出去依然相当难。"

你可以怎么做:这是你账号定位的一句现成的、来自一线的外部佐证。一人公司叙事里最有共鸣的痛点其实不是"我一个人怎么造",而是"造完了没人知道"。把它立成一个支柱选题:造得越快,发布这一环的瓶颈就越显眼。 配上你自己的产能账,这部分别人抄不走。

3|时间戳意识:他花了整整一句去声明"我提案在那两条推文之前"

他是怎么做的:讲到 Karpathy 等人也在说"HTML 是新的 markdown"时,他特意插了一句:我这个演讲提案是在这两条推文出现之前提交的,"你要是好奇,我待会儿可以拿证据给你看"。一个 15 分钟的技术演讲,他愿意为这件事花掉十几秒。

你可以怎么做:build-in-public 这套打法的核心资产就是时间戳——你先说的,比你说得对更值钱,因为对的判断迟早有很多人说,但"谁先说的"只有一个答案。这对你的存稿期是把双刃剑:好处是你可以先粗糙地把判断发出去占位,回头再补精修版;风险是攒得太久,判断的时间戳就烂在硬盘里了。至少给每篇存稿标上写成日期,发的时候把它亮出来。


四、xiaohongshu_momorain:品牌调性变成文件,以及"母语"换个对象

他是怎么做的:他们做了一个只给网址就能出片的技能,路径是让 agent 去访问网站、抓回所有素材,还原设计、配色主题和品牌调性,再配上教给模型的基础动效示例,一次性就能跑出不错的成片。要害是把"品牌调性"固化成一份 agent 能读的文件,而不是每次口头描述。

你可以怎么做:你的家居号痛点里有"封面标签没激活"。同样的做法能直接搬:把封面规范——配色、字体、标签位置、构图、留白——写成一份文件,让 agent 每次照着生成,而不是每次重新跟它解释一遍。顺带把"母语"这个概念换个对象再想一遍:你读者的母语是什么? 他的洞察是别逼对方讲外语。放到内容上就是——你那张 PM 思维的牌一直没打出去,很可能不是判断不好,是你在用 PM 的语言跟家居读者说话。翻译成她们的母语(一个具体的家、一次具体的纠结、多花的那笔具体的钱),你的判断力才接得住。


五、Personal Thinking 与 Chief of Staff apps:这把尺子先量你自己

他是怎么做的:技能只教品味不教语法;持续评测、并且用 agent 反过来改进技能;目标是抬高下限。

你可以怎么做:这三条同样适用于你第二大脑里这套技能,包括生成这一段的这个技能本身。拿去量一遍:你的技能文档里,多少字在讲"文件写到哪、格式长什么样",多少字在讲"什么才算一段有价值的分析"? 你的痛点是摄入 SOP 和信噪比——信噪比是品味问题,SOP 是语法问题,两者写在同一份文件里时,语法几乎总会挤掉品味,因为语法好写、可验证、写完有成就感。至于决策外脑,他那句"用之前怎么做,用之后还是怎么做"是个很好的设计约束:外脑的价值在于把你写过的原则放回你眼前,不在于替你决定。


六、StockHelp:冻住时钟这一招是可以搬的

他是怎么做的:把网页变成确定性视频的难点在于"浏览器天生就是异步的"——字体、图片会慢慢加载进来,这在网页上叫渐进增强,在视频里就叫穿帮。解法是冻住浏览器时钟,确定性地跳到每一帧,等页面完全就绪再截图,逐帧采样直到拿齐。一句话:把不确定的运行时冻成可枚举的状态,再一个一个采样。

你可以怎么做:你的看板每天收盘后拉数据,本质就是在做这件事,但目前只留了"当下这一帧"。等你要做信号和通知的时候,会立刻撞上一个墙:没有历史帧,就没法验证信号到底对不对。现在就开始每天把整屏快照存下来——不只是价格,还有当时的市盈率、五年分位、各项基本面比率、算出来的公允价和所有中间值。成本几乎为零,但它是你后面所有回测和信号的地基,而且这种地基只能从今天开始攒,补不回来。这同时也是价值投资本身的一条纪律:把你当时看到的数字和当时的判断一起冻住存档,否则半年后回头看,你只会记得自己是对的。


更深角度

该反着用:他们是有团队的公司,养得起"持续评测 + 用 agent 迭代技能"这套重循环,甚至有余力去牵头做一个行业评测基准。你没有——一个人扛正职加多个副业,精力是最稀缺的那样东西。但结论要反着读:正因为你养不起厚封装,"最薄的赢"对你不是优化建议,是生存约束。 他们试了一年多才敢砍到最薄,你没有一年多可以试,所以你的默认值就该是薄,加厚必须先拿出证据。同理,他要抬的是整个行业的下限,你要抬的只是你自己一个人的下限——把每个项目"最差那次"变成可接受,比让任何一个项目偶尔惊艳有用得多,因为一个人的系统是被最差那次拖垮的。

和你现在做法冲突:这是这期最该让你不舒服的地方。你正在建的 PRD 工厂是加法方向——更厚的 agent 定义、更细的协议步骤、更多评审环节;而且面对"碰撞纪律难落地"这个痛点,你的解法是再加一层结构。这场演讲拿一年多实测给出的结论正好相反:抽象层每厚一分,模型的先验知识就被挡掉一分;system prompt 越写越长,往往是格式选错了的症状,不是努力不够的证明。 这个张力我不替你下结论——写 PRD 和做视频确实不一样,PRD 要审计、要留痕、要多人对齐、要能追责,这些是做视频没有的约束,那层结构可能真的值。但你至少得能回答一句:我加的这一层,换来了什么,值不值它吃掉的 token 和维护成本? 你现在答不上来,不是因为答案是坏的,是因为你根本没有对照组。第二个冲突小一些但同样真实:你想把"该做什么"前移到 agent,他明确把"该做什么"留给人,理由就一句——模型在创意判断上还不够好。

对你的镜子:你 2021 年写下的第一条产品价值观是"创新大于机械"。而这场演讲里赢的那个方案,恰恰是所有候选里最不创新、最土的一个——试遍了专业剪辑软件、动效格式、用代码写视频的框架,最后选了 HTML,一个 30 年前的东西。一年多的努力,全部价值凝结在最后那一个判断上:别跟模型对着干。 这就是你自己那条"判断力 > 努力"的现场演示:真正值钱的不是他们试过多少方案,是他们最后敢承认最土的那个是对的、并且把前面一年的沉没成本一把扔掉。

第二面镜子更扎人:他开场那句"造已经很容易了,发出去还是很难",说的就是你。你有一条能造 App 的链路、一本第二大脑、一个能生成分析的工厂——但家居号的指标盘空着没在跑,档案只盘了不到十分之一,一人公司还停在存稿期。你的瓶颈不在造,在发。 这期最该留下的,可能不是任何一条技术做法,而是这句诊断。


所以呢

可迁移的思维模型

  • 【耐用】母语优先:给任何执行者(模型、协作的人、你的读者)设计接口时,先问一句"这是它天天在用的语言吗"。不是,就换。教学成本是每次都要交的税,而且交了税也换不来最好的输出。
  • 【耐用】最弱执行者压测法:用能力最差的那个来验证你的规范。它跑得通,强的一定跑得通;它跑不通,多半是规范有问题,不是它笨。这条对带人、写文档、设计流程一样成立。
  • 【耐用】抽象层守恒:你在提示词里补的每一句语法,都是在替一个选错的格式还债。技能文档里语法占比过半,就是抽象层选错了的报警灯。
  • 【耐用】冻住时钟再采样:任何要把异步、不确定的过程变成可复现产物的场合,通用解法都是先把状态冻成可枚举的,再一个一个采。
  • 【会过期】"HTML 就是母语"这个具体答案会过期。它成立的唯一原因是当下训练数据的构成,跟 HTML 本身好不好没什么关系。数据构成一变,答案就变。耐用的是那个问法——"模型的母语是什么"——不是这一版的答案。

判断更新

你之前遇到 agent 产出不行时,默认假设大概率是"上下文给得不够、提示词不够细、技能写得不够全",所以动作方向一直是加。这期给了你一个成本更低、也更该先试的假设:可能是你让它讲外语了。 下次改之前,先花十分钟问一句"这个格式模型见过吗",再决定要不要写那两百字。

这周一个赌注

拿 Claude Code 加 Hyperframes,给你手上任意一个项目做一支 30 秒发布视频,限时一个下午,全程记账。这一件事同时押三个方向:验证"最薄封装、不用教框架"到底是不是真的(你会亲手感受到那种落差);补上你造完就发不出去的那个环节;产出一篇有实测、有账、有翻车的验证体存稿。做不成也不亏——"我试了没成,原因是这个"本身就是一篇好内容,而且比成功那版更容易过你的闸门。

接着读