data-start),用来让 agent 和自己都知道时间轴之类的信息。→ 详细愿景一句话:「那个帮你做产品的 agent,同时也能帮你做产品的发布视频。」但他紧接着说了句实话:「模型在创意类的活儿上还是不够好」——他们花了大量时间做 eval,想在 skill 里把这块推得更远。→ 详细
他认为这需要更高一层的改变,所以团队开始做一个 code-to-video benchmark(代码转视频的公开评测基准),想拉上各家 LLM 实验室和所有做视频 agent 的创作者,一起把行业下限抬上去。感兴趣的可以会后找他,或找现场任何一位穿 Hyperframes T 恤的同事。→ 详细
彩蛋:AI Engineer World's Fair 的官方宣传展示视频,就是 HeyGen 与大会团队深度合作、用 Hyperframes 做出来的——留给现场观众的小惊喜,也是「它到底能做到什么程度」的实证。→ 详细
收尾三句:那支片子证明了用 HTML、CSS、JavaScript 能做出什么水准的动态图形;agent 已让「做产品」无比容易,但「把产品发出去」依然相当难;答案是——要做出好视频、把产品推向世界,你的 agent 需要的就只有 HTML。→ 详细
开源仓库:Hyperframes 项目(演讲末页给出链接),欢迎去看、点 star、把 skills 下下来用。→ 详细
X:@Reems_Juso —— James Russo 本人;他表示会后就在场外,想聊随时找他。→ 详细
先说结论:这期跟你的关联度极高,而且不是"讲 agent 的都算相关"那种高。 你手上这七八个项目里,有五个的内核是同一件事——我写一套东西,让 agent 照着干:ERP 那套 PRD 工厂、造 App 的链路、两个自媒体的 agent 班子、第二大脑里这套技能。而这场 15 分钟的演讲,本质上是一个团队花了一年多、试遍市面上所有方案之后,交出来的一份关于"该怎么给 agent 设计接口"的实测报告。更值钱的是:它的结论跟你现在的做法是反的。所以这段会写得比较长。
1|别让 agent 讲外语——你那套自定义结构,很可能就是他说的 DSL
他是怎么做的:全场地基句是"HTML、CSS 和 JavaScript 是 LLM 的母语",因为训练数据里绝大部分就是被抓取的网页。反过来,当你教模型一门新的领域专用语言、甚至只是你自己定的一套 JSON 结构,你就是在逼它讲外语。他的比喻是让莎士比亚用日语或中文写诗——词能拼对,韵味全无。最狠的一句在后面:这个损耗不是靠给示例能补回来的,"哪怕你给它一堆示例、教它一大堆东西,你也拿不到它最好的输出,因为那不是它的母语"。
你可以怎么做:把 PRD 工厂里所有"我自己发明的东西"列一张清单——自造的阶段命名、自造的模板字段、自造的产物结构、自造的评审维度名。逐个问一句:模型见过这个吗?没见过的那部分,就是你每次都要花 token 去教、而且教了也换不来最好输出的那部分。能换成模型天天见的通用写法(普通 Markdown 标题、常见需求文档写法、标准 issue 格式、表格)就换掉。这不是让你放弃标准化,是让你把标准化建在模型已经认识的词上。
2|减法式上下文工程:最薄的那层封装赢了
他是怎么做的:他们在 HTML 外面套了各种封装层去试,"往里塞大量 context,把 system prompt 越写越长,还加了 skill"。结果原话是"但让我们意外的是,最后胜出的是最薄的那层封装"——说到底就是纯 HTML,加几个自定义小标签当元数据,用来标时间轴之类的信息。所有加法,全输给了减法。
你可以怎么做:你现在的方向是加法——更厚的 agent 定义、更细的碰撞步骤、更多的约定。挑一条最常跑的链路做个对照实验:一份用现在的完整版,一份砍到只剩最必要的输入加三五个字段的极薄版,同一个需求各跑三遍,另开一个会话盲评哪份产出更好。你的痛点里写着"agent 产出缺可验证证据"——这就是一次成本极低、当天能拿到闭环证据的实验。很可能你会发现,某几步协议和某几层封装是纯消耗。
3|用最弱的模型当设计伙伴,把格式的难度上限压出来
他是怎么做的:他们一上来就拿一个很小的模型当"设计伙伴",逻辑是"如果连小模型都能在一个框架里写出能跑的代码,那大模型和这些 coding agent 就百分之百也能做到"。用最弱的执行者压测格式设计,而不是用最强的模型去掩盖格式的毛病。
你可以怎么做:你的痛点里有"碰撞协议纪律是否真执行"——但在加强制约束之前,先做这个测试:把你的 agent 定义丢给最便宜的小模型跑一遍。跑不通的地方,八成不是模型不行,是你的规范写得只有你自己看得懂。 强制约束是用规则去堵漏,小模型压测是把漏堵在源头。这招还附送一层时间复利,他说得很清楚:小模型现在能搞定,随着模型变强只会更好。反过来,一套只有最强模型才勉强跑得动的规范,是在借未来的债——今天堪堪能用,明天换个便宜模型就塌。
4|技能只教品味,不教语法
他是怎么做的:配套技能有个明确分工——只写审美和视频门道,不写语法,"因为 LLM 和 agent 本来就会写 HTML、CSS 和 JavaScript,我们不用教它们语言,只需要教它们怎么做出好视频"。他还直接点了同行的问题:"你去看某些框架的 skill,内容其实基本就是:在这个框架里东西该怎么写。"那些 token 全花在补语法上了。
你可以怎么做:这是一把可以马上拿去量的尺子。把你 PRD 工厂的每份 agent 定义打开,粗略数一下:多少篇幅在讲"格式怎么写、文件放哪、字段怎么填",多少篇幅在讲"什么才算一份好 PRD"? 如果前者过半,按他的诊断,问题不在定义写得不够细,在你选的抽象层不对。语法应该被格式本身消化掉,技能的字数要全留给品味和判断——那才是模型真不会、也只有你能给的东西。
5|目标是抬高下限,不是追上限
他是怎么做的:他们持续做评测、并且用 agent 来改进技能,目的写得非常明确——"抬高视频的下限,确保一次性 prompt 出来的基础产出就已经相当不错"。不追偶尔惊艳,只让最差情况可接受。
你可以怎么做:一个 8 人 PM 团队要用你这套东西,决定它成败的从来不是最好那次的输出,是最差那次。给工厂定一条下限指标——比如"随便一个同事、随便一个需求,不做任何人工补救,产出的 PRD 能直接进评审"——然后所有改进都对着这条线走。下限稳了才谈得上推广,上限惊艳只够做 demo。
1|"设计稿即工程契约"——契约本身用的是不是母语?
他是怎么做的:他们淘汰掉的方案没一个是败在效果上的。Lottie、Rive 产出"相当不错";Remotion 更是"很好地展示了 LLM 用代码能做到什么程度"。它们败在同一件事:得教框架、教语言、给一堆写法示例,"这最终把创造力消磨掉了很多"。HTML 的胜出理由只有一个——不用教。
你可以怎么做:你把"设计稿即工程契约"设成强制项,那就得盯住这份契约的载体。如果它是一套自定义中间结构(自造的组件描述、自造的命名体系),agent 每次都要先学一遍你的方言,学费你天天在付。换成 agent 本来就天天在写的东西——常规组件代码、通用 CSS 变量、标准设计稿导出结构——契约的强制力一点没少,教学成本直接归零。
2|他那句"用之前怎么做,用之后还是怎么做",跟你的方向是拧着的
他是怎么做的:他们给重度用户的承诺是完全掌控,标准原话是"在有 Hyperframes 之前我们怎么做视频,用上 Hyperframes 之后还是怎么做"。真实工序五步:想清叙事和使命 → 逐帧分镜、想清每帧承担什么 → 逐帧加动效 → 合并成片 → 在编辑器里做最后一公里精修。工具接管的是执行,不是流程。他还补了句实话:"模型在创意类的活儿上还是不够好。"
你可以怎么做:你的痛点写着"把该做什么前移到 agent"——注意这跟他的选择是反的,他把"该做什么"牢牢留在人手里,只把"怎么做"交出去。可行的折中是把两类活儿分开:判断类的决定(这个 App 解决什么问题、首屏该给用户什么、什么算激活)留在人手里;构造类的动作(生成、组合、渲染、对齐、自检)整体前移。 别把两类混在同一个 agent 里往前推——一混,前移的就不是效率,是责任。
3|白嫖生态:浏览器能渲染的,视频里就都能有
他是怎么做的:选了浏览器当运行时之后,整个 Web 生态白送——3D 库、图表、SVG、着色器特效、WebGL 全都能进视频。他们团队做视频的日常动作因此变了:上网找灵感,把网页效果当例子改一改,直接塞进片子。
你可以怎么做:这条对你的激活/首屏体验痛点是现成弹药。首屏动效不用自己憋,去网上找到你想要的那个效果,把整个页面丢给 agent 让它照着改。选对了运行时,别人的存量就是你的库存——这是"杠杆 > 工时"在工程选型上的具体形态。
1|它完美符合你那类"大佬说 X,我试了"的验证体
他是怎么做的:Hyperframes 开源、永久免费,判据只有一条——"只要你的 agent 会写 HTML、CSS 和 JavaScript,它就会做视频",Claude Code、Codex、Cursor 都能直接配合。规模数字硬得能当论据用:过去 90 天开源用户渲染了超过 130 万支视频,26.7 万创作者试过,每天约 1.5 万支,GitHub 3.2 万 star。
你可以怎么做:这周就把它当选题做掉。 一个 PM 用 Claude Code 加这个框架,给自己的项目做一支 30 秒发布视频——从零开始,记时间、记花了多少钱、记翻了什么车、记最后成片能不能见人。这条天然过得了你那道闸门:删掉你的实测和判断,这篇立刻不成立,剩下的只是一条工具新闻。而且它一次补两处血——你缺的验证体存货,和你造完却发不出去的老问题。
2|他开场那句话,写的就是一人公司的处境
他是怎么做的:开场他举手调查——有多少人觉得,有了 coding agent 之后,写发布文案、做发布视频反而比把产品做出来还难?有人举手。收尾他又说了一遍:"agent 已让做产品变得无比容易,但把产品发出去依然相当难。"
你可以怎么做:这是你账号定位的一句现成的、来自一线的外部佐证。一人公司叙事里最有共鸣的痛点其实不是"我一个人怎么造",而是"造完了没人知道"。把它立成一个支柱选题:造得越快,发布这一环的瓶颈就越显眼。 配上你自己的产能账,这部分别人抄不走。
3|时间戳意识:他花了整整一句去声明"我提案在那两条推文之前"
他是怎么做的:讲到 Karpathy 等人也在说"HTML 是新的 markdown"时,他特意插了一句:我这个演讲提案是在这两条推文出现之前提交的,"你要是好奇,我待会儿可以拿证据给你看"。一个 15 分钟的技术演讲,他愿意为这件事花掉十几秒。
你可以怎么做:build-in-public 这套打法的核心资产就是时间戳——你先说的,比你说得对更值钱,因为对的判断迟早有很多人说,但"谁先说的"只有一个答案。这对你的存稿期是把双刃剑:好处是你可以先粗糙地把判断发出去占位,回头再补精修版;风险是攒得太久,判断的时间戳就烂在硬盘里了。至少给每篇存稿标上写成日期,发的时候把它亮出来。
他是怎么做的:他们做了一个只给网址就能出片的技能,路径是让 agent 去访问网站、抓回所有素材,还原设计、配色主题和品牌调性,再配上教给模型的基础动效示例,一次性就能跑出不错的成片。要害是把"品牌调性"固化成一份 agent 能读的文件,而不是每次口头描述。
你可以怎么做:你的家居号痛点里有"封面标签没激活"。同样的做法能直接搬:把封面规范——配色、字体、标签位置、构图、留白——写成一份文件,让 agent 每次照着生成,而不是每次重新跟它解释一遍。顺带把"母语"这个概念换个对象再想一遍:你读者的母语是什么? 他的洞察是别逼对方讲外语。放到内容上就是——你那张 PM 思维的牌一直没打出去,很可能不是判断不好,是你在用 PM 的语言跟家居读者说话。翻译成她们的母语(一个具体的家、一次具体的纠结、多花的那笔具体的钱),你的判断力才接得住。
他是怎么做的:技能只教品味不教语法;持续评测、并且用 agent 反过来改进技能;目标是抬高下限。
你可以怎么做:这三条同样适用于你第二大脑里这套技能,包括生成这一段的这个技能本身。拿去量一遍:你的技能文档里,多少字在讲"文件写到哪、格式长什么样",多少字在讲"什么才算一段有价值的分析"? 你的痛点是摄入 SOP 和信噪比——信噪比是品味问题,SOP 是语法问题,两者写在同一份文件里时,语法几乎总会挤掉品味,因为语法好写、可验证、写完有成就感。至于决策外脑,他那句"用之前怎么做,用之后还是怎么做"是个很好的设计约束:外脑的价值在于把你写过的原则放回你眼前,不在于替你决定。
他是怎么做的:把网页变成确定性视频的难点在于"浏览器天生就是异步的"——字体、图片会慢慢加载进来,这在网页上叫渐进增强,在视频里就叫穿帮。解法是冻住浏览器时钟,确定性地跳到每一帧,等页面完全就绪再截图,逐帧采样直到拿齐。一句话:把不确定的运行时冻成可枚举的状态,再一个一个采样。
你可以怎么做:你的看板每天收盘后拉数据,本质就是在做这件事,但目前只留了"当下这一帧"。等你要做信号和通知的时候,会立刻撞上一个墙:没有历史帧,就没法验证信号到底对不对。现在就开始每天把整屏快照存下来——不只是价格,还有当时的市盈率、五年分位、各项基本面比率、算出来的公允价和所有中间值。成本几乎为零,但它是你后面所有回测和信号的地基,而且这种地基只能从今天开始攒,补不回来。这同时也是价值投资本身的一条纪律:把你当时看到的数字和当时的判断一起冻住存档,否则半年后回头看,你只会记得自己是对的。
该反着用:他们是有团队的公司,养得起"持续评测 + 用 agent 迭代技能"这套重循环,甚至有余力去牵头做一个行业评测基准。你没有——一个人扛正职加多个副业,精力是最稀缺的那样东西。但结论要反着读:正因为你养不起厚封装,"最薄的赢"对你不是优化建议,是生存约束。 他们试了一年多才敢砍到最薄,你没有一年多可以试,所以你的默认值就该是薄,加厚必须先拿出证据。同理,他要抬的是整个行业的下限,你要抬的只是你自己一个人的下限——把每个项目"最差那次"变成可接受,比让任何一个项目偶尔惊艳有用得多,因为一个人的系统是被最差那次拖垮的。
和你现在做法冲突:这是这期最该让你不舒服的地方。你正在建的 PRD 工厂是加法方向——更厚的 agent 定义、更细的协议步骤、更多评审环节;而且面对"碰撞纪律难落地"这个痛点,你的解法是再加一层结构。这场演讲拿一年多实测给出的结论正好相反:抽象层每厚一分,模型的先验知识就被挡掉一分;system prompt 越写越长,往往是格式选错了的症状,不是努力不够的证明。 这个张力我不替你下结论——写 PRD 和做视频确实不一样,PRD 要审计、要留痕、要多人对齐、要能追责,这些是做视频没有的约束,那层结构可能真的值。但你至少得能回答一句:我加的这一层,换来了什么,值不值它吃掉的 token 和维护成本? 你现在答不上来,不是因为答案是坏的,是因为你根本没有对照组。第二个冲突小一些但同样真实:你想把"该做什么"前移到 agent,他明确把"该做什么"留给人,理由就一句——模型在创意判断上还不够好。
对你的镜子:你 2021 年写下的第一条产品价值观是"创新大于机械"。而这场演讲里赢的那个方案,恰恰是所有候选里最不创新、最土的一个——试遍了专业剪辑软件、动效格式、用代码写视频的框架,最后选了 HTML,一个 30 年前的东西。一年多的努力,全部价值凝结在最后那一个判断上:别跟模型对着干。 这就是你自己那条"判断力 > 努力"的现场演示:真正值钱的不是他们试过多少方案,是他们最后敢承认最土的那个是对的、并且把前面一年的沉没成本一把扔掉。
第二面镜子更扎人:他开场那句"造已经很容易了,发出去还是很难",说的就是你。你有一条能造 App 的链路、一本第二大脑、一个能生成分析的工厂——但家居号的指标盘空着没在跑,档案只盘了不到十分之一,一人公司还停在存稿期。你的瓶颈不在造,在发。 这期最该留下的,可能不是任何一条技术做法,而是这句诊断。
可迁移的思维模型
判断更新
你之前遇到 agent 产出不行时,默认假设大概率是"上下文给得不够、提示词不够细、技能写得不够全",所以动作方向一直是加。这期给了你一个成本更低、也更该先试的假设:可能是你让它讲外语了。 下次改之前,先花十分钟问一句"这个格式模型见过吗",再决定要不要写那两百字。
这周一个赌注
拿 Claude Code 加 Hyperframes,给你手上任意一个项目做一支 30 秒发布视频,限时一个下午,全程记账。这一件事同时押三个方向:验证"最薄封装、不用教框架"到底是不是真的(你会亲手感受到那种落差);补上你造完就发不出去的那个环节;产出一篇有实测、有账、有翻车的验证体存稿。做不成也不亏——"我试了没成,原因是这个"本身就是一篇好内容,而且比成功那版更容易过你的闸门。