▲ 嘉宾 Aparna Dhinakaran——Arize AI 联合创始人兼 CPO,公司累计融资 1.31 亿美元;本期自愿当「小白鼠」现场全程演示。
▲ 主持人 Aakash Gupta——承诺替观众追问 Aparna 可能跳过的每一步,逼她把闭环拆开讲清楚。
▲ 全程不开 IDE,只在终端里给 Claude Code 一句起步 prompt,并把 Phoenix 仓库 URL 直接贴进去,让它拿到「要搭什么」的确切上下文。
▲ 同一块终端串起两步:上半是 agent 念出的完整 game plan(拉数据→打分→Opus 出报告),下半只用一句话就把它挂成 loop skill,往后每有新 issue 就自动重跑。
▲ 一句「can you help me instrument this agent?」后,skill 自己读代码库判明语言/LLM 提供方/该用哪个库,把每一类 LLM 与 tool 调用都接好往 Arize 发——PM 不必再去喊工程搭档配 tracing。
NPX skills add,「你可以直接把它丢给你的 coding agent」。其中的 instrumentation skill 本质上「就是用英文写明 Claude Code 该怎么把 trace 数据发送到 Arize」,人人都能读懂。用法就一句「你能帮我给这个 agent 做埋点吗」:skill 自动判断出代码是 Python、LLM 提供方是 Anthropic、该用哪个库,最后回「一切都已接好,正在往 Arize 发送」。跑完即见效:「这就是过去 15 分钟里所有的内容」——traces 流式灌进平台,看得到一个个 LLM 调用、tool 调用、去 GitHub 拉东西、打分,最后产出那份报告。 → 详细
▲ PM 真正想要的颗粒度不在「成品报告」层,而在这里:把每一个 issue 单独拎出来,看 agent 给它算出的 composite_score 到底合不合理——这正是 priority accuracy evaluator 要逐条评判的对象。
本期为「访谈 + 现场实操演示」格式,无独立 lightning round。收尾的核心行动号召与金句如下:
周末 2 小时行动:挑一个你每周重复花几小时的工作流(哪怕只是产品营销每周写 release notes),用 Claude Code 搭成 agent;先亲身体会上手有多容易(「insanely easy」),再用 evals + observability 把它从「vibe code」打磨到「真正好用」。 → 详细
本期最强金句:「任何用过 observability、会去看自己 traces 与 evals 的产品人,你大概率已经是全世界 PM 里的前 1% 了。」 → 详细
evals 的本质:「evals 不是凭空变出来的,是从你的 trace 里来的」;好 eval 要「健康比例判对 + 健康比例判错」,全错就是该回头审 eval 的信号。 → 详细
快速进闭环的四步配方:把数据弄进来 → 把 eval 搭起来 → 给它狠提批评 → 让它在 loop 里跑起来;再把「改进」本身也做成第二个 loop skill,就走向了自我改进型 agent。 → 详细
主持人收尾资源:放出 Arize 定价页;想免费拿 12 个月 Arize 团队版(Pro)可走 Aakash 的 bundle(bundle.akashg.com),或先用免费的 Phoenix 上手;强烈建议每位 AI PM 把 AI eval 技能练到家。 → 详细
嘉宾:Aparna Dhinakaran — Arize AI 联合创始人兼 CPO(公司累计融资 1.31 亿美元)。
主持人/频道:Aakash Gupta(YouTube 频道 Aakash Gupta)。
产品/资源:Arize AI(付费/企业版,底层数据存储 ADB + ADB data fabric)、Arize Phoenix(开源 observability + evals 平台)、Arize skills(NPX skills add,含 instrumentation 埋点 / evaluator 写 eval 等)、Alex(产品内嵌 agent)、OpenInference(Arize 发明的开放埋点标准);想免费拿 Arize 团队版见 bundle.akashg.com。
个人社交账号:原视频未直接给出 Aparna 的个人联系方式(无)。提及可关注/致敬的人:Jaya Gupta(Twitter,context graph 一文作者)、Hamel Husain(evals 方法论,曾发推力荐 Phoenix)、Shreya(evals 方法论,全文一处口语化为 Trey/Treya)、Mikio(Arize 开源负责人,与 Hamel 做过一期 skills 访谈)。
observability(可观测性):能看见 agent 内部每一步在干什么的监控能力。
trace(轨迹):agent 一次完整运行的逐步回放(拉数据→打分→出报告这一整串)。
span:一条 trace 里的单个步骤(如要看的某一个 issue)。
eval(evaluation,评估):对 agent 输出好坏的自动化打分。
instrument(埋点):往代码里塞监控探针,让 agent 的每步往 observability 平台发数据。
vibe code / vibe eval:凭感觉随手搭出来、未经真实数据校准的东西。
alpha:超额收益、护城河(本片指「产品品味」)。
AI native(AI 原生):核心产品本身就是 AI agent 的团队/公司。
context graph(上下文图谱):把分散各处的反馈/数据连成一张能喂给 agent 的网。
ground truth:人工确认过的"标准答案"数据集。
harness(执行框架):包在模型外面、驱动它干活的那套代码。
cron job:让程序按固定节奏(每天/每小时/每 5 分钟)自动重跑的定时任务。
prompt caching(提示词缓存):把不变的大段输入缓存起来,省去每次重拉的开销。
LLM-as-a-judge:用一个 LLM 去当评判,给另一个 agent 的输出打分。
OpenInference:Arize 发明的开放埋点标准(竞品也在用并在文档里链接它)。
相关度:高。 这期几乎是冲着你来的——一位融了 1.31 亿美金公司的 CPO,亲手演示「PM 怎么靠 observability / traces / evals 这套技能,从『把活交接给工程师』变成『自己一天搭完闭环』」。这正好压在你三件事上:你本人的职业与不公平优势、Holdwell 的多-Agent PRD 工厂、app_incubator 的 7-Agent 造 App 链路。下面按这三摊分开说,别的项目(StockHelp / 小红书等)这期确实不沾,略。
① 「会看自己 agent 的 traces 和 evals」= PM 前 1% 的门票——这是一张你已经摸到、但还没正式打出去的牌。
② 好奇心 > 培训,是头号录用信号——因为工具迭代快到没法做培训。
③ 「该 all-in 哪个编码下注」——这期给了你一个判断口径:挑你有全部上下文、且每周真在重复的那一个。
① 「先有真实 trace 数据,再做 evals」——这直接打在你的碰撞纪律难验证、agent 产出缺可观测上。
② 逐条颗粒度评判,而不是只看「成品报告」——对应你的评审该评到哪一层。
③ 注入一条具体的人类品味原则(如「bug 永远高优」)来校准 agent——这是「品味怎么落进系统」的可抄范式。
④ 「人在循环」该卡在哪三处——给你的真人评审卡点定了位置。
① 「把『该做什么』前移」她给了具体打法:让 agent 替你消化海量反馈、浮现出该优先的那一两件。
② 「设计稿即工程强制契约」遇上「self-improving agent」——这期给你提了个醒,也提了个张力(见下「冲突」)。
🔄 该反着用:她是资源足的 CPO 在「鼓励多试、激进自我改进」;你是精力为元约束的单兵,正确借法是反过来——克制地只下一个注、只 loop 一个流程。 她公司「招 PM 和工程师比以往都多」,可以让团队广撒网试遍所有新工具、让多个内部 agent 激进自改进。你不行——你的红线是「精力与聚焦是最稀缺资源」。所以她那句「好奇心、试遍所有新工具」对你要反着读:不是去试更多工具,而是用她的『周末 2 小时、只接一个数据源、从超简单开始』这条克制纪律,只把一个你上下文最满的流程做成 agent,跑稳了再说第二个。她的「广度好奇」对你应转译成「深度专注」。
⚡ 和你现在做法冲突:她主张「先动手搭出 vibe code、再用 evals 打磨」;你 Holdwell 那套是『先把三驾马车 + 六步碰撞协议的重型流程设计好』的偏前置规划派。 她明说有两条路都行,但她个人会「先让它跑、先搭点东西,再一轮轮反馈」,甚至「always start Claude generating, then give it ruthless criticism」。你的 PRD 工厂明显是重前置设计的那一极。张力在于:你「碰撞纪律难验证、评审回炉缺闭环」的卡点,会不会部分来自设计得太满、却没先跑出真实产物来校准?这里不替你下结论——但她全片最反复的那句「不先从真实 trace 数据起步是最大的错」,值得你拿去照一照自己那套重流程。
🪞 对你的镜子:你不是「一个在用 agent 工具的 PM」,你是「已经在亲手搭多-agent 系统的 PM」——这期把你正在做的事,命名成了当下最贵的那项技能。 你可能一直把 Holdwell 的 PRD 工厂、app_incubator 当成「我的工作 / 我的副业项目」。这期换了个镜子:你日常在做的「设计 agent、看 agent 产出、给它定判据」,正是 Aparna 用来定义「PM 前 1% / 拿 instant offer」的那项技能本身。你缺的不是能力,是把这件事识别成资产、并讲成你不公平优势的那层叙事。
① 「会看 traces / evals 的 PM 是前 1%」——这句话就是你新号定位的第三方背书,也是一篇 C 类验证体的现成引子。
② 「注入一条具体品味原则校准 agent」——你的『我的判断』支柱有了可展示的形态。
③ 「周末 2 小时把重复工作流搭成 agent」——一个天然的 C 类实测选题,顺带验证她的『insanely easy』有没有水分。
NPX skills add / Claude loop skill / OpenInference)——她自己都说 Claude Code「30 天 90 个功能」,这些 API / skill 名半年后多半变样,别记工具记打法。