technical-library/bulletins/xxx):「如果我在下面这个 TSB 通知这里,我就知道它属于 safety bulletin,而且它属于 technical library」。拿到一个 URI 就能「真的从 graph 里抓出一个 node,这个 node 上有原始文本,或者甚至只是一个指向原始文本的链接」,还能顺着拿子树往下钻。→ 详细HAS*0..25 是重点:包含关系的边最多往下走 25 层,且这个深度在查询里是参数化的,「所以它给了你一个选项,可以决定你想遍历多深。这在某种程度上就是拼出这份目录时那种『图的味道』」。另有第二个「简单得多」的查询负责把 link 抓出来。→ 详细depth=1 → 只往下一层;传入具体 URI(例如 Falcon 2.0 那份文档,或它链到的 coil identification)→ 「它基本上就会给我那份文档以及它链接到的所有东西」。→ 详细starts with 做后置过滤限定子树,「所以我就可以说,只在手册的这一部分下面搜索」。妙处在于「它仍然在利用那个层级化的包含结构、那棵树,但它是通过 URI 这个 ID 结构来实现的,这样就不用做那么多图遍历」。→ 详细misfire OR rough idle。把语义理解外包给模型,把召回留给确定性索引——这是个可以直接抄的架构选择。→ 详细content_search,脚本传进去的字符串就是 Lucene 查询参数;先命中索引缩到一批文档和 section,再按 URI 前缀过滤。→ 详细HAS 做成通用的多层包含关系:「如果我搞成 HAS_FOLDER、HAS_DOCUMENT_SECTION 这样,Cypher 就会变得很复杂。所以这就是我把命名保持得很短的原因。」→ 详细misfire OR rough idle,命中最高分的发动机型号,确认自己找对了文档)→ tree shape 找交叉链接和成因(从手册链到各维修流程)→ 拿 join path → 回数仓按 VIN 查工单。→ 详细本场没有 lightning round,但讲者每 10-15 分钟主动停下来收问题(开场即声明「有问题请直接举手」,并让 Ben Squire、Ryan 在场边解环境卡点)。以下逐题列出:
HAS 刻意做通用以免 Cypher 复杂;粒度越细 agent 越精确但模型越复杂,几百种关系类型会撑爆上下文窗口。→ 详细content_search,建在 document 和 section 节点上;先全文命中,再用层级 URI 做前缀后置过滤。→ 详细收尾:workshop 全程可在线免费重做;Anthropic 的 key 会被撤掉(需自备),BigQuery 的 key 会多留一阵;课程后面还有几节没现场讲的信息性章节和可选练习课。→ 详细
这场 workshop 表面在讲"怎么在数据湖仓上建图",骨子里讲的是一件跟你天天在干的事高度同构的活儿:你手上已经有一大堆结构化的表和一大堆非结构化的文档,AI 拿不动它们,不是因为它不会查,而是因为你没给它形状。 下面按跟你项目的相关度从高到低排。
他们怎么做的
doc outline format.md、theme format 这类规格文件写好,脚本里那句真正干活的查询故意留空,然后让 Claude Code 拿着 Cypher skill 和 GDS skill 去把空填上→ 详细。人负责"要什么形状",agent 负责"怎么查出来"→ 详细。你可以怎么做
更深一层(反着用)
他这场最值钱的判断是**"不要让 LLM 起名字"——themes 那一段他宁可让社区检测算法输出一堆没名字的簇,也不让模型给簇编个好听的标签,他原话是"它其实从来没有给 theme 起过名字,这正是这套做法的关键点"——你拿到的每一个名字(链接名、排名靠前的文件名)都直接来自数据本身→ 详细。反过来照镜子:你的 PRD 工厂里有多少地方,是让 agent 生成了一个看起来很规整、但没有任何底层结构支撑的命名**?比如自动生成的模块名、自动归类的需求主题。凡是这种地方,都是"看着收口了、其实没收口"的高发区。
所以呢
下周挑一件事:在 PRD 工厂里加一条"证伪查询"——不问"我们做了什么",问"什么该有但没有"。一条就够,跑出来的结果大概率会比你想象的难看,而那正是"agent 产出的可观测/可验证"这个痛点第一次有了抓手。
他们怎么做的
starts with 直接把查询限制在某棵子树里→ 详细。misfire OR rough idle)再去检索→ 详细。你可以怎么做
更深一层(冲突)
这里有个跟你现在做法直接冲突的点:他不用向量检索。你(和大多数人)默认"知识库 = 向量库 + RAG",但他的论据很硬——向量检索答不了"什么不存在"、答不了"整体上有哪些主题"、也答不了"这条结论的上一级语境是什么"→ 详细。全文索引 + 结构 + 语义扩展这条路更土,但可解释、可增量、便宜。对一个精力是最稀缺资源的人来说,"土但不用维护"往往赢过"先进但要一直调"。
所以呢
先做最小那步:挑一个主题,把它下面的笔记之间的引用关系补全,然后问一句"这个主题下有哪些笔记从来没被任何其他笔记引用过"。孤儿笔记就是你信噪比的噪声源,也是你跨主题串联最该动手的地方。
他们怎么做的
你可以怎么做
更深一层(镜子)
他这场最像你的地方是:一个人把形状想清楚,剩下的交给 agent 填。你的"9+1 Agent 一人公司"本质上赌的也是这个。但他给出的边界更清楚——agent 负责实现,人负责定义什么是对的(spec 和 skill 是人写的,查询是 agent 写的)。你现在的三驾马车如果卡住,多半不是 agent 不够强,是你还没把"什么算对"写成 spec。
所以呢
把这期直接排进 Phase 0 的存稿清单,作为一篇验证体:一个明确的观点(别让 LLM 抽实体)、一次真实的实测(你自己的库)、三个可抄的数字。这比再攒一篇观点短评值钱得多。
他们怎么做的
doc outline format.md 定义了输出必须长什么样,agent 只能照着填→ 详细。你可以怎么做
你的"设计稿即工程强制契约"和他的"spec 即查询契约"是同一个思路的两个实例,可以互相补强:他多做的一步是把契约的执行点放进脚本(留空、必须填、填不对跑不通),而不只是放进约定。你的 7-Agent 链路里,Figma 那层契约如果目前只靠 agent 自觉,可以照这个改成机器可校验的。另外"把该做什么前移到 agent"这个痛点,本期的答案是别前移——该做什么(形状)恰恰是人最不该让渡的那部分。
所以呢
选一个 agent 交接点,把口头约定改成"缺字段就报错"的硬校验,看链路的返工率有没有降。
他们怎么做的
你可以怎么做
季度回望现在多半靠你自己翻记录。可以把你写过的决策记录 + 原则条目跑一次社区检测,看"我这季度实际在纠结的主题"聚成了哪几簇——算法看到的你和宪法里写的你如果对不上,那个差值就是最值钱的回望材料。跨域守门同理:哪两个域之间的连接特别少(conductance 低到几乎不相往来),那就是守门该盯的缝。
所以呢
下次季度回望前跑一次,把"算法聚出来的簇"当成议程的第一页。
"哪块内容特别薄"这个查询→ 详细正对着你"档案只盘了 16/218"和"选题矿池覆盖不均"——把已发内容按支柱聚一遍,缺口自然浮出来,比对着空指标盘发愁快。
本期最能迁移到你元约束上的是那条取舍原则:能用确定性规则解决的,别请 LLM→ 详细——每一处交给模型的自由发挥,都是一笔你日后要反复校验的维护成本,而校验要花的正是你最缺的精力。
StockHelp / 投资:本期是纯数据工程内容,跟选股、估值、商业模式、市场心理都不沾边,没有可直接借鉴的地方。唯一沾边的一点:讲师提到社区检测这类算法在 AI 火起来之前,早就在反欺诈和反洗钱里用来聚类可疑账户→ 详细——仅此而已,不展开。