跳到主要内容

用眼睛搜索 — 四种浏览、图查询语言与前谷歌时刻

这一章讲三件事: 四种浏览各回答什么问题(不打查询语句的搜索); 图浏览怎么当场诊断一次被污染的搜索(主走查); 以及全书留给这个时代的结束语——为什么说现在是「前谷歌时刻」。 它是拆解的最后一章:前面九章铺的所有结构,在这里被「点」出来。

1. 先看现象:你还不知道要搜什么

前两章的搜索都有前提:你知道要什么(一个名字、一个区间、一个主题)。 但很多时候你不知道——新员工想搞懂「油漆在木构房屋里怎么用」,你连词都不会拼; PR 经理发现搜索结果不对劲,但不知道哪里错了。这种时候,打查询语句是死路, 点着走才是活路。

书里给浏览的定义很谦逊:它其实也是搜索模式,只是不打语句,靠在词表、血缘、图里 点来点去;而且它是其他搜索之间的中转站——让你边逛边学会公司的语言和域, 之后打查询也更有准头1。这就是第 01 章「垂直/水平/关系」三种组织线在 UI 上的样子: 当初怎么组织的,今天就怎么浏览。

2. 四种浏览:四个方向,四种问题

浏览沿着什么走回答什么问题书里的例子
词表浏览三种词表的层级与簇这个词在公司里怎么被理解?新员工搜「paint」,对照全局/域/自由词表里的不同身份2
域浏览能力/流程树上下走这类数据该在哪个域?该找谁?客户画像项目挂「客户信息管理」还是「客户偏好管理」3
血缘浏览数据的来路上游/去向下游这报表为什么坏了?改上游会砸到谁?找「有进无出」的死表、追敏感数据的下落4
图浏览知识图谱的点和边这数据和什么意外地有关?主走查(下一节)

几个值得抄走的用法细节:

  • 词表浏览是学公司话的课本:同一个「paint」,全局词表里是严格受控的正式术语, 域词表里是一个域的口径,自由词表里是大家的随手标签——点开一层,组织的语言层级就看清了5;
  • 域浏览可以纯好奇:书里说好奇驱动的域浏览「从来不亏」,它让你理解公司的数据版图6;
  • 血缘浏览是运维与合规的双面刀:上游查「报表为什么坏了」,下游测「改这个上游会砸到谁」; 还能揪出只有流入没有流出的死资产、常年没动过的老管道;DPO 拿它记录敏感数据流向了哪里7;
  • 图浏览是偶得的最大化(第 07 章的概念在此兑现):书里的原话是「在图上点着走, 是最大化 serendipity 的终极方式」8。书里还给了两个图技术的成熟应用当参照: 警务与情报机构拿图分析犯罪网络(IBM、Palantir 卖的就是这个),学界拿图画文献计量地图9

3. 主走查:两个「promotion」,一次污染诊断

H&M 通讯部的 PR 经理遇上怪事:搜「promotion」,结果明显歪了—— 混进来一堆八竿子打不着的东西,又说不上来为什么10

第 1 步 搜「promotion」→ 结果歪,看不出原因

第 2 步 再搜一次,打开顶部命中(促销策划数据集),切换成「图视图」

第 3 步 图上摊开与 promotion 相连的一切:术语、流程、数据源
→ 两个「promotion」现形:
· 域词表里的 promotion = 公关推广活动(他想要的)
· 自由词表里的 promotion = 职场晋升(别人打的标签)

第 4 步 自由词表那个 promotion 后面带着「!」——目录自动检测到
它与域词表的正式术语撞名(重复),标了惊叹号

第 5 步 过滤掉自由词表分支再搜 → 结果回到正轨

这一走查把前面所有章拧在了一起:自由词表(第 05 章,folksonomy)贡献了长尾视角, 也贡献了歧义;域词表的正式术语是锚;(第 01 章的第三种线)让「这个词还连着什么」 变得看得见;目录的重复检测机制把疑似冲突主动标出来。 关键词搜索只会把两股 promotion 混在一起排序,图浏览让污染当场现形11

书里在这段后面跟了一句总结,值得当座右铭:搜索是一个过程——往往是「搜了改、改了搜」 的一系列搜索,逐步放大、收窄、重新聚焦,直到结果终于对上需求12

4. 最后一张底牌:用图查询语言搜遍一切

前两章反复出现一个天花板:IRQL 是供应商设计的——它提供一些搜索要素,漏掉另一些, 永远不可能让你搜到一切13

知识图谱目录留了一张底牌:目录建在图数据库上,而图数据库有自己的查询语言—— SPARQL、Cypher、GraphQL、Gremlin(第 05 章提过这是图谱目录的「可搜索」特性)。 直接用这门语言,元模型里定义过的一切都能搜——供应商的 IRQL 圈到哪儿,你就越到哪儿14。 血缘若是图式的,同样能这么搜15

代价书里也没瞒:这是一门技术手艺,不是所有用例都值得学;但「想按自己的方式组织数据、 按自己的方式搜索」的人,这就是完整的自由16。 (对比第 07 章的两套语言:SQL 查数据,IRQL 找数据——图查询语言是 IRQL 的「完全体」, 只在图谱目录里存在。)

5. 前谷歌时刻:这本书的结束语

拆解的最后一节,留给作者放在原章小结里的历史判断。他说,对话式 AI 搜索此刻处在一个 罕见的状态:没有任何一家厂商赢下市场——就像 Google 崛起之前的搜索引擎世界, 一切都还没定;「那个稀有的时刻稍纵即逝,趁它还在,享受它」17

紧接着是对读者的直接喊话:请继续实验——现在是塑造对话式搜索未来的时候, 我们正在一起定义它18

判断(我们的,不是书里的): 「前谷歌时刻」的判断放在企业数据这个行当里尤其准确, 因为目录市场本来就高度分散(O'Reilly 版市场格局里从未出现一家通吃),对话式界面 没有网络效应壁垒,格局比通用搜索引擎更可能长期碎片化——所以「时刻」未必「稍纵即逝」, 它可能就是常态。对读者真正有用的推论是:别把任何一家的对话式搜索体验当成行业标配来学, 要学的是这一章背后的结构(词表、域、血缘、图)——结构跨供应商存活。 如果错,会错在: 如果某家厂商靠模型能力实现赢者通吃(对话质量差距大到用户不再迁移), 结构知识仍然成立,但「多供应商实验」的策略收益会缩水。

6. 作者的判断与证据

书里给出的方法与例子:

  • 四种浏览与第 01 章「垂直/水平/关系」三种组织一一对应——这是全书结构上的收口;
  • 「两个 promotion」是作者自造的教学案例,展示了自由词表与正式词表的冲突、 目录的重复检测标记(!)机制;
  • 血缘浏览的运维用法(死表、老管道)与合规用法(DPO 追数据下落),书里明说「第 6 章」 有更多展开——那章不在试读版里7

作者的立场:

  • 「图浏览是最大化偶得的终极方式」——定位判断,依赖目录真的建在图上;
  • 「前谷歌时刻」——历史类比,是全书最有个人色彩的判断。

判断(我们的,不是书里的): 这本书的隐含结论其实是:目录的市场护城河不在搜索框, 在词表、域架构和图这三样「慢工出细活」的资产。对话式搜索拉平了交互体验之后, 各家比拼的恰恰是第 04–06 章那些笨功夫——作者用一个「会过时的关键词章节」 换来了一个「不过时的结构章节」,这个取舍是本书设计上最聪明的地方。 如果错,会错在: 如果未来目录的主要消费者是 AI 而不是人(第 02 章的「喂 AI」方向), 「浏览」这种人类交互的比重会持续下降,结构知识也要换一种形态存活(变成模型可读的图)—— 方向不变,形态会变。

7. 边界与局限

  • 浏览体验强依赖供应商实现。 血缘功能各家差异极大,书里提醒选型时要专门评估这一项, 并承认评估「耗时巨大」19;
  • 图浏览的前提是图目录。 非图谱目录没有这一整章的能力;
  • 「自动重复检测(!)」的真实覆盖未知。 撞名检测能抓字面重复,抓不住语义重复 (同义词不同写法),书里没有展开;
  • 试读版止步于此。 原书第 5–13 章(访问与观测、端用户赋能、数据域、数据产品与契约、 生命周期、目录即源、LLM+KG 模式、标准与 AI、未来展望)全部缺席—— 本拆解的「全书」只到原书第 4 章,这是 Early Release 的边界,不是书的边界。

8. 可带走的

  1. 浏览是不打语句的搜索,是其他搜索之间的中转站——边点边学公司的语言;
  2. 四种浏览对四问:词表(这词什么意思)、域(该在哪个域)、血缘(从哪来到哪去)、 图(和什么有关);
  3. 血缘浏览的四类实际用法:查故障、测改动波及、揪死表、追敏感数据下落;
  4. 搜索结果「歪了」的时候,打开图视图找污染源——folksonomy 的歧义会当场现形;
  5. 搜索是一个过程:一系列放大、收窄、重新聚焦,不是一击命中;
  6. IRQL 永远搜不全;图谱目录的图查询语言(SPARQL/Cypher/Gremlin)是搜遍一切的完全体;
  7. 此刻是前谷歌时刻:没有赢家,值得亲手实验;
  8. 真正跨供应商保值的是结构(词表/域/图),不是任何一家的搜索框。

9. 原文地图

主题原书章原文位置
浏览=搜索之间的阶段第 4 章text/25-fm-browsing-patterns.txt:7(搜「phase between」)
词表浏览与 paint 例第 4 章text/25-fm-browsing-patterns.txt:15(搜「surface treatment」)
三种词表层级差异第 4 章text/25-fm-browsing-patterns.txt:21(搜「stands out clearly」)
域浏览的两个动机第 4 章text/25-fm-browsing-patterns.txt:30(搜「purview of Customer Information」) · text/25-fm-browsing-patterns.txt:33(搜「sheer curiosity」)
血缘浏览四类用法第 4 章text/25-fm-browsing-patterns.txt:39(搜「report is broken」) · text/25-fm-browsing-patterns.txt:42(搜「no flows going out」)
DPO 追敏感数据第 4 章text/25-fm-browsing-patterns.txt:45(搜「processed downstream」)
血缘功能各家不同第 4 章text/25-fm-browsing-patterns.txt:50(搜「assess lineage functionality」)
图浏览=最大化偶得第 4 章text/25-fm-browsing-patterns.txt:60(搜「maximize serendipity」)
警务与文献计量的图第 4 章text/25-fm-browsing-patterns.txt:77(搜「Palantir」) · text/25-fm-browsing-patterns.txt:78(搜「bibliometric」)
PR 经理走查第 4 章text/25-fm-browsing-patterns.txt:91(搜「career advancement」) · text/25-fm-browsing-patterns.txt:92(搜「exclamation mark」)
搜索是一个过程第 4 章text/26-fm-searching-a-graph-based-data-catalog.txt:4(搜「series of searches」)
IRQL 的天花板第 4 章text/26-fm-searching-a-graph-based-data-catalog.txt:13(搜「IRQL will never allow」)
图查询语言搜遍一切第 4 章text/26-fm-searching-a-graph-based-data-catalog.txt:16(搜「actually search for everything」) · text/26-fm-searching-a-graph-based-data-catalog.txt:19(搜「Gremlin」)
搜遍元模型的一切第 4 章小结text/27-fm-summary.txt:6(搜「everything that the metamodel contains」)
前谷歌时刻第 4 章小结text/27-fm-summary.txt:15(搜「before Google won」)
请继续实验第 4 章小结text/27-fm-summary.txt:22(搜「keep experimenting」)

Footnotes

  1. 出处:「Browsing Patterns」第 4 段(text/25-fm-browsing-patterns.txt:4,搜「search patterns, but they usually don」)与第 7 段(text/25-fm-browsing-patterns.txt:7,搜「phase between」)。

  2. 出处:「Browsing Patterns」第 15 段(text/25-fm-browsing-patterns.txt:15,搜「surface treatment」)。

  3. 出处:「Browsing Patterns」第 30 段(text/25-fm-browsing-patterns.txt:30,搜「Customer Information Management」)。

  4. 出处:「Browsing Patterns」第 38 段(text/25-fm-browsing-patterns.txt:38,搜「upstream」)至第 44 段(text/25-fm-browsing-patterns.txt:44,搜「old data pipelines」)。

  5. 出处:「Browsing Patterns」第 21 段(text/25-fm-browsing-patterns.txt:21,搜「stands out clearly」)。

  6. 出处:「Browsing Patterns」第 33 段(text/25-fm-browsing-patterns.txt:33,搜「sheer curiosity」)。

  7. 出处:「Browsing Patterns」第 45 段(text/25-fm-browsing-patterns.txt:45,搜「processed downstream」):DPO 可以用血缘记录敏感数据如何被下游处理;更多示例书里指向第 6 章(试读版不含)。 2

  8. 出处:「Browsing Patterns」第 60 段(text/25-fm-browsing-patterns.txt:60,搜「maximize serendipity」)。

  9. 出处:「Browsing Patterns」第 77 段(text/25-fm-browsing-patterns.txt:77,搜「Palantir」)与第 78 段(text/25-fm-browsing-patterns.txt:78,搜「bibliometric」)。

  10. 出处:「Browsing Patterns」第 88 段(text/25-fm-browsing-patterns.txt:88,搜「seem skewed」)。

  11. 出处:「Browsing Patterns」第 91 段(text/25-fm-browsing-patterns.txt:91,搜「career advancement」)与第 92 段(text/25-fm-browsing-patterns.txt:92,搜「exclamation mark」)。

  12. 出处:「Searching a Graph-Based Data Catalog」第 3 段(text/26-fm-searching-a-graph-based-data-catalog.txt:3,搜「search is a process」)。

  13. 出处:「Searching a Graph-Based Data Catalog」第 13 段(text/26-fm-searching-a-graph-based-data-catalog.txt:13,搜「IRQL will never allow」)。

  14. 出处:「Searching a Graph-Based Data Catalog」第 18 段(text/26-fm-searching-a-graph-based-data-catalog.txt:18,搜「GraphQL」)与「Summary」第 6 段(text/27-fm-summary.txt:6,搜「everything that the metamodel contains」)。

  15. 出处:「Searching a Graph-Based Data Catalog」第 19 段(text/26-fm-searching-a-graph-based-data-catalog.txt:19,搜「graphbased」):「数据血缘也可以是图式的,若如此,血缘同样可以这样搜。」

  16. 出处:「Summary」第 1 段(text/27-fm-summary.txt:1,搜「technical skill set」)。

  17. 出处:「Summary」第 14 段(text/27-fm-summary.txt:14,搜「no single vendor controls」)与第 15 段(text/27-fm-summary.txt:15,搜「before Google won」)。

  18. 出处:「Summary」第 22 段(text/27-fm-summary.txt:22,搜「keep experimenting」)。

  19. 出处:「Browsing Patterns」第 50 段(text/25-fm-browsing-patterns.txt:50,搜「assess lineage functionality」)与第 52 段(text/25-fm-browsing-patterns.txt:52,搜「substantial time」)。