用眼睛搜索 — 四种浏览、图查询语言与前谷歌时刻
这一章讲三件事: 四种浏览各回答什么问题(不打查询语句的搜索); 图浏览怎么当场诊断一次被污染的搜索(主走查); 以及全书留给这个时代的结束语——为什么说现在是「前谷歌时刻」。 它是拆解的最后一章:前面九章铺的所有结构,在这里被「点」出来。
1. 先看现象:你还不知道要搜什么
前两章的搜索都有前提:你知道要什么(一个名字、一个区间、一个主题)。 但很多时候你不知道——新员工想搞懂「油漆在木构房屋里怎么用」,你连词都不会拼; PR 经理发现搜索结果不对劲,但不知道哪里错了。这种时候,打查询语句是死路, 点着走才是活路。
书里给浏览的定义很谦逊:它其实也是搜索模式,只是不打语句,靠在词表、血缘、图里 点来点去;而且它是其他搜索之间的中转站——让你边逛边学会公司的语言和域, 之后打查询也更有准头1。这就是第 01 章「垂直/水平/关系」三种组织线在 UI 上的样子: 当初怎么组织的,今天就怎么浏览。
2. 四种浏览:四个方向,四种问题
| 浏览 | 沿着什么走 | 回答什么问题 | 书里的例子 |
|---|---|---|---|
| 词表浏览 | 三种词表的层级与簇 | 这个词在公司里怎么被理解? | 新员工搜「paint」,对照全局/域/自由词表里的不同身份2 |
| 域浏览 | 能力/流程树上下走 | 这类数据该在哪个域?该找谁? | 客户画像项目挂「客户信息管理」还是「客户偏好管理」3 |
| 血缘浏览 | 数据的来路上游/去向下游 | 这报表为什么坏了?改上游会砸到谁? | 找「有进无出」的死表、追敏感数据的下落4 |
| 图浏览 | 知识图谱的点和边 | 这数据和什么意外地有关? | 主走查(下一节) |
几个值得抄走的用法细节:
- 词表浏览是学公司话的课本:同一个「paint」,全局词表里是严格受控的正式术语, 域词表里是一个域的口径,自由词表里是大家的随手标签——点开一层,组织的语言层级就看清了5;
- 域浏览可以纯好奇:书里说好奇驱动的域浏览「从来不亏」,它让你理解公司的数据版图6;
- 血缘浏览是运维与合规的双面刀:上游查「报表为什么坏了」,下游测「改这个上游会砸到谁」; 还能揪出只有流入没有流出的死资产、常年没动过的老管道;DPO 拿它记录敏感数据流向了哪里7;
- 图浏览是偶得的最大化(第 07 章的概念在此兑现):书里的原话是「在图上点着走, 是最大化 serendipity 的终极方式」8。书里还给了两个图技术的成熟应用当参照: 警务与情报机构拿图分析犯罪网络(IBM、Palantir 卖的就是这个),学界拿图画文献计量地图9。
3. 主走查:两个「promotion」,一次污染诊断
H&M 通讯部的 PR 经理遇上怪事:搜「promotion」,结果明显歪了—— 混进来一堆八竿子打不着的东西,又说不上来为什么10。
第 1 步 搜「promotion」→ 结果歪,看不出原因
│
第 2 步 再搜一次,打开顶部命中(促销策划数据集),切换成「图视图」
│
第 3 步 图上摊开与 promotion 相连的一切:术语、流程、数据源
→ 两个「promotion」现形:
· 域词表里的 promotion = 公关推广活动(他想要的)
· 自由词表里的 promotion = 职场晋升(别人打的标签)
│
第 4 步 自由词表那个 promotion 后面带着「!」——目录自动检测到
它与域词表的正式术语撞名(重复),标了惊叹号
│
第 5 步 过滤掉自由词表分支再搜 → 结果回到正轨
这一走查把前面所有章拧在了一起:自由词表(第 05 章,folksonomy)贡献了长尾视角, 也贡献了歧义;域词表的正式术语是锚;图(第 01 章的第三种线)让「这个词还连着什么」 变得看得见;目录的重复检测机制把疑似冲突主动标出来。 关键词搜索只会把两股 promotion 混在一起排序,图浏览让污染当场现形11。
书里在这段后面跟了一句总结,值得当座右铭:搜索是一个过程——往往是「搜了改、改了搜」 的一系列搜索,逐步放大、收窄、重新聚焦,直到结果终于对上需求12。
4. 最后一张底牌:用图查询语言搜遍一切
前两章反复出现一个天花板:IRQL 是供应商设计的——它提供一些搜索要素,漏掉另一些, 永远不可能让你搜到一切13。
知识图谱目录留了一张底牌:目录建在图数据库上,而图数据库有自己的查询语言—— SPARQL、Cypher、GraphQL、Gremlin(第 05 章提过这是图谱目录的「可搜索」特性)。 直接用这门语言,元模型里定义过的一切都能搜——供应商的 IRQL 圈到哪儿,你就越到哪儿14。 血缘若是图式的,同样能这么搜15。
代价书里也没瞒:这是一门技术手艺,不是所有用例都值得学;但「想按自己的方式组织数据、 按自己的方式搜索」的人,这就是完整的自由16。 (对比第 07 章的两套语言:SQL 查数据,IRQL 找数据——图查询语言是 IRQL 的「完全体」, 只在图谱目录里存在。)
5. 前谷歌时刻:这本书的结束语
拆解的最后一节,留给作者放在原章小结里的历史判断。他说,对话式 AI 搜索此刻处在一个 罕见的状态:没有任何一家厂商赢下市场——就像 Google 崛起之前的搜索引擎世界, 一切都还没定;「那个稀有的时刻稍纵即逝,趁它还在,享受它」17。
紧接着是对读者的直接喊话:请继续实验——现在是塑造对话式搜索未来的时候, 我们正在一起定义它18。
判断(我们的,不是书里的): 「前谷歌时刻」的判断放在企业数据这个行当里尤其准确, 因为目录市场本来就高度分散(O'Reilly 版市场格局里从未出现一家通吃),对话式界面 没有网络效应壁垒,格局比通用搜索引擎更可能长期碎片化——所以「时刻」未必「稍纵即逝」, 它可能就是常态。对读者真正有用的推论是:别把任何一家的对话式搜索体验当成行业标配来学, 要学的是这一章背后的结构(词表、域、血缘、图)——结构跨供应商存活。 如果错,会错在: 如果某家厂商靠模型能力实现赢者通吃(对话质量差距大到用户不再迁移), 结构知识仍然成立,但「多供应商实验」的策略收益会缩水。
6. 作者的判断与证据
书里给出的方法与例子:
- 四种浏览与第 01 章「垂直/水平/关系」三种组织一一对应——这是全书结构上的收口;
- 「两个 promotion」是作者自造的教学案例,展示了自由词表与正式词表的冲突、 目录的重复检测标记(!)机制;
- 血缘浏览的运维用法(死表、老管道)与合规用法(DPO 追数据下落),书里明说「第 6 章」 有更多展开——那章不在试读版里7。
作者的立场:
- 「图浏览是最大化偶得的终极方式」——定位判断,依赖目录真的建在图上;
- 「前谷歌时刻」——历史类比,是全书最有个人色彩的判断。
判断(我们的,不是书里的): 这本书的隐含结论其实是:目录的市场护城河不在搜索框, 在词表、域架构和图这三样「慢工出细活」的资产。对话式搜索拉平了交互体验之后, 各家比拼的恰恰是第 04–06 章那些笨功夫——作者用一个「会过时的关键词章节」 换来了一个「不过时的结构章节」,这个取舍是本书设计上最聪明的地方。 如果错,会错在: 如果未来目录的主要消费者是 AI 而不是人(第 02 章的「喂 AI」方向), 「浏览」这种人类交互的比重会持续下降,结构知识也要换一种形态存活(变成模型可读 的图)—— 方向不变,形态会变。
7. 边界与局限
- 浏览体验强依赖供应商实现。 血缘功能各家差异极大,书里提醒选型时要专门评估这一项, 并承认评估「耗时巨大」19;
- 图浏览的前提是图目录。 非图谱目录没有这一整章的能力;
- 「自动重复检测(!)」的真实覆盖未知。 撞名检测能抓字面重复,抓不住语义重复 (同义词不同写法),书里没有展开;
- 试读版止步于此。 原书第 5–13 章(访问与观测、端用户赋能、数据域、数据产品与契约、 生命周期、目录即源、LLM+KG 模式、标准与 AI、未来展望)全部缺席—— 本拆解的「全书」只到原书第 4 章,这是 Early Release 的边界,不是书的边界。
8. 可带走的
- 浏览是不打语句的搜索,是其他搜索之间的中转站——边点边学公司的语言;
- 四种浏览对四问:词表(这词什么意思)、域(该在哪个域)、血缘(从哪来到哪去)、 图(和什么有关);
- 血缘浏览的四类实际用法:查故障、测改动波及、揪死表、追敏感数据下落;
- 搜 索结果「歪了」的时候,打开图视图找污染源——folksonomy 的歧义会当场现形;
- 搜索是一个过程:一系列放大、收窄、重新聚焦,不是一击命中;
- IRQL 永远搜不全;图谱目录的图查询语言(SPARQL/Cypher/Gremlin)是搜遍一切的完全体;
- 此刻是前谷歌时刻:没有赢家,值得亲手实验;
- 真正跨供应商保值的是结构(词表/域/图),不是任何一家的搜索框。
9. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 浏览=搜索之间的阶段 | 第 4 章 | text/25-fm-browsing-patterns.txt:7(搜「phase between」) |
| 词表浏览与 paint 例 | 第 4 章 | text/25-fm-browsing-patterns.txt:15(搜「surface treatment」) |
| 三种词表层级差异 | 第 4 章 | text/25-fm-browsing-patterns.txt:21(搜「stands out clearly」) |
| 域浏览的两个动机 | 第 4 章 | text/25-fm-browsing-patterns.txt:30(搜「purview of Customer Information」) · text/25-fm-browsing-patterns.txt:33(搜「sheer curiosity」) |
| 血缘浏览四类用法 | 第 4 章 | text/25-fm-browsing-patterns.txt:39(搜「report is broken」) · text/25-fm-browsing-patterns.txt:42(搜「no flows going out」) |
| DPO 追敏感数据 | 第 4 章 | text/25-fm-browsing-patterns.txt:45(搜「processed downstream」) |
| 血缘功能各家不同 | 第 4 章 | text/25-fm-browsing-patterns.txt:50(搜「assess lineage functionality」) |
| 图浏览=最大化偶得 | 第 4 章 | text/25-fm-browsing-patterns.txt:60(搜「maximize serendipity」) |
| 警务与文献计量的图 | 第 4 章 | text/25-fm-browsing-patterns.txt:77(搜「Palantir」) · text/25-fm-browsing-patterns.txt:78(搜「bibliometric」) |
| PR 经理走查 | 第 4 章 | text/25-fm-browsing-patterns.txt:91(搜「career advancement」) · text/25-fm-browsing-patterns.txt:92(搜「exclamation mark」) |
| 搜索是一个过程 | 第 4 章 | text/26-fm-searching-a-graph-based-data-catalog.txt:4(搜「series of searches」) |
| IRQL 的天花板 | 第 4 章 | text/26-fm-searching-a-graph-based-data-catalog.txt:13(搜「IRQL will never allow」) |
| 图查询语言搜遍一切 | 第 4 章 | text/26-fm-searching-a-graph-based-data-catalog.txt:16(搜「actually search for everything」) · text/26-fm-searching-a-graph-based-data-catalog.txt:19(搜「Gremlin」) |
| 搜遍元模型的一切 | 第 4 章小结 | text/27-fm-summary.txt:6(搜「everything that the metamodel contains」) |
| 前谷歌时刻 | 第 4 章小结 | text/27-fm-summary.txt:15(搜「before Google won」) |
| 请继续实验 | 第 4 章小结 | text/27-fm-summary.txt:22(搜「keep experimenting」) |