跳到主要内容

AI 进场 — 目录既被 AI 增强,又成了 AI 的源

这一章讲三件事: AI 改了目录的哪两头;一次真实的搜索怎么从闲聊开始、 穿过目录、再落到 Slack 聊天记录上(本章主走查);以及「数据发现」这个词为什么是目录的全部目的。 这一章是第一版与第二版的分水岭:第一版只讲地图,第二版讲 AI 怎么用这张地图、又怎么吃这张地图。

1. 先交代:作者为什么写第二版

2023 年初,作者出版第一版时,核心主张还是「目录就像搜索引擎,只不过搜的是公司数据」1。 书刚出,ChatGPT 就把整个搜索行业掀了:微软 CEO 纳德拉宣布与 OpenAI 合作时说 「这是搜索的新的一天」,必应开始用对话机器人答题,Google 二十五年的稳态第一次被撼动2

作者当时在播客里被当众追问:「那 ChatGPT 会让数据目录发生什么?」他的回答是: 我书里给目录画了一个未来,真要展开讲这个未来,那显然就是 ChatGPT 和 AI3

第二版就是兑现这句话。它的结构是两个方向,这一章各给一块:

方向书里的说法一句话解释
with AI(用 AI)目录的实施、使用、扩展都因 AI 而显著变容易4AI 替你干活:找数、写描述、翻查询
for AI(喂 AI)目录成了更大搜索基础设施的一环,它本身成了一个源5AI 来目录这里取料

2. 主走查:一次午休闲聊,换回七份数据和十六个聊天线程

书里给整套 AI 增强编了一个贯穿案例公司:Hugin & Munin, 一家虚构的北欧可持续木构建筑公司,建材只用工地附近森林的木头6。 它的目录长什么样?书里描述的界面几乎是照着大家熟悉的搜索引擎抄的: 一根搜索栏,下面一只松鼠图标(点它进入对话式 AI 搜索)、一个放大镜(浏览)、 一摞书(词表——公司业务词汇的官方清单,第 05 章专讲)7像,是刻意的。

走查开始。你是 H&M 的一名员工,午饭时听到隔壁桌聊起一位叫 Kris 的数据科学家, 说他在目录里发布的几个「数据产品」对你手头的项目可能有用——话没问完, 那桌人起身进了会议室。回到工位,你怎么办?

第 1 步 你在目录搜索栏里用人话打一句:
「找出 Kris 拥有的、和数据科学业务术语表相关的数据产品」

第 2 步 目录里的 AI 把这句话拆成结构化查询。
放在几年前,你得自己写这样的式子:
Data Owner: "Kris*" AND business glossary: "Data Science"
AND Asset Type: "Data Product"
——星号是通配符,AND 是「并且」,写错一个引号就查不出东西[^8]

第 3 步 命中:Kris Kegelstrom 发布的 7 个数据产品,
内容是 H&M 家用房屋外墙的长期耐久性数据[^9]

第 4 步 产品描述写得不错,但你缺背景:午休那段对话里的想法,
描述里没写全。你想到:这些产品有没有在公司聊天工具 Slack 里被聊过?

第 5 步 你打开公司级 AI 助手「H&M chat」,让它同时查目录和 Slack。
这一步之所以可能,是因为目录和 Slack 都挂上了 MCP 服务器(即按这套约定开放、供助手来查的一端)[^10]

第 6 步 结果:16 个 Slack 线程讨论过这批数据产品,时间跨度超过一年;
助手把讨论总结成一页,你带着它继续做自己的方案[^11]

这六步里藏着这一章的全部机制。第 1–3 步是「用 AI」:自然语言进去,结构化查询出来; 第 4–6 步是「喂 AI」:目录被当成一个源,和 Slack 放在同一张桌上被同一个助手查。 下面两节把两头各拆开讲。

3. 用 AI:自然语言进去,结构化查询出来

先看过去的麻烦

目录里的东西都是描述(第 01 章讲过),搜目录因此和搜数据库不同: 你在搜「哪份资产跟我的问题有关」。过去表达这种搜索,得学一套查询写法—— 上一步走查里那行 Data Owner: "Kris*" AND … 就是,栏位名、引号、通配符、大小写, 一处不对就白写8

AI 做的两件事

现在的目录把这件事拆给了 AI:

  1. 抽取:从你的一句大白话里抽出关键词和布尔运算符(AND/OR/NOT 这类「并且、或者、排除」的逻辑词);
  2. 翻译:把抽出来的东西拼成正规的结构化查询语句,去目录里执行,把结果端回来9

你看不到中间那步,也不再需要会写它。书里把这件事的分量说得很直白: AI 让目录终于能「对完全自由灵活的自然语言搜索开放,话题多复杂都行」10

为什么这件事对推广尤其重要

书里还有一段专门说给数据治理和数据工程的人听的:你们可能觉得 AI 热闹归热闹、与我无关—— 恰恰相反。目录这种工具最难的一关是让高管点头放预算、让终端用户愿意上手, 而 AI 把这两关都变容易了:演示效果好懂,上手没有学习门槛11。 第 03 章讲的「谁为目录买单」会回到这一点。

4. 喂 AI:目录成了源本身

从「指路的」变成「被查的」

第一版里目录的身份是指路牌:你在这里搜到某份数据在哪儿,然后去那个系统里干活。 第二版加了一个新身份:目录自己成了 AI 的取料源——企业级 AI 助手不只搜目录, 还把它连着的所有源一起搜,而目录提供的全公司数据地图,恰好是 AI 最缺的那种背景12

这里必须解释两个词。

MCP,即模型上下文协议——一套公开的约定,规定 AI 助手怎么 连上外部工具和数据源、怎么发请求、怎么拿结果——主走查第 5 步里「目录和 Slack 都挂上 MCP 服务器——即按这套约定开放、供助手来查的一端」,说的就是两者都按这套约定开了个口子,让助手能来查13。 (补充(不在书里,依据我们的 protocol 书架):MCP 由 Anthropic 于 2024 年 11 月发布, 现已成为 AI 助手连接企业数据源的主流协议(即行业通行的标准);我们书架里有它的完整规范拆解。 依据: shelf=ai-protocol-reference/mcp-spec#03-server-primitives.md 事实=规范把服务器(对外提供服务、等别处来连的一端)定义为一侧暴露工具与数据项、供另一侧程序调用的角色,与本章「挂上 MCP 服务器即可被助手查询」的说法一致。)

AI 助手就是企业内部用的对话机器人。作者特意统一用词:大家熟悉的 Claude、Mistral、 OpenAI 这类产品是消费版,企业版就是 AI 助手——同一个东西,锁在公司数据范围内14

为什么书坚持「目录必须建在知识图谱上」

目录能给 AI 的不只是元数据的清单,还有结构。书里的判断是: 建在知识图谱上的目录能「大幅提高大语言模型(LLM,即 ChatGPT 这类大模型)做生成式(让机器直接产出内容的)AI 项目时答得多准」。

智能体(行话叫 agent:能自己接任务、自己调工具干活的 AI 程序)架构配上知识图谱, 执行任务也更有效——因为图谱本身记着什么和什么在业务上相关,这张关系网 能引导 AI,帮它采取更好的动作15

回忆第 01 章的三种线:垂直的域、水平的血缘、关系式的知识图谱。前两种给人看,第三种恰好 是机器能直接读的:点和边本来就是 AI 可以遍历的结构。这就是「喂 AI」这个方向上, 图谱式目录被书反复点名的原因。原书第二部分(第 11–13 章)将展开「LLM+知识图谱」模式、 MCP 与 Agent2Agent 标准——试读版未放出这几章,本拆解不代写16

5. 目的:这一切都为「数据发现」服务

书里给目录的存在理由起了一个专门的名字:数据发现(data discovery)—— 搜到并且真的找到你要的数据17

它有一个可以当验收标准的目标状态,借自 Peter Morville 2005 年那本《Ambient Findability》: 环境可寻性——「一个正在快速成形的世界:我们能在任何时间、任何地点,找到任何人、任何东西」18。 书里把这个标准原封不动搬进公司:在目录里,你应当能随时随地找到公司里的任何人、任何东西19

四类人靠数据发现吃饭,书里列得很清楚20:

拿目录干什么
数据工程盯数据管道的运行状况(数据可观测性)与数据质量
数据分析找到最合适的数据源,而不是困在孤岛里「手头有什么用什么」
治理、风险与合规给全部数据自动贴敏感/机密标签(第 06 章专讲)
AI 架构与 AI 工程把目录当企业级搜索与智能体编排(调度多个智能体分工干活)的源(本章 §4)

书里把这四类合起来叫数据智能(data intelligence)21

6. 作者的判断与证据

书里当作事实陈述的:

  • 主走查的全部情节(H&M 界面、7 个数据产品、16 个线程)是作者虚构的演示场景, 但其中每个环节对应的能力(自然语言查询、MCP 接入、跨源搜索)都是他认定已经成立的产品事实;
  • 「知识图谱提高 LLM 回答的准确性、帮助智能体」——作者说第二部分会引用科学文献来支撑22, 试读版未含该部分,所以这一论断在本书目前的部分里还挂着欠条

作者的推测:

  • 「没人知道对话式搜索会把目录带向哪里,但一定有什么要变」(前言的立场);
  • 「AI 让目录更容易卖出去」——是经验判断,没有给出对比数据11

判断(我们的,不是书里的): 主走查里最有长期价值的不是「AI 帮你写查询」 (这只是过渡形态),而是第 5–6 步那次跨源跳转:目录提供「公司有什么」的地图, Slack 提供「人们怎么谈论它」的活背景——这两层信息过去分开住在两个互不相通的系统里。 「目录即源」的真正含义是:元数据第一次成了可以直接喂给模型的原材料如果错,会错在: 如果企业 AI 助手最终直接读源系统的元数据接口(对外开放的读取口)、绕开目录, 目录作为「源」的地位会被架空——所以书反复强调目录必须建在图谱上、必须把元数据质量做高, 否则它连当源的资格都没有。

7. 边界与局限

  • 演示即上限。 主走查里的对话式搜索是理想态;书自己也提醒:「AI 时代还在婴儿期, 别指望这个能力已经全面替代复杂搜索」23
  • MCP 是本版新加入的设定,书只在案例里用了它,没有讲实现;而且讲深 MCP 的第 13 章不在试读版里。
  • 「图谱提高准确性」在试读版里是欠条,引用文献承诺在第二部分,见不到就别当已证。
  • 数据发现 ≠ 在数据里发现洞见。 书里特意分清:目录管「找到数据」, 找到之后的分析是数据科学的事24——第 07 章把这条区分讲透。

8. 可带走的

  1. 第二版 = 两个箭头:用 AI(目录更好用了)+ 喂 AI(目录本身成了源);
  2. 用 AI 的核心动作:大白话 → 抽关键词和逻辑词 → 结构化查询 → 结果,你不再需要学查询的写法格式;
  3. 喂 AI 的核心动作:目录与业务系统(如 Slack)各自挂上 MCP 口子,企业 AI 助手跨源一起查;
  4. 「数据产品在 Slack 里被聊过 16 个线程」这种活背景,是静态的资产描述永远给不了的;
  5. 目录的新身份:从指路牌到源本身——前提是元数据质量过硬、图谱结构可用;
  6. 验收目录的口诀:环境可寻性——随时随地找到任何人、任何东西;
  7. 「图谱帮助 AI」在本书试读版里是未兑现的承诺,引用前先知道自己引的是主张不是证据。

9. 原文地图

主题原书章原文位置
第一版核心主张与时代背景前言text/05-fm-preface.txt:26(搜「core message of the book」) · text/05-fm-preface.txt:45(搜「new day」)
播客之问与「未来=AI」前言text/05-fm-preface.txt:12(搜「take on ChatGPT」) · text/05-fm-preface.txt:20(搜「future vision」)
with AI / for AI 两方向第 1 章text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:12(搜「easier to implement, use and scale」) · text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:19(搜「source in itself」)
AI 助手=企业版 chatbot第 1 章text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:22(搜「Think Claude」)
图谱提高 LLM 精度、助智能体第 1 章text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:26(搜「increase precision greatly」)
高管买单更容易第 1 章text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:30(搜「decision makers on board」)
H&M 界面与松鼠图标第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:186(搜「fictitious Scandinavian」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:193(搜「squirrel」)
旧式查询写法第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:210(搜「Data Owner」)
AI 抽取并翻译成结构化查询第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:213(搜「structured query statement」)
7 个数据产品命中第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:214(搜「Kegelstrom」)
MCP 服务器 + Slack第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:225(搜「MCP servers」)
16 个线程、超过一年第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:229(搜「16 different threads」)
数据发现定义第 1 章text/08-fm-data-discovery.txt:3(搜「is called data discovery」)
环境可寻性引文第 1 章text/08-fm-data-discovery.txt:21(搜「anyone or anything」)
四类用途与数据智能第 1 章text/08-fm-data-discovery.txt:37(搜「Data engineering」) · text/08-fm-data-discovery.txt:65(搜「data intelligence」)
Part II 将讲 MCP 与 Agent2Agent前言text/05-fm-preface.txt:150(搜「Model Context Protocol」)
KG 目录赢市场的两个理由第 1 章小结text/11-fm-summary.txt:55(搜「won the market, and there」)
「AI 时代在婴儿期」第 3 章text/21-fm-mechanics-the-mathematics-behind-search.txt:3(搜「in its infancy」)

Footnotes

  1. 出处:「Preface」第 26 段(text/05-fm-preface.txt:26,搜「core message of the book」)。

  2. 出处:「Preface」第 45 段(text/05-fm-preface.txt:45,搜「new day」)。纳德拉原话为「It's a new day for search」;作者用它标定整个行业的转折点。

  3. 出处:「Preface」第 12 段(text/05-fm-preface.txt:12,搜「take on ChatGPT」)与第 20 段(text/05-fm-preface.txt:20,搜「future vision」)。

  4. 出处:「The AI Data Catalog and as Source for AI」第 12 段(text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:12,搜「easier to implement, use and scale」)。

  5. 出处:「The AI Data Catalog and as Source for AI」第 19 段(text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:19,搜「source in itself」)。

  6. 出处:「The Core Functionality of a Data Catalog」第 186 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:186,搜「fictitious Scandinavian」)。

  7. 出处:「The Core Functionality of a Data Catalog」第 193 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:193,搜「squirrel」)。原文说明这界面「与多数流行的网络搜索引擎和 AI 助手非常相似」。

  8. 出处:「The Core Functionality of a Data Catalog」第 208 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:208,搜「complicated operators」)。

  9. 出处:「The Core Functionality of a Data Catalog」第 213 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:213,搜「structured query statement」):AI「自动抽取关键词与布尔运算符,把你的问题翻译成结构化查询语句」。

  10. 出处:「Summary」第 33 段(text/11-fm-summary.txt:33,搜「however complicated the topic」)。

  11. 出处:「The AI Data Catalog and as Source for AI」第 30 段(text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:30,搜「decision makers on board」)。 2

  12. 出处:「The AI Data Catalog and as Source for AI」第 19 段(text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:19,搜「source in itself」);AI 助手「不只搜目录,还搜连到助手的所有源」在第 17 段(搜「all sources connected」)。

  13. 出处:「The Core Functionality of a Data Catalog」第 225 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:225,搜「MCP servers」);协议全名见「Preface」第 150 段(text/05-fm-preface.txt:150,搜「Model Context Protocol」)。

  14. 出处:「The AI Data Catalog and as Source for AI」第 22 段(text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:22,搜「Think Claude」)。

  15. 出处:「The AI Data Catalog and as Source for AI」第 26 段(text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:26,搜「increase precision greatly」)与第 64 段(text/08-fm-data-discovery.txt:64,搜「semantic structure」)。

  16. 出处:「Preface」第 150 段(text/05-fm-preface.txt:150,搜「Model Context Protocol」):第二部分将讲知识图谱+LLM 组合,以及 MCP、Agent2Agent 等新兴标准。

  17. 出处:「Data Discovery」第 3 段(text/08-fm-data-discovery.txt:3,搜「is called data discovery」)。

  18. 出处:「Data Discovery」第 21 段(text/08-fm-data-discovery.txt:21,搜「anyone or anything」)。Morville 原书 2005 年由 O'Reilly 出版,作者在脚注里给了出处。

  19. 出处:「Data Discovery」第 19 段(text/08-fm-data-discovery.txt:19,搜「should strive」)。

  20. 出处:「Data Discovery」第 37 段(text/08-fm-data-discovery.txt:37,搜「Data engineering」)、第 48 段(text/08-fm-data-discovery.txt:48,搜「happen to know」)、第 58 段(text/08-fm-data-discovery.txt:58,搜「sensitivity and confidentiality」)。

  21. 出处:「Data Discovery」第 65 段(text/08-fm-data-discovery.txt:65,搜「data intelligence」)。

  22. 出处:「The AI Data Catalog and as Source for AI」第 33 段(text/06-fm-the-ai-data-catalog-and-as-source-for-ai.txt:33,搜「scientific articles」):脚注写明「第二部分将引用记录此事的科学文献」。

  23. 出处:「Mechanics: The Mathematics Behind Search」第 3 段(text/21-fm-mechanics-the-mathematics-behind-search.txt:3,搜「in its infancy」)。

  24. 出处:「Data Discovery」第 24 段(text/08-fm-data-discovery.txt:24,搜「completely unrelated」)。