AI 进场 — 目录既被 AI 增强,又成了 AI 的源
这一章讲三件事: AI 改了目录的哪两头;一次真实的搜索怎么从闲聊开始、 穿过目录、再落到 Slack 聊天记录上(本章主走查);以及「数据发现」这个词为什么是目录的全部目的。 这一章是第一版与第二版的分水岭:第一版只讲地图,第二版讲 AI 怎么用这张地图、又怎么吃这张地图。
1. 先交代:作者为什么写第二版
2023 年初,作者出版第一版时,核心主张还是「目录就像搜索引擎,只不过搜的是公司数据」1。 书刚出,ChatGPT 就把整个搜索行业掀了:微软 CEO 纳德拉宣布与 OpenAI 合作时说 「这是搜索的新的一天」,必应开始用对话机器人答题,Google 二十五年的稳态第一次被撼动2。
作者当时在播客里被当众追问:「那 ChatGPT 会让数据目录发生什么?」他的回答是: 我书里给目录画了一个未来,真要展开讲这个未来,那显然就是 ChatGPT 和 AI3。
第二版就是兑现这句话。它的结构是两个方向,这一章各给一块:
| 方向 | 书里的说法 | 一句话解释 |
|---|---|---|
| with AI(用 AI) | 目录的实施、使用、扩展都因 AI 而显著变容易4 | AI 替你干活:找数、写描述、翻查询 |
| for AI(喂 AI) | 目录成了更大搜索基础设施的一环,它本身成了一个源5 | AI 来目录这里取料 |
2. 主走查:一次午休闲聊,换回七份数据和十六个聊天线程
书里给整套 AI 增强编了一个贯穿案例公司:Hugin & Munin, 一家虚构的北欧可持续 木构建筑公司,建材只用工地附近森林的木头6。 它的目录长什么样?书里描述的界面几乎是照着大家熟悉的搜索引擎抄的: 一根搜索栏,下面一只松鼠图标(点它进入对话式 AI 搜索)、一个放大镜(浏览)、 一摞书(词表——公司业务词汇的官方清单,第 05 章专讲)7。像,是刻意的。
走查开始。你是 H&M 的一名员工,午饭时听到隔壁桌聊起一位叫 Kris 的数据科学家, 说他在目录里发布的几个「数据产品」对你手头的项目可能有用——话没问完, 那桌人起身进了会议室。回到工位,你怎么办?
第 1 步 你在目录搜索栏里用人话打一句:
「找出 Kris 拥有的、和数据科学业务术语表相关的数据产品」
│
第 2 步 目录里的 AI 把这句话拆成结构化查询。
放在几年前,你得自己写这样的式子:
Data Owner: "Kris*" AND business glossary: "Data Science"
AND Asset Type: "Data Product"
——星号是通配符,AND 是「并且」,写错一个引号就查不出东西[^8]
│
第 3 步 命中:Kris Kegelstrom 发布的 7 个数据产品,
内容是 H&M 家用房屋外墙的长期耐久性数据[^9]
│
第 4 步 产品描述写得不错,但你缺背景:午休那段对话里的想法,
描述里没写全。你想到:这些产品有没有在公司聊天工具 Slack 里被聊过?
│
第 5 步 你打开公司级 AI 助手「H&M chat」,让它同时查目录和 Slack。
这一步之所以可能,是因为目录和 Slack 都挂上了 MCP 服务器(即按这套约定开放、供助手来查的一端)[^10]
│
第 6 步 结果:16 个 Slack 线程讨论过这批数据产品,时间跨度超过一年;
助手把讨论总结成一页,你带着它继续做自己的方案[^11]
这六步里藏着这一章的全部机制。第 1–3 步是「用 AI」:自然语言进去,结构化查询出来; 第 4–6 步是「喂 AI」:目录被当成一个源,和 Slack 放在同一张桌上被同一个助手查。 下面两节把两头各拆开讲。
3. 用 AI:自然语言进去,结构化查询出来
先看过去的麻烦
目录里的东西都是描述(第 01 章讲过),搜目录因此和搜数据库不同:
你在搜「哪份资产跟我的问题有关」。过去表达这种搜索,得学一套查询写法——
上一步走查里那行 Data Owner: "Kris*" AND … 就是,栏位名、引号、通配符、大小写,
一处不对就白写8。