跳到主要内容

只有一半的地图 — 数据目录是什么、为什么它敢让人人可见

这一章讲三件事: 数据目录到底是个什么东西(一句话:一张只有元数据的地图); 它凭什么解决「没人知道公司有什么数据」这个死结;以及撑起全书的五块积木怎么拼。 这是全书的地基:后面九章都在这张地图上干活。 不需要任何基础,遇到的生词都当场解释。

1. 先看现象:你找不到公司里已有的东西

一个上班的真实日常:你要做一件活儿,明知公司里一定有现成的数据, 但不知道它在哪个系统、归谁管、能不能用。怎么办?问同事、翻群聊、靠脑子里的印象碰运气。

这不是你一个人的问题,而是每个公司的结构性状态:

没有任何一名员工能看到公司 IT 版图里的全部数据;更麻烦的是,没人能看到别人能看到什么1

每拨人守着自己系统里的那份数据干活,看不见、也不知道别的系统里有什么。 书里给这种状态起了个名字:数据孤岛(data silos,各团队的数据各自封在自己的系统里,像海上的孤岛)2

孤岛还只是表面。书里指出更深的一层:孤岛之间其实是连着的——数据会从一个系统流到另一个系统, 只是没人看得见它们怎么连3。这意味着你想梳理全局时,连「从哪根线开始拉」都不知道。

判断(我们的,不是书里的): 「没人知道公司有什么数据」不是技术故障,是规模与分工的必然—— 系统是十几年里陆续买的,人是流动的,没有任何角色的日常工作会把全貌看一遍。 所以指望「换个更认真的团队」解决不了,只能靠一个专门把全貌摆出来的工具。 如果错,会错在: 如果某家公司规模极小、系统极少,一个勤快的架构师确实能人脑记全—— 但本书面向的正是「记不全」的那种组织,这也是目录这类产品存在的原因。

2. 数据目录是什么:一张只有元数据的地图

作者的回答短得惊人:数据目录就是「公司数据的有序清单,仅此而已」4

关键在「清单」这个词上。目录里装的不是数据本身,是元数据

元数据就是「描述数据的数据」:它不装「张三的手机号是多少」,而是记录 「有一张客户表、在哪个系统里、有几列、每列叫什么、谁负责、建于何时」。 就像图书馆的书目卡片:卡片上没有书的正文,只有书名、作者、索书号、放在哪排书架—— 但你靠卡片能找到书5

于是这句话可以反过来说了:目录是一张故意缺了一半的地图——数据值那半被整块抠掉, 只剩描述那一半。而这正是它最大的优点:

  • 真实数据里有客户隐私、商业机密,给人人开放等于灾难;
  • 元数据里没有值,所以可以让全公司每个人看到「全部」——看的全是描述6;
  • 这恰好是数据孤岛的死穴:孤岛困住的是数据值,而描述可以被集中到一处,摆给所有人看。
公司 IT 版图(现实) 数据目录(地图)
┌────────┬────────┬────────┐ ┌─────────────────────────┐
│ HR系统 │ 财务库 │ 客户表 │ 抽取描述 │ 客户表 · 12列 · 负责人:Kris │
│ 数据值🔒 │ 数据值🔒 │ 数据值🔒 │ ───────→ │ 建于2021 · 财务域 · 3个标签 │
└────────┴────────┴────────┘ │ (没有任何一行真实数据值) │
└─────────────────────────┘
图说:左边人人只见一格,右边人人可见全部——代价是右边只有描述,没有值。

3. 主走查:一张表在目录里长什么样

拿书里的例子走一遍。数据库里有一张订单表,其中一列叫 customer_ID,存的是真实客户编号。 它被目录登记之后,目录里出现的是这样一份描述:

数据源里的表(真实) 目录里的同一张表(描述)
┌────────────────────┐ ┌──────────────────────────┐
│ customer_ID │ C-88123 │ │ customer_ID (只有列名) │
│ order_date │ 2024-03-02 │ order_date (只有列名) │
│ amount │ 1250.00 │ ────→ │ amount (只有列名) │
│ ... │ ... │ │ 负责人:王明 · 建于 2024-01 │
└────────────────────┘ └──────────────────────────┘
图说:右边每一格的值都消失了,只剩下「有这么一列」的事实与人工补的说明。

走查里有三步值得停一下:

  1. 值整列消失。 C-881231250.00 这些值不出现在目录里——这就是「只有元数据」的具体样子7;
  2. 描述可以一层层往上加。 可以给整张表写说明,也可以给每一列单独写说明, 每加一条,这张表就多一个将来能被搜到的抓手8;
  3. 描述本身也可能泄密。 如果列名直接叫 身份证号,或者描述里写了「此表存高管薪酬」, 那么目录虽然不装值,也等于把机密挂上了墙——所以目录必须配上屏蔽手段9

书里敢说「人人可见一切」,靠的就是第 1 步;而第 3 步提醒我们,这地图的一半也未必干净。

4. 五块积木:这张地图由什么拼成

资产与数据源:地图上的「点」

数据资产(asset)是 IT 版图里存在的一份份数据实体:一张表、一个文件、一个文件夹都算10。 目录登记一份资产时,自动采到的描述包括:名称、创建日期、负责人、列名、所在文件夹结构等11

数据源(data source)是数据从哪儿来:一个系统、一个应用、一个平台,甚至一个电子表格都算—— 书里刻意不分贵贱,所有数据源在目录里被一视同仁地登记12

域:把点圈成片

(domain)是「逻辑上属于一起」的一组资产或数据产品13。注意「逻辑上」三个字: 一个财务域里的资产可以同时来自分析系统和预算系统——域是按「这堆数据干什么用」圈的, 不是按「它存在哪个系统里」圈的14。域划得好不好,决定外部门的同事敢不敢进来翻; 这是第 04 章的主题。

血缘与知识图谱:点与点之间的两种连线

地图上只有点还不够,书里给资产配了三种组织方向,各画一种线:

方向线长什么样回答什么问题
垂直(域)从公司顶层往下分叉到子域这份数据属于公司的哪一块?
水平(血缘)一条箭头从系统 A 指到系统 B这份数据从哪来、被什么加工过、流去了哪?
关系(知识图谱)弧线把相关的资产牵在一起这份数据和别的什么数据在业务上有关?

数据血缘(lineage)画的是数据的旅程:数据怎么从系统流向系统、途中被怎么加工—— 比如订单表被一个 BI 报表(商业智能报表,给业务方看的统计页面)引用,血缘上就有一支箭头指向那份报表15

知识图谱(knowledge graph)画的是业务上的关联:订单表里有个 Date_ID 列, 生产系统里的时间类数据、编码命名的规则都可能和它扯上关系——这些关系被连成一张「点+边」的网16。 这一根线在全书分量极重:目录要变成 AI 能用的源,靠的就是它(第 02 章开头、第 10 章展开)。

垂直:财务域 ── 子域:应付账款 水平:源库 ──→ 加工任务 ──→ BI报表

关系:订单表.Date_ID ═══ 生产表.批次时间
图说:同一个资产,三根线各画一个方向;三种线都齐,这张地图才算能用。

5. 作者的主张:目录的本质是企业搜索引擎

本书的第一版就是围绕一个顿悟写的,第二版原话照旧: 目录应该成为「企业的搜索引擎」——网络搜索引擎为公司外的人做了什么,目录就为公司内的人做什么17

这个类比在书里是精确的,不是修辞。目录和网络搜索引擎干的活同构:都是先爬取(自动扫描整个版图) 再索引(把扫到的东西登记成可查的底账),然后让你搜这个版图;唯一的区别是版图—— 搜索引擎的版图是整个万维网,目录的版图是你公司的数据18

由此推出全书最重要的那句原则。作者的职业底子是图书馆与信息科学(他在哥本哈根大学教过这门课), 在制药公司做信息管理时,他的团队靠一条指导原则就能应付监管部门的突击检查—— 哪怕问题是「1992 年 6 月那台发酵罐里那根管测出来是多少度」这种刁钻问题19:

你组织数据的方式,决定了你能怎么搜它。20

这句话是全书的发动机:数据组织得烂,任何搜索技术都救不回来;组织得好,搜索才有的放矢。 后面所有章——域怎么划、元数据怎么写、标签怎么贴——都是在回答「怎么组织」; 第 07–10 章回答「怎么搜」。

顺带把目录的用途说全。作者列的四类用途:数据工程拿它盯管道运行状况, 分析人员拿它找合适的数据源,治理团队拿它贴敏感/机密标签,AI 架构师拿它当 AI 的数据源21。 最后一类是第二版新增的主角,下一章就讲它。

6. 作者的判断与证据

书里给了证据的:

  • 「元数据层人人可见」与「数据值层无人可见」的对照,是目录这类产品的基本构造,每个供应商的产品都长这样22;
  • 制药检查的故事是作者亲身经历,用来说明「组织决定搜索」这条原则[已引,见 §5]。

作者自己的推测(书里没给数据):

  • 「数据科学家不再把一半时间花在找数据上」——书里是以设想的口吻说的(「想象一下这种可能性」), 没有给任何统计依据23;
  • 「孤岛状态是一大堆组织问题的根源」(低质量分析、不完整的数据集、缺安全标签)—— 这是经验判断,书里没有附事故案例或数字24

判断(我们的,不是书里的): 「一半时间在找数据」这个量级在各种行业调查里反复出现过, 方向上可信;但用它给目录立项时要小心——它量的是「找数据花的时间」, 而目录只能压缩「找到数据之前」的成本,数据质量差、权限拿不到、不敢用这些下游成本它管不了。 如果错,会错在: 如果某家组织的瓶颈其实全在下游(数据烂而不在找不到), 目录上线后 ROI(投资回报)依然会落空——这正是第 03 章要讲的「目录为什么经常失败」的入口。

7. 边界与局限

  • 目录不是数据仓库,更不是数据本身。 它只是描述层;指望在目录里看数、算数,走错门了。
  • Early Release 的先天缺口。 本书是试读版,只放出原书 13 章计划里的前 4 章; 「访问与观测数据」「数据产品与数据契约」「LLM+知识图谱模式」等 9 章不在, 书里多处承诺(如「数据产品第 8 章细讲」)在试读版里兑现不了。本拆解照实说明,不代作者补写。
  • 「人人可见」有前提。 值不可见,但列名与描述可能带敏感信息,屏蔽手段是必配项,不是可选项9
  • 外部视角的提醒(不在书里,来自通用知识): 目录类产品过去二十年有大量「买来没人用」的失败案例, 业界共识是败因多在组织与运营而非技术——这与作者反复强调的「团队、角色、域架构」篇幅比例一致。

8. 可带走的

  1. 数据目录 = 只由元数据组成的、全公司可见的数据地图;它没有数据值,这不是残缺,是设计;
  2. 元数据就像图书馆的书目卡片:卡片不装正文,但你靠它找到书;
  3. 数据孤岛的真问题不止「看不见」,还有**「连着但看不见怎么连」**;
  4. 五块积木:资产(点)、数据源(点的出处)、域(按用途圈片)、血缘(数据旅程)、知识图谱(业务关联);
  5. 目录与搜索引擎同构:爬取 → 索引 → 搜索,只是版图换成公司数据;
  6. 全书发动机:你组织数据的方式,决定了你能怎么搜它;
  7. 给目录立项时,别用「省一半找数据时间」当全部论据——它管不了数据质量与权限这些下游成本。

9. 原文地图

主题原书章原文位置
播客之问、第一版核心主张前言text/05-fm-preface.txt:12(搜「take on ChatGPT」) · text/05-fm-preface.txt:70(搜「engines to search for data」)
制药检查、组织决定搜索前言text/05-fm-preface.txt:167(搜「first job in pharma」) · text/05-fm-preface.txt:169(搜「June 1992」) · text/05-fm-preface.txt:175(搜「defines how you can search it」)
「企业的搜索引擎」顿悟前言text/05-fm-preface.txt:196(搜「search engine for companies」)
目录=有序清单、只装元数据第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:2(搜「organized inventory」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:4(搜「metadata level only」)
人人可见一切第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:6(搜「everyone see everything」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:64(搜「visible to all employees」)
元数据库+搜索引擎+AI 助手第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:10(搜「database with metadata」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:15(搜「single most important feature」)
数据孤岛及其根因第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:49(搜「No employee can see all」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:51(搜「referred to as data silos」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:53(搜「root cause of an immense」)
孤岛连着但看不见怎么连第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:59(搜「no one can see it」)
资产与自动采到的元数据第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:84(搜「entity of data that exists」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:87(搜「creation date, owner」)
数据源一视同仁第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:91(搜「where the data that is」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:92(搜「spreadsheet」)
数据产品与域的定义第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:96(搜「autonomous, consumable」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:98(搜「logically belong together」)
customer_ID 走查、描述也可能泄密第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:119(搜「customer_ID」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:128(搜「also contain sensitive or confidential」)
垂直/水平/关系三种组织第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:137(搜「vertical, horizontal, and relational」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:145(搜「travels from system to system」) · text/07-fm-the-core-functionality-of-a-data-catalog.txt:154(搜「Date_ID」)
不是整理一次就完第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:164(搜「organized once」)
与搜索引擎同构第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:173(搜「crawl and index」)
Hugin & Munin 案例设定第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:186(搜「fictitious Scandinavian」)
「省一半时间」的设想第 1 章text/07-fm-the-core-functionality-of-a-data-catalog.txt:22(搜「half their」)

Footnotes

  1. 出处:「The Core Functionality of a Data Catalog」第 49 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:49,搜「No employee can see all」)。原文接着说,这状况被称作「不透明」(opaque)。

  2. 出处:「The Core Functionality of a Data Catalog」第 51 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:51,搜「referred to as data silos」)。

  3. 出处:「The Core Functionality of a Data Catalog」第 59 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:59,搜「no one can see it」)。原文的措辞是:这让孤岛状态「更加危险」,而目录的绘图能力正是冲着它去的。

  4. 出处:「The Core Functionality of a Data Catalog」第 2 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:2,搜「organized inventory」)。

  5. 比方是我们的(不在书里,来自通用知识):书目卡片是图书馆信息科学的经典意象,作者本人的学术底子正是这门学科(出处:「Preface」第 75 段(text/05-fm-preface.txt:75,搜「Library- and Information Science」)。

  6. 出处:「The Core Functionality of a Data Catalog」第 6 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:6,搜「everyone see everything」)与第 64 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:64,搜「visible to all employees」)。

  7. 出处:「The Core Functionality of a Data Catalog」第 119 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:119,搜「customer_ID」)。原文说明:敏感的 customer_ID 值不可见,目录里只显示列名。

  8. 出处:「The Core Functionality of a Data Catalog」第 133 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:133,搜「both at the table level」)。

  9. 出处:「The Core Functionality of a Data Catalog」第 128 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:128,搜「also contain sensitive or confidential」)。原文是侧栏警告:必须确保这类元数据对目录用户不可见。 2

  10. 出处:「The Core Functionality of a Data Catalog」第 84 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:84,搜「entity of data that exists」)。

  11. 出处:「The Core Functionality of a Data Catalog」第 87 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:87,搜「creation date, owner」)。

  12. 出处:「The Core Functionality of a Data Catalog」第 91 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:91,搜「where the data that is」)。原文明确说:在本书语境里,数据源的类型无关紧要,因为所有数据源都被同等对待。

  13. 出处:「The Core Functionality of a Data Catalog」第 98 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:98,搜「logically belong together」)。

  14. 出处:「The Core Functionality of a Data Catalog」第 100 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:100,搜「budget data sources」):财务域可以同时含分析类与预算类数据源,「这些资产可以来自一个或多个数据源」。

  15. 出处:「The Core Functionality of a Data Catalog」第 145 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:145,搜「travels from system to system」);BI 报表箭头见第 150 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:150,搜「BI report」)。

  16. 出处:「The Core Functionality of a Data Catalog」第 151 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:151,搜「curved lines organize」)与第 154 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:154,搜「Date_ID」)。

  17. 出处:「Preface」第 196 段(text/05-fm-preface.txt:196,搜「search engine for companies」);核心主张的完整表述见第 70 段(text/05-fm-preface.txt:70,搜「engines to search for data」):目录是「搜索数据的引擎,之后你才能在数据里搜索——直接在数据库里」。

  18. 出处:「The Core Functionality of a Data Catalog」第 173 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:173,搜「crawl and index」)。

  19. 出处:「Preface」第 167 段(text/05-fm-preface.txt:167,搜「first job in pharma」)与第 169 段(text/05-fm-preface.txt:169,搜「June 1992」)。检查方还会问发酵罐是否按 SOP(标准作业程序)清洁——数据经理答不上来时,就轮到作者的信息管理团队上场。

  20. 出处:「Preface」第 175 段(text/05-fm-preface.txt:175,搜「defines how you can search it」)。

  21. 出处:「Data Discovery」第 39 段(text/08-fm-data-discovery.txt:39,搜「risk & compliance」)与第 60 段(text/08-fm-data-discovery.txt:60,搜「agentic orchestration」)。

  22. 出处:「The Core Functionality of a Data Catalog」第 4 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:4,搜「metadata level only」)。

  23. 出处:「The Core Functionality of a Data Catalog」第 22 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:22,搜「half their」)。原文侧栏以「想象一下」起头,是动员式设想。

  24. 出处:「The Core Functionality of a Data Catalog」第 53 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:53,搜「root cause of an immense」)。