01-outline — the-enterprise-data-catalog-scale-ai
切分:10 章。原书 Early Release 含前言+第 1–4 章(共 13 章计划,5–13 不可用); 我们的 10 章把这 4 章按推理链重切,不与原书一一对应。 主线:你组织数据的方式决定了你能怎么搜它 → 组织 = 域架构 + 元数据描述 + 分类标签 → 搜 = 找数据(不是查数据)→ 搜得动的数学与模式 → AI 同时改两头(更好的搜索 + 目录本身成了 AI 的源)。
| 章 | 文件 | 进来时以为…… → 出去时知道…… | 原书来源 |
|---|---|---|---|
| 01 | 01-metadata-map.md | 数据目录是个存东西的工具 → 它是一张只有元数据的公司数据地图;没有数据值,恰恰是人人可见一切的原因;五块积木:资产/数据源/域/血缘/知识图谱 | 前言、第 1 章 Core Functionality |
| 02 | 02-ai-in-and-out.md | AI 只是目录的新按钮 → AI 改两头:with AI(自然语言进、结构化查询出)与 for AI(目录挂上 MCP 成为企业 AI 助手可搜的源);目录从指向源的工具变成源本身 | 第 1 章 AI Data Catalog、Data Discovery |
| 03 | 03-team-roles.md | 买个目录装上就行 → 需要一支「数据发现团队」+ 元模型总图;归属放哪三选一各有利弊;三类用户里只有分析用户交付 ROI;一次访问请求沿七级角色梯怎么走 | 第 1 章 Discovery Team、End-User Roles、Summary |
| 04 | 04-domain-architecture.md | 按部门划分就行 → 主入口唯一;顶层挂价值链;域用信息科学定义(人+知识+目标+方法+沟通)而非 DDD;流程 vs 能力二选一;通用/特定数据源两层;别照组织架构图划 | 第 2 章 Organizing Domains |
| 05 | 05-describing-data.md | 元数据=关于数据的数据,自动就有 → 元数据「同时存在两处」;自带元数据只是最低限描述;三种词表(自由/域/全局 = folksonomy/taxonomy/thesaurus)与穷尽性/特异性;AI 帮倒忙的两个坑 | 第 2 章 Organizing Data、KG Catalogs、Metadata Quality、Using AI |
| 06 | 06-three-labels.md | 分类=贴一个密级 → 分类有三张互相独立的标签(内容/机密性/敏感性),一张数据可以同时「高度机密+毫不敏感」;损害阶梯怎么定级;为什么 CISO 和 DPO 反而会支持目录 | 第 2 章 Classification |
| 07 | 07-for-not-in.md | 搜索就是搜索 → 「找数据」与「查数据」是两件事、两套查询语言(DQL/IRQL);数据目录是第四种参考数据库;信息需求的四种大小决定搜法;偶得、它的邪孪生与 promptism | 第 3 章 Concepts |
| 08 | 08-search-math.md | 排序是黑魔法 → 简单搜索幕后六机制全服务查准率;复杂搜索服务查全率;混淆矩阵+两个公式走一遍;两者不可兼得;齐普夫定律:爬得越多越糊涂,词表是解药 | 第 3 章 Features、Mechanics |
| 09 | 09-keyword-patterns.md | 会打关键词就行 → 六种关键词模式各对应一种信息需求与查准/查全档位;区块搜索的多阶段打法;学老写法是为了「精确地对话」 | 第 4 章 Overview、Keyword Search |
| 10 | 10-browsing-and-graphs.md | 浏览=随便点点 → 词表/域/血缘/图四种浏览各回答什么问题;图浏览怎么诊断被污染的搜索;想搜一切得用图数据库的查询语言;此刻是「前谷歌时刻」 | 第 4 章 Browsing Patterns、Graph-Based、Summary |
自查(两两「出去时知道」比对):
- 01(元数据地图)vs 02(AI 两头改):不重。01 只立「只有元数据」这条;AI 全在 02。
- 05(词表=描述)vs 06(分类=标签):描述与分类是书中分开的两个机制,不重。
- 07(概念:找 vs 查)vs 08(数学:查准/查全):07 不进公式,08 不重复概念定义;08 引用 07 的信息需求。
- 09(关键词模式)vs 10(浏览/图):09 不讲浏览;10 的四种浏览在 08 只一句话带过并记兑现表。
- 无两行「出去时知道」是同一件事。通过。