跳到主要内容

01-outline — the-enterprise-data-catalog-scale-ai

切分:10 章。原书 Early Release 含前言+第 1–4 章(共 13 章计划,5–13 不可用); 我们的 10 章把这 4 章按推理链重切,不与原书一一对应。 主线:你组织数据的方式决定了你能怎么搜它 → 组织 = 域架构 + 元数据描述 + 分类标签 → 搜 = 找数据(不是查数据)→ 搜得动的数学与模式 → AI 同时改两头(更好的搜索 + 目录本身成了 AI 的源)。

文件进来时以为…… → 出去时知道……原书来源
0101-metadata-map.md数据目录是个存东西的工具 → 它是一张只有元数据的公司数据地图;没有数据值,恰恰是人人可见一切的原因;五块积木:资产/数据源/域/血缘/知识图谱前言、第 1 章 Core Functionality
0202-ai-in-and-out.mdAI 只是目录的新按钮 → AI 改两头:with AI(自然语言进、结构化查询出)与 for AI(目录挂上 MCP 成为企业 AI 助手可搜的源);目录从指向源的工具变成源本身第 1 章 AI Data Catalog、Data Discovery
0303-team-roles.md买个目录装上就行 → 需要一支「数据发现团队」+ 元模型总图;归属放哪三选一各有利弊;三类用户里只有分析用户交付 ROI;一次访问请求沿七级角色梯怎么走第 1 章 Discovery Team、End-User Roles、Summary
0404-domain-architecture.md按部门划分就行 → 主入口唯一;顶层挂价值链;域用信息科学定义(人+知识+目标+方法+沟通)而非 DDD;流程 vs 能力二选一;通用/特定数据源两层;别照组织架构图划第 2 章 Organizing Domains
0505-describing-data.md元数据=关于数据的数据,自动就有 → 元数据「同时存在两处」;自带元数据只是最低限描述;三种词表(自由/域/全局 = folksonomy/taxonomy/thesaurus)与穷尽性/特异性;AI 帮倒忙的两个坑第 2 章 Organizing Data、KG Catalogs、Metadata Quality、Using AI
0606-three-labels.md分类=贴一个密级 → 分类有三张互相独立的标签(内容/机密性/敏感性),一张数据可以同时「高度机密+毫不敏感」;损害阶梯怎么定级;为什么 CISO 和 DPO 反而会支持目录第 2 章 Classification
0707-for-not-in.md搜索就是搜索 → 「找数据」与「查数据」是两件事、两套查询语言(DQL/IRQL);数据目录是第四种参考数据库;信息需求的四种大小决定搜法;偶得、它的邪孪生与 promptism第 3 章 Concepts
0808-search-math.md排序是黑魔法 → 简单搜索幕后六机制全服务查准率;复杂搜索服务查全率;混淆矩阵+两个公式走一遍;两者不可兼得;齐普夫定律:爬得越多越糊涂,词表是解药第 3 章 Features、Mechanics
0909-keyword-patterns.md会打关键词就行 → 六种关键词模式各对应一种信息需求与查准/查全档位;区块搜索的多阶段打法;学老写法是为了「精确地对话」第 4 章 Overview、Keyword Search
1010-browsing-and-graphs.md浏览=随便点点 → 词表/域/血缘/图四种浏览各回答什么问题;图浏览怎么诊断被污染的搜索;想搜一切得用图数据库的查询语言;此刻是「前谷歌时刻」第 4 章 Browsing Patterns、Graph-Based、Summary

自查(两两「出去时知道」比对):

  • 01(元数据地图)vs 02(AI 两头改):不重。01 只立「只有元数据」这条;AI 全在 02。
  • 05(词表=描述)vs 06(分类=标签):描述与分类是书中分开的两个机制,不重。
  • 07(概念:找 vs 查)vs 08(数学:查准/查全):07 不进公式,08 不重复概念定义;08 引用 07 的信息需求。
  • 09(关键词模式)vs 10(浏览/图):09 不讲浏览;10 的四种浏览在 08 只一句话带过并记兑现表。
  • 无两行「出去时知道」是同一件事。通过。