跳到主要内容

reading-notes — the-enterprise-data-catalog-scale-ai

通读日期 2026-08-28。原书:Ole Olesen-Bagneux, The Enterprise Data Catalog(2nd edition Early Release)。 转码 28 个文件;01(扉页)/02(版权)/03+04(目录,点导线乱码)为导航章,不引; 正文 = 05 前言 + 原书第 1–4 章(文件 06–27)。Early Release 只放出 13 章计划中的前 4 章 (05–13 不可用)。以下行号都核过原文。

版本与作者(写 index §2、书卡用)

  • 扉页 01-fm-actian.txt:副标题 "Scale AI with Metadata Using LLMs, MCP, and Agentic Architecture" ——bookId 里的 "scale-ai" 来自副标题的动词短语,不是 Scale AI 公司。
  • 版权页 02-fm-copyright.txt:© 2027 O'Reilly;第一版 2023-02,第二版预告 2027-06; Early Release 三次放出 2026-02-18 / 03-20 / 06-05。 L32:O'Reilly 与 Actian 的合作出版声明(利益相关!)。
  • 作者页 28-fm-about-the-author.txt:Ole Olesen-Bagneux,哥本哈根大学信息科学博士, 曾教知识组织与信息检索;现任 Actian 首席布道官(Chief Evangelist)。
  • 前言 05-fm-preface.txt:
    • L12 播客被问「ChatGPT 对数据目录意味着什么」;L26 第一版 2023 年初出版; L70–74 核心主张「目录是搜索数据的引擎,之后才能在数据里搜索」; 静态预设元模型 → 灾难性实施(L72–74)。
    • L75–79 博士,哥本哈根大学教 LIS(图书馆与信息科学)。
    • L84–88 第二版两部分:Part I AI 增强目录;Part II 目录(本体)作为 AI 的源。
    • L99–107 data mesh 热潮已退,「没人再谈 data mesh」,但 data products 与 data contracts 留下。
    • L146–151 Part II 将讲 MCP 与 Agent2Agent(章不可用)。
    • L154 「这不可能就是数据目录的全部吧?」L166–176 制药公司任职:药监局检查, 「1992 年 6 月那台机器里那根管的温度是多少」;指导原则:你组织数据的方式决定了你能怎么搜它(L175–176)。
    • L181 编目过家具、武器、人体组织。L196–198 顿悟「数据目录就是企业的搜索引擎」。
    • L211–218 用「搜索框+干系人小故事」做演示推销。
    • L242–263 第一章开头:AI 视角有助于拿到高管层战略支持。

原书第 1 章 Introduction to Data Catalogs(文件 06–11)

  • 06(Ch1 §The AI Data Catalog and as Source for AI):
    • L12–14 with AI:目录因 AI 而更容易实施、使用、扩展。
    • L16–19 for AI:目录成为更大搜索基础设施的一部分;不只是指向源的工具,它本身成了源(「source in itself」)。
    • L21–23 AI assistant = 企业版 chatbot(Claude/Mistral/OpenAI),全书用 AI assistant。
    • L25–28 知识图谱显著提高 LLM 精度;agentic 架构配 KG 更有效。
    • L29–31 对治理/工程的人:AI 让高管买单更容易、推广更顺。
  • 07(Ch1 §Core Functionality):
    • L2–3 目录 = 「公司数据的有序清单,仅此而已」;L4–7 只在元数据层,不暴露实际数据值 → 所有人可见一切而不泄密。
    • L10–15 目录 = 元数据库 + 搜索引擎 + AI 助手;搜索是唯一最重要功能
    • L20–27 侧栏:数据科学家不再花一半时间找数据。
    • L32–36 连接器扫描 IT 版图;数据产品在元数据层自我发布。
    • L48–56 没人能看到全部数据;数据孤岛(data silos);孤岛是一大堆问题的根因。
    • L58–61 反转:孤岛其实是连着的,只是没人看得见怎么连。
    • L63–67 目录里正好相反:元数据层人人可见一切。
    • L84–94 资产(asset)= 文件/文件夹/表;自动采到的元数据:名称、创建日期、负责人、列名、 schema 名、文件名、目录结构;数据源 = 数据来自的地方(系统/应用/平台/电子表格)。
    • L96–97 数据产品 = 自主的、可消费的资产(与「只暴露存在性」的资产相对)。
    • L98–102 域 = 逻辑上属于一起的资产/产品组;财务域可含分析源+预算源。
    • L104–111 目录域的理解:数据管理文献用 DDD;本书用信息科学的百年传统。
    • L119–120 customer_ID 值不可见,只显示列名。L127–130 但列名等元数据也可能敏感,要有手段屏蔽。
    • L139–156 三种组织:垂直(域/子域)、水平(血缘 lineage:数据怎么在系统间流动、怎么被加工; BI 报表箭头)、关系(知识图谱;Date_ID 与其他源的时间指标关联)。
    • L164–167 目录不是整理一次就完;持续重组优化搜索。
    • L173–176 目录与网络搜索引擎同为「爬取+索引+搜索」,只是版图换成公司数据。
    • L185–188 Hugin & Munin 贯穿案例:虚构的北欧可持续木构建筑公司。
    • L198–216 Kris 走查:午餐厅听说数据科学家 Kris → 目录高级搜索(自然语言)→ 旧式写法 Data Owner: "Kris*" AND business glossary: "Data Science" AND Asset Type: "Data Product"(L210) → AI 把自然语言抽成关键词+布尔运算符→结构化查询(L211–213)→ 找到 7 个数据产品(Kris Kegelstrom, 外墙耐久性,L214–216)。
    • L217–231 企业级 AI 助手 H&M chat:目录与 Slack 都挂上 MCP 服务器 → 助手查到 16 个 Slack 线程、讨论超过一年 → 拿到上下文。
  • 08(Ch1 §Data Discovery):
    • L2–6 搜到数据 = data discovery;常被误当成「在数据里搜」。
    • L11–13 先发现「有这数据」,再谈在数据里搜。
    • L14–22 ambient findability(Peter Morville 2005):「随时随地找到任何人任何东西」— 目标状态。
    • L37–66 四个用途:数据工程(可观测性、质量监控)、分析(不在孤岛里碰运气)、 治理风险合规(敏感性+机密性自动分类,DPO/CISO;「bedazzling feature」)、 AI 生成式搜索与 agentic 编排的源(必须建在 KG 上,语义结构引导 AI)。合称 data intelligence。
  • 09(Ch1 §The Data Discovery Team):
    • L1–7 叫「数据发现团队」而不是「目录团队」— 卖能力不卖工具;建议接管所有元数据库 (CMDB、数据共享协议系统)。
    • L19–30 元模型(metamodel)= 实体类型+关系的总图(部门有人、执行流程、被技术支撑); capability 定义域,域归拢技术里的数据。
    • L36–41 KG 目录的元模型灵活:可视化、可扩展、可搜索;KG 目录赢了市场
    • L46–48 归属三选一(下接 10)。
  • 10(Ch1 §End-User Roles):
    • L1–22 归属:放治理 → 合规稳但目录沦为「开支」;放 CDO → 理想但罕见(员工职能, 数据战略基于实证);放分析部门 → 最出价值但失稳(泄密/质量被忽视)。
    • L25–53 终端用户三类:分析&AI 用户(交付 ROI)、治理用户(找机密/敏感数据去保护; ROI 难量化)、日常用户(未来最大群体;搜报表/战略文件/SOP/系统入口)。
    • L56–71 角色梯:数据源负责人(=system owner/custodian)、域负责人(定归属、派角色)、 域管家(面谈、管域架构、给权限)、资产负责人(数据的实际所有者,批准访问)。
  • 11(Summary,含 10 的续):
    • L2–3 资产管家(某个资产子集的专家);L5–8 术语负责人/术语管家(术语生命周期)。
    • L14–16 终端用户整体构成一张社交网络,能独立于团队协作时目录价值最大。
    • L55–60 KG 目录赢市场的两个理由:灵活元模型;AI 的独特源(提升生成与 agentic 决策)。

原书第 2 章 Organize Data(文件 12–18)

  • 12(§Using AI to Organize Data):
    • L9–34 AI 组织数据的两个坑:
      • 同义反复(tautologies):AI 给 Customer 列写「这列描述客户」→ 零区分度、制造搜索噪声; 人写元数据必须起「(正向)区分」作用(L18–20)。
      • 伪本体(false ontologies):别让厂商用 LLM 扫 SOP/邮件/Slack 自动生成元模型/知识图谱 — 元模型「小而极珍贵」,要手工打造(L24–34)。
  • 13(§Organizing Domains):
    • L15–17 顶层 = 价值链(企业交付价值的最高层描述;公共/私营/NGO 都有)。
    • L27–37 主入口(main entry)唯一:所有数据只能存一个地方 + 团队要总控。
    • L43–46 两个理解域的来源:DDD 与信息科学。
    • L55–64 DDD:Eric Evans 2003,为软件而生;L69–76 data mesh 把 DDD 搬进数据 (Dehghani;Strengholt);L81–86 两人都承认把 DDD 重定范围到数据不容易不理想。
    • L89–105 信息科学定义(Smiraglia):共享知识、目标、做事方法、沟通的一群人; 本体论基础/目的论/方法论/社会语义。
    • L116–128 内涵 intension(专家知识深度;酿酒→自然酿酒→有机/生物动力)与 外延 extension(宽度;爱好者把旅行娱乐都算进来)。
    • L130–144 DDD 套数据的根本问题:内涵外延不自由 → 域被迫围着数据的物理流动(血缘)组织, 概念组织丢失。
    • L156–167 流程(process,事怎么做)vs 能力(capability,能做什么;名词式;人+流程+技术构成)。
    • L173–187 流程域:直接流程(研发/制造/销售)与间接流程;HR 例:招聘→入职→发展→自助→离职办理→辞职。
    • L193–201 能力域:数据分析→描述性(发生了什么)/诊断性(为什么)/预测性(会怎样)/规范性(该做什么)。
    • L207–212 别照组织架构图划域(组织天天变)。
    • L213–225 强监管行业(食品/制药/油气)用 QMS 流程图(ISO 9001:2015;FDA 审计)1:1 镜像,最底层省略。
    • L229–253 技术层:通用数据源(Power BI/Tableau/Qlik Sense 软件本身)vs 特定数据源(具体实例/订阅); 不许跳过能力/流程层直接堆数据源。
  • 14(§Organizing Data in the Domains):
    • L1–9 特定数据源=具体实例(可以是订阅的一部分);数据源是域沟通的方式
    • L24–26 域内数据组织得好坏 = 目录成败。
    • L32–37 元数据新定义:「同时存在于两个地方的数据」(源 + 指向源的目录);驳「关于数据的数据」。
    • L42–51 负责人与管家是强制元数据;负责人定访问权;管家日常维护(加元数据、处理访问请求)。
    • L57–79 元数据三种来路:源里自带的(技术元数据:创建者/时间/格式,例 Qlik Sense 报表 2021-12-13; 业务元数据:表名列名等人类语言描述)→ 只是最低限描述,不够。
    • L82–98 目录里加的:描述(至少两要素:主要用途 + 次要用途=给潜在消费者的建议)、 人员(七种角色名册)、词表术语。
    • L110–121 三种词表:自由/域/全局。
    • L123–130 自由词表 = folksonomy(民间标签,#puppies #ootd #metoo;无规则;能补中央团队想不到的切角)。
    • L131–145 域词表 = taxonomy(层级;窄/宽;分面 blue+dress;小组商定的正式语言)。
    • L146–155 全局词表 = thesaurus(簇思维:首选词 PT 居中,变体 VT=同义词,相关词 RT, 窄词 NT,宽词 BT;不在总层级里)。
    • L156–163 「既要无控制又要控制」;受控≠更客观(Adler:国会图书馆编目的性别种族偏见)。
  • 15(§KG Powered Data Catalogs 开头 + 词表脚注):
    • L1–9 数据字典(data dictionary:字段名+类型描述)≠ 词表(把数据放进公司知识的解释)。
    • L12–27 KG 目录:必须建在图数据库上;元模型可视化、可扩展、可搜索(SPARQL/Cypher/GraphQL)。
    • L28–32 H&M 例:元模型可扩展出「木头从砍伐到板材入库到建成房屋」的实体。
  • 16(§Data Assets and Data Products + Metadata Quality):
    • L4–12 血缘=整份数据横向流动(ETL/ELT);语义关系=资产的部件(某列)与其他资产部件的关系; 两者都可手动+API 扩充。
    • L17–33 资产架构图:直线=血缘,弧线=图关系;数据产品直接落在域里,不依附任何应用, 是自主的数据容器,为缩短「找到→访问→使用」的时间而生。
    • L38–47 元数据质量:目录搜索好不好取决于元数据质量,不取决于源数据质量。
    • L48–72 理想的域深度宽度来自域分析,叫穷尽性 exhaustivity;Wood 例:只一个「Wood」词 → 穷尽性太低,搜索根本没法用。
    • L79–99 特异性 specificity:词表里有的词实际用没用在数据上;词表有 Beech/Oak/Pine 而数据只打了 Wood → 穷尽性高、特异性低 → 搜索照样失效;2×2 矩阵。
  • 17(§Classification):
    • L2–13 CISO 与 DPO 吵架对话:都对 — 数据可以同时「高度机密」且「不敏感」; 三种分类:内容/机密性/敏感性,自由组合。
    • L21–39 内容分类 = 数据是什么;按域结构建;编码式表达 DA.DeA.RM.DT.Power BI (Data Analytics→Descriptive Analytics→Report Management→Demand Trends + 通用源);可自动化。
    • L40–61 机密性 = 多秘密;CISO+法务定;源自军方/情报;NATO 四级(COSMIC TOP SECRET → RESTRICTED)
      • UNCLASSIFIED;按泄露损害定级;全标 TOP SECRET 等于没标(9/11 脚注:情报共享过度受限)。
    • L64–73 损害阶梯例:保洁 SOP 无害 < BI 生产报表 < 机加工详图 DWG(工业间谍灾难)。
    • L73–90 敏感性 = 多个人;DPO 管 PII:非个人 / 个人数据(姓名地址年龄)/ 敏感个人数据 (工会、党派、族裔、健康);GDPR 口径;很多目录能自动检测 PII。
    • L92–98 卖点:CISO/DPO 本来会反对「人人可见」,但目录只有元数据 → 他们反而支持, 因为第一次能在真实 IT 版图(而非纸面政策)上执法。

原书第 3 章 Search(文件 19–22)

  • 19(§Concepts):
    • L16–30 找数据(for)vs 查数据(in):in=问值(「上周六晚多少人看了网站」→1340); for=找源(「哪里有网站流量数据」)。先 for 后 in。
    • L31–48 in 用 DQL(SQL/DBMS);数据科学从这里长出来。
    • L51–59 DAMA-DMBOK 整本只有一句话讲「为数据而搜」(元数据库须有检索前端)— 数据管理文献的空白。
    • L60–74 LIS 早研究透了:IRQL(信息检索查询语言,图书馆员/信息科学家造);与 DQL 同能, 只是作用层不同。源数据库 vs 参考数据库(Chowdhury:参考库把你领到源)。
    • L94–111 LIS 三种参考数据库(书目/馆藏/引荐)+ 作者加第四种:数据目录
    • L112–130 搜索光谱(易→难);AI 两头都改:自然语言 → 幕后翻成 IRQL;AI Analysts 把 NL→SQL→结果翻回人话。
    • L132–179 信息需求(Taylor 1962)决定怎么搜:全部(要查全率)/ 几个好东西 / 唯一对的东西(要查准率)/ 还要再用一次的东西;搜数据是多步长过程,「别不耐烦」,开车比方。
    • L196–244 serendipity 偶得:Google「手气不错」;公式 insight+experience+luck+coincidence (丹麦 Videnskab.dk;Merton & Barber);luck≠coincidence;调词表与描述、记住搜索史来提高偶得。
    • L246–258 zemblanity(偶得的邪孪生):撞见不想看的坏东西;目录里=恶意评论,警惕。
    • L260–267 + 20 L1–21 promptism(Sune Selbæk-Reitz 2026 自造词):「不加批判地相信措辞好的问题 就能得到可靠客观的答案」;LeCun:我们的眼睛得学会不把机器生成当人类表达; 对话式搜索指向「真相的感觉」而非真相。
  • 20(§Features):
    • L26–30 四个入口:简单搜索/浏览/词表搜索/高级搜索(常为对话式)。
    • L41–58 语法 syntax(写错→跑不动)vs 语义 semantics(跑得动但找错东西); 目录只能搜到目录里有的东西。
    • L63–153 简单搜索:对你简单,幕后不简单 — 自动补全、字符串匹配/模糊(陀思妥耶夫斯基拼法、 日期格式、NATO/OTAN)、同义环、叙词表(簇)、本体(图上近邻提权)、搜索行为记忆; 全部服务查准率
    • L156–216 浏览三向:垂直(域→子域→源→资产)、水平(血缘上/下游;O'Neil & Fryman:14 种血缘; Steenbeek:血缘是心态)、图形(知识图谱联想跳);组织到位则三向无缝。
    • L221–267 复杂搜索:对你复杂(语法+语义),对软件简单(只执行算符,幕后没戏法); 写错查询没有计算代价; Yin-Yang:简单搜索复杂在幕后,复杂搜索简单在幕后; 精读(perusing)结果 ≠ 浏览式扫。
    • L272–289 对话式搜索:不是搜索引擎的加速版,换了搜索的性质 — 深度上下文的复杂话题 终于不用学 IRQL 就能表达;(21) L1–5:AI 时代尚在婴儿期,别指望全面替代。
  • 21(§Mechanics):
    • L19–46 湿疹/医生四格 → 混淆矩阵;任何搜索都逃不出。
    • L52–68 召回率 recall = tp/(tp+fn):相关的东西找回来多少;难算(假阴性未知;估到 ~0.75); 复杂搜索天生服务它。
    • L69–90 查准率 precision = tp/(tp+fp):只看结果集,好算,冲 0.9;简单搜索天生服务它。
    • L91–96 两者不可能同时拉满;简单搜索的幕后机制全在服务查准率。
    • L102–115 复杂搜索机制(用户自己执行)服务查全率;穷尽性↑→召回↑精确↓。
    • L117–148 齐普夫定律 Zipf's law:词频 ∝ 1/排名(「the」每 10 词 1 次,「of」每 20 词 1 次); 统一化(泛词)vs 多样化(专名)两股力;在目录里 = 描述 vs 区分: 爬得越多,Result/Score/Efficiency 这类泛名越多 → 撞名资产分不开; 解药 = 人工打词表术语。
    • (22) L1–5 解药例:Score 表分别打「木材耐久」「客户满意」「员工绩效」。
    • L149–150 Zipf 并非他发明,也不真是定律。

原书第 4 章 Search Patterns(文件 23–27)

  • 23 模式总览;Table 4-1:六种关键词模式 + 四种浏览模式,各带 precision/recall 档位与 「AI 重构了吗」标记(基本简单搜索 no;其余 mostly yes;浏览三种 no)。
  • 24(§Keyword Search and Conversational AI Search):
    • L1–4 保留第一版全部模式,让你知道对话式搜索正在替换什么。
    • L46–84 基本简单搜索:一两个词;顶部命中即一切(vendor 演示最爱;不可能满足所有信息需求)。 瑞典销售搜「sales」例。KG 目录的简单搜索极强(Google Knowledge Graph 类比)。
    • L86–124 详细简单搜索:GlobalGlossary:Ash Fraxinus AND DataSteward:John Miller (白蜡树拉丁学名+管家);慢而准;对话式替换已在发生;学会老写法是为了「精确地提示」
    • L130–155 灵活简单搜索:*wood* 截断;捕到 wooden floor/beautiful wood/woods; 查全率优先;这种要结果集的搜索保持关键词形态。
    • L157–177 区间搜索:> RES.100.7.1003 AND < RES.100.7.1837; 心材照片:Pictures of heartwood AND (< 01.31.2018 AND > 10.31.2012)
    • L178–254 区块搜索:诉讼案;律师尽调;木种词块(Pine OR Ash OR Beech OR Oak NOT Linden…)+ 硬度词块;多阶段调整;search builder(灰色括号点选激活;PubMed 同款); 依赖人工打标(Zipf!);法律/合规场景 make-or-break;对话式区块搜索「太早说不清」。
    • L255–261 Boole 旁注:布尔逻辑回到语言本身。
    • L263–274 陈述搜索:大杂烩;数据发现团队找「Legal/Finance/IT 里 2022-01-01 后创建、 没有资产负责人的 Tableau 报表」→ 找管家补负责人。
  • 25(§Browsing Patterns):
    • L3–9 浏览是搜索之间的阶段,学公司语言。
    • L11–24 词表浏览:新员工搜「paint」看三种词表结构差异。
    • L26–35 域浏览:客户画像项目该挂 Customer Information 还是 Customer Preference;好奇不亏。
    • L36–53 血缘浏览:上游查「报表为什么坏了」、下游测改动后果、找无下游的死表、老管道;DPO 追敏感数据去向。
    • L55–80 图浏览 = 最大化 serendipity;社会网络先例:警/军/情报(IBM、Palantir)、文献计量图。
    • L86–95 PR 经理走查:搜「promotion」结果歪 → 打开首条命中为图 → 发现自由词表里的 「promotion」指晋升而非公关活动,且目录自动标「!」(与域词表重复)→ 过滤之。
  • 26(§Searching a Graph-Based Data Catalog):
    • L7–19 IRQL 永远搜不全;想搜一切 → 用目录图库的 DQL(GraphQL/SPARQL/Cypher/Gremlin); 血缘若是图的,同样可搜。
  • 27(Summary):
    • L13–17 前谷歌时刻:对话式 AI 没有赢家,像 Google 席卷前的搜索引擎市场 —「趁它还在,享受它」。
    • L18–23 对话式正在改写所有关键词模式;请读者自己接着实验。

差异化(与 rag-ready-patterns):那本讲数据平台怎么喂 RAG(数据→检索管道);

本本讲公司怎么把数据资产本身组织成可搜的地图(元数据/域/词表/分类/搜索模式)。 在 index 覆盖/不覆盖与主线里点明。

写作决定

  • 原书章名引用统一用:前言/第 1 章 §小节名。出处指向文件行号,搜英文原短语。
  • 演示数字全部标「为演示编的」。走查:01 customer_ID 表;02 Kris+MCP;03 访问请求沿角色梯走; 04 H&M 域路径;05 Wood 穷尽性/特异性;06 一张报表三张标签;07 两个问题(for/in); 08 编造数走混淆矩阵+Zipf 撞名;09 诉讼区块搜索;10 promotion 图走查。