给数据划地盘 — 域架构:从价值链到一张具体的报表
这一章讲三件事: 域的分层架构怎么搭(顶层是什么、主入口为什么只能有一个); 「域」这个词到底该按哪个学科的定义理解、为什么软件业的主流答案在这件事上是错的; 以及第一层到底选「流程」还是选「能力」。 它是全书骨架章:第 05 章的描述、第 06 章的标签、第 08 章之后的搜索,全都挂在这副骨架上。
1. 先看现象:打开目录,你从哪开始点
想象你第一次打开公司的数据目录:左边是一棵树,树上挂着几百个数据源、几千份资产。 如果这棵树的分叉方式是随手定的——这堆按项目、那堆按部门、另一堆按年份—— 你每找一个东西都在重新学一遍它的分法。外部门的同事更是进来就迷路。
书里的判断很硬:域怎么划,决定外部门的人敢不敢进来翻; 划得直观,目录才算迈出了打破数据孤岛的第一步1。所以划域不是整理癖,是搜索的基建。
2. 主走查:一条从价值链到报表的完整路径
先把结论的形状摆出来。书里给 H&M(第 02 章那家木构建筑公司)画的域架构是这样一条路径2:
价值链(H&M:设计 → 采购木材 → 建造 → 交付)
└─ 数据目录主入口(整棵树的根)
└─ 能力层:数据分析(Data Analytics)
└─ 子能力:描述性分析(Descriptive Analytics)
└─ 子能力:报表管理(Report Management)
└─ 子能力:需求趋势报告管理(Demand Trends)
└─ 通用数据源:Power BI(这个软件本身)
└─ 特定数据源:H&M 的那一份 Power BI 订阅
└─ 资产:某张具体的数据表、某份具体的报表
图说:从「公司做什么」一层层走到「哪张表」。走查用的这六层名称全部来自原书案例。
记住这条路径的方向感:越往上越稳定(价值链十年不变), 越往下越多变(买的软件实例、报表、表天天动)。后面两节解释每一层为什么这样定。
3. 骨架的三条硬规矩
主入口只有一个
整棵树的根叫主入口——它可以理解为「整个目录」本身。书里给了两条理由,说明它必须唯一3:
- 公司的数据是一个整体,任何数据源的数据都只能落进这一个体系里,各层自然都从属于一个顶层;
- 数据发现团队(第 03 章)需要对整棵树有完整控制权——角色和职责都从这根往下派,两个根就没法派了。
顶层挂价值链
价值链是什么?一家企业交付价值的那条最粗的流程——H&M 是「设计、采购木材、建造、交付」, 律所可能是「获客、办案、结案」。书里强调:公营、私营、NGO,所有组织都有价值链,先找到它4。
为什么不挂别的?因为顶层要的是稳定。价值链是一个组织存在的理由,十年不变; 而部门、系统、项目都会变。域是「给数据安全降落的地方」——降落区当然不能自己天天搬家。
禁止照组织架构图划域
这是书里用感叹级别语气警告的一条:别把公司组织架构图直接搬进目录5。 团队会合并、拆分、外包、重 组成常态——照着它划域,你维护的将是一张永远在改的目录, 而不是在服务数据发现。这一条和「顶层挂价值链」是同一条原则的正反面: 跟着组织的稳定结构走,不跟着组织的临时结构走。
4. 「域」到底怎么定义:一场学科之争
「域」听起来人人都懂,真正划的时候才发现要选边站。书里把两个候选学科摆在一起6:
候选一:DDD(领域驱动设计)——软件业的主流答案,2000 年代由 Eric Evans 提出, 教工程师围绕业务领域组织软件设计7。后来兴起的数据网格(data mesh)运动 把 DDD 搬进了数据领域,建议每个业务单元(一个业务部门)自治地管理自己的数据8。 这是数据管理文献里最常见的口径。
候选二:信息科学——作者自己的本行(图书馆与信息科学),定义朴素得多: 域是一群共享知识、目标、做事方法和沟通方式的人9。 这个定义后面还挂着四个部件:本体论基础(这群人对「世界上有哪些概念」的共同理解)、 目的论(他们想达成什么)、方法论(他们怎么做研究、怎么扩展自己的域)、社会语义(这群人用什么工具和行话交流)(他们用什么工具交流)10。
书里为什么舍 DDD 取信息科学?因为它点破了一个根本问题:DDD 是为「造软件」设计的, 不是为「组织数据」设计的——连数据网格的思想领袖们自己也承认,把 DDD 重新定范围到数据上 「远不容易、也不理想」11。
问题出在信息科学的两个补充概念上。信息科学给域配了两把尺子12:
- 内涵(intension):这个域往深处走多远、专家知识钻多深。书里的例子:酿酒是一个域, 爱好者分到「自然酿酒」「传统酿酒」就停了,学者还要再分「有机酿酒」「生物动力酿酒」,无穷往下钻;
- 外延(extension):这个域往宽处扫多远。爱好者会把相邻的域都圈进来—— 酿酒爱好者的域里可能同时住着旅行和玩乐。
书里的判决是:DDD 套到数据上,内涵和外延就不自由了——域被拴在软件组件之间数据怎么流动上, 也就是被迫围着血缘(数据的物理旅程)组织,而丢掉了按主题组织数据的能力13。 换句话说:按 DDD 划域,你得到的是「系统之间怎么连线」的图;按信息科学划域, 你得到的是「公司的知识版图」。目录要的是后者,因为搜数据的人脑子里装的是主题,不是系统拓扑。
5. 第一层:流程还是能力
定了「域是人的域」,第一层怎么分?书里给出二选一14:
| 选项 | 定义 | 长什么样 | 适合谁 |
|---|---|---|---|
| 流程(process) | 事怎么做——按价值链的步骤分 | 直接流程:研发、制造、销售;间接流程:HR、财务 | 有成熟流程图的公司 |
| 能力(capability) | 公司能做什么——用名词表达 | 管理、分析;数据分析域下分:描述性(发生了什么)、诊断性(为什么)、预测性(会怎样)、规范性(该做什么) | 与企业架构工作紧耦合的公司 |
两者的深浅差别:流程是一条链,环环相扣——书里的 HR 例:招聘→入职→发展→自助服务→ 离职办理→辞职,少一环整段流程就不成立15;能力是许多部门同时在做的事, 彼此独立、没有先后——描述性分析和预测性分析可以由不同团队各自 为政16。
选一个,坚持到底,不许混用——书里把这条写成硬规矩:流程和能力本质不同, 混着划出来的树谁也读不懂17。
监管行业有现成答案。 食品、制药、油气这类受监管行业必须持有一张官方流程图 (装在质量管理体系 QMS 里,ISO 9001:2015 这类标准要求,应对 FDA 这类机构的审计)。 书里的建议:直接把这张流程图 1:1 搬进目录,最底层 employee 级的细枝末节砍掉, 流程层之下直接落数据源18。
6. 第二层:通用数据源与特定数据源
流程/能力层之下才是数据源——但书里要求把数据源拆成两层19:
- 通用数据源:软件本身。Power BI、Tableau、Qlik Sense——全世界有很多家公司用 Power BI, 它作为「一类软件」先登记一次;
- 特定数据源:你公司的那一份具体实例。H&M 的那一份 Power BI 订阅(向厂商 买下的使用席位)——甚至只是订阅的一部分, 因为有时不必把订阅里的全部数据都暴露出来20。
为什么要拆两层?书里给了一个人话理由:数据源是域沟通的方式——一个域用几个数据源、 每个源暴露多少数据,应该不多不少正好等于这个域对外沟通所需21。 「通用+特定」的拆法让这个对话保持干净:软件是一回事,公司怎么用它、谁负责它,是另一回事。
还有一个顺序上的禁令:不许跳过能力/流程层,直接从主入口跳到数据源。 那样得到的源列表对外人「接近不可读」,连数据发现团队自己都会记不清登记过哪些源22。
7. 作者的判断与证据
书里当作方法论给出的(作者自建,不是引用):
- 整套「价值链 → 能力/流程 → 数据源」的域架构,是作者为数据目录自创的参考架构; 他推荐动手前先读 BIZBOK(业务架构知识体系指南)的能力与流程章节23;
- DDD 与信息科学的 取舍,书里给了双方文献(Evans 原著、Dehghani 与 Strengholt 的数据管理著作、 Smiraglia 的知识组织),并引用了 Smiraglia 的域定义原文9。
作者的立场(需要读者知道其倾向):
- 对 DDD 的批评书里讲得很直白,但要记得作者的信息科学背景——他的裁决受益于自己的学科本行; 数据网格社区对「域」的理解在工业界仍有大量拥趸。
判断(我们的,不是书里的): 这场「学科之争」的实用结论可以压缩成一句话: 先问「搜的人脑子里装的是什么」,再决定按什么分叉。 找数据的业务人员想的是 「营销的东西在哪」「风控的东西在哪」——主题;只有数据工程师想的是系统拓扑。 如果你的目录主要服务工程师做管道运维,DDD 式划分反而顺手;服务全员搜索, 信息科学式划分胜出。书默认的是后一种目录。 如果错,会错在: 如果目录的核心用户其实只有数据团队(比如只是给数据平台配的元数据层), 按主题划域就是给少数人做了多数人的功课——此时书里那套架构的收益会被高估。
8. 边界与局限
- Early Release 的注释痕迹。 原文里图编号有错乱(同一节里 Figure 2-3 与 2-13 混用)、 个别句子没写完——说明这章还在编辑中;书里承诺的「数据产品第 8 章细讲」不在试读版里, 本章只讲到数据产品的「自主可消费的资产」为止(第 01 章已 讲)。
- 两套口径并存于业界。 本书取信息科学,但 DDD/数据网格式划域在真实公司里仍然常见; 读者去别家文档看到「按限界上下文(DDD 里的概念:一个模型适用的边界)划域」时,要知道那是另一套答案。
- 能力/流程地图本身难产。 书里假定公司「有或能画出」这两张图;对什么都没有的组织, 画图的工作量不在书里讨论范围。
9. 可带走的
- 域架构三层:价值链(顶层)→ 能力或流程(中段)→ 通用/特定数据源(底层),资产落在最底;
- 主入口唯一:数据是一个整体,控制权也只能有一个根;
- 别照组织架构图划域——组织为变而生,域要为稳而建;
- 「域」取信息科学的定义:共享知识、目标、方法、沟通的一群人,不是一段软件边界;
- 内涵=钻多深,外延=扫多宽;DDD 套数据时这两把尺子不自由,主题式组织会输给系统拓扑;
- 流程是一条链(怎么做),能力是一堆名词(能做什么)——选一个,别混;
- 数据源拆两层:软件是通用的,订阅是特定的;域用几个源,就登记几个源;
- 监管行业直接搬 QMS 流程图,砍掉最底层。
10. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 没有参考架构无从下手 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:11(搜「where to start」) |
| 顶层是价值链 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:15(搜「value chain」) |
| 主入口唯一、两条理由 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:27(搜「main entry」) · text/13-fm-organizing-domains-in-the-data-catalog.txt:32(搜「stored in only one place」) |
| DDD 与信息科学两个候选 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:43(搜「two fields can deliver」) |
| DDD 与 Evans | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:56(搜「Eric Evans」) |
| 数据网格把 DDD 搬进数据 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:70(搜「applied DDD for」) |
| DDD 非为数据而生 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:81(搜「not intended for data architecture」) |
| 信息科学的域定义 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:92(搜「share knowledge」) |
| 域的四个部件 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:98(搜「ontological base」) · text/13-fm-organizing-domains-in-the-data-catalog.txt:113(搜「Ontology is the study」) |
| 内涵与酿酒例子 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:120(搜「winemaking」) |
| 外延 与旅行玩乐 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:124(搜「Extension, on the other hand」) |
| 内涵外延不自由 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:131(搜「intension and extension are not free」) |
| 被迫围着血缘组织 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:143(搜「physical movement of data」) |
| 流程怎么 done / 能力能什么 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:158(搜「company performs its tasks」) |
| 按企业架构选能力、按流程图选流程 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:165(搜「enterprise architecture activities」) |
| 直接与间接流程 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:175(搜「Direct processes」) |
| HR 流程六环 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:182(搜「Offboarding」) |
| 四种分析能力 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:197(搜「Descriptive Analytics」) |
| 组织架构图陷阱 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:207(搜「organization diagram」) |
| QMS 与监管行业 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:215(搜「quality management system」) |
| 选一不混 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:227(搜「choose one or the other」) |
| 不许跳层 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:240(搜「close to unreadable」) |
| 通用数据源 | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:235(搜「generic data source」) |
| 特定数据源=具体实例 | 第 2 章 | text/14-fm-organizing-data-in-the-domains.txt:3(搜「specific instance」) |
| 数据源是域沟通的方式 | 第 2 章 | text/14-fm-organizing-data-in-the-domains.txt:7(搜「how the domain communicates」) |
| 信息科学口径的另一好处 | 第 2 章 | text/14-fm-organizing-data-in-the-domains.txt:14(搜「rooted in software」) |
| H&M 能力路径(走查素材) | 第 2 章 | text/13-fm-organizing-domains-in-the-data-catalog.txt:246(搜「Demand Trends Report Management」) |