跳到主要内容

给数据划地盘 — 域架构:从价值链到一张具体的报表

这一章讲三件事: 域的分层架构怎么搭(顶层是什么、主入口为什么只能有一个); 「域」这个词到底该按哪个学科的定义理解、为什么软件业的主流答案在这件事上是错的; 以及第一层到底选「流程」还是选「能力」。 它是全书骨架章:第 05 章的描述、第 06 章的标签、第 08 章之后的搜索,全都挂在这副骨架上。

1. 先看现象:打开目录,你从哪开始点

想象你第一次打开公司的数据目录:左边是一棵树,树上挂着几百个数据源、几千份资产。 如果这棵树的分叉方式是随手定的——这堆按项目、那堆按部门、另一堆按年份—— 你每找一个东西都在重新学一遍它的分法。外部门的同事更是进来就迷路。

书里的判断很硬:域怎么划,决定外部门的人敢不敢进来翻; 划得直观,目录才算迈出了打破数据孤岛的第一步1。所以划域不是整理癖,是搜索的基建。

2. 主走查:一条从价值链到报表的完整路径

先把结论的形状摆出来。书里给 H&M(第 02 章那家木构建筑公司)画的域架构是这样一条路径2:

价值链(H&M:设计 → 采购木材 → 建造 → 交付)
└─ 数据目录主入口(整棵树的根)
└─ 能力层:数据分析(Data Analytics)
└─ 子能力:描述性分析(Descriptive Analytics)
└─ 子能力:报表管理(Report Management)
└─ 子能力:需求趋势报告管理(Demand Trends)
└─ 通用数据源:Power BI(这个软件本身)
└─ 特定数据源:H&M 的那一份 Power BI 订阅
└─ 资产:某张具体的数据表、某份具体的报表

图说:从「公司做什么」一层层走到「哪张表」。走查用的这六层名称全部来自原书案例。

记住这条路径的方向感:越往上越稳定(价值链十年不变), 越往下越多变(买的软件实例、报表、表天天动)。后面两节解释每一层为什么这样定。

3. 骨架的三条硬规矩

主入口只有一个

整棵树的根叫主入口——它可以理解为「整个目录」本身。书里给了两条理由,说明它必须唯一3:

  1. 公司的数据是一个整体,任何数据源的数据都只能落进这一个体系里,各层自然都从属于一个顶层;
  2. 数据发现团队(第 03 章)需要对整棵树有完整控制权——角色和职责都从这根往下派,两个根就没法派了。

顶层挂价值链

价值链是什么?一家企业交付价值的那条最粗的流程——H&M 是「设计、采购木材、建造、交付」, 律所可能是「获客、办案、结案」。书里强调:公营、私营、NGO,所有组织都有价值链,先找到它4

为什么不挂别的?因为顶层要的是稳定。价值链是一个组织存在的理由,十年不变; 而部门、系统、项目都会变。域是「给数据安全降落的地方」——降落区当然不能自己天天搬家。

禁止照组织架构图划域

这是书里用感叹级别语气警告的一条:别把公司组织架构图直接搬进目录5。 团队会合并、拆分、外包、重组成常态——照着它划域,你维护的将是一张永远在改的目录, 而不是在服务数据发现。这一条和「顶层挂价值链」是同一条原则的正反面: 跟着组织的稳定结构走,不跟着组织的临时结构走。

4. 「域」到底怎么定义:一场学科之争

「域」听起来人人都懂,真正划的时候才发现要选边站。书里把两个候选学科摆在一起6:

候选一:DDD(领域驱动设计)——软件业的主流答案,2000 年代由 Eric Evans 提出, 教工程师围绕业务领域组织软件设计7。后来兴起的数据网格(data mesh)运动 把 DDD 搬进了数据领域,建议每个业务单元(一个业务部门)自治地管理自己的数据8。 这是数据管理文献里最常见的口径。

候选二:信息科学——作者自己的本行(图书馆与信息科学),定义朴素得多: 域是一群共享知识、目标、做事方法和沟通方式的人9。 这个定义后面还挂着四个部件:本体论基础(这群人对「世界上有哪些概念」的共同理解)、 目的论(他们想达成什么)、方法论(他们怎么做研究、怎么扩展自己的域)、社会语义(这群人用什么工具和行话交流)(他们用什么工具交流)10

书里为什么舍 DDD 取信息科学?因为它点破了一个根本问题:DDD 是为「造软件」设计的, 不是为「组织数据」设计的——连数据网格的思想领袖们自己也承认,把 DDD 重新定范围到数据上 「远不容易、也不理想」11

问题出在信息科学的两个补充概念上。信息科学给域配了两把尺子12:

  • 内涵(intension):这个域往深处走多远、专家知识钻多深。书里的例子:酿酒是一个域, 爱好者分到「自然酿酒」「传统酿酒」就停了,学者还要再分「有机酿酒」「生物动力酿酒」,无穷往下钻;
  • 外延(extension):这个域往宽处扫多远。爱好者会把相邻的域都圈进来—— 酿酒爱好者的域里可能同时住着旅行和玩乐。

书里的判决是:DDD 套到数据上,内涵和外延就不自由了——域被拴在软件组件之间数据怎么流动上, 也就是被迫围着血缘(数据的物理旅程)组织,而丢掉了按主题组织数据的能力13。 换句话说:按 DDD 划域,你得到的是「系统之间怎么连线」的图;按信息科学划域, 你得到的是「公司的知识版图」。目录要的是后者,因为搜数据的人脑子里装的是主题,不是系统拓扑。

5. 第一层:流程还是能力

定了「域是人的域」,第一层怎么分?书里给出二选一14:

选项定义长什么样适合谁
流程(process)怎么做——按价值链的步骤分直接流程:研发、制造、销售;间接流程:HR、财务有成熟流程图的公司
能力(capability)公司能做什么——用名词表达管理、分析;数据分析域下分:描述性(发生了什么)、诊断性(为什么)、预测性(会怎样)、规范性(该做什么)与企业架构工作紧耦合的公司

两者的深浅差别:流程是一条链,环环相扣——书里的 HR 例:招聘→入职→发展→自助服务→ 离职办理→辞职,少一环整段流程就不成立15;能力是许多部门同时在做的事, 彼此独立、没有先后——描述性分析和预测性分析可以由不同团队各自为政16

选一个,坚持到底,不许混用——书里把这条写成硬规矩:流程和能力本质不同, 混着划出来的树谁也读不懂17

监管行业有现成答案。 食品、制药、油气这类受监管行业必须持有一张官方流程图 (装在质量管理体系 QMS 里,ISO 9001:2015 这类标准要求,应对 FDA 这类机构的审计)。 书里的建议:直接把这张流程图 1:1 搬进目录,最底层 employee 级的细枝末节砍掉, 流程层之下直接落数据源18

6. 第二层:通用数据源与特定数据源

流程/能力层之下才是数据源——但书里要求把数据源拆成两层19:

  • 通用数据源:软件本身。Power BI、Tableau、Qlik Sense——全世界有很多家公司用 Power BI, 它作为「一类软件」先登记一次;
  • 特定数据源:你公司的那一份具体实例。H&M 的那一份 Power BI 订阅(向厂商买下的使用席位)——甚至只是订阅的一部分, 因为有时不必把订阅里的全部数据都暴露出来20

为什么要拆两层?书里给了一个人话理由:数据源是域沟通的方式——一个域用几个数据源、 每个源暴露多少数据,应该不多不少正好等于这个域对外沟通所需21。 「通用+特定」的拆法让这个对话保持干净:软件是一回事,公司怎么用它、谁负责它,是另一回事。

还有一个顺序上的禁令:不许跳过能力/流程层,直接从主入口跳到数据源。 那样得到的源列表对外人「接近不可读」,连数据发现团队自己都会记不清登记过哪些源22

7. 作者的判断与证据

书里当作方法论给出的(作者自建,不是引用):

  • 整套「价值链 → 能力/流程 → 数据源」的域架构,是作者为数据目录自创的参考架构; 他推荐动手前先读 BIZBOK(业务架构知识体系指南)的能力与流程章节23;
  • DDD 与信息科学的取舍,书里给了双方文献(Evans 原著、Dehghani 与 Strengholt 的数据管理著作、 Smiraglia 的知识组织),并引用了 Smiraglia 的域定义原文9

作者的立场(需要读者知道其倾向):

  • 对 DDD 的批评书里讲得很直白,但要记得作者的信息科学背景——他的裁决受益于自己的学科本行; 数据网格社区对「域」的理解在工业界仍有大量拥趸。

判断(我们的,不是书里的): 这场「学科之争」的实用结论可以压缩成一句话: 先问「搜的人脑子里装的是什么」,再决定按什么分叉。 找数据的业务人员想的是 「营销的东西在哪」「风控的东西在哪」——主题;只有数据工程师想的是系统拓扑。 如果你的目录主要服务工程师做管道运维,DDD 式划分反而顺手;服务全员搜索, 信息科学式划分胜出。书默认的是后一种目录。 如果错,会错在: 如果目录的核心用户其实只有数据团队(比如只是给数据平台配的元数据层), 按主题划域就是给少数人做了多数人的功课——此时书里那套架构的收益会被高估。

8. 边界与局限

  • Early Release 的注释痕迹。 原文里图编号有错乱(同一节里 Figure 2-3 与 2-13 混用)、 个别句子没写完——说明这章还在编辑中;书里承诺的「数据产品第 8 章细讲」不在试读版里, 本章只讲到数据产品的「自主可消费的资产」为止(第 01 章已讲)。
  • 两套口径并存于业界。 本书取信息科学,但 DDD/数据网格式划域在真实公司里仍然常见; 读者去别家文档看到「按限界上下文(DDD 里的概念:一个模型适用的边界)划域」时,要知道那是另一套答案。
  • 能力/流程地图本身难产。 书里假定公司「有或能画出」这两张图;对什么都没有的组织, 画图的工作量不在书里讨论范围。

9. 可带走的

  1. 域架构三层:价值链(顶层)→ 能力或流程(中段)→ 通用/特定数据源(底层),资产落在最底;
  2. 主入口唯一:数据是一个整体,控制权也只能有一个根;
  3. 别照组织架构图划域——组织为变而生,域要为稳而建;
  4. 「域」取信息科学的定义:共享知识、目标、方法、沟通的一群人,不是一段软件边界;
  5. 内涵=钻多深,外延=扫多宽;DDD 套数据时这两把尺子不自由,主题式组织会输给系统拓扑;
  6. 流程是一条链(怎么做),能力是一堆名词(能做什么)——选一个,别混;
  7. 数据源拆两层:软件是通用的,订阅是特定的;域用几个源,就登记几个源;
  8. 监管行业直接搬 QMS 流程图,砍掉最底层。

10. 原文地图

主题原书章原文位置
没有参考架构无从下手第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:11(搜「where to start」)
顶层是价值链第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:15(搜「value chain」)
主入口唯一、两条理由第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:27(搜「main entry」) · text/13-fm-organizing-domains-in-the-data-catalog.txt:32(搜「stored in only one place」)
DDD 与信息科学两个候选第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:43(搜「two fields can deliver」)
DDD 与 Evans第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:56(搜「Eric Evans」)
数据网格把 DDD 搬进数据第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:70(搜「applied DDD for」)
DDD 非为数据而生第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:81(搜「not intended for data architecture」)
信息科学的域定义第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:92(搜「share knowledge」)
域的四个部件第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:98(搜「ontological base」) · text/13-fm-organizing-domains-in-the-data-catalog.txt:113(搜「Ontology is the study」)
内涵与酿酒例子第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:120(搜「winemaking」)
外延与旅行玩乐第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:124(搜「Extension, on the other hand」)
内涵外延不自由第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:131(搜「intension and extension are not free」)
被迫围着血缘组织第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:143(搜「physical movement of data」)
流程怎么 done / 能力能什么第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:158(搜「company performs its tasks」)
按企业架构选能力、按流程图选流程第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:165(搜「enterprise architecture activities」)
直接与间接流程第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:175(搜「Direct processes」)
HR 流程六环第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:182(搜「Offboarding」)
四种分析能力第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:197(搜「Descriptive Analytics」)
组织架构图陷阱第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:207(搜「organization diagram」)
QMS 与监管行业第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:215(搜「quality management system」)
选一不混第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:227(搜「choose one or the other」)
不许跳层第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:240(搜「close to unreadable」)
通用数据源第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:235(搜「generic data source」)
特定数据源=具体实例第 2 章text/14-fm-organizing-data-in-the-domains.txt:3(搜「specific instance」)
数据源是域沟通的方式第 2 章text/14-fm-organizing-data-in-the-domains.txt:7(搜「how the domain communicates」)
信息科学口径的另一好处第 2 章text/14-fm-organizing-data-in-the-domains.txt:14(搜「rooted in software」)
H&M 能力路径(走查素材)第 2 章text/13-fm-organizing-domains-in-the-data-catalog.txt:246(搜「Demand Trends Report Management」)

Footnotes

  1. 出处:「The Core Functionality of a Data Catalog」第 101 段(text/07-fm-the-core-functionality-of-a-data-catalog.txt:101,搜「intriguing to explore」):域应当「对外部门的人直观,让他们有兴趣探索——数据目录是打破数据孤岛的第一步」。

  2. 出处:「Organizing Domains in the Data Catalog」第 246 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:246,搜「Demand Trends Report Management」):H&M 用 Power BI 支撑「需求趋势报告管理」能力,它属于报表管理,属于描述性分析,属于数据分析;通用与特定数据源见第 251 段(搜「generic data source」)。

  3. 出处:「Organizing Domains in the Data Catalog」第 27 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:27,搜「main entry」)与第 32 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:32,搜「stored in only one place」)。

  4. 出处:「Organizing Domains in the Data Catalog」第 15 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:15,搜「value chain」):「找到它,以此点燃你在目录里的数据组织!」

  5. 出处:「Organizing Domains in the Data Catalog」第 207 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:207,搜「organization diagram」)。

  6. 出处:「Organizing Domains in the Data Catalog」第 43 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:43,搜「two fields can deliver」)。

  7. 出处:「Organizing Domains in the Data Catalog」第 56 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:56,搜「Eric Evans」)。书脚注给出 Evans《Domain-Driven Design》(Addison-Wesley, 2003)。

  8. 出处:「Organizing Domains in the Data Catalog」第 70 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:70,搜「applied DDD for」)。数据网格的联合治理模型:每个业务单元负责自己数据的存储、暴露与访问。

  9. 出处:「Organizing Domains in the Data Catalog」第 92 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:92,搜「share knowledge」),定义引自 Richard P. Smiraglia《The Elements of Knowledge Organization》(Springer, 2014),完整理论定义见第 110 段脚注(搜「underlying teleology」)。 2

  10. 出处:「Organizing Domains in the Data Catalog」第 98 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:98,搜「ontological base」)。「本体论/目的论」两个词的通俗解释见原书脚注第 113–115 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:113,搜「Ontology is the study」):本体论研究「存在什么」,目的论研究「内在目的是什么」。

  11. 出处:「Organizing Domains in the Data Catalog」第 81 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:81,搜「not intended for data architecture」);Dehghani 与 Strengholt 的态度见第 83 段(搜「far from easy」)。

  12. 出处:「Organizing Domains in the Data Catalog」第 116 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:116,搜「degrees of intension」);酿酒例子见第 120 段(搜「winemaking」)与第 124 段(搜「Extension, on the other hand」)。

  13. 出处:「Organizing Domains in the Data Catalog」第 131 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:131,搜「intension and extension are not free」)与第 143 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:143,搜「physical movement of data」):域被迫围着数据的物理移动组织,而非主题式的概念组织。

  14. 出处:「Organizing Domains in the Data Catalog」第 158 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:158,搜「company performs its tasks」)。

  15. 出处:「Organizing Domains in the Data Catalog」第 182 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:182,搜「Offboarding」);「少一环就失去意义」在第 183 段(搜「lose its meaning」)。

  16. 出处:「Organizing Domains in the Data Catalog」第 199 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:199,搜「chain of events」):能力不属于事件链,可由公司不同部门同时、独立地执行。

  17. 出处:「Organizing Domains in the Data Catalog」第 227 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:227,搜「choose one or the other」)。

  18. 出处:「Organizing Domains in the Data Catalog」第 215 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:215,搜「quality management system」)与第 222 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:222,搜「1:1」):镜像流程图但「可以省略最低层级」。

  19. 出处:「Organizing Domains in the Data Catalog」第 235 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:235,搜「generic data source」):通用数据源指软件组件本身,如 Tableau、Qlik Sense、Power BI。

  20. 出处:「Organizing Data in the Domains」第 3 段(text/14-fm-organizing-data-in-the-domains.txt:3,搜「specific instance」)与第 5 段(text/14-fm-organizing-data-in-the-domains.txt:5,搜「part of a subscription」)。

  21. 出处:「Organizing Data in the Domains」第 7 段(text/14-fm-organizing-data-in-the-domains.txt:7,搜「how the domain communicates」):数据源的数量与暴露的数据「必须不多不少,正好等于域用来沟通的源的数量」。

  22. 出处:「Organizing Domains in the Data Catalog」第 240 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:240,搜「close to unreadable」)。

  23. 出处:「Organizing Domains in the Data Catalog」第 161 段(text/13-fm-organizing-domains-in-the-data-catalog.txt:161,搜「BIZBOK」):《A Guide to the Business Architecture Body of Knowledge》,能力见其 2.2 节、流程见 3.4 节。