只有一半的地图 — 数据目录是什么、为什么它敢让人人可见
这一章讲三件事: 数据目录到底是个什么东西(一句话:一张只有元数据的地图); 它凭什么解决「没人知道公司有什么数据」这个死结;以及撑起全书的五块积木怎么拼。 这是全书的地基:后面九章都在这张地图上干活。 不需要任何基础,遇到的生词都当场解释。
1. 先看现象:你找不到公司里已有的东西
一个上班的真实日常:你要做一件活儿,明知公司里一定有现成的数据, 但不知道它在哪个系统、归谁管、能不能用。怎么办?问同事、翻群聊、靠脑子里的印象碰运气。
这不是你一个人的问题,而是每个公司的结构性状态:
没有任何一名员工能看到公司 IT 版图里的全部数据;更麻烦的是,没人能看到别人能看到什么1。
每拨人守着自己系统里的那份数据干活,看不见、也不知道别的系统里有什么。 书里给这种状态起了个名字:数据孤岛(data silos,各团队的数据各自封在自己的系统里,像海上的孤岛)2。
孤岛还只是表面。书里指出更深的一层:孤岛之间其实是连着的——数据会从一个系统流到另一个系统, 只是没人看得见它们怎么连3。这意味着你想梳理全局时,连「从哪根线开始拉」都不知道。
判断(我们的,不是书里的): 「没人知道公司有什么数据」不是技术故障,是规模与分工的必然—— 系统是十几年里陆续买的,人是流动的,没有任何角色的日常工作会把全貌看一遍。 所以指望「换个更认真的团队」解决不了,只能靠一个专门把全貌摆出来的工具。 如果错,会错在: 如果某家公司规模极小、系统极少,一个勤快的架构师确实能人脑记全—— 但本书面向的正是「记不全」的那种组织,这也是目录这类产品存在的原因。