三张标签 — 内容、机密性、敏感性:分类为什么不是一个词
这一章讲三件事: 「分类」为什么至少有三个意思;每张标签按什么标准定级; 以及为什么「给全公司数据贴标签」这件事,恰恰要到元数据层的目录里才第一次变得可行。 它是组织篇(第 04–05 章)的收口:描述写完、词表挂好,最后一步是把标签贴齐。
1. 先看现象:两位高管为一份数据吵架
书里开场就是一段对话剧。CISO(首席信息安全官,管公司机密的)和 DPO(数据保护官,管个人隐私合规的)对着同一份数据各执一词1:
CISO:「我已经给这份数据分好类了——高度机密!」 DPO:「什么意思?我几个月前就给它分过类了,它一点都不敏感。」 CISO:「什么?我完全不同意!」 DPO:「哈?我也完全不同意!」
笑点在于:两人都对。一份「高管薪酬汇总」可以同时是高度机密(泄露伤公司)和毫不敏感 (里面没有一个自然人的个人信息)。吵起来不是因为有人错了,而是因为「分类」这个词 在数据治理里至少指三件不同的事2:
| 标签 | 管什么 | 谁说了算 | 定级的依据 |
|---|---|---|---|
| 内容分类 | 这数据是什么 | 域负责人(按域结构定) | 它在域树上的位置 |
| 机密性 | 这数据多秘密 | CISO(与法务协作) | 泄露会给公司造成多大损害 |
| 敏感性 | 这数据多个人 | DPO(落实隐私法规) | 是否可识别到自然人、泄露伤人多深 |
三条规矩:每份数据三张标签都要有;标签之间互相独立、自由组合—— 「高机密性不蕴含高敏感性,反之亦然」3。
2. 主走查:给一份需求趋势报表贴满三张标签
拿第 04 章走查过的那份资产继续走:H&M(木构建筑公司)里支撑「需求趋势报告管理」能力的 那份 Power BI 数据。看三张标签怎么依次落上去。
第一张:内容标签。 书里要求内容分类按域结构来建,并且压成一串可读的代号。 这份资产得到的是4:
DA . DeA . RM . DT . Power BI
│ │ │ │ └─ 通用数据源:Power BI
│ │ │ └─ 子能力:需求趋势报告管理(Demand Trends)
│ │ └─ 子能力:报表管理(Report Management)
│ └─ 子能力:描述性分析(Descriptive Analytics)
└─ 能力域:数据分析(Data Analytics)
图说:代号就是第 04 章那条域路径的缩写,每个首字母缩写都保证互不重合。
这串代号就是这份数据的「身份证号」:它回答「这数据是什么」——不是靠自然语言描述, 而是靠它在公司能力树上的坐标。书里承认逐个子域定义内容分类很繁琐, 但强调流程可以自动化,而回报「非常可观」——它是搜索(第 08–09 章)可以直接吃的结构化钩子5。
第二张:机密性标签。 问一个书里给的标准问题:这数据意外流出,损害多大?6 对比书里的损害阶梯7:
保洁 SOP(打扫流程文档) → 相对无害
生产设施的 BI 报表 → 有点伤,但不致命
生产设施的完整 CAD 图纸(DWG) → 灾难:工业间谍的直接弹药
需求趋势报表落在中间档:暴露了公司的销售趋势,伤业务,但不动筋骨。 (具体贴「机密」还是「受限」,由 CISO 依公司自己的密级 表定——书里给的定级思路是 NATO 的,下一节展开。)
第三张:敏感性标签。 问的是:这数据能识别到自然人吗?8 需求趋势报表是汇总数字,没有姓名、地址、任何个人痕迹——非个人数据,敏感性最低档。 如果换成另一份「门店员工排班表」,它就得进 PII(个人身份信息,可识别到具体的人的数据)档, 还要再分「个人数据」还是「敏感个人数据」(下一节)。
三张标签贴完,这份资产在目录里的样子:一串内容代号 + 一个机密档位 + 一个敏感档位—— 治理用户(第 03 章)从此可以用任何一张标签当搜索条件:「找出全公司所有『受限』级的 DWG 文件」「找出 HR 域里所有『敏感』档的数据」——第 08 章会看到这样的真实查询式子。
3. 机密性:从军队学来的定级法
机密性标签的家底来自军队、警察与情报机构9。书里给的是 NATO(北大西洋公约组织)的四级表10:
| NATO 密级 | 泄露损害 |
|---|---|
| COSMIC TOP SECRET(绝密) | 例外严 重的损害 |
| NATO SECRET(机密) | 严重损害 |
| NATO CONFIDENTIAL(秘密) | 损害北约利益 |
| NATO RESTRICTED(受限) | 对北约不利 |
注意定级的轴心是损害程度,不是「这文件看着重要吗」。企业不必照搬军队名词, 但要照搬这个思路:先定「泄露的代价」,再回填标签。
书里还用了一个历史教训堵住「宁高勿低」的冲动:全公司都标绝密 = 没有标。 安全结构臃肿,目录「让人发现数据」的初衷直接报废;书里脚注引了美国国会的调查结论: 9·11 事件前各情报机构之间过严的密级壁垒,恰恰阻碍了线索共享11。
4. 敏感性:PII 的三个档位
敏感性标签由 DPO 落实,管的是全球各地隐私法规(书里点名 GDPR,欧盟通用数据保护条例) 对个人信息的分级12。书里给的口径13:
非个人数据 → 识别不到任何自然人(例:需求趋势汇总报表)
PII ─ 个人数据 → 私密但不致命(姓名、地址、年龄)
└ 敏感个人数据 → 泄露即伤人(工会会籍、党派、族裔、健康数据)
两个实用点:其一,「敏感性」的边界比直觉模糊——多份非个人数据拼起来可能识别到个人, 书里脚注引了专门讨论「个人信息中的『个人』是什么」的论文14; 其二,这档标签可以自动化:很多目录能自动检测数据里有没有 PII 值,敏感性分类因此是三张标签里 最先能交给机器的一张15。
5. 为什么安全与隐私的高管反而支持目录
这一节是本章真正的「卖点」。按直觉,CISO 和 DPO 应该最反对「人人可见」的目录—— 安全部门的天性是缩小可见面。书里说,恰恰相反16:
- 过去 CISO 和 DPO 的「可见性控制」落在纸面政策上:哪些数据该保密、哪些该保护, 写在制度文件里,没人能对着真实的 IT 版图核对;
- 目录里只有元数据(第 01 章),所以「人人可见」不泄露值;
- 于是两位高管第一次拿到了能对着全公司真实数据执法的操作台:CISO 控机密性、 DPO 控敏感性,直接在 IT 版图上,而不是在政策里17。
判断(我们的,不是书里的): 这一节其实是全书「元数据层」设计的价值证明: 把「值」和「描述」切开,安全与透明就不再是一对矛盾。 能公开的(描述)全力公开, 必须管的(值)整层隔离——这套切法可以推广到目录之外任何「既要开放又要保密」的系统设计。 如果错,会错在: 如果元数据本身就带敏感信息(列名叫「身份证号」、描述写了「薪酬表」), 切分就失效——所以第 01 章那条「元数据也要屏蔽」的警告在这里闭环: 目录的透明度永远以元数据脱敏为前提。
6. 作者的判断与证据
书里当作事实与方法给出的:
- 三分法(内容/机密性/敏感性)与「自由组合」,是作者给数据目录定的操作框架; NATO 四级与 GDPR 的 PII 分级是引用的公开标准;
- 9·11 与国会调查的脚注、Adler 式的文献引用习惯一致,给了可查的出处11。
作者的判断:
- 「自动分类是不难卖的功能」(原文用词近乎炫技:「bedazzling feature」)——经验之谈;
- 「内容分类按域结构建」——直接建立在第 04 章的信息科学域架构上,两章是一体的设计。
判断(我们的,不是书里的): 三张标签里,内容分类是最被低估的一张—— 机密性和敏感性有法规逼着公司做,内容分类没有;但它恰恰是搜索(业务价值)最依赖的一张。 实施时先被逼着做的是后两张,先偷懒不做的是第一张,这正是「目录建完了搜不动」的高发病因。 如果错,会错在: 如果一个目录的内容分类用别的东西替代(比如只靠 AI 生成的摘要), 搜索质量将取决于摘要质量——那是另一条未经本书验证的路。
7. 边界与局限
- 密级名词不可照搬。 NATO 的 COSMIC TOP SECRET 是军事口径;企业该学的是 「按损害定级」的方法,书里没有给企业版密级模板。
- 敏感性识别的自动化有限。 书里说「很多目录能自动检测 PII」,但没讨论误报/漏报的处理, 也没讨论「多份非个人数据拼成个人信息」这类难题怎么自动化(事实上很难)。
- 权限与分类的联动不在试读版。 贴了标签之后「谁能看什么」怎么执行,书里指向 第 5–6 章(访问与观测)——不在。
- 法规差异。 GDPR 是欧洲口径;书里面向「全球化运营」的公司,没有展开各法域的差异。
8. 可带走的
- 「分类」至少三义:内容(是什么)、机密性(多秘密)、敏感性(多个人)——三张标签,独立打分;
- 一份数据完全可以高度机密且毫不敏感——CISO 和 DPO 吵架,通常是在鸡同鸭讲;
- 内容分类的形态是一串域路径代号(如
DA.DeA.RM.DT.Power BI),它是搜索的结构化钩子; - 机密性按损害程度定级,别按「看着重要」;全标绝密等于没标;
- 敏感性按 PII 三档走:非个人 / 个人 / 敏感个人;这张标签最先能自动化;
- 目录让安全与隐私高管从「反对者」变成「用户」:元数据层透明 + 数据值层隔离;
- 元数据的脱敏是「人人可见」的前提——透明度以脱敏为界。
9. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| CISO 与 DPO 对话 | 第 2 章 | text/17-fm-classification.txt:5(搜「highly confidential」) |
| 三种分类 | 第 2 章 | text/17-fm-classification.txt:19(搜「three types of classification」) |
| 自由组合、互不蕴含 | 第 2 章 | text/17-fm-classification.txt:20(搜「combine them as they want」) |
| 内容分类=唯一标签 | 第 2 章 | text/17-fm-classification.txt:21(搜「unique label」) |
代号 DA.DeA.RM.DT.Power BI | 第 2 章 | text/17-fm-classification.txt:27(搜「DA.DeA.RM.DT」) |
| 代号逻辑与自动化回报 | 第 2 章 | text/17-fm-classification.txt:29(搜「distinguishable from each other」) · text/17-fm-classification.txt:38(搜「And the payoff really」) |
| 机密性=多秘密、CISO 定 | 第 2 章 | text/17-fm-classification.txt:40(搜「how secret your data is」) |
| 军队起源与 NATO 四级 | 第 2 章 | text/17-fm-classification.txt:41(搜「originate from military」) · text/17-fm-classification.txt:45(搜「COSMIC」) |
| 按损害定级 | 第 2 章 | text/17-fm-classification.txt:51(搜「level of damage」) |
| 宁高勿低的代价与 9·11 | 第 2 章 | text/17-fm-classification.txt:56(搜「err on the side of caution」) · text/17-fm-classification.txt:59(搜「terror attacks」) |
| SOP/报表/图纸损害阶梯 | 第 2 章 | text/17-fm-classification.txt:71(搜「industrial espionage」) |
| 敏感性=多个人、PII | 第 2 章 | text/17-fm-classification.txt:73(搜「how personal your data is」) |
| PII 三档与 GDPR | 第 2 章 | text/17-fm-classification.txt:79(搜「Nonpersonal data」) · text/17-fm-classification.txt:82(搜「sensitive personal data」) |
| PII 自动检测 | 第 2 章 | text/17-fm-classification.txt:90(搜「holds a value that is PII」) |
| CISO/DPO 支持目录 | 第 2 章 | text/17-fm-classification.txt:92(搜「selling point」) · text/17-fm-classification.txt:98(搜「not just in policies」) |
| 元数据也可能敏感(回顾) | 第 1 章 | text/07-fm-the-core-functionality-of-a-data-catalog.txt:128(搜「also contain sensitive or confidential」) |