聪明实习生测试与实体内核 — 资产侧的第一块地基
这一章讲三件事: 一个思想实验,证明最强的基础模型(在全网文字上练出来的大模型)到了你的数据平台上 和一个聪明的实习生处境完全相同;「实体内核」这个模式怎么给核心业务概念发身份证; 以及一张治理清单——没有它,内核建好也会被日常改动悄悄蚕食。 承上:02 章说资产支柱的入口是实体内核;这一章把它建出来。
1. 顶层全景:从一道测试题到一个模式
聪明实习生测试(它的两项短板) 实体内核(补短板的模式)
┌────────────────────────┐ ┌────────────────────────┐
│ ① 不懂业务词汇 │ → │ 核心档案 + 扩展表 │
│ ② 不懂资产目录 │ → │ 同一永久编号串起全部 │
│ (哪个表可信?谁能问?)│ → │ 治理清单把变更挡在门外 │
└────────────────────────┘ └────────────────────────┘
图说:左边是病,右边是方子。本章 §2 讲病,§3-§4 讲方子,§6 讲防复发。
2. 聪明实习生测试:模型和实习生缺的是同两样
这一节先做一道思想实验。它是全书第二章的发动机,也是「元数据缺口」最直观的呈现。
书请你想象:公司招了一个数据分析师实习生,非常聪明——会一大堆查询语言, 熟悉主流数据库、查询引擎、数据仓库和管道编排(把成百上千个任务 按顺序排好自动跑),可视化也是专家1。 但有两个前提:他不了解你们决策者的业务,也不知道你们有哪些报表、 哪些库、哪些表、怎么拼在一起1。
书问:这个实习生能多大程度上帮上你的决策者?他的答案几乎没有悬念, 因为摆在他面前的是两道过不去的坎2:
- 不懂业务上下文和词汇——公司内部沟通里满是行话,外人听不懂;
- 不懂资产目录——哪些表可信、哪些已经过期没人下架、哪些是某个专家当年 为一次汇报随手搭的(这类低代码小工件从来不受正式的变更管理),没人告诉他3。
没有老手带,实习生的成功率很低——书说得很直白3。
然后是这一章的转折句:这个实习生就是基础模型。大模型读过的语料(拿来喂给机器学的海量文字)是互联网上的公开文字, 不包含你公司内部的数据平台——它对你们的业务行话和数据资产,和实习生一样盲4。 模型写查询语句的能力再强,「查哪张表、那张表的『客户』是什么口径」这件事上, 它和实习生站在同一条起跑线上。
判断(我们的,不是书里的): 这个类比是全书最好用的思考工具—— 后面每个模式都可以拿它验收:「这个做法能让实习生干得更好吗?」能,就对模型也有效, 因为两者缺的是同一类东西:没有写下来的组织内部知识。 如果错,会错在: 如果模型能靠超强的模式匹配从表名和列名里猜出业务含义, 类比就不成立——但 02 章三个「用户」的案例恰好是猜错的实录。