数据平台的 AI 就绪模式 — 全书拆解
30 秒导读: 企业急着把会写会答的 AI 用在自己的数据上,但数据平台过去二十年 是为「人看报表」建的。这本书的判断是:RAG(行话叫检索增强生成:先去你的 资料里把相关内容找出来、再让 AI 照着作答的一种用法)能不能靠谱, 瓶颈不在 AI 这台机器,在数据准备的那一段路上。
书给出的不是理念,是一套模式:实体内核、源头契约、语义(每个词在业务里 是什么意思)分层、管道契约、管道即代码——全部在生产环境验证过。
本组文档是我们重写的完整拆解,八章。读完不 必看原书。 原书是 Early Release(试读版),只出了 3 个正文章;我们的 8 章是把这 3 章 按一条因果链(一步逼出下一步)重新切开的,不是原书一章对我们一章。
1. 先交代清楚:这是谁在什么时候写的
| 作者 | Ravi Vedula(微软副总裁,管着超千人的数据组织)、Gerardo Bodegas Martinez(合作设计总监)、Maruti Chittajallu(IDEAS 产品总监)、Jack Pullikottil(合作架构师,IDEAS 栈的设计负责人)——四人都来自微软 IDEAS,公司内部最大的数据平台 |
| 写作时间 | 2026 年(O'Reilly 出版;书内契约示例的生效日期标到 2025 年 10 月) |
| 成书状态 | Early Release:作者写一章放一章,目前只有第 1-3 章,附「目录未定稿」 |
| 利益相关 | 案例全部来自作者自己运营的平台;书里出现的工具名(Geneva、Cosmos、UDM、ContractDoctor)多为微软内部专名。论证成立与否,和买不买微软产品是两件事,读时分开 |
两件事影响怎么读这本书。第一,作者不是观察者而是当事人——「数百 PB、数万个数据源」 是他们的日常规模,处方带大型平台前提。第二,它是一部没写完的书:第 1 章许诺的模式 清单里,「质量作为检索信号」「策划好的接地样例与活术语表」「SBAC 专章」「企业级 RAG 栈」 都还没有出场(细节见第 4 节)。