跳到主要内容

找数据,不是查数据 — 信息需求、偶得与「真相的感觉」

这一章讲三件事: 「找」与「查」为什么是两门手艺、各用什么语言; 图书馆员的一门老手艺(信息需求)怎么决定你的搜法;以及两个新词—— 偶得与提示主义——为什么在 AI 时代突然变得要紧。 组织篇到此收官:从这里起,全书转入「怎么搜」。

1. 先看现象:两个长得几乎一样的问题

  • 问题一:「上周六晚上,多少人看了我们的网站?」——这是一个有答案的数:1340 人。
  • 问题二:「哪里有关于网站流量的数据?」——答案不是数,是一个位置:哪张表、在哪个系统、谁负责。

两个问题都叫「搜索」,但它们是两种劳动。书里把第一种叫在数据里搜(searching in data), 第二种叫为数据而搜(searching for data),并且把它定为「与目录打交道时唯一必须想明白的事」1。 更扎心的是顺序问题:数据发现始于发现「有这么一份数据」,而不是它内容是什么2—— 找不到源,再好的分析手艺都无处施展。

日常里「为数据而搜」的真实形态往往很难看:找人打听、翻聊天记录、靠脑子里的印象碰运气。 书里管这叫顺手的、不成体系的搜法,与之相对的才是结构化的、在专门工具(目录)里进行的搜法3

2. 主走查:两个问题,两条完整的路

把两个问题各走到底,看得更清楚。

问题一的路(在数据里查):

「上周六晚多少人看了网站?」
↓ 翻译成查询语句(SQL——结构化查询语言,对数据库发问的通用语言)
↓ 在数据库管理系统里执行
1340(答案是一个值,劳动结束)

这条路用的语言叫 DQL(数据库查询语言):你能组合出极复杂的语句、对海量数据做精细计算—— 数据科学这门行当,就是从「在数据里搜」里长出来的4

问题二的路(为数据而找):

「哪里有关于网站流量的数据?」
↓ 信息需求:「几个好东西」(不是全部,也不是唯一)
↓ 第一次尝试:「网站」→ 命中太多,多数与流量无关(查全率高、查准率低)
↓ 收窄:「网站 流量 分析」→ 命中变少,开始有对的东西
↓ 借助词表:挂过「流量分析」术语的资产浮上来
答案是一个位置:某张访问日志表 · 在数据平台 · 负责人王明
↓ (从这里开始,才轮到问题一那条路:进数据里查)

第二步以后的具体搜索式是我们为演示编的,不是原书例句;但「搜了改、改了搜的多步长过程」 是书里的原话主张,第 4 节展开5

两条路的差别可以压成一张表:

在数据里查为数据而找
你要的答案一个值一个位置
用的语言DQL(如 SQL)IRQL(信息检索查询语言)
作用的对象源数据库(装着数据)参考数据库(装着数据的描述)
谁研究透了它计算机科学、数据科学图书馆与信息科学

3. 两套语言与四种参考数据库

数据管理文献的一个尴尬

「在数据里查」的语言汗牛充栋;「为数据而找」呢?书里做了一次挖苦式核查: 数据管理的权威手册 DAMA-DMBOK 里,关于「数据目录怎么支持搜索」 全书只有一句话——「元数据库必须有支持检索功能的前端应用」6。 一句话,没有功能,没有技术。这就是本书要用一整章(乃至第三章全书)补空白的原因。

信息科学早就把答案备好了

图书馆与信息科学(LIS)研究「怎么找到资料」有几百年。它给出一对书里的关键概念7:

  • 源数据库:装数据本身——查它,答案直接到手,不必去别处;
  • 参考数据库:装数据的描述,它的任务是把你领到源——书里引信息检索教科书的话: 「参考数据库引领用户到信息源;源数据库无需用户另找别处即给出答案」8

LIS 传统上有三种参考数据库:书目数据库(某主题有哪些书)、馆藏数据库(图书馆收藏了哪些书)、 引荐数据库(某主题有哪些人、公司、技术)9。作者在这里做了一个全书式的动作: 给这个清单加上第四种——数据目录:一家企业数据的收藏10

这一步落定,目录的本质就清楚了:目录是参考数据库,所以在目录里的搜索只能用 IRQL, 不能用 DQL——你不是在数据里,你是在描述里11。IRQL 这套语言由图书馆员、档案员、 信息科学家开发,绝大多数数据人从未学过——这就是为什么「搜目录」要专门学、专门讲。

4. 信息需求:先想清楚你要多大的一网鱼

图书馆员的超级能力

数据科学家擅长「在数据里搜」;但「为数据而搜」恰好用不上那套本事。 书里把对照给得很直白:数据科学家的超能力在数据里,图书馆员的超能力在数据外—— 馆员的看家本领,是先判断「信息需求」,再决定怎么搜12

信息需求(information need)这个词 1962 年就由 Robert S. Taylor 提出了: 我们向参考数据库提问的方式,取决于我们到底想要什么13。 书里给了四档14:

你要的是行话搜索该朝着什么目标调
全部everything查全率(宁可捞进一堆噪声)
几个好东西a few good things二选一:较高的查全或较高的查准
唯一对的那个the sole right thing查准率(宁缺毋滥)
之前用过的那个a thing you need again查准率,但难度更低

(查全率/查准率的精确定义与数学在第 08 章专讲;这里只需要记住: 先定需求大小,再定搜法——顺序反了,搜索必然白费。)

这是一门慢手艺

书里特意给「一搜即中」的幻想泼了冷水:为数据而搜是一个多步长过程—— 把需求翻译成系统的语言、加词、删词、改词,一遍遍逼近;「别不耐烦」—— Google 式的简单搜索让你以为一切搜索都该一步到位,那是简单搜索在骗你15。 书里还给了个比方:为数据而搜像开车——有时是下楼取个快递,有时是盘山公路, 有时到一站才发现还得去下一站16

光谱,以及 AI 改掉了什么

书里把从简单到复杂的搜法排成一条搜索光谱:最易端是一两个词的简单搜索, 最难端是查询的写法与含义都得自己把控的高级查询17。AI 从两头改它:

  • 易端增强:你用自然语言提问,系统在幕后自动翻成 IRQL——你看不见,也不再需要会写18;
  • 难端易化:「AI 分析员」把你的自然语言翻成 SQL 去数据里查,再把结果翻回人话甚至仪表盘19

注意方向:AI 压平的是操作难度,不是那对概念——「找」与「查」的差别依然在, 只是两种语言都开始由机器代笔。

5. 偶得,和它的邪孪生

serendipity:找到你没在找的好东西

偶得(serendipity)就是「撞见了你本来没找、但正需要的东西」。 书里给的例子是 Google 的「手气不错」按钮:输入关键词,它直接把你带到第一条命中—— 可能正中,也可能把你引上一条完全不同的路,让你一路捡到别的东西20

书里主张目录应当刻意经营偶得——它是用户黏性的发动机:「像磁力一样, 偶得越强,越多用户被拉进目录,产生的价值越大」21。 甚至给了一个公式(源自丹麦科普论坛,书里注明是概念性而非严格数学)22:

偶得 = 洞察 + 经验 + 运气 + 巧合

四个部件都要照顾:词表和描述要贴着用户的洞察(他们知道什么)写; 搜索结果要照顾经验(同事身边耳濡目染知道的事——比如 HR 的人听 R&D 同事念叨过某个实验); 运气巧合要靠机制——书里区分得很细:运气是「不确定行不行的查询碰巧返回了好东西」, 巧合是「撞到了搜索范围之外的东西」,两者不同,都可设计(比如让目录记住你的搜索历史, 据此多给一些可能相关的结果)23

zemblanity:撞见你绝不想看的坏东西

偶得有个邪孪生兄弟:zemblanity——撞见你没在找的坏东西。社交媒体上到处是它; 目录里它长这样:你翻资产页的评论,撞见一条对你或同事的刻薄误读24。 书里的叮嘱很短:把 zemblanity 挡在目录外面,不计代价——协作平台上的攻击性评论, 毁掉的是整个「人人可见」的信任基础。

6. promptism:AI 时代的搜索素养

本章最后一个概念是全书最年轻的:作者引入 Sune Selbæk-Reitz 2026 年提出的 promptism(提示主义)——注意,这是一个刚被造出来、尚未成为学界公认术语的词, 书里特意让它与「信息需求」「偶得」这些老概念并列25。它的定义26:

「不加批判地相信:向 AI 提一个措辞得当的问题,就会得到可靠、客观的答案; 把机器生成的回答当作真相,而不审查其来源、语境与意图。常植根于对『数据中立』 和『机器权威』的错误信任——是解释力向便利性的悄然缴械。」

支撑它的是 Yann LeCun 的一个观察:我们的眼睛必须学会不再把机器生成的、 像人类表达的东西当成人类表达——「我们是最后一代这样看世界的人」27

落到搜索上,书里的警告是:对话式搜索指向的不是真相,是「真相的感觉」28。 一个措辞漂亮的提问,得到的可能是一段流畅的、自信的、错的总结。 所以书里反复说:学会那些「老式」的关键词搜索(第 09 章),不是为了怀旧, 是为了知道对话背后发生了什么——这样你才能「精确地提示」29

判断(我们的,不是书里的): 提示主义这条,是本书对 AI 检索类工具最值得推广到书外的一句警告, 而且它和第 02 章「用 AI」的主张并不矛盾——书里拥抱自然语言搜索,同时要求使用者 保留「幕后发生了什么」的心智模型。工具可以代笔,不能代想。 如果错,会错在: 如果对话式搜索的答案后来普遍带引用与溯源(答案可一键回核到源), 「真相的感觉」问题会被大幅缓解——届时提示主义的分量就从「素养警告」降为「使用须知」。

7. 作者的判断与证据

书里给出处的:

  • 信息需求(Taylor 1962)、四种需求大小(引 Rosenfeld 的信息架构)、参考数据库三分法 (引 Chowdhury 的信息检索教科书)、偶得的 Merton & Barber 社会学研究——脚注俱全13;
  • DAMA-DMBOK「只有一句话」的核查,是可复核的文献批评6

作者的立场:

  • 「数据目录是第四种参考数据库」——作者自创的延伸,不是信息科学的既有分类;
  • 引入 promptism 的决定——作者自己说明:这是一个 2026 年的新概念, 他「特意让它与成熟的科学概念并列」25,这是立场声明,不是学界共识。

8. 边界与局限

  • 「在数据里搜」的书里不讲。 SQL 怎么写、数据科学怎么做,书里明确划出边界: 那是另一门学问,本书只管「找到门」30
  • IRQL 的具体语法(各家查询的写法)要到供应商文档里学。 本章讲的是「有这么一套语言」,不是教学。
  • 偶得公式是概念性的,四个部件怎么折成数字,书里没有答案(作者也只当概念用)。
  • promptism 的文献基础薄(一本书、一位作者),把它当思考工具,别当定论引用。

9. 可带走的

  1. 找数据 ≠ 查数据:前者要位置,后者要值;顺序是先找后查,次序不能颠倒;
  2. 目录是第四种参考数据库——装描述、指路;在它里面用的是 IRQL 那一族语言,不是 SQL;
  3. 数据管理权威手册对「为数据而搜」只有一句话——这块空白正是目录的价值空间;
  4. 搜之前先定信息需求的大小:全部/几个好的/唯一对的/再用一次——它决定你冲查全还是查准;
  5. 为数据而搜是多步长过程,一遍遍改词逼近;一步到位的期待来自简单搜索的错觉;
  6. 偶得值得经营(洞察+经验+运气+巧合),zemblanity 必须清零;
  7. 对话式搜索给你「真相的感觉」——提示主义是素养问题,工具代笔不代想;
  8. 学老式关键词搜索不是怀旧,是为了看懂对话背后被机器代写的那一步。

10. 原文地图

主题原书章原文位置
找 vs 查的总区分第 3 章text/19-fm-concepts.txt:19(搜「not in data」)
1340 例与位置例第 3 章text/19-fm-concepts.txt:23(搜「1340」) · text/19-fm-concepts.txt:27(搜「data location」)
先找后查、相辅相成第 3 章text/19-fm-concepts.txt:29(搜「hand in hand」)
顺手的 vs 结构化的搜法第 1 章text/08-fm-data-discovery.txt:7(搜「haphazard conversations」)
发现「有这数据」在先第 1 章text/08-fm-data-discovery.txt:11(搜「exists at all」)
DQL 与数据科学的源头第 3 章text/19-fm-concepts.txt:31(搜「database query language」)
SQL 与 BI 例第 3 章text/19-fm-concepts.txt:41(搜「Structured Query Language」)
DAMA 只有一句话第 3 章text/19-fm-concepts.txt:58(搜「And that's it」)
LIS 与 IRQL第 3 章text/19-fm-concepts.txt:64(搜「information retrieval query languages」)
DQL 查数据、IRQL 找数据第 3 章text/19-fm-concepts.txt:70(搜「you use DQLs to search in data」)
源数据库 vs 参考数据库第 3 章text/19-fm-concepts.txt:73(搜「Source databases」) · text/19-fm-concepts.txt:84(搜「lead the users to the source」)
LIS 三种参考数据库第 3 章text/19-fm-concepts.txt:97(搜「Bibliographic databases」)
第四种:数据目录第 3 章text/19-fm-concepts.txt:101(搜「fourth reference database」) · text/19-fm-concepts.txt:107(搜「collection of data in an enterprise」)
搜索光谱第 3 章text/19-fm-concepts.txt:116(搜「spectrum of search」)
自然语言幕后翻成 IRQL第 3 章text/19-fm-concepts.txt:124(搜「behind the scenes」)
AI 分析员 NL↔SQL第 3 章text/19-fm-concepts.txt:129(搜「AI Analysts」)
信息需求与 Taylor 1962第 3 章text/19-fm-concepts.txt:145(搜「information need determines」)
四种需求大小第 3 章text/19-fm-concepts.txt:153(搜「sole right thing」)
查全/查准的取舍预告第 3 章text/19-fm-concepts.txt:162(搜「high recall at the expense」)
多步长过程、别不耐烦第 3 章text/19-fm-concepts.txt:171(搜「don't get impatient」) · text/19-fm-concepts.txt:179(搜「way more subtle」)
开车比方第 3 章text/19-fm-concepts.txt:180(搜「driving a car」)
偶得与「手气不错」第 3 章text/19-fm-concepts.txt:197(搜「Feeling Lucky」)
偶得=磁力第 3 章text/19-fm-concepts.txt:212(搜「magnetic force」)
偶得公式第 3 章text/19-fm-concepts.txt:216(搜「experience + luck」)
运气≠巧合、搜索史第 3 章text/19-fm-concepts.txt:235(搜「luck is not the same as coincidence」) · text/19-fm-concepts.txt:243(搜「search history」)
zemblanity第 3 章text/19-fm-concepts.txt:246(搜「zemblanity」)
LeCun 与眼睛第 3 章text/19-fm-concepts.txt:263(搜「LeCun」)
promptism 定义第 3 章text/20-fm-features-search-features-in-a-data-catalog.txt:10(搜「uncritical belief」)
「真相的感觉」第 3 章text/20-fm-features-search-features-in-a-data-catalog.txt:17(搜「feeling of truth」)
promptism 与并列理由第 3 章text/20-fm-features-search-features-in-a-data-catalog.txt:3(搜「promptism」)

Footnotes

  1. 出处:「Concepts」第 19 段(text/19-fm-concepts.txt:19,搜「searching for data, not in data」)。

  2. 出处:「Data Discovery」第 11 段(text/08-fm-data-discovery.txt:11,搜「exists at all」)。

  3. 出处:「Data Discovery」第 7 段(text/08-fm-data-discovery.txt:7,搜「haphazard conversations」)。

  4. 出处:「Concepts」第 35 段(text/19-fm-concepts.txt:35,搜「data science has emerged」)。

  5. 出处:「Concepts」第 177 段(text/19-fm-concepts.txt:177,搜「multiple-step long search」)。

  6. 出处:「Concepts」第 55 段(text/19-fm-concepts.txt:55,搜「front-end application that supports」)与第 58 段(text/19-fm-concepts.txt:58,搜「And that's it」)。引文出自 DAMA-DMBOK 第 440 页,书脚注注明数据目录被归入「元数据库」。 2

  7. 出处:「Concepts」第 71 段(text/19-fm-concepts.txt:71,搜「two kinds of databases」)。

  8. 出处:「Concepts」第 84 段(text/19-fm-concepts.txt:84,搜「lead the users to the source」)。引 G. G. Chowdhury《Introduction to Modern Information Retrieval》第 17 页。

  9. 出处:「Concepts」第 94 段(text/19-fm-concepts.txt:94,搜「three kinds of reference databases」)。

  10. 出处:「Concepts」第 101 段(text/19-fm-concepts.txt:101,搜「fourth reference database」)与第 107 段(text/19-fm-concepts.txt:107,搜「collection of data in an enterprise」)。

  11. 出处:「Concepts」第 109 段(text/19-fm-concepts.txt:109,搜「Instead, you can use IRQL」)。

  12. 出处:「Concepts」第 136 段(text/19-fm-concepts.txt:136,搜「superpower」)与第 145 段(text/19-fm-concepts.txt:145,搜「information need determines」)。

  13. 出处:「Concepts」第 146 段(text/19-fm-concepts.txt:146,搜「coined as a term in 1962」)。四档分组书里注明引自 Rosenfeld 等《Information Architecture》(O'Reilly, 2015) 第 45 页(脚注见第 192 段,搜「grouped differently」)。 2

  14. 出处:「Concepts」第 139 段(text/19-fm-concepts.txt:139,搜「Everything」)至第 168 段(搜「thing you need again」)。

  15. 出处:「Concepts」第 171 段(text/19-fm-concepts.txt:171,搜「don't get impatient」)与第 179 段(text/19-fm-concepts.txt:179,搜「way more subtle」)。

  16. 出处:「Concepts」第 180 段(text/19-fm-concepts.txt:180,搜「driving a car」)。

  17. 出处:「Concepts」第 116 段(text/19-fm-concepts.txt:116,搜「spectrum of search」)。

  18. 出处:「Concepts」第 123 段(text/19-fm-concepts.txt:123,搜「natural language」)与第 124 段(text/19-fm-concepts.txt:124,搜「behind the scenes」)。

  19. 出处:「Concepts」第 129 段(text/19-fm-concepts.txt:129,搜「AI Analysts」)。

  20. 出处:「Concepts」第 197 段(text/19-fm-concepts.txt:197,搜「Feeling Lucky」)。

  21. 出处:「Concepts」第 212 段(text/19-fm-concepts.txt:212,搜「magnetic force」)。

  22. 出处:「Concepts」第 216 段(text/19-fm-concepts.txt:216,搜「experience + luck」)。公式出自丹麦科普网站 Videnskab.dk,书脚注强调这是概念性的理解方式,并给 Merton & Barber 的专著作延伸阅读。

  23. 出处:「Concepts」第 235 段(text/19-fm-concepts.txt:235,搜「luck is not the same as coincidence」)与第 243 段(text/19-fm-concepts.txt:243,搜「search history」)。

  24. 出处:「Concepts」第 246 段(text/19-fm-concepts.txt:246,搜「zemblanity」)与第 254 段(text/19-fm-concepts.txt:254,搜「vicious, unjust」)。

  25. 出处:「Features: Search Features in a Data Catalog」第 3 段(text/20-fm-features-search-features-in-a-data-catalog.txt:3,搜「promptism」):作者说明特意将此新概念与成熟科学概念并列。 2

  26. 出处:「Features: Search Features in a Data Catalog」第 10 段(text/20-fm-features-search-features-in-a-data-catalog.txt:10,搜「uncritical belief」)。定义出自 Selbæk-Reitz《Promptism》(Technics Publications, 2026) 第 4 页,书脚注给全。

  27. 出处:「Concepts」第 263 段(text/19-fm-concepts.txt:263,搜「LeCun」)。

  28. 出处:「Features: Search Features in a Data Catalog」第 17 段(text/20-fm-features-search-features-in-a-data-catalog.txt:17,搜「feeling of truth」)。

  29. 出处:「Keyword Search and Conversational AI Search」第 122 段(text/24-fm-keyword-search-and-conversational-ai-search.txt:122,搜「prompt with precision」)。

  30. 出处:「Concepts」第 24 段(text/08-fm-data-discovery.txt:24,搜「completely unrelated」):在数据里搜「刁钻而微妙」,整个数据科学因此而生——本书不展开。