六种关键词搜索 — 从一两个词,到诉讼级检索
这一章讲三件事: 六种关键词搜索模式各解决什么信息需求; 其中最重的「区块搜索」怎么分阶段打(本章主走查); 以及为什么书里要把这些「正在过时」的写法完整保留下来。 它是第 07、08 章的实战篇:概念落成手法,公式落成打法。
1. 先看现象:你怎么搜,取决于你要什么
第 07 章说过,信息需求的大小决定搜法。这一章把这句话展开成六种具体模式。 书里先给了一个总表1,我们把它翻译成带例子的一览:
| 模式 | 形态 | 例子(原书场景) | 查准 | 查全 |
|---|---|---|---|---|
| 基本简单搜索 | 一两个词 | 瑞典销售搜「sales」 | 高 | 低 |
| 详细简单搜索 | 简单组合式 | 白蜡树学名+管家名 | 高 | 低 |
| 灵活简单搜索 | 截断词 | *wood* 捞所有木头词 | 低 | 高 |
| 区间搜索 | 两值夹一段 | 某两年的照片 | 高 | 低 |
| 区块搜索 | 词块拼装 | 律师尽调整堆木种词 | 低 | 高 |
| 陈述搜索 | 大杂烩陈述 | 找无主的 Tableau 报表 | 高 | 低 |
注意这章讲的全是关键词搜索(一个词一个词拼出查询式的老式搜索,行话叫 keyword search)。 书里明说:它把第一版的所有模式原样保留,就是为了让你看清对话式搜索正在替换什么2—— 这些写法看着老,背后的逻辑正是你将来「精确地对话」的本钱。
2. 简单端:三种简单搜索
基本简单搜索:顶部命中即一切
一两个日常词打进去,要的是排在最顶上的那一条——书里的标准很苛刻: 「顶部那一击,单独看,必须是完美的查准命中;顶 上以下的一切都不重要」3。 H&M 的例子:驻瑞典的销售代表搜「sales」,指望第一条就是他辖区最新的销售报表4。
为什么敢这么期待?因为第 08 章那六套幕后机制都在为他服务:他知道你是谁、 你常搜什么、你上次点了什么。建在知识图谱上的目录,简单搜索尤其强—— 书里直接拿 Google 的知识图谱作类比5。
书里还提醒了一个营销陷阱:供应商演示时最爱演这种搜索——它最好看, 但它不可能满足所有信息需求;其他模式难学难演,所以从不被宣传6。
详细简单搜索:慢,但每一发都中
当你明确知道要什么、而且能准确说出它的名字时,用这种。H&M 的词表里, 木头都带拉丁学名。要找「管家是 John Miller 的白蜡树(ASH,学名 Fraxinus)数据」7:
GlobalGlossary:Ash Fraxinus AND DataSteward:John Miller
慢在哪?你得先查清词表里的准确写法、管家的准确拼写,再小心拼起来—— 所以它慢;准在哪?每个条件都是精确值,回来的每一条都对8。
这种写法书里自己都承认「可能已经显得老派」——对话版已经出现:你说人话, AI 负责把布尔运算符放对位置、把语义意图抓对9。
灵活简单搜索:故意放宽,捞回来再说
不知道资产怎么描述、只知道大概主题时,反过来玩:牺牲查准,换取查全。
通讯部想知道公司用过哪些木头(写新闻稿用),听说在 CSV(逗号分隔的表格文件)里,于是搜
「CSV + wood 的所有变体」——用两侧截断(*wood*)把 wooden floor、beautiful wood、woods
统统捞进来10。
书里给这种模式留了个耐人寻味的判词:即使对话式 AI 也能做,这种搜索会保持关键词形态—— 因为你要的本来就是「一整个结果集」,不是一条答案11。
3. 复杂端:三种复杂搜索
区间搜索:在两个值之间找
找「某个时间段/某个编号段」的东西。H&M 的项目组要 2012 年 11 月到 2018 年 2 月之间的 心材照片12:
项目编号版: > RES.100.7.1003 AND < RES.100.7.1837
日期版: Pictures of heartwood AND (< 01.31.2018 AND > 10.31.2012)
两个值夹出一段,高查准低查全——和「详细简单」同档,只是约束从「等于」换成了「之间」。
区块搜索(主走查):为诉讼而搜
现在走本章的主走查。场景:一个不满的客户起诉 H&M——他家的房子外墙开裂, 他主张造房的木头不够结实13。H&M 的律师要开始尽职调查:把公司里所有关于 「各类木头在自己建筑中的坚固性」的报告和测试数据全部找齐—— 一条都不能漏,漏一条就是庭审时的哑弹14。
律师的打法,分三步:
第一步:拆主题成词块。 「木头的种类」是一个块(松 Pine、白蜡 Ash、山毛榉 Beech、 橡 Oak……但排除椴木 Linden——那是另一个用途的木头),「坚固性/耐久性」是另一个块。 书里给出的真实查询式长这样(原文截取)15:
(DomainTerm:((Pine OR Ash OR Beech OR Oak OR Wood) NOT Linden)
OR FreeTerm:Wood OR GlobalTerm:(Pine ...
读法:域词表里的任一木种词、或自由词表里的 wood、或全局词表里的木种词—— 三条路通向「木头块」;之后整个木头块还要并且匹配坚固性块。
第二步:接受它的代价。 这种拼法追求的是把每一个潜在相关资产都捞上来—— 最大化查全率,代价是查准率;律师们知道自己将要精读一大堆结果(第 08 章的 「精读」在这里上场)16。
第三步:多阶段迭代——搜、看命中、调词、再搜。 书里指出,区块搜索(LIS 界的老方法)通常是好几个阶段的: 先搜一轮,分析命中,加词、删词、再搜——直到把「需要的数据」彻底翻译成 「目录的语言和结构」17。
它为什么必须靠人工词标? 第 08 章的齐普夫定律在这里兑现: 只靠机器爬来的技术元数据,区块搜索成功率很低——你需要人来打的词表术语, 不是机器生成的,资产才能彼此分开18。第 05 章打的那些标签、第 06 章贴的内容代号, 全是为这一刻准备的。书里的判词:在法律、合规与复杂创新检索里,区块搜索是成败手19。
辅助工具:search builder。 不是所有律师都学过查询语言。高级搜索里的 search builder(搜索构建器)把长查询变成点选式面板——灰色括号默认可选,点一下激活20。 书里补了一句冷知识:这类构建器是 PubMed(医学文献检索库)的标准件,很多目录也有。
陈述搜索:大杂烩,但常用
最后一种最没有诗意:把人、系统、域、日期一股脑拼进一条长陈述。最常见的用途是 管理目录本身。H&M 数据发现团队的例题:「找出 Legal、Finance、IT 三个部门里, 2022 年 1 月 1 日之后创建、没有资产负责人的 Tableau 报表」—— 拿这份名单去找各域管家,把缺的负责人补上21。 (第 03 章的角色梯在这里接上:负责人署名不是荣誉,是可被审计的缺口。)