五个行业:凭什么捞得准,以及两个例外
这一章讲三件事: 那套「凭什么捞得准」的骨架长什么样; 三个行业各自怎么用它;以及为什么另外两个行业根本不用它。
它在全书链条里的位置: 第 06 章给了「它能去外面取」这个能力, 这一章回答那个能力真正的难点; 第 14 章会把同一套骨架在一家电商的客服里再走一遍。
1. 问题不在「能不能取」,在「凭什么取那几页」
这一节从第 06 章的结论起步,不重讲那一章。
第 06 章说过:它能临时去外面取东西,取回来的内容被拼进这一轮的提问里,它照着答。
那一章没讲的是:公网可以搜,可企业库有几万页。 一位律师十年的案卷、一个城市的公积金政策全文、一个岗位十年的面试记录—— 这些东西不可能整个塞进一轮提问里(第 01 章说过,它能看见的只有这一轮的文字)。
所以真问题只有一句:拿什么决定取哪几页?
这一章的五个行业里,有三个共用同一套回答:法律、政务、人力资源。 另外两个是例外:
| 行业 | 用不用那套骨架 | 靠什么 |
|---|---|---|
| 法律 | 用 | 把案卷库变成可以按「像不像」捞的东西 |
| 政务 | 用,而且还多一步训练 | 政策文件 + 高频问答 |
| 人力资源 | 用 | 简历里的每一段都事先记好了位置 |
| 教育 | 不用 | 给它一个身份(苏格拉底导师、辩论对手、孔乙己) |
| 数字游民 / 个人 IP | 不用 | 按平台口吻改写 |
先讲那套骨架,再讲三个用它的行业,最后讲两个例外——例外恰恰是用来看清骨架边界的。
2. 骨架:四步,每一步都有名字
这一节把那套骨架讲透,后面三节都是它的实例。
第一步:把资料切成小块。 一份三十页的政策文件不能整个用, 要切成一段一段——这个动作叫分块。为什么要切?因为你一次只捞得动几块, 块太大就把不相干的东西一起捞上来了。
第二步:把每一块变成一串数。 这件事第 01 章提过一次 (「它拿到你的话之后,第一件事是把这句话变成一串数」)。 这串数叫向量——就是一 串按固定顺序排好的数字,比如 0.12、-0.87、0.33…… 几百上千个,合起来代表这一块文字。
这串数是怎么算出来的? 书里给的名字是嵌入—— 就是「把一段文字换算成一串数」的那套做法; 书里说它能把关键词和搜索指令转换成这样的一串数1。
第三步:按「像不像」捞。 两块文字如果意思接近,它们那两串数就靠得近。 于是「找最相关的几块」变成了一道算数题:算哪几串数离你的问题最近。 注意「像不像」比的是意思,不是字面——这种按意思找的做法叫语义匹配, 所以你问「衣服能不能洗」也能捞到写着「机洗须知」的那一段。
第四步:把捞回来的几块拼进提问,交给它照着答。 这一步就是第 06 章的结论,不再重讲。
这四步合起来今天有个通行的名字,叫检索增强(英文缩写 RAG)—— 「增强」指的就是拿捞回来的资料把你的提问补壮实。 书里没有用这个词,但你出门一定会撞见它。
企业库(几万页)
│
① 分块 ───────→ 一段一段
│
② 嵌入 ───────→ 每段一串数,存起来
│
你的问题 ──② 嵌入──→ 也变成一串数
│
③ 比一比 ─────→ 捞出最近的 6 段
│
④ 拼进提问 ───→ 交给它照着答
3. 法律:找得准之前,先要 4000 小时
这一节讲第一个用骨架的行业,它把「准」这件事的成本摆了出来。
书里讲的是一家法律科技公司做的助手2。这一节有两个数字必须记住:
这三个数各配一个参照物再读一遍:
| 数 | 拿什么比 |
|---|---|
| 4000 小时 | 一个人全职工作一年约 2000 小时——相当于两个人干满一整年,只为了把「它会不会编」压下去 |
| 30000 多个法律问题 | 拿上一行除一下:4000 小时摊到 3 万个问题上,平均每个问题只有 8 分钟——这不是逐题精雕,是流水线上的快速过一遍 |
| 10000 多家律所 | 和第 14 章那个跨境电商行业是同一个量级:那里有内容生成和客服需求的卖家、独立站和渠道商共 2.54 万家 |
(表里的换算和跨章对照都是我们补的,不在书里。)
书里点破了这一行为什么容不得编造: 律师要出具法律意见书、尽职调查报告、律师工作报告、专项核查意见, 而律师应当严格依法履行职责,保证所出具意见的真实性、合法性5。
书里给的那套六步流程,就是第 2 节骨架的实例6:
| 第几步 | 干什么 |
|---|---|
| 1 收集 | 案件名称、类型、案情描述、当事人信息、法律问题、进展情况 |
| 2 清洗 | 去重、格式化、标准化 |
| 3 嵌入 | 把案件数据变成一串串数,保存在本地 |
| 4 拼提问 | 律师输入查询之后,先按「像不像」在本地捞到具体文本,再和问题一起拼成提问 |
| 5 请求 | 把拼好的提问发给云端 |
| 6 用 | 从数据集中获取相似案例和建议 |
第 3 步那句「保存在本地」是这一节的隐藏重点: 书里在痛点里专门写了内容安全——当事人的聊天记录、案件细节这类信息, 必须严格遵守保密协议,妥善私有化并在严格监督下使用和销毁7。 这就是为什么这一行不能直接把资料发给公网服务:数据不能出门。
4. 政务:两步走,而且第二步是训练(主走查)
这一节是本章的主走查,而且要说清一件容易被读漏的事:政务这一段不止检索。
书里给的是三个步骤,请注意第二步8:
| 步骤 | 干什么 |
|---|---|
| 步骤一:数据准备 | 收集政策解读原文;提取市民问得最多的问题及回答,构建标准问答对;清洗去重;用嵌入把处理后的文本编码成一串串数 |
| 步骤二:模型训练 | 根据训练数据和目标,选合适的模型和参数,拿公积金提取领域的相关数据训练;通过多轮训练一步步改进,提高准确率和可用性 |
| 步骤三:系统集成 | 用高频问答测试集测;做界面;集成到平台;上线后持续收集反馈、一轮轮改 |
所以政务这一段是「嵌入 + 再训一遍」两条腿走路,不是纯检索。 (「再训一遍」这个动作叫什么,第 04 章第 2 节讲过:微调。)
现在走主走查。输入:王伯要提公积金。
下面每一步的内容全部来自书里,连「过了一周」这个时间也是原文里的; 我们只是把散在对话里的六个来回排成了一条时间线,没有补任何一个数。
| 第几步 | 王伯做了什么 | 它回了什么 / 发生了什么 |
|---|---|---|
| 1 | 问:「我是在 A 市工作的 B 市人,刚在 C 市买房,能提取在 A 市缴纳的公积金吗?」9 | 「只要您在 A 市缴纳过住房公积金,就可以在 A 市提取,与您的户籍所在地或现居住地无关」9 |
| 2 | 问:那怎么提取呢? | 给出四步:登录官网或小程序 → 准备身份证、购房合同、房屋产权证明 → 在线上传并选择提取方式、填银行卡 → 后台审核10 |
| 3 | 照着做,上传材料 | 过了一周,提取要求被拒绝了11 |
| 4 | 回来问:为什么审核不通过? | 「您最近一次公积金提取审核不通过的原因是购房合同不完整,请您检查上传购房合同的完整性」12 |
| 5 | 下载之前上传的扫描件检查 | 发现遗漏了最后的签字盖章页13 |
| 6 | 重新扫描,再次提交 | 成功提取13 |
看第 4 步:这一步才是这条走查真正的价值。 它回答的不是政策条文,是「你这一单为什么被拒」—— 这说明它接的不只是政策文件,还接了这个人的办理状态。 书里没有交代这条状态是从哪儿接进来的, 这是这一节最大的空白。
这套东西上线之后的效果,书里只给了一句:公积金提取的人工工单量下降不少14—— 没有具体数字。
5. 人力资源:语义索引,以及那个被删掉的问题
这一节讲第三个用骨架的行业,并给出这一章最诚实的一个细节。
书里的工具是一个对话式的文档工具,它的做法书里写在注里: 把 PDF 文件拆开读、为文件中每个段落创建语义索引、 再调用底层那台机器去理解用户的意图15—— 「语义索引」就是第 2 节那三步的另一种叫法: 索引就是「事先建好的一张查找表」,让你不必每次从头翻。
招聘这条流程走下来是四步16:
| 第几步 | 招聘负责人做什么 | 它给出什么 |
|---|---|---|
| 1 | 先问「这个岗位有竞争力的薪资水平是怎样的」 | 给了美国和中国两个区间17 |
| 2 | 上传历史岗位的目标与总结材料,让它写岗位描述 | 一份含 7 条工作职责、4 条任职要求的描述18 |
| 3 | 上传候选人简历,问「能胜任吗」「有哪些相关经历」「是否具备市场洞察力」 | 逐条从简历里找出对应证据;关于「能不能胜任」,它的回答是「需要面试官进行综合评估」19 |
| 4 | 让它生成针对性的面试问题 | 5 个问题 |
第 4 步之后发生的事,是这一章最值得记的一句: 它生成的第 4 个问题是一个技术问题,并不适合提供给候选人面试, 招聘负责人删掉了它,才把剩下的问题交给业务面试官20。
书里由此下了一句判断:虽然它是优秀的个人工作助手, 但当前还不能完全替代初筛环节,需要人根据专业知识在各个环节仔细把关21。
用第 12 章的尺子看:这一整段都还在副驾。 而书里在这一节最后一段提出的「把流程固化下来、快速复制到多种岗位」22, 才是往代驾走的那一步。
6. 第一个例外:教育那一段不检索
这一节讲那个反过来的行业,它正好用来看清骨架的边界。
教育那一段自始至终没有出现过「捞资料」这件事。 它靠的是另外三样东西:
第一样:给它一个身份。 书里的原文提示是: 「你是一位以苏格拉底式启发进行回应的导师。你从不直接给学生答案, 但始终努力提出正确的问题,帮助他们学会独立思考。」23
效果是可以核对的: 书里拿第 11 章那道「北京有多少井盖」当题目, 学生连答三次「我不知道啊」「我看见马路上有」「我怎么知道呢」, 而它始终没有给答案,一直在反问; 书里的核对结论是:它几乎全程做到了不直接给答案,唯一的一次例外是提供了北京市总面积24。
第二样:让它当陪练。 学生选辩题(「人工智能对于人类弊大于利」)和立场(反方), 它站正方,先立四个论点,再针对学生的论点逐条反驳25。
第三样:让它演一个人。 学生选了孔乙己,它就用那个口吻答话—— 从鲁迅那篇小说区区两千五百字里,它学到了这个人物的精髓26。
为什么这一段不需要骨架? 因为教育要的不是「准确的资料」,是「合适的提问、合适的对手、合适的口吻」。 要资料的场景才需要捞;要陪伴的场景不需要。
但书里也点了它的边界: 苏格拉底那套能不能成, 依赖于它是否已学会这类问题的解答思路;如果某类问题超出了它的能力, 需要用垂直领域数据进行微调训练,然后再尝试27。
(为什么教育这一段最不一样,回到第 10 章那张六层表看: 它在这里干的是「评价」和「创造」那两层,不是「记忆」那一层。)
7. 第二个例外:个人 IP 那一段既不检索也不训练
这一节讲全章唯一一个既不用骨架、也不靠身份的行业,它只做一件事。
书里的主角是35 岁的阿雯,刚从某互联网大厂离职, 准备在几个平台上打造个人 IP;她要的第一样东西是一段文案28。
这一段的三步,请看清楚每一步之间变了什么:
| 第几步 | 她说了什么 | 变化在哪 |
|---|---|---|
| 1 | 「请为我生成一个小红书风格的文案,核心是介绍自己转换成数字游民的心路历程,关键词包括『35 岁』『大厂辞职』」 | 拿到一段带表情符号、分段抒情的文案28 |
| 2 | 「根据以下特点,调整上一段生成的文案:小红书上,喜欢称呼别人为刘亦菲、姐妹,喜欢称呼自己先生为队友」 | 同一篇文案被改写:开头变成「刘亦菲们来听我……」,称呼变成「姐妹们」,「我毅然辞职」变成「在队友的支持下,我毅然辞职」29 |
| 3 | 「帮我根据这个文案,写一个转换成数字游民身份的视频脚本」 | 一份11 个镜头的脚本,每个镜头带时间码和旁白——从「俯瞰摩天大楼」到「主人公与队友在阳光下微笑拥抱」30 |
看第 2 步:那不是「写得更好」,是「 换一个平台的口吻」。 书里管这件事叫「根据不同平台的营销特点做内容调整」—— 它还能接着做后续的文本改写、翻译和热点主题推荐31。
这一段为什么值得单独讲? 因为它把骨架的边界照得很清楚:
| 那三个行业 | 这一段 | |
|---|---|---|
| 难在哪 | 捞得准不准 | 像不像那个圈子的说话方式 |
| 错了会怎样 | 给错政策、引错判例 | 没人看 |
| 靠什么解决 | 分块 + 嵌入 + 捞 | 一句话描述目标读者的口头禅 |
这一行的市场,书里给了两个数:全球大约有 3500 万名数字游民; 据估计,他们每年消费达 7870 亿美元32。 7870 亿美元是什么概念? 约合人民币 5.6 万亿元—— 比书里给的中国人力资源服务业年营业收入(2.46 万亿元)高一倍多33。 (这个对比是我们把书里两个数放在一起算的。)
8. 三年后:把你说过的话也存进去,再捞回来
这一节是书外补充,标明来源。它兑现的是第 01 章那句「它不记得你」。
第 01 章说过:它不记得你,而这本书到最后也没解决这件事。 但第 2 节那套骨架,本身就是一个现成的答案—— 只不过要捞的不是政策文件,是你自己说过的话。
补充(不在书里,依据我们的前沿书架):今天的做法是, 把对话熬成一句句能独立成立的事实存起来(「用户住在西雅图」「用户对花生过敏」), 下次再按「像不像」把相关的几条捞回来,拼进这一轮的提问。
依据: shelf=ai-frontier-reference/mem0#01-add-pipeline.md §1–§3 @001c235229be8795e3834520467bd0d661ed8f34 事实=写入端只做一件事:用一次模型调用把对话里值得记的事抽成自包含的事实, 再去重、成串地算出那些数、成串地落库; 捞回来的时候按「意思像 + 关键词对得上 + 提到同一个人或物」三路合起来判。
为什么这一节要放在第 13 章而不是第 01 章? 因为它用的正是这一章的骨架,一个新零件都不需要。 这也说明书里那个缺陷不是原理性的,是当时还没人把这件事做成产品。
9. 作者的判断与证据
| 说法 | 性质 |
|---|---|
| 法律那家公司的 4000 小时、30000 个问题、10000 家律所 | 公司公开数据,书里转述 |
| 政务那三 个步骤 | 作者设计的方案,不是某个已上线系统的实录 |
| 王伯那段对话 | 示例,书里以 A 市 / B 市 / C 市指代 |
| 招聘那四步与被删掉的问题 | 实录,而且是全章最诚实的细节 |
| 教育那三样做法 | 实录,书里给了完整对话 |
| 阿雯那三步 | 实录,书里给了完整文案和脚本 |
| 各行业的市场规模数字 | 转引自各类统计机构和咨询报告 |
必须点破的一处:这一章的五段行业,只有法律那一段有真实企业的落地数据。 其余四段都是「设想一个人在用它」的演示。 它们的价值在于展示做法,不在于证明效果。
10. 边界与局限
- 书里没有讲「捞得准不准」怎么衡量。 捞回来 6 条,其中几条真的相关? 一个数都没有。
- 书里没有讲切多大一块合适。 分块的粒度是这套骨架最影响效果的一个选择, 书里完全没提。
- 政务那一段的「办理状态」从哪来,书里没交代。 见第 4 节。
- 教育那一段全部是单个学生的一对一场景。 一个班四十个人怎么用?没有回答。
- 五段行业没有一段讲失败。 没有一次「它捞错了」「它答错了」的案例—— 而第 11 章第 8 节刚给过一个被 404 戳穿的例子。