跳到主要内容

五个行业:凭什么捞得准,以及两个例外

这一章讲三件事: 那套「凭什么捞得准」的骨架长什么样; 三个行业各自怎么用它;以及为什么另外两个行业根本不用它。

它在全书链条里的位置: 第 06 章给了「它能去外面取」这个能力, 这一章回答那个能力真正的难点; 第 14 章会把同一套骨架在一家电商的客服里再走一遍。

1. 问题不在「能不能取」,在「凭什么取那几页」

这一节从第 06 章的结论起步,不重讲那一章。

第 06 章说过:它能临时去外面取东西,取回来的内容被拼进这一轮的提问里,它照着答。

那一章没讲的是:公网可以搜,可企业库有几万页。 一位律师十年的案卷、一个城市的公积金政策全文、一个岗位十年的面试记录—— 这些东西不可能整个塞进一轮提问里(第 01 章说过,它能看见的只有这一轮的文字)。

所以真问题只有一句:拿什么决定取哪几页?

这一章的五个行业里,有三个共用同一套回答:法律、政务、人力资源。 另外两个是例外:

行业用不用那套骨架靠什么
法律把案卷库变成可以按「像不像」捞的东西
政务用,而且还多一步训练政策文件 + 高频问答
人力资源简历里的每一段都事先记好了位置
教育不用给它一个身份(苏格拉底导师、辩论对手、孔乙己)
数字游民 / 个人 IP不用按平台口吻改写

先讲那套骨架,再讲三个用它的行业,最后讲两个例外——例外恰恰是用来看清骨架边界的。

2. 骨架:四步,每一步都有名字

这一节把那套骨架讲透,后面三节都是它的实例。

第一步:把资料切成小块。 一份三十页的政策文件不能整个用, 要切成一段一段——这个动作叫分块。为什么要切?因为你一次只捞得动几块, 块太大就把不相干的东西一起捞上来了。

第二步:把每一块变成一串数。 这件事第 01 章提过一次 (「它拿到你的话之后,第一件事是把这句话变成一串数」)。 这串数叫向量——就是一串按固定顺序排好的数字,比如 0.12、-0.87、0.33…… 几百上千个,合起来代表这一块文字。

这串数是怎么算出来的? 书里给的名字是嵌入—— 就是「把一段文字换算成一串数」的那套做法; 书里说它能把关键词和搜索指令转换成这样的一串数1

第三步:按「像不像」捞。 两块文字如果意思接近,它们那两串数就靠得近。 于是「找最相关的几块」变成了一道算数题:算哪几串数离你的问题最近。 注意「像不像」比的是意思,不是字面——这种按意思找的做法叫语义匹配, 所以你问「衣服能不能洗」也能捞到写着「机洗须知」的那一段。

第四步:把捞回来的几块拼进提问,交给它照着答。 这一步就是第 06 章的结论,不再重讲。

这四步合起来今天有个通行的名字,叫检索增强(英文缩写 RAG)—— 「增强」指的就是拿捞回来的资料把你的提问补壮实。 书里没有用这个词,但你出门一定会撞见它。

企业库(几万页)

① 分块 ───────→ 一段一段

② 嵌入 ───────→ 每段一串数,存起来

你的问题 ──② 嵌入──→ 也变成一串数

③ 比一比 ─────→ 捞出最近的 6 段

④ 拼进提问 ───→ 交给它照着答

3. 法律:找得准之前,先要 4000 小时

这一节讲第一个用骨架的行业,它把「准」这件事的成本摆了出来。

书里讲的是一家法律科技公司做的助手2。这一节有两个数字必须记住:

  • 专门的可信度团队自 2022 年 10 月以来,已花费近 4000 小时, 根据 30000 多个法律问题,对它的输出进行训练和微调3;
  • 集成这个助手的产品,已受到 10000 多家律所的信赖4

这三个数各配一个参照物再读一遍:

拿什么比
4000 小时一个人全职工作一年约 2000 小时——相当于两个人干满一整年,只为了把「它会不会编」压下去
30000 多个法律问题拿上一行除一下:4000 小时摊到 3 万个问题上,平均每个问题只有 8 分钟——这不是逐题精雕,是流水线上的快速过一遍
10000 多家律所和第 14 章那个跨境电商行业是同一个量级:那里有内容生成和客服需求的卖家、独立站和渠道商共 2.54 万家

(表里的换算和跨章对照都是我们补的,不在书里。)

书里点破了这一行为什么容不得编造: 律师要出具法律意见书、尽职调查报告、律师工作报告、专项核查意见, 而律师应当严格依法履行职责,保证所出具意见的真实性、合法性5

书里给的那套六步流程,就是第 2 节骨架的实例6:

第几步干什么
1 收集案件名称、类型、案情描述、当事人信息、法律问题、进展情况
2 清洗去重、格式化、标准化
3 嵌入把案件数据变成一串串数,保存在本地
4 拼提问律师输入查询之后,先按「像不像」在本地捞到具体文本,再和问题一起拼成提问
5 请求把拼好的提问发给云端
6 用从数据集中获取相似案例和建议

第 3 步那句「保存在本地」是这一节的隐藏重点: 书里在痛点里专门写了内容安全——当事人的聊天记录、案件细节这类信息, 必须严格遵守保密协议,妥善私有化并在严格监督下使用和销毁7这就是为什么这一行不能直接把资料发给公网服务:数据不能出门。

4. 政务:两步走,而且第二步是训练(主走查)

这一节是本章的主走查,而且要说清一件容易被读漏的事:政务这一段不止检索。

书里给的是三个步骤,请注意第二步8:

步骤干什么
步骤一:数据准备收集政策解读原文;提取市民问得最多的问题及回答,构建标准问答对;清洗去重;用嵌入把处理后的文本编码成一串串数
步骤二:模型训练根据训练数据和目标,选合适的模型和参数,拿公积金提取领域的相关数据训练;通过多轮训练一步步改进,提高准确率和可用性
步骤三:系统集成用高频问答测试集测;做界面;集成到平台;上线后持续收集反馈、一轮轮改

所以政务这一段是「嵌入 + 再训一遍」两条腿走路,不是纯检索。 (「再训一遍」这个动作叫什么,第 04 章第 2 节讲过:微调。)

现在走主走查。输入:王伯要提公积金。

下面每一步的内容全部来自书里,连「过了一周」这个时间也是原文里的; 我们只是把散在对话里的六个来回排成了一条时间线,没有补任何一个数。

第几步王伯做了什么它回了什么 / 发生了什么
1问:「我是在 A 市工作的 B 市人,刚在 C 市买房,能提取在 A 市缴纳的公积金吗?」9「只要您在 A 市缴纳过住房公积金,就可以在 A 市提取,与您的户籍所在地或现居住地无关」9
2问:那怎么提取呢?给出四步:登录官网或小程序 → 准备身份证、购房合同、房屋产权证明 → 在线上传并选择提取方式、填银行卡 → 后台审核10
3照着做,上传材料过了一周,提取要求被拒绝了11
4回来问:为什么审核不通过?「您最近一次公积金提取审核不通过的原因是购房合同不完整,请您检查上传购房合同的完整性」12
5下载之前上传的扫描件检查发现遗漏了最后的签字盖章页13
6重新扫描,再次提交成功提取13

看第 4 步:这一步才是这条走查真正的价值。 它回答的不是政策条文,是「你这一单为什么被拒」—— 这说明它接的不只是政策文件,还接了这个人的办理状态。 书里没有交代这条状态是从哪儿接进来的,这是这一节最大的空白。

这套东西上线之后的效果,书里只给了一句:公积金提取的人工工单量下降不少14—— 没有具体数字。

5. 人力资源:语义索引,以及那个被删掉的问题

这一节讲第三个用骨架的行业,并给出这一章最诚实的一个细节。

书里的工具是一个对话式的文档工具,它的做法书里写在注里: 把 PDF 文件拆开读、为文件中每个段落创建语义索引、 再调用底层那台机器去理解用户的意图15—— 「语义索引」就是第 2 节那三步的另一种叫法: 索引就是「事先建好的一张查找表」,让你不必每次从头翻。

招聘这条流程走下来是四步16:

第几步招聘负责人做什么它给出什么
1先问「这个岗位有竞争力的薪资水平是怎样的」给了美国和中国两个区间17
2上传历史岗位的目标与总结材料,让它写岗位描述一份含 7 条工作职责、4 条任职要求的描述18
3上传候选人简历,问「能胜任吗」「有哪些相关经历」「是否具备市场洞察力」逐条从简历里找出对应证据;关于「能不能胜任」,它的回答是「需要面试官进行综合评估」19
4让它生成针对性的面试问题5 个问题

第 4 步之后发生的事,是这一章最值得记的一句: 它生成的第 4 个问题是一个技术问题,并不适合提供给候选人面试, 招聘负责人删掉了它,才把剩下的问题交给业务面试官20

书里由此下了一句判断:虽然它是优秀的个人工作助手, 但当前还不能完全替代初筛环节,需要人根据专业知识在各个环节仔细把关21

用第 12 章的尺子看:这一整段都还在副驾。 而书里在这一节最后一段提出的「把流程固化下来、快速复制到多种岗位」22, 才是往代驾走的那一步。

6. 第一个例外:教育那一段不检索

这一节讲那个反过来的行业,它正好用来看清骨架的边界。

教育那一段自始至终没有出现过「捞资料」这件事。 它靠的是另外三样东西:

第一样:给它一个身份。 书里的原文提示是: 「你是一位以苏格拉底式启发进行回应的导师。你从不直接给学生答案, 但始终努力提出正确的问题,帮助他们学会独立思考。」23

效果是可以核对的: 书里拿第 11 章那道「北京有多少井盖」当题目, 学生连答三次「我不知道啊」「我看见马路上有」「我怎么知道呢」, 而它始终没有给答案,一直在反问; 书里的核对结论是:它几乎全程做到了不直接给答案,唯一的一次例外是提供了北京市总面积24

第二样:让它当陪练。 学生选辩题(「人工智能对于人类弊大于利」)和立场(反方), 它站正方,先立四个论点,再针对学生的论点逐条反驳25

第三样:让它演一个人。 学生选了孔乙己,它就用那个口吻答话—— 从鲁迅那篇小说区区两千五百字里,它学到了这个人物的精髓26

为什么这一段不需要骨架? 因为教育要的不是「准确的资料」,是「合适的提问、合适的对手、合适的口吻」。 要资料的场景才需要捞;要陪伴的场景不需要。

但书里也点了它的边界: 苏格拉底那套能不能成, 依赖于它是否已学会这类问题的解答思路;如果某类问题超出了它的能力, 需要用垂直领域数据进行微调训练,然后再尝试27

(为什么教育这一段最不一样,回到第 10 章那张六层表看: 它在这里干的是「评价」和「创造」那两层,不是「记忆」那一层。)

7. 第二个例外:个人 IP 那一段既不检索也不训练

这一节讲全章唯一一个既不用骨架、也不靠身份的行业,它只做一件事。

书里的主角是35 岁的阿雯,刚从某互联网大厂离职, 准备在几个平台上打造个人 IP;她要的第一样东西是一段文案28

这一段的三步,请看清楚每一步之间变了什么:

第几步她说了什么变化在哪
1「请为我生成一个小红书风格的文案,核心是介绍自己转换成数字游民的心路历程,关键词包括『35 岁』『大厂辞职』」拿到一段带表情符号、分段抒情的文案28
2「根据以下特点,调整上一段生成的文案:小红书上,喜欢称呼别人为刘亦菲、姐妹,喜欢称呼自己先生为队友」同一篇文案被改写:开头变成「刘亦菲们来听我……」,称呼变成「姐妹们」,「我毅然辞职」变成「在队友的支持下,我毅然辞职」29
3「帮我根据这个文案,写一个转换成数字游民身份的视频脚本」一份11 个镜头的脚本,每个镜头带时间码和旁白——从「俯瞰摩天大楼」到「主人公与队友在阳光下微笑拥抱」30

看第 2 步:那不是「写得更好」,是「换一个平台的口吻」。 书里管这件事叫「根据不同平台的营销特点做内容调整」—— 它还能接着做后续的文本改写、翻译和热点主题推荐31

这一段为什么值得单独讲? 因为它把骨架的边界照得很清楚:

那三个行业这一段
难在哪捞得准不准像不像那个圈子的说话方式
错了会怎样给错政策、引错判例没人看
靠什么解决分块 + 嵌入 + 捞一句话描述目标读者的口头禅

这一行的市场,书里给了两个数:全球大约有 3500 万名数字游民; 据估计,他们每年消费达 7870 亿美元327870 亿美元是什么概念? 约合人民币 5.6 万亿元—— 比书里给的中国人力资源服务业年营业收入(2.46 万亿元)高一倍多33。 (这个对比是我们把书里两个数放在一起算的。)

8. 三年后:把你说过的话也存进去,再捞回来

这一节是书外补充,标明来源。它兑现的是第 01 章那句「它不记得你」。

第 01 章说过:它不记得你,而这本书到最后也没解决这件事。 但第 2 节那套骨架,本身就是一个现成的答案—— 只不过要捞的不是政策文件,是你自己说过的话

补充(不在书里,依据我们的前沿书架):今天的做法是, 把对话熬成一句句能独立成立的事实存起来(「用户住在西雅图」「用户对花生过敏」), 下次再按「像不像」把相关的几条捞回来,拼进这一轮的提问。

依据: shelf=ai-frontier-reference/mem0#01-add-pipeline.md §1–§3 @001c235229be8795e3834520467bd0d661ed8f34 事实=写入端只做一件事:用一次模型调用把对话里值得记的事抽成自包含的事实, 再去重、成串地算出那些数、成串地落库; 捞回来的时候按「意思像 + 关键词对得上 + 提到同一个人或物」三路合起来判。

为什么这一节要放在第 13 章而不是第 01 章? 因为它用的正是这一章的骨架,一个新零件都不需要。 这也说明书里那个缺陷不是原理性的,是当时还没人把这件事做成产品。

9. 作者的判断与证据

说法性质
法律那家公司的 4000 小时、30000 个问题、10000 家律所公司公开数据,书里转述
政务那三个步骤作者设计的方案,不是某个已上线系统的实录
王伯那段对话示例,书里以 A 市 / B 市 / C 市指代
招聘那四步与被删掉的问题实录,而且是全章最诚实的细节
教育那三样做法实录,书里给了完整对话
阿雯那三步实录,书里给了完整文案和脚本
各行业的市场规模数字转引自各类统计机构和咨询报告

必须点破的一处:这一章的五段行业,只有法律那一段有真实企业的落地数据。 其余四段都是「设想一个人在用它」的演示。 它们的价值在于展示做法,不在于证明效果。

10. 边界与局限

  • 书里没有讲「捞得准不准」怎么衡量。 捞回来 6 条,其中几条真的相关? 一个数都没有。
  • 书里没有讲切多大一块合适。 分块的粒度是这套骨架最影响效果的一个选择, 书里完全没提。
  • 政务那一段的「办理状态」从哪来,书里没交代。 见第 4 节。
  • 教育那一段全部是单个学生的一对一场景。 一个班四十个人怎么用?没有回答。
  • 五段行业没有一段讲失败。 没有一次「它捞错了」「它答错了」的案例—— 而第 11 章第 8 节刚给过一个被 404 戳穿的例子。

11. 可带走的

  1. 第 06 章的能力是「能取」,这一章的问题是「取哪几页」。
  2. 骨架四步:分块 → 每块变成一串数(嵌入)→ 按「像不像」捞 → 拼进提问。 今天这一整套叫检索增强(RAG)。
  3. 「像不像」比的是意思,不是字面。
  4. 法律那一段的成本是 4000 小时、30000 个问题——准确不是免费的。
  5. 政务那一段是「嵌入 + 再训一遍」两条腿,不是纯检索。
  6. 人力那一段最诚实的细节是:5 个面试问题里有 1 个被人删掉了。
  7. 两个例外:教育靠身份,个人 IP 靠口吻——要资料才需要捞,要陪伴和调性不需要。

12. 原文地图

主题原书章原文位置
嵌入这套做法10 知识工作型应用text/12-ch10.txt:973(搜「嵌入式向量」) · text/12-ch10.txt:992(搜「数据嵌入」)
法律行业的痛点与要求10 知识工作型应用text/12-ch10.txt:882(搜「保证其所出具意见的真实性」)
4000 小时与 10000 家律所10 知识工作型应用text/12-ch10.txt:958(搜「已花费近4000小时」) · text/12-ch10.txt:962(搜「10000多家律师事务所」)
政务三步10 知识工作型应用text/12-ch10.txt:1099(搜「步骤一:数据准备」) · text/12-ch10.txt:1113(搜「步骤二:模型训练」)
王伯的六步10 知识工作型应用text/12-ch10.txt:1148(搜「我是在A市工作的B市人」) · text/12-ch10.txt:1186(搜「审核不通过的原因是购房」)
招聘四步与被删的问题10 知识工作型应用text/12-ch10.txt:663(搜「丽丽是招聘负责人」) · text/12-ch10.txt:852(搜「并不适合提供给」)
苏格拉底导师10 知识工作型应用text/12-ch10.txt:252(搜「你是一位以苏格拉底式启发进行回应的导师」) · text/12-ch10.txt:319(搜「几乎全程做到了不直接给答案」)
辩论与孔乙己10 知识工作型应用text/12-ch10.txt:336(搜「人工智能对于人类弊大于利」) · text/12-ch10.txt:413(搜「孔乙己啊,你好歹是个读书人」)
阿雯的三步10 知识工作型应用text/12-ch10.txt:1272(搜「请为我生成一个小红书风格的文案」) · text/12-ch10.txt:1306(搜「称呼别人为刘亦菲」) · text/12-ch10.txt:1403(搜「镜头11」)
数字游民的两个数10 知识工作型应用text/12-ch10.txt:1417(搜「全球大约有3500万名数字游民」) · text/12-ch10.txt:1420(搜「数字游民每」)

Footnotes

  1. 出处:「10 知识工作型应用」第 973 段(text/12-ch10.txt:973,搜「嵌入式向量」)。原文说这是一种能够将关键词和搜索指令转换成向量的技术,可以支持本地文档库的文件问答、法律法规或内容检索。

  2. 出处:「10 知识工作型应用」第 928 段(text/12-ch10.txt:928,搜「Casetext」)。

  3. 出处:「10 知识工作型应用」第 958 段(text/12-ch10.txt:958,搜「已花费近4000小时」)。原文说这个可信度团队由经验丰富的诉讼律师和工程师组成。

  4. 出处:「10 知识工作型应用」第 962 段(text/12-ch10.txt:962,搜「10000多家律师事务所」)。

  5. 出处:「10 知识工作型应用」第 882 段(text/12-ch10.txt:882,搜「保证其所出具意见的真实性」)。

  6. 出处:「10 知识工作型应用」第 983 段(text/12-ch10.txt:983,搜「收集个人案件数据」)到第 1004 段(text/12-ch10.txt:1004,搜「支持案例分析」)。

  7. 出处:「10 知识工作型应用」第 919 段(text/12-ch10.txt:919,搜「必须严格遵守保密协」)。

  8. 出处:「10 知识工作型应用」第 1099 段(text/12-ch10.txt:1099,搜「步骤一:数据准备」)、第 1113 段(text/12-ch10.txt:1113,搜「步骤二:模型训练」)与第 1120 段(text/12-ch10.txt:1120,搜「步骤三:系统集成」)。「步骤二:模型训练」这一步很容易被读成纯检索,它不是。

  9. 出处:「10 知识工作型应用」第 1148 段(text/12-ch10.txt:1148,搜「我是在A市工作的B市人」)。回答在第 1150–1152 段。 2

  10. 出处:「10 知识工作型应用」第 1162 段(text/12-ch10.txt:1162,搜「您可以通过以下步骤来提取」)。

  11. 出处:「10 知识工作型应用」第 1182 段(text/12-ch10.txt:1182,搜「过了一周」)。

  12. 出处:「10 知识工作型应用」第 1186 段(text/12-ch10.txt:1186,搜「审核不通过的原因是购房」)。

  13. 出处:「10 知识工作型应用」第 1190 段(text/12-ch10.txt:1190,搜「发现确实遗漏了最后的签字盖章页」)。 2

  14. 出处:「10 知识工作型应用」第 1196 段(text/12-ch10.txt:1196,搜「公积金提取的人工工单量也下降不少」)。

  15. 出处:「10 知识工作型应用」第 743 段(text/12-ch10.txt:743,搜「解析、为文件中每个段落创建语」)。这是原书作者给那个工具加的一条注。

  16. 出处:「10 知识工作型应用」第 663 段(text/12-ch10.txt:663,搜「丽丽是招聘负责人」)。

  17. 出处:「10 知识工作型应用」第 667 段(text/12-ch10.txt:667,搜「当前有竞争力的AI高级产品经理薪资水平」)。

  18. 出处:「10 知识工作型应用」第 686 段(text/12-ch10.txt:686,搜「帮我参考以下岗位的历史信息生成一份招聘要求」)。

  19. 出处:「10 知识工作型应用」第 785 段(text/12-ch10.txt:785,搜「进行综合评估」)。

  20. 出处:「10 知识工作型应用」第 852 段(text/12-ch10.txt:852,搜「并不适合提供给」)。

  21. 出处:「10 知识工作型应用」第 855 段(text/12-ch10.txt:855,搜「当前还不能完全替代初」)。

  22. 出处:「10 知识工作型应用」第 848 段(text/12-ch10.txt:848,搜「固化为」)。原文的那条流程是:生成岗位描述 → 询问候选人关键能力匹配情况 → 询问核心价值观匹配情况 → 生成针对性面试问题。

  23. 出处:「10 知识工作型应用」第 252 段(text/12-ch10.txt:252,搜「你是一位以苏格拉底式启发进行回应的导师」)。

  24. 出处:「10 知识工作型应用」第 319 段(text/12-ch10.txt:319,搜「几乎全程做到了不直接给答案」)。

  25. 出处:「10 知识工作型应用」第 336 段(text/12-ch10.txt:336,搜「人工智能对于人类弊大于利」)。学生的反方论点与它的逐条反驳在第 367–397 段。

  26. 出处:「10 知识工作型应用」第 464 段(text/12-ch10.txt:464,搜「区区两千五百字」)。

  27. 出处:「10 知识工作型应用」第 323 段(text/12-ch10.txt:323,搜「依赖于大模型是否已学会」)。

  28. 出处:「10 知识工作型应用」第 1268 段(text/12-ch10.txt:1268,搜「35岁的阿雯刚从某互联网大厂离职」)与第 1272 段(text/12-ch10.txt:1272,搜「请为我生成一个小红书风格的文案」)。 2

  29. 出处:「10 知识工作型应用」第 1306 段(text/12-ch10.txt:1306,搜「称呼别人为刘亦菲」)。改写后的文案在第 1308–1334 段,那句「在队友的支持下」在第 1319 段(text/12-ch10.txt:1319,搜「在队友的支持下」)。

  30. 出处:「10 知识工作型应用」第 1339 段(text/12-ch10.txt:1339,搜「写一个转换成数字游民身份的视频脚」)。11 个镜头在第 1348–1405 段(text/12-ch10.txt:1403,搜「镜头11」)。

  31. 出处:「10 知识工作型应用」第 1411 段(text/12-ch10.txt:1411,搜「根据不同平台的营销特」)。

  32. 出处:「10 知识工作型应用」第 1417 段(text/12-ch10.txt:1417,搜「全球大约有3500万名数字游民」)与第 1420 段(text/12-ch10.txt:1420,搜「数字游民每」)。原文还说数字游民的平均年龄是 40 岁,30 多岁的人占全球所有数字游民的 47% 左右。

  33. 出处:「10 知识工作型应用」第 863 段(text/12-ch10.txt:863,搜「我国人力资源服务业年营业收入2.46万亿元」)。