essential-graphrag 拆解大纲(12 章)
自查:任意两行的「出去时知道」不是同一件事。02 与 03 分工:02 管「RAG 是什么、为什么要图」(架构层), 03 管「向量检索怎么转」(机制层)。08 与 09 分工:08 管「把文本抽成带摘要的图」,09 管「把图聚成社区并写报告」。 10 合并 global+local,因为两者共享「拿 08/09 的资产答题」这同一条链。
| 章 | 文件 | 拆原书 | 进来时以为… | 出去时知道… |
|---|---|---|---|---|
| 01 | 01-why-llm-gets-it-wrong.md | ch1 前半 | LLM 是个会查资料的知识库 | 它只是一台「下一词预测机」,事实不存库里、只压在权重里;所以截止、过时、幻觉、私有数据四个坑是结构性的 |
| 02 | 02-rag-and-knowledge-graph.md | ch1 后半 | 修 LLM 就是继续训练它 | 预训练太贵、微调灌事实证据互相矛盾;RAG 把事实放进 prompt;而非结构化数据答不了过滤/计数/聚合——知识图谱一个库同时装两类数据 |
| 03 | 03-vector-and-hybrid-search.md | ch2 | 向量检索很玄 | 全套零件(向量索引/余弦/chunking/embedding 模型)+爱因斯坦论文走通最小 RAG;再加全文检索拼成混合检索,分数要归一化才能合流 |
| 04 | 04-better-retrieval.md | ch3 | 检索不准只能换模型 | 问题侧:step-back 改写把具体问撒成大网;文档侧:parent-document 策略子块匹配、父文档喂 LLM;两边可以叠着用 |
| 05 | 05-text2cypher.md | ch4 | 图数据库只能写死查询 | 聚合/过滤类问题向量永远答不了;text2cypher 的质量靠四件套:schema、few-shot、术语映射、格式指令;LLM 错了就沉淀成示例 |
| 06 | 06-agentic-rag.md | ch5 | agentic 是玄学名词 | =路由器+检索器群+答案批评家三个零件;关键机制:LLM 只决定调谁、不亲手调;批评家必须留出口,否则死循环 |
| 07 | 07-extraction-to-graph.md | ch6 | 建知识图谱要人工标注 | LLM 按数据模型(字段+类型+描述)直接抽结构化数据灌图;optional 不标会诱导编值;抽完要实体消解,这事没有通用解 |
| 08 | 08-graphrag-indexing.md | 7.1+7.2.1–7.2.3 | GraphRAG=微软的 RAG 产品名 | 它是索引期把图建「厚」的管道:chunk 越小抽得越全;同名实体/关系对的多条描述再让 LLM 合并成摘要;大hub会撑爆 prompt |
| 09 | 09-communities.md | 7.2.4 | 社区=随便聚类 | 社区=内部比外部连得密的实体群;Louvain/Leiden 检测(不确定、非确定复现);每社区预写结构化报告(标题/摘要/影响分/发现)——这是回答全局问题的预计算资产 |
| 10 | 10-global-and-local-search.md | 7.3 | 检索只有一种姿势 | global=map-reduce:每份社区报告出带分的中间点,再合成答案,答「整体在讲什么」;local=向量找入口实体、扩四类上下文,答「某个实体的事」 |
| 11 | 11-evaluation.md | ch8 | RAG 好不好靠感觉 | 四个评测位;考卷 17 题、ground truth 用 Cypher 写(数据变考卷不变);RAGAS 三指标;0.7774/0.7941/0.9657 读出「修检索不修生成」 |
| 12 | 12-neo4j-toolbox.md | appendix | 这本书绑死一个商业数据库 | Cypher 是开放语言(openCypher→ISO GQL),六家数据库用;APOC/GDS 两个插件承担 meta 推断和社区检测;书里 GDS 硬依赖在 ch7 |
原书 23 个文件 → 导航章(01/02/03/23)不拆;foreword/preface/about 进总纲第 2 节;summary(19)并进 08/10; ch06 文件尾混入的 ch07 章首并进 08。