跳到主要内容

essential-graphrag 拆解大纲(12 章)

自查:任意两行的「出去时知道」不是同一件事。02 与 03 分工:02 管「RAG 是什么、为什么要图」(架构层), 03 管「向量检索怎么转」(机制层)。08 与 09 分工:08 管「把文本抽成带摘要的图」,09 管「把图聚成社区并写报告」。 10 合并 global+local,因为两者共享「拿 08/09 的资产答题」这同一条链。

文件拆原书进来时以为…出去时知道…
0101-why-llm-gets-it-wrong.mdch1 前半LLM 是个会查资料的知识库它只是一台「下一词预测机」,事实不存库里、只压在权重里;所以截止、过时、幻觉、私有数据四个坑是结构性的
0202-rag-and-knowledge-graph.mdch1 后半修 LLM 就是继续训练它预训练太贵、微调灌事实证据互相矛盾;RAG 把事实放进 prompt;而非结构化数据答不了过滤/计数/聚合——知识图谱一个库同时装两类数据
0303-vector-and-hybrid-search.mdch2向量检索很玄全套零件(向量索引/余弦/chunking/embedding 模型)+爱因斯坦论文走通最小 RAG;再加全文检索拼成混合检索,分数要归一化才能合流
0404-better-retrieval.mdch3检索不准只能换模型问题侧:step-back 改写把具体问撒成大网;文档侧:parent-document 策略子块匹配、父文档喂 LLM;两边可以叠着用
0505-text2cypher.mdch4图数据库只能写死查询聚合/过滤类问题向量永远答不了;text2cypher 的质量靠四件套:schema、few-shot、术语映射、格式指令;LLM 错了就沉淀成示例
0606-agentic-rag.mdch5agentic 是玄学名词=路由器+检索器群+答案批评家三个零件;关键机制:LLM 只决定调谁、不亲手调;批评家必须留出口,否则死循环
0707-extraction-to-graph.mdch6建知识图谱要人工标注LLM 按数据模型(字段+类型+描述)直接抽结构化数据灌图;optional 不标会诱导编值;抽完要实体消解,这事没有通用解
0808-graphrag-indexing.md7.1+7.2.1–7.2.3GraphRAG=微软的 RAG 产品名它是索引期把图建「厚」的管道:chunk 越小抽得越全;同名实体/关系对的多条描述再让 LLM 合并成摘要;大hub会撑爆 prompt
0909-communities.md7.2.4社区=随便聚类社区=内部比外部连得密的实体群;Louvain/Leiden 检测(不确定、非确定复现);每社区预写结构化报告(标题/摘要/影响分/发现)——这是回答全局问题的预计算资产
1010-global-and-local-search.md7.3检索只有一种姿势global=map-reduce:每份社区报告出带分的中间点,再合成答案,答「整体在讲什么」;local=向量找入口实体、扩四类上下文,答「某个实体的事」
1111-evaluation.mdch8RAG 好不好靠感觉四个评测位;考卷 17 题、ground truth 用 Cypher 写(数据变考卷不变);RAGAS 三指标;0.7774/0.7941/0.9657 读出「修检索不修生成」
1212-neo4j-toolbox.mdappendix这本书绑死一个商业数据库Cypher 是开放语言(openCypher→ISO GQL),六家数据库用;APOC/GDS 两个插件承担 meta 推断和社区检测;书里 GDS 硬依赖在 ch7

原书 23 个文件 → 导航章(01/02/03/23)不拆;foreword/preface/about 进总纲第 2 节;summary(19)并进 08/10; ch06 文件尾混入的 ch07 章首并进 08。