跳到主要内容

审查 essential-graphrag — 2026-08-27

结论: PASS(小疵 3 处,均不触红线/门禁,建议顺手修;详见问题清单)

门禁实跑:

book-verify: 1 本有拆解、共 533 处出处、0 处对不上 (533 出处 + 4 书架锚,0 处对不上)
book-jargon: 1 本,共 0 处专业词没解释就用了 (88 个专业词首现处都有解释)
book-jargon --quota: 段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)

重点核查项(均过)

  1. GraphRAG 机制走查实算(08/09/10 主走查):抽核全部承重数字,均与原文吻合—— 66 实体/182 关系且"每次跑会变"(text/17-…:230 原句确认)、24 卷平均 6515 token(:61)、 600-token 曲线最高/2400 最低(:82)、Telemachus×Minerva 14 条关系(:271)、 9 个社区/2–13 节点(:491)、rating_threshold 默认 5(text/18-…:199)、 map 要点 0-100 分、不知道记 0 分、引用最多 5 个 +more(:101/:97/:117)。 流程步骤(global=map 每报告独立出带分要点→reduce 按分合成;local=实体摘要嵌入做向量入口 →扩四类上下文各自排序限量)与原书 7.3 一一对应。
  2. 「66 实体、global/local 输出几乎相同」判断块:在位且公允。10 §4 主走查正文点破, index.md §5 第三条判断块复述并带「如果错」;亲自比对原文两段成品答案 (text/18-…:265:521)——开头三行逐字相同,写手的观察属实。 表述公允:归因于「示例图太小」而非「机制没差别」,且两个方向的误用都警示了。
  3. 4 处书架锚逐条核「事实=」:全部吻合——
    • graphrag#02-graph-extraction.md:gleaning=「再抽一遍、再问还有吗」多轮补抽(该文 §2.3 原文确认);
    • graphrag#03-communities-and-reports.md 锚①:hierarchical_leiden(edge_list, max_cluster_size, random_seed) 且 seed 透传 Leiden 保可复现(该文 :43、:48 确认);
    • 同文 锚②:上层社区放不下原料时改用下层报告当输入(该文 essence 与 :81 确认);
    • ragas#01-metrics-engine.md:faithfulness=拆原子→逐条 LLM 判定→聚合成 0~1 分(该文 :8、:19、:48 确认)。
  4. ③ 类补充:08 章 [^1] 的 arXiv:2404.16130 带查阅日期(2026-08-27);并核实书末参考文献 确实未收 Edge 等 2024 这篇(text/22-fm-references.txt 无此条),脚注里「参考文献未给 URL」的 说法属实,降级 ③ 处理正确。
  5. 完整性:原书 8 章 + 7.1–7.3 + Summary + Appendix 全覆盖——ch1→01/02、ch2→03、ch3→04、 ch4→05、ch5→06、ch6→07、7.1+7.2→08、7.2(社区半)→09、7.3→10、Summary→10[^17]、 ch8→11、appendix→12;frontmatter sourceChapters 与此一致;导航章(目录/版权/索引)未引用。
  6. 抽查出处:共回核 10 条(超出要求的 5 条):01[^9] Cuban、03[^18] 归一化、07[^6] 不标 Optional 会编值、08[^9] 66/182、09[^5] 9 社区、10[^15] 两段答案开头逐字相同、11[^12] 三个分数、 08[^5] 块大小曲线、08[^13] 14 条关系、19-fm-summary.txt:4 社区摘要可当独立向量检索路。 10/10 属实,指向的段落都说了拆解声称的事。
  7. 总纲:六节齐全(30 秒导读 + 作者/时代/利益相关 + 主线 + 地图 + 覆盖 + 判断 + 兑现表); 第 2 节主线(标准第 3 节)十一环因果链能独立成篇,海拔合规——只留效果句, 机制细节(余弦、Louvain、四件套清单)都留在了章节层。兑现表 31 行,抽核 3 行 (08§1→09、09§4→10 rating 阈值、06§6→11 延迟差)全部真实兑现且是许诺的那件事。
  8. 判断块:16 个「判断(我们的)」全部带「如果错,会错在」,无一缺席。
  9. 书卡:readState=read、readChapters、claims(6 条)、notCovered(7 条)与拆解实际覆盖 逐条一致;summary/soWhat 已填;分数 0.7774/0.7941/0.9657 与第 11 章及原文表 8.5 一致。
  10. 台账泄漏:正文无格式/许可/清洗统计;07 章的「许可合同」是 licensing agreement 的 正文语义,非许可证台账;index 页脚「原始书籍文件不入库…」与样板 what-is-chatgpt-doing 及 rag-ready 的页脚同款,属房规,不算泄漏。TODO(没懂) 零命中。
  11. 差异化(与 unlock-data-genai-rag、rag-ready):立住。本书是唯一把微软 GraphRAG 管道 (索引期/社区/global-local)走查到机制层的拆解;unlock 的 graph 章(10)开篇即声明 「本章不是讲 GraphRAG」并指向微软管线,两者边界清晰(本体驱动的人建图 vs LLM 自动建厚图); rag-ready 讲检索前的数据平台可靠性模式,与本书选题不重叠;对 frontier 书架 graphrag 工程版的分工在 index §4 明写。唯一可加强处见问题 4。
  12. 红线一:最长的原文引用是 10 章两段答案开头各三行——引用目的正当(证明「几乎相同」)、 长度在短句范围内;ORESTES 六条描述是中文转写非搬原文。无整段搬运。
  13. 台阶抽查:09 §3、05 §4 段首句连读不跳;各章主走查均落在正文(非脚注/附录), 演示编的数(10 章要点分 92/71、06 章走查中间结果)都当场标了「演示编的」。

问题清单

  1. [01-why-llm-gets-it-wrong.md:§5] 训练四阶段处残留一个空表格骨架——| 阶段 | 在干什么 | 代价 | 表头加分隔行之后跟的是编号列表而不是表格行,渲染出一悬空空表。违反行文第 5 条 (并列项要么表格要么分点,不能半截)。建议:四阶段补成真表格行,或删掉表头改纯分点。
  2. [02-rag-and-knowledge-graph.md:§6 可带走第 3 条] 「RAG 的 publicly 可见形态」残留英文 副词,零基础读者会卡。建议改成「公开可见的形态」。
  3. [07-extraction-to-graph.md:§2 第一步末] 「beyond 这个,调法靠试」同一类残留。 建议改成「除此之外」或「出了这个范围」。
  4. (非缺陷,可选)index.md §4 未提两本姊妹 RAG 书。差异化实际立住(见核查项 11), 但「不覆盖」表里给 frontier 书架 graphrag 指了路、对 unlock/rag-ready 没有一句话边界。 若想更稳,可在 §4 加一行「与 unlock(广度survey,其 graph 章明言不讲 GraphRAG)、 rag-ready(检索前数据平台)的分工」。不改不算过。

判定依据

  • 四条门禁全绿(上面原样末行);533+4 出处 0 处对不上;
  • 抽查出处 10/10 属实,含全部承重机制数字;
  • 收尾自检表逐项过:完整性/生词/台阶/走查/句子/数字/许诺/总纲/出处/分层/诚实/来源/干净/版权/锚均过; 「主人认可」一项不在审的职责内(待 book-verdict)。
  • 上述 1–3 为排版与措辞小疵,不触任何红线,修完即净。