数据截至 (上游 commit f791fa4751f6)
双层检索:把问题拆成两层关键词,分走图的点和边
本章是 LightRAG 的灵魂。讲清楚查询时怎么把一个问题拆成「高层词 + 低层词」,这两层分别检索什么,以及四种模式的分叉。
1. 这一步要解决什么
纯向量检索把整个问题压成一个向量,去和块向量比相似度。LightRAG 认为一个问题其实有两个层次的检索意图:
- 低层(low-level): 具体的实体、专有名词、技术术语(「找到关于 X 实体 的局部信息」)。
- 高层(high-level): 抽象的主题、概念、关系类型(「找到关于 某种关系/主题 的全局信息」)。
这两层在图谱里对应不同的东西:低层词适合去匹配图的点(实体),高层词适合去匹配图的边(关系)。把它们分开检索再融合,就是 dual-level retrieval。