RAGFlow — 这是什么 / 全景图 / 阅读地图
30 秒导读: RAGFlow 是一款开源的 RAG(检索增强生成)引擎。它的核心赌注是「深度文档理解」——先像人一样把 PDF、扫描件、表格、幻灯片"看懂"成有版面结构的块,再切块、建索引;检索时走全文 + 向量双路召回并融合重排,最后让大模型基于命中块作答并回填可点击的引用。给谁用:想把一堆杂乱文档变成「能带出处问答的知识库 / Agent」的开发者和企业。
本章只讲大盘和该跳哪一章,不深入任何单一机制的代码——细节都在 01–04 四章里。
1. 这是什么(零基础也能懂)
一句话定义: RAGFlow = 「把文档喂进去 → 得到一个能带引用回答问题的知识库 / Agent」的一整套开源引擎。
它想解决的痛点。 普通 RAG 的效果天花板,往往不在"用哪个大模型",而在最前面那一步:文档被切碎的质量。一份财报 PDF 里有跨页表格、多栏排版、图表、脚注;粗暴地按字数切块,会把一句话腰斩、把表格搅烂,后面的检索再准也救不回来。RAGFlow 的立场是:Quality in, quality out——先把文档读懂,后面才有戏(README「Key Features」)。
四个卖点,落到具体机制。 README 的「Key Features」是四句营销话,这里把每句翻成"它到底做了什么":
| README 卖点 | 白话 | 背后的具体机制(哪章讲) |
|---|---|---|
| Deep document understanding |