2026/10/9 0:35:46

如何追溯RAG答案的每一步来源:EdgeQuake知识图谱谱系与引用追踪完整指南

如何追溯RAG答案的每一步来源:EdgeQuake知识图谱谱系与引用追踪完整指南 如何追溯RAG答案的每一步来源EdgeQuake知识图谱谱系与引用追踪完整指南【免费下载链接】edgequakeEdegQuake High-performance GraphRAG inspired from LightRag written in Rust; Transform documents into intelligent knowledge graphs for superior retrieval and generation项目地址: https://gitcode.com/gh_mirrors/ed/edgequakeEdgeQuake 是一个用 Rust 编写的高性能 GraphRAG 框架它把文档转换成智能知识图谱用于更优的检索与生成。与只给一段答案的传统 RAG 不同EdgeQuake 内置完整的**谱系追踪Lineage Tracking**系统每一条答案背后的实体、关系、文本块都可以一步步回溯到源文档、源文件甚至具体的行号让引用追踪Citation Tracing真正可审计、可复现。本文是一份面向新手的完整指南教你读懂这条从 PDF 到答案的来源链条并掌握 3 种最实用的溯源方法。为什么 RAG 答案需要来源追溯想象你问系统Sarah Chen 的研究方向是什么模型回答后你最关心的往往不是答案本身而是 这句话来自哪份文档 具体在文档的哪个位置 提取这个实体时用的是哪个 LLM 模型普通 RAG 框架经常在这里失守答案里的页码、文档名可能是模型编出来的点进去也打不开正确的页面。EdgeQuake 的做法是在数据入库时就为每一层知识打上来源标记答案里的每个引用都能验证而不是事后猜。谱系追踪的原理一条五层来源链EdgeQuake 在摄入文档时会把整条链路逐级记录。核心结构如下详细定义见 lineage-tracking.md层级记录了什么来源元数据PDF / 源文件文件名、大小、SHA256 校验和、页数Document文档文档类型、使用的 LLM 与 Embedding 模型、处理时间✂️Chunk文本块在文档中的起始/结束行号、字符偏移、Token 数Entity实体来自哪些 chunk、来自哪些源文档Relationship关系关系两端的实体 来源 chunk整条链的不变式很严格每个 chunk 必须能指回父文档每个实体必须至少引用一个来源 chunk——这正是每个答案都能追溯的底层保证。这些结构体在源码中都有清晰定义例如 chunk 上的行号字段start_line/end_line与模型字段文档类型定义document.rs文本块类型定义chunk.rs谱系数据结构DocumentLineagelineage.rs实战一从一个实体反向追到源文档这是最常见的场景你在知识图谱里看到一个实体比如QUANTUM_COMPUTING想知道它到底出现在哪些文档里。步骤 1调用实体溯源端点。只需一条请求就能拿到该实体所有来源文档与 chunkcurl http://localhost:8080/api/v1/entities/QUANTUM_COMPUTING/provenance \ -H X-Workspace-ID: default | jq返回结果会告诉你这个实体被提取了几次、来自哪些文档、每个文档里的哪些 chunk附行号以及与之相关的其他实体。步骤 2钻进具体 chunk 看原文。拿到chunk_id后查询 chunk 详情即可看到原始文本、字符范围和其中提取出的全部实体与关系。步骤 3一次调用拿全链路。chunk 的 lineage 端点会一次性返回父文档信息、行号区间、使用的 LLM/Embedding 模型、实体清单——单次请求完整链条无 N1 查询典型文档 P95 延迟 200ms。完整的分步教程含 curl / Python / TypeScript / Rust 四种方式见官方示例tracing-entity-sources.md。实战二从文档正向看它贡献了哪些知识反过来你上传了一份 PDF想知道系统从中提取了什么。调用文档谱系端点curl http://localhost:8080/api/v1/documents/{document_id}/lineage | jq一次返回完整的谱系树全部 chunk含行号、Token 数、内容预览 全部实体含类型和来源 chunk 列表。配套的metadata端点则返回扁平的元数据文件哈希、页数、处理模型等方便做审计比对。实战三在 WebUI 里点点鼠标完成溯源不想敲命令EdgeQuake 的 Web 界面把谱系能力做成了可视化面板文档页侧边栏Metadata Sidebar打开任意文档右侧面板有三块——扩展元数据全部 KV 字段、数据层级树Document → Chunks → Entities可折叠展开、来源信息类型、页数、校验和、文件大小。谱系浏览器Lineage Explorer选择文档后可以浏览实体图谱并对每个实体点击查看其来源 provenance。知识图谱页点击任意实体节点直接记下实体名就能去调溯源接口。谱系能力如何支撑可信引用EdgeQuake 的查询引擎支持 6 种模式naive/local/global/hybrid/mix/bypass默认mix。无论哪种模式检索到的 chunk 都携带着上文那条来源链——答案中的每个引用条目都可以经由实体 → chunk → 行号 → 文档 → 源 PDF一路验证。对于带图表的 PDF谱系还覆盖了多模态资产视觉转换生成的页面截图会以assets/page-0001.png的形式挂载到文档上chunk 中引用的图片同样能通过pdf_id 资产路径回溯到具体 PDF 页。常见应用场景速查你的需求用哪个端点这个实体出现在哪些文档里GET /entities/{id}/provenance这份文档提取了哪些实体和关系GET /lineage/documents/{id}某个 chunk 的完整来源链GET /chunks/{id}/lineage文档的哈希、页数、模型等元数据GET /documents/{id}/metadata整棵谱系树chunk 实体GET /documents/{id}/lineage典型落地场景合规审计回答必须可举证、质量对比同一文档换模型提取后 diff 实体差异、故障定位管道哪一步出错一目了然、多文档冲突排查同一事实在多份文档中的不同表述。总结EdgeQuake 的谱系与引用追踪体系可以概括为一句话知识图谱里的每个节点都记得自己从哪里来。五层来源链PDF → Document → Chunk → Entity → Relationship在摄入时自动打标配合 provenance / lineage / metadata 三组 API 和 WebUI 可视化面板让你既能正向审查文档变成了什么也能反向验证答案来自哪里——这正是把 RAG 从黑盒问答升级为可审计知识系统的关键一步。 延伸阅读谱系架构设计docs/architecture/lineage-tracking.md谱系 API 完整参考docs/api-reference/lineage-endpoints.md实体溯源分步教程docs/tutorials/tracing-entity-sources.md【免费下载链接】edgequakeEdegQuake High-performance GraphRAG inspired from LightRag written in Rust; Transform documents into intelligent knowledge graphs for superior retrieval and generation项目地址: https://gitcode.com/gh_mirrors/ed/edgequake创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考