](https://github.com/gzileni/kgrag-agent) ](https://github.com/gzileni/kgrag-agent/stargazers) ](https://github.com/gzileni/kgrag-agent/network)
代理描述
用于摄取和查询结构化和非结构化内容的代理。接受PDF、CSV、JSON和TXT文件,提取文本和元数据,对内容进行规范化,并将其导入语义图中,以便通过信息链接进行复杂查询。
主要特点
- 支持的格式:PDF(可选OCR)、CSV、JSON、TXT。
- 提取:解析表格结构,提取文本和元数据(作者、时间戳、列名等)。
- 清理和规范化:噪声去除、标记化、分割成语义块。
- 丰富:提取实体、关系和语义注释以创建节点和边。
- 图摄取:将实体映射到节点,创建语义边,并将其存储在图后端。
- 图查询:按实体、节点间路径、模式匹配和聚合进行搜索;支持文本和结构化查询。
- 可追溯性:保留对原始文档和文本块的引用以重建上下文。
益处
- 将各种文档格式转换为可查询的图形表示。
- 支持跨异构数据的语义分析和隐藏关系的发现。
- 便于与现有管道(如kgrag商店、MCP服务器)集成,以进行高级搜索和推理。
工作流程示例
- 文件接收→ 2. 提取和归一化→ 3. 实体/关系提取→ 4. 图形摄取→ 5. 执行查询并检索结果
依赖项
kgrag-store:核心数据存储和图形管理库。memory-agent:用于AI代理应用程序中高级内存管理的Python库
