快速入门-https://github.com/jgravelle/jdatamunch-mcp/blob/main/QUICKSTART.md
免费供个人使用
用它来赚钱,J叔叔就尝到了滋味。公平吗? 详情
______________________________________________________________________
文档
| 文档 | 它涵盖了什么 |
|---|---|
| QUICKSTART.md | 通过三个步骤从零到索引 |
| 用户手册md | 面向分析师、运维人员和非开发人员的完整指南 |
______________________________________________________________________
通过以下方式减少电子表格令牌的使用 99.997%
大多数AI代理以昂贵的方式探索表格数据:
将整个文件转储到提示符中→ 浏览一百万行不相关的行→ 重复。
这并不是“有点低效” 这是一个 代币焚烧炉.
一个包含100万行的255 MB CSV文件的成本 1.11亿代币 如果你把它生吃。 一个 describe_dataset call在中回答了相同的定向问题 3849个代币.
这是一个 25333×减少 --在真实的100万行公共数据集上进行测量,而不是估计。
jDataMunch对文件进行一次索引,让代理只检索他们需要的确切数据:列配置文件、筛选行、服务器端聚合、跨数据集连接和语义搜索——具有SQL精度。
基准: 洛杉矶警察局犯罪记录——1004894行,28列,255 MB 基线(原始文件):111028360个令牌|jDataMunch:~3849个令牌| 25333×减少 方法和利用 · 全部结果
| 任务 | 传统方法 | 使用jDataMunch |
|---|---|---|
| 了解数据集 | 粘贴整个CSV | describe_dataset → 列名、类型、基数、示例 |
| 查找相关列 | 读取每一行 | search_data → 带ID的列级结果 |
| 回答筛选后的问题 | 加载数百万行 | get_rows 使用结构化过滤器→ 仅匹配行 |
| 按 | 返回所有数据计算组 | aggregate → 服务器端SQL,一个结果集 |
| 比较两个数据集 | 全部加载 | join_datasets → 跨索引存储的SQL JOIN |
| 查找列关系 | 导出到电子表格 | get_correlations → 成对皮尔逊相关性 |
索引一次。廉价查询。继续走。 精确检索胜过暴力上下文。
______________________________________________________________________
jDataMunch MCP
人工智能代理的结构化表格数据检索
 ](https://pypi.org/project/jdatamunch-mcp/) ](https://pypi.org/project/jdatamunch-mcp/)
## 商业许可证 jDataMunch MCP是 免费用于非商业用途. 商业使用需要付费许可证。 jDataMunch仅许可证 - 建筑商——39美元 --1名开发人员 - 工作室——149美元 --最多5名开发人员 - 平台----799美元 --全组织内部部署 想要完整的jMunch套房吗? - 蒙克Trio Builder套装——99美元 - 蒙克三重奏工作室套餐——449美元 - 蒙克三重奏平台套装——2499美元
别再付钱给你的模特看整个该死的电子表格了。
jDataMunch将表格数据探索转化为 结构化检索.
jDataMunch没有强制代理加载整个CSV,扫描数百万行,并烧穿上下文以找到正确的列名,而是让它通过以下方式导航 数据是什么 并检索 只有重要的事.
这意味着:
- 25333×数据读取令牌使用率降低 在1M行CSV上(测量)
- 更少无关的上下文 污染提示符
- 更快的数据集定向 -一个调用告诉关于模式的一切
- 准确的过滤查询 --特工要求好莱坞的袭击,却得到了好莱坞的袭击
- 服务器端聚合 --GROUP BY在SQLite中运行,而不是在上下文窗口中运行
- 跨数据集连接 --在单个SQL查询中组合两个索引文件
- 语义搜索 --按含义查找列,而不仅仅是关键字匹配
- 自然语言摘要 --自动生成每个列和数据集的描述
它使用流解析器和SQLite对文件进行一次索引,以适当的类型亲和性存储列配置文件和行数据,并准确检索代理所要求的内容,而不是在每个问题上重新加载整个文件。
______________________________________________________________________
支持的文件格式
| 格式 | 扩展 | 安装额外 |
|---|---|---|
| CSV/TSV | .csv, .tsv | --(内置) |
| Excel | .xlsx, .xls | pip install "jdatamunch-mcp[excel]" |
| 拼花地板 | .parquet | pip install "jdatamunch-mcp[parquet]" |
| JSONL/NDJSON | .jsonl, .ndjson | --(内置) |
______________________________________________________________________
为什么代理商需要这个
大多数代理仍然像在阅读一篇文章之前打印整个互联网的人一样处理电子表格:
- 粘贴整个CSV以回答一个狭窄的问题
- 跨工具调用重复重新加载同一文件
- 使用列标题、空单元格、格式错误的行和不相关的记录
- 在问题从未涉及的数据上燃烧上下文窗口
jDataMunch通过为他们提供一种结构化的方式来解决这个问题:
- 在接触任何行数据之前描述数据集的模式
- 按关键字或含义搜索包含答案的特定列
- 仅检索与筛选器匹配的行
- 在服务器端运行聚合并返回单个结果集
- 连接两个数据集,而不将其中任何一个加载到提示符中
- 在提交完整查询之前,使用示例进行定位
- 自动检测数据质量问题和列相关性
代理不需要更大的上下文窗口。
他们需要 更好的目标.
______________________________________________________________________
你得到了什么
列级检索
在一次低于10ms的调用中了解数据集的完整模式——类型、基数、空率、值分布、样本和自然语言摘要。未加载行。
筛选行检索
具有10个运算符的结构化过滤器(eq, neq, gt, gte, lt, lte, contains, in, is_null, between).所有参数化SQL——无注入曲面。每次调用500行的硬上限,以保护上下文预算。
服务器端聚合
分组与 count, sum, avg, min, max, count_distinct, median。计算保留在SQLite中。返回的是一个紧凑的结果集,而不是模型本身聚合的数据。
智能列搜索
search_data 同时搜索列名、值索引和AI摘要。询问“武器类型”并获得 Weapon Used Cd \ Hermes Agent config
# ~/.hermes/config.yaml
mcp_servers:
jdatamunch:
command: "uvx"
args: ["jdatamunch-mcp"]______________________________________________________________________
新来的?
从 快速入门指南 --0分三步索引。
或者,如果你更喜欢边做边学:为文件建立索引,运行 describe_dataset,看看什么回来了。
这一次调用——35毫秒,3849个令牌——告诉你所有需要花费1.11亿个令牌才能读取原始令牌的事情。
这就是整个想法。..
