🔍 EDA助理MCP
  
使用模型上下文协议(MCP)构建的全面的探索性数据分析(EDA)助手,为数据分析工作流程提供智能、上下文感知的提示。
🌟 概述
EDA Assistant MCP是一个复杂的工具,旨在简化和增强探索性数据分析工作流程。它使用FastMCP构建,提供20多个专门的提示,涵盖数据探索的各个方面,从初始数据分析到高级统计分析和模型准备评估。
✨ 主要特点
- 🔄 全面的EDA工作流程 -从数据摄取到洞察的完整分析流程
- 📊 多域支持 -时间序列、地理空间、文本、分类和数值数据分析
- 🎯 上下文感知提示 -以业务为中心的分析,考虑特定领域的因素
- 🛠️ 高级分析 -统计测试、相关性分析、异常检测和特征工程
- 📈 可视化策略 -针对特定受众的可视化建议和故事讲述
- 🤖 机器学习就绪性评估 -模型准备和部署注意事项
- 📁 文件操作 -用于读取CSV、文本文件和目录管理的内置工具
- ⚡ 自动化管道 -可配置的自动化,用于重复分析任务
🚀 快速开始
先决条件
- Python 3.13+
- pip或uv包管理器
安装
- 克隆存储库:
git clone https://github.com/Yash-Kavaiya/eda-assistant-mcp.git
cd eda-assistant-mcp- 安装依赖项:
# Using pip
pip install -r requirements.txt
# Or using uv (recommended)
uv sync- 运行MCP服务器:
python server.pyDocker设置
# Build the Docker image
docker build -t eda-assistant-mcp .
# Run the container
docker run -p 8000:8000 eda-assistant-mcp📋 可用分析提示
🔍 核心数据探索
initial_data_exploration-具有业务背景的全面数据集概述advanced_statistical_analysis-假设检验的深度统计分析data_quality_comprehensive_audit-多维质量评估
📊 专题分析
correlation_and_relationships-高级相关性分析和特征关系time_series_comprehensive_eda-完成时间序列分析和分解categorical_deep_dive_analysis-分类变量分析和编码策略outlier_anomaly_comprehensive_analysis-多方法异常检测feature_engineering_advanced_strategies-ML就绪功能工程
🎨 可视化和讲故事
visualization_storytelling_strategy-以受众为中心的可视化建议geospatial_data_eda-专业地理空间分析text_data_eda_nlp-使用NLP技术进行文本数据分析
🤖 模型准备
model_readiness_assessment-机器学习的数据集准备就绪automated_eda_pipeline-自动化管道设计eda_quality_metrics_dashboard-质量评估和监测
🛠️ 内置工具
文件操作
read_text_file(file_path)-通过编码检测读取和分析文本文件read_csv_file(file_path, preview_rows)-CSV分析与数据分析list_files_in_directory(directory_path, file_extension)-目录探索get_file_info(file_path)-详细的文件元数据和统计数据
💡 使用示例
基础数据探索
# Using the initial_data_exploration prompt
prompt_result = initial_data_exploration(
dataset_info="Customer transaction data from e-commerce platform",
columns="customer_id, transaction_date, amount, product_category, payment_method",
business_context="Analyzing customer behavior for retention strategies",
sample_data="First 5 rows with typical transaction patterns"
)高级统计分析
# Advanced statistical analysis for hypothesis testing
analysis = advanced_statistical_analysis(
dataset_name="Sales Performance Dataset",
numerical_columns="revenue, units_sold, profit_margin",
categorical_columns="region, product_line, sales_channel",
target_variable="monthly_revenue",
analysis_depth="comprehensive"
)自动管道设置
# Create automated EDA pipeline
pipeline = automated_eda_pipeline(
dataset_info="Monthly sales data with seasonal patterns",
analysis_goals="Identify trends, seasonality, and anomalies",
automation_level="semi-automated",
report_format="html"
)🏗️ 建筑
EDA Assistant MCP
├── 🔧 FastMCP Server
├── 📝 Analysis Prompts (20+ specialized prompts)
├── 🛠️ File Operations Tools
├── 📊 Statistical Analysis Modules
├── 🎨 Visualization Strategies
└── 🤖 ML Readiness Assessment🎯 用例
📈 商业智能
- 客户行为分析
- 销售业绩评价
- 市场趋势识别
- 风险评估和监测
🔬 数据科学项目
- 数据集探索和分析
- 特征工程和选择
- 模型准备和验证
- 自动化分析管道
📊 研究与分析
- 统计假设检验
- 相关性模式发现
- 时间序列预测准备
- 地理空间格局分析
🏢 企业数据管理
- 数据质量审计
- 自动化报告系统
- 特定于利益相关者的仪表板
- 合规与治理
🤝 整合
与Claude/ChatGPT合作
# Configure as MCP server in your AI assistant
# Add to your MCP configuration:
{
"name": "eda-assistant",
"command": "python",
"args": ["path/to/server.py"]
}使用Jupyter笔记本
# Import and use prompts directly
from server import mcp
# Access any prompt function
result = mcp.get_prompt("initial_data_exploration")📚 文档
提示类别
|类别|描述|用例| |----------|-------------|-----------|| | 核心EDA |基础数据探索|初步分析、质量审核| | 统计的 |高级统计分析|假设检验,分布| | 专业 |特定领域分析|时间序列、地理空间、文本| | ML准备 |模型准备评估|功能工程、验证| | 自动化 |管道和报告|自动化工作流程、仪表板|
分析深度级别
- 快速 -基本分析和概述
- 标准 -可视化综合分析
- 深 -高级统计测试和建模准备
- 自定义 -使用专业技术进行领域特定分析
🔧 配置
环境变量
# Optional: Set analysis preferences
EDA_DEFAULT_DEPTH=comprehensive
EDA_VISUALIZATION_BACKEND=plotly
EDA_AUTOMATION_LEVEL=semi-automated自定义分析模板
通过扩展基本MCP服务器创建自定义提示模板:
@mcp.prompt()
def custom_domain_analysis(dataset_info: str, domain_context: str) -> str:
"""Your custom analysis prompt"""
return f"Custom analysis for {domain_context}..."🚀 高级功能
多尺度分析
- 全球格局 -数据集范围内的趋势和分布
- 局部模式 -分组和细分分析
- 时间模式 -基于时间的趋势分析
- 空间格局 -地理分布分析
智能自动化
- 智能提示选择 -情境感知分析建议
- 渐进式披露 -基于发现的复杂性缩放
- 质量门 -自动验证和质量检查
- 利益相关者的适应 -针对特定受众的报告生成
🤝 贡献
我们欢迎捐款!请查看我们的 贡献指南 了解详情。
开发设置
- 复刻仓库
- 创建要素分支:
git checkout -b feature/amazing-feature - 安装开发依赖项:
uv sync --dev - 进行更改并添加测试
- 提交拉取请求
贡献领域
- 🔄 针对专业领域的新分析提示
- 🎨 增强的可视化模板
- 🤖 ML模型集成改进
- 📊 高级统计方法
- 🌐 多语言支持
📄 许可证
此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。
🙏 致谢
- FastMCP -优秀的MCP框架,可快速开发
- 熊猫和NumPy -核心数据操作库
- Matplotlib&Seaborn -可视化功能
- Plotly -交互式可视化支持
📞 支持
- 📧 电子邮件: your-email@domain.com
- 🐛 问题:
- 💬 讨论:
🗺️ 路线图
🎯 版本1.1
- \[\]交互式仪表板生成
- \[\]实时流数据分析
- \[\]高级ML模型集成
- \[\]支持多语言数据集
🚀 版本1.2
- \[\]云部署模板
- \[\]API端点生成
- \[\]计划分析自动化
- \[\]企业SSO集成
🌟 版本2.0
- \[\]人工智能驱动的洞察力生成
- \[\]自然语言查询界面
- \[\]协作分析工作区
- \[\]高级治理功能
______________________________________________________________________
🔍 Explore your data with intelligence. Analyze with confidence. 📊
由...制作❤️ 通过 Yash Kavaiya
