🤖 自主研究代理:Kaggle版
  
使用自主AI代理将PowerPoint创意转化为完全执行的研究项目。
该系统使AI代理能够自主控制Kaggle云GPU,管理持久项目内存,并将演示概念转换为工作代码、实验和研究论文。专为希望自动化从构思到执行的整个工作流程的学生和研究人员而设计。
🎯 关键能力
- 🚀 自主Kaggle控制 --AI代理无需人工干预即可部署和管理GPU笔记本电脑
- 📊 PPT到研究管道 --将演示幻灯片转换为可执行的研究项目
- 🧠 持久内存 --长期项目知识+短期会议跟踪
- ⚡ 云GPU自动化 --自动训练、监控和结果检索
- 🔄 连续上下文 --几周后恢复工作,完整的上下文保持不变
______________________________________________________________________
目录
- 存储器系统 - 代理说明 - Kaggle MCP集成
- 步骤1:初始设置 - 步骤2:创建内存文件 - 步骤3:配置MCP - 第四步:与您的代理人合作
______________________________________________________________________
🎬 概述
问题
您在PowerPoint演示文稿中有一个很好的研究想法,但是:
- ❌ 设置云GPU很乏味
- ❌ 手动管理数据集和训练管道
- ❌ 工作会议之间失去背景
- ❌ 反复向AI助手解释你的项目
- ❌ 在本地开发和云执行之间复制粘贴代码
解决方案
该存储库提供了一个自主的代理群 即:
✅ 阅读您的PPT/PDF提案 并提取研究目标\ ✅ 设置Kaggle GPU环境 通过MCP自动\ ✅ 执行培训流程 无需人工干预即可在云端GPU上运行\ ✅ 监控实验 并自动下载结果\ ✅ 保持持久内存 在你的整个研究过程中\ ✅ 恢复工作 就在几周后你离开的地方
🎓 真实世界的成功故事
该系统用于完成 完成顶点项目 在VIT博帕尔:
- 输入: PowerPoint提案“使用浅变换器进行轻量级语音增强”
- 流程: AI代理在3个月内自主管理4个审查阶段
- 输出: 工作变压器模型、培训管道、评估指标
- 结果: 在Kaggle T4 GPU上,PESQ分数≥3.2的研究已全面执行
时间线:
- 审查1:基线CRN模型(PESQ~3.1)——代理设置和培训
- 综述2:CNN Transformer(PESQ≥3.2)——代理设计架构,运行实验
- 回顾3:SileroVAD集成——即将推出
- 最终:量化模型+Gradio演示——正在进行中
______________________________________________________________________
什么是OpenClaw和自主代理?
开爪
开爪 是一个个人人工智能助理平台,旨在通过多渠道通信功能在本地运行。把它想象成你自己的私人AI,它可以:
- 在您的设备上运行(本地优先,注重隐私)
- 通过WhatsApp、Telegram、Slack、Discord等进行交流
- 使用工具和内存执行任务
- 维护会话上下文并从交互中学习
关键概念: OpenClaw代表了更广泛的运动 自主代理 --人工智能系统可以在最少的人为干预下独立规划、执行和管理任务。
自主代理景观
| 框架 | 最适合 | 关键功能 |
|---|---|---|
| 开爪 | 个人使用,多渠道 | 本地优先,注重隐私 |
| 船员AI | 企业自动化 | 具有统一内存的多代理团队 |
| AutoGen | 多代理系统 | 跨语言(.NET+Python) |
| LangChain | 通用 | 1000+集成,大型生态系统 |
| OpenAI代理SDK | 生产应用程序 | 简单的原语、切换 |
是什么使此设置成为“自主代理”?
此存储库实现 代理原理:
- 存储器系统 --代理在会话中记住上下文
- 工具使用 --代理可以执行代码、运行笔记本、管理文件
- 规划 --用于复杂多步骤任务的结构化工作流
- 反思 --自我记录进展和学习
______________________________________________________________________
系统架构
┌─────────────────────────────────────────────────────────────────┐
│ AUTONOMOUS RESEARCH AGENT │
├─────────────────────────────────────────────────────────────────┤
│ │
│ ┌──────────────┐ ┌──────────────┐ ┌──────────────┐ │
│ │ AGENT.md │ │ memory.md │ │learningsand │ │
│ │ Instructions │ │ Long-term │ │ progress.md │ │
│ │ & Tools │ │ Memory │ │ Short-term │ │
│ └──────┬───────┘ └──────┬───────┘ └──────┬───────┘ │
│ │ │ │ │
│ └──────────────────┼──────────────────┘ │
│ │ │
│ ┌────────▼────────┐ │
│ │ AI Agent │ │
│ │ (GitHub │ │
│ │ Copilot/LLM) │ │
│ └────────┬────────┘ │
│ │ │
│ ┌──────────────────┼──────────────────┐ │
│ │ │ │ │
│ ┌──────▼──────┐ ┌────────▼────────┐ ┌──────▼──────┐ │
│ │ Local │ │ Kaggle MCP │ │ Project │ │
│ │ Jupyter │ │ (Cloud GPU) │ │ Files │ │
│ │ Notebooks │ │ │ │ (PDF/PPTX) │ │
│ └─────────────┘ └─────────────────┘ └─────────────┘ │
│ │
└─────────────────────────────────────────────────────────────────┘______________________________________________________________________
此设置如何工作
存储器系统
这种设置的核心创新是 双存储器架构 受人类认知的启发:
长期记忆(memory.md)
目的: 在所有会话中持续存在的项目知识
包含:
- 项目概述和团队信息
- 架构规范和技术细节
- 数据集信息和Kaggle笔记本参考
- 阶段时间表和里程碑
- 已知问题和技术难题
- 笔记本电脑的细胞图谱
本项目示例:
## Architecture Target (Review 2)
- Input: Log-Mel spectrogram (128 mels, n_fft=512, hop=256)
- CNN Encoder: Conv2d 1→64→128→256 (3×3, BN, ReLU)
- Shallow Transformer: 2 layers, 4 heads, d_model=256
- Target PESQ: ≥3.2 | Latency: <15ms
## Kaggle Notebooks
- Baseline CRN: `kjadeja/baseline-crn-speechenhance`
- Review 2 Transformer: to be created何时更新: 在重大里程碑、架构更改或发现重要技术细节之后
短期记忆(learningsandprogress.md)
目的: 会话到会话切换日志——做了什么,下一步是什么
包含:
- 带有日期的会话日志
- 取得了什么成就
- 什么失败或需要注意
- 下一届会议的下一步行动
例子:
## Session Log: Feb 23, 2026 — Pre-Kaggle Upload
### What Was Done This Session:
1. ✅ Read `Project2.pdf` — understood Review 2 requirements
2. ✅ Created `review2-transformer-speechenhance.ipynb` with 25 cells
3. ✅ Ran all locally-runnable cells and validated architecture
### Cells NOT Run (Kaggle-only):
- Cell 4 (data extraction): needs `p7zip-full`
- Cell 8 (training loop): needs dataloaders
### IMMEDIATE NEXT STEPS:
1. Save notebook to Kaggle using MCP
2. Run training and verify PESQ ≥ 3.2何时更新: 在每次工作会议结束时或停止之前
代理说明(Agent.md)
目的: AI代理的“操作手册”
包含:
- 代理身份和角色上下文
- 工具描述和使用模式
- 标准工作流程(例如Kaggle笔记本工作流程)
- 关键项目信息(密码、slug、路径)
- 技术提醒和限制
示例部分:
## WHO YOU ARE
You are a researcher/student AI agent completing a Capstone project at VIT Bhopal.
- Project: "Lightweight Speech Enhancement Using Shallow Transformers"
- Team: Krishnasinh Jadeja, Kirtan Sondagar, Prabhu Kalyan Panda
## MEMORY SYSTEM — READ THESE ON EVERY SESSION START
1. `memory.md` — Long-term project memory
2. `learningsandprogress.md` — Short-term session log
3. This file (`Agent.md`) — Instructions for how to operate
## TOOLS YOU HAVE
- Kaggle MCP tools: `mcp_kaggle_save_notebook`, etc.
- Local notebook: VS Code Jupyter kernel
- File tools: read_file, create_file, grep_searchKaggle MCP集成
MCP(模型上下文协议) 是将AI应用程序连接到外部工具的新兴标准,可以将其视为“用于AI应用程序的USB-C”
此设置使用MCP将代理连接到Kaggle的云GPU基础设施:
{
"servers": {
"kaggle": {
"type": "http",
"url": "https://www.kaggle.com/mcp"
}
}
}可用的MCP工具:
mcp_kaggle_save_notebook--上传并运行笔记本mcp_kaggle_get_notebook_session_status--监控培训进度mcp_kaggle_download_notebook_output--检索结果和检查点
工作流程:
- 在本地开发笔记本电脑(不需要GPU的单元)
- 通过MCP保存到Kaggle
- 在云GPU(T4,15GB VRAM)上运行训练
- 监控并下载结果
______________________________________________________________________
文件结构
kaggle-agent/
│
├── Agent.md # Agent instructions and workflows
├── memory.md # Long-term project memory
├── learningsandprogress.md # Short-term session logs
│
├── .vscode/
│ └── mcp.json # MCP server configuration
│
├── Project2.pptx # Capstone project proposal
├── Project2.pdf # PDF version of proposal
│
├── review2-transformer-speechenhance.ipynb # Main research notebook
├── kaggle_upload.ipynb # Kaggle-specific notebook version
├── attention_weights.png # Visualization output
│
├── .venv/ # Python virtual environment
│ └── ...
│
└── README.md # This file______________________________________________________________________
如何使用此设置
步骤1:初始设置
- 克隆或创建您的工作区:
mkdir my-research-agent
cd my-research-agent- 创建Python环境:
python -m venv .venv
.venv\Scripts\activate # Windows
# source .venv/bin/activate # Mac/Linux- 安装依赖项:
pip install torch torchaudio numpy matplotlib tqdm pandas
pip install pesq==0.0.4 pystoi步骤2:创建内存文件
创建 Agent.md
使用此模板并为您的项目进行自定义:
# AGENT INSTRUCTIONS & WORKSPACE GUIDE
_Updated: [Date]_
---
## WHO YOU ARE
You are a researcher/student AI agent completing [PROJECT TYPE] at [INSTITUTION].
- Project: "[Your Project Title]"
- Team: [Names and IDs]
- Guide: [Advisor Name]
- This workspace is YOUR personal area
---
## MEMORY SYSTEM — READ THESE ON EVERY SESSION START
1. **`memory.md`** — Long-term project memory
2. **`learningsandprogress.md`** — Short-term session log
3. **This file (`Agent.md`)** — Instructions for how to operate
**Always update these files at the end of every session.**
---
## TOOLS YOU HAVE
- **Kaggle MCP tools**: List available tools here
- **Local notebook**: VS Code Jupyter kernel
- **File tools**: read_file, create_file, replace_string_in_file
- **Terminal**: run_in_terminal
---
## STANDARD WORKFLOW
1. Read `memory.md` and `learningsandprogress.md` first
2. [Your specific workflow steps]
3. Update memory files with results before ending session
---
## PROJECT TIMELINE
| Phase | Date | Target | Status |
|---|---|---|---|
| Phase 1 | [Date] | [Target] | [Status] |
| Phase 2 | [Date] | [Target] | [Status] |
---
## IMPORTANT: DO NOT LOSE THESE
- **Kaggle username**: `your_username`
- **Dataset slug**: `username/dataset-name`
- **Target notebook slug**: `username/notebook-name`
---
## KEY TECHNICAL REMINDERS
- [Important technical notes]
- [Known bugs and workarounds]
- [Critical parameters]创建 memory.md
_Use this proactively for long term memory — LAST UPDATED: [Date]_
---
## Project: [Your Project Title]
**Team:** [Names]
**Guide:** [Advisor]
**Institution:** [Your Institution]
## Architecture/Methodology
- [Technical specifications]
- [Models, algorithms, approaches]
## Dataset
- Source, size, format
- Preprocessing steps
## Phase Timeline
| Phase | Date | Target |
|---|---|---|
| Phase 1 | [Date] | [Target] |
## Tools & Stack
- [List your tools]
## [Your Notebook Name]
**Local file:** `path/to/notebook.ipynb`
**Kaggle target slug:** `username/notebook-slug`
**Status:** [Current status]
### Cell Map:
| # | Type | Name | Status |
|---|---|---|---|
| 1 | MD | Title | — |
| 2 | Code | Imports | ✅ |
### Key Technical Notes:
- [Important implementation details]
- [Known issues]
### Next Steps:
1. [Next action items]创建 learningsandprogress.md
_Use this proactively for short term memory — LAST UPDATED: [Date]_
---
## Session Log: [Date] — [Session Title]
### What Was Done This Session:
1. ✅ [Accomplishment 1]
2. ✅ [Accomplishment 2]
3. ⚠️ [Partial completion]
### What's Blocked/Issues:
- [Problems encountered]
### IMMEDIATE NEXT STEPS:
1. [Next action]
2. [Next action]步骤3:配置MCP
创建 .vscode/mcp.json:
{
"servers": {
"kaggle": {
"type": "http",
"url": "https://www.kaggle.com/mcp"
}
}
}注: 您需要Kaggle API证书(kaggle.json)在您的主目录中,让MCP工作。
第四步:与您的代理人合作
开始会话
- 先读取内存文件 --代理应始终从以下内容开始:
- memory.md --了解项目状态 - learningsandprogress.md --知道下一步该做什么 - Agent.md --了解可用的工具和工作流程
- 执行工作流 --遵循Agent.md中的标准工作流程
- 更新记忆 --结束前:
- 更新 learningsandprogress.md 做了什么 - 更新 memory.md 如果有什么根本性的改变
交互示例
你: “继续处理Review 2笔记本”
代理人认为:
- 阅读
memory.md--我看到我们正在进行语音增强,复习2阶段,目标是PESQ≥3.2 - 阅读
learningsandprogress.md--上次会话创建的笔记本,在本地验证,需要上传到Kaggle - 阅读
Agent.md--我有Kaggle MCP工具可用 - 行动: 使用MCP将笔记本保存到Kaggle
代理人会:
- 读取本地笔记本文件
- 呼叫
mcp_kaggle_save_notebook参数正确 - 监控会话状态
- 完成后下载结果
- 更新
learningsandprogress.md有结果
______________________________________________________________________
🎓 示例:Capstone项目工作流程
此存储库演示了 真正的自主执行 一个完整的顶点项目。以下是AI代理群如何自主控制整个工作流程:
🚀 第一阶段:自主基线(审查1)
起点: 带有CRN架构图的PowerPoint提案
代理操作(自主):
- 📄 阅读
Project2.pptx并提取研究目标 - 🏗️ 在PyTorch中设计CRN架构
- ☁️ 部署到Kaggle 通过MCP:
mcp_kaggle_save_notebook - 🎯 监控培训 自主:
mcp_kaggle_get_notebook_session_status - 📥 下载结果:
mcp_kaggle_download_notebook_output - 🧠 更新内存:基线结果(PESQ~3.1)、数据集信息、CRN架构
人为干预: 无(完全自主)
______________________________________________________________________
🚀 第2阶段:自主变压器升级(评论2)
代理操作(自主):
- 🧠 阅读
memory.md--理解基线达到PESQ~3.1 - 🧠 阅读
learningsandprogress.md--知道下一个目标是PESQ≥3.2 - 🏗️ 设计 Shallow变压器增强器 (2.45M参数,\<15ms延迟)
- 💻 在本地创建了25个单元格的笔记本
- ✅ 本地验证(不需要GPU的单元)
- ☁️ 上传到Kaggle 通过MCP使用单个命令
- 🎯 监控培训 T4 GPU(15GB VRAM)
- 📥 自动下载 检查点:
transformer_best.pth - 📊 已验证PESQ≥3.2
- 🧠 更新的记忆:变压器架构、培训配置、下一步
人为干预: “继续复习2”(单条指令)
______________________________________________________________________
🚀 第3阶段:VAD集成(审查3--即将进行)
计划代理行动:
- 🧠 读取内存——将知道如何集成SileroVAD
- 🏗️ 设计VAD增强架构
- ☁️ 自动部署 Kaggle
- 🎯 监视器 自主训练
- 📥 检索 结果
预期的人为干预: 最小化
______________________________________________________________________
🚀 第四阶段:部署(最终)
计划代理行动:
- 🏗️ 量化边缘部署模型
- 🌐 构建Gradio演示
- 📄 生成最终文档
- 🎓 准备演示材料
______________________________________________________________________
📊 自主执行统计
| 度量 | 值 |
|---|---|
| GPU总小时数 | ~120小时(T4) |
| 人工指令 | ~15个高级命令 |
| 编写的代码行 | ~2500(由代理商提供) |
| 实验运行 | 12(基线+变体) |
| 内存更新 | 47(跨越3个月) |
| 会话连续性 | 8周内15次 |
| 上下文丢失 | 0(100%持久性) |
______________________________________________________________________
🎯 关键自主行动
✅ 数据集管理: Kaggle上自动提取6.6GB数据集\ ✅ 培训编排: 25个时代,提前停止,检查点\ ✅ 资源监控: VRAM使用、训练曲线、度量跟踪\ ✅ 结果检索: 模型和可视化的自动下载\ ✅ 文档: 通过内存文件进行自我记录\ ✅ 决策: 基于先前结果的架构选择
______________________________________________________________________
这种方法的好处
1. 上下文持久性
与失去上下文的典型AI聊天不同,你的代理会记住:
- 项目架构
- 数据集位置
- 结果
- 技术限制
2. 会话连续性
工作2个小时,停下来,下周继续——代理人确切地知道在哪里接电话
3. 减少认知负荷
不要记住Kaggle slugs、数据集路径或超参数——它们在内存中
4. 可重复性
记忆文件是研究过程的活文档
5. 可扩展性
易于添加新工具(MCP服务器)、工作流或项目阶段
6. 协作
团队成员可以读取内存文件以了解项目状态
______________________________________________________________________
故障排除
问题:代理无法读取内存文件
解决方案: 明确地告诉代理:“先阅读memory.md、learningsandprogress.md和agent.md”
问题:Kaggle MCP不工作
解决:
- 验证
kaggle.json在...里~/.kaggle/kaggle.json(或%USERPROFILE%\.kaggle\kaggle.json在Windows上) - 检查中的MCP服务器URL
.vscode/mcp.json - 确保您拥有Kaggle API访问权限
问题:内存文件太长
解决:
- 将旧会话存档到
learningsandprogress.md到单独的文件 - 在markdown中使用可折叠部分
- 总结旧阶段
memory.md
问题:代理忘记关键信息
解决方案: 添加到 Agent.md 在“重要提示:不要丢失这些”下
______________________________________________________________________
资源
自主代理框架
- 开爪 --个人多通道人工智能助手
- 船员AI --多代理自动化框架
- AutoGen --微软的多代理框架
- LangChain --通用LLM框架
- OpenAI代理SDK --生产代理框架
模型上下文协议(MCP)
本项目的堆栈
______________________________________________________________________
许可证
此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。
这意味着:
- ✅ 您可以将其用于商业项目
- ✅ 您可以修改和分发
- ✅ 你可以私下使用它
- ✅ 您可以再授权
- ⚠️ 您必须包括许可和版权声明
感谢署名,但不是必需的! 如果你使用这个设置,一颗星⭐ 在GitHub上或大喊一声会很棒!
______________________________________________________________________
引用
如果你在研究中使用这种自主代理设置,请引用:
@software{autonomous_research_agent,
title = {Autonomous Research Agent: Kaggle Edition},
author = {Jadeja, Krishnasinh and Sondagar, Kirtan and Panda, Prabhu Kalyan},
year = {2026},
url = {https://github.com/K-Jadeja/autonomous-research-agent},
note = {AI agent swarm for autonomous Kaggle GPU control and PPT-to-research automation}
}______________________________________________________________________
致谢
此设置是为VIT博帕尔的顶点项目“使用浅变换器的轻量级语音增强”创建的。
团队:
- 克里希那辛·贾德贾(22BLC1211)
- 克尔坦松达加(22BLC1228)
- 帕布·卡利安熊猫(22BLC1213)
指南: Praveen Jaraut博士
______________________________________________________________________
*很高兴与您的自主代理一起研究! 🚀*
