视频研究mcp
Claude Code无法处理视频或生成媒体。Gemini 3.1 Pro和ElevenLabs可以。这个插件将它们连接在一起,让克劳德可以通过MCP访问视频理解、深入研究、网络搜索和完整的媒体制作工具包。
  ](https://www.npmjs.com/package/video-research-mcp)  
Watch the full demo on YouTube
盒子里有什么
A. Claude代码插件 拥有51个工具、17个斜线命令、12个技能和7个子代理。MCP服务器提供工具。这些命令为您提供了快速的工作流程(/gr:video, /gr:research).这些技能教会了克劳德如何使用一切——从研究到电影视频制作。代理处理并行研究和可视化等后台任务。
| 服务器 | 工具 | 用途 |
|---|---|---|
| 视频研究mcp | 34 | 视频分析、深度研究、内容提取、网络搜索、学术论文、知识存储 |
| 视频解释器mcp | 15 | 从研究中合成解释者视频(包装 视频解说员) |
| 视频代理mcp | 2 | 通过并行场景生成 Claude代理SDK |
安装
npx video-research-mcp@latest
export GEMINI_API_KEY="your-key-here"一个命令。一个API密钥。安装程序将17个命令、12个技能和7个代理复制到 ~/.claude/ 并配置MCP服务器通过 uvx 来自PyPI。
npx video-research-mcp@latest --check # show install status
npx video-research-mcp@latest --uninstall # clean removal
npx video-research-mcp@latest --local # install for this project only需要Python>=3.11, 紫外线, >=16,以及a 谷歌人工智能API密钥.
它做什么
观看会议录音
/gr:video-chat ~/recordings/project-kickoff.mp4
> "Create meeting minutes in Dutch. Screenshot every shared screen."Gemini观看完整视频,并提取时间戳、决策和行动项。对于本地文件,ffmpeg在关键的视觉时刻提取帧。超过20MB的文件被上传到Gemini的文件API和上下文缓存——后续问题重用缓存而不是重新加载。
分析YouTube教程
/gr:video https://youtube.com/watch?v=...同样的功能也适用于YouTube。精确的时间戳、概念图和在后台分析的评论情绪。
研究一个具有证据分级的主题
/gr:research "HNSW index parameters for high-dimensional embeddings"并行运行网络搜索和Gemini分析。每个发现都有一个证据层——确认、强指标、推理或猜测——这样你就知道给每个说法多大的权重。结果被可视化为交互式证据网络。
分析论文、URL或目录
/gr:analyze https://arxiv.org/abs/2401.12345
/gr:analyze ~/papers/attention-is-all-you-need.pdf
/gr:analyze ~/papers/ # cross-document comparison适用于PDF、URL和原始文本。提取实体、关系和关键参数。将其指向一个目录,它会一次性比较所有文档。支持PDF、TXT、MD、HTML、XML、JSON、CSV。
基于源文件的研究
/gr:research-doc ~/papers/
/gr:research-doc paper1.pdf paper2.pdf "Compare methodologies and find contradictions"四阶段流程:文档映射、证据提取、交叉引用、综合。每一项索赔都被引回文件和页码。
搜索网页
/gr:search "latest developments in MCP protocol"通过Gemini搜索源引用。
回想一下你学到了什么
/gr:recall # overview: stats + saved analyses
/gr:recall "kubernetes" # semantic search + filesystem grep
/gr:recall ask "what do I know about X?" # AI-powered Q&A with source citations什么都不会丢失。每个分析和研究结果都会自动存储。几周后,在另一个项目中,你只需问。配置Weaviate后,搜索将使用语义匹配。如果没有它,recall就会退回到保存文件上的确切关键字grep。
将其用作独立的MCP服务器
这些工具是标准的MCP。任何MCP客户端都可以调用它们——不需要克劳德代码。
{
"mcpServers": {
"video-research": {
"command": "uvx",
"args": ["video-research-mcp"],
"env": { "GEMINI_API_KEY": "${GEMINI_API_KEY}" }
}
}
}命令
| 命令 | 它的作用 | |
|---|---|---|
/gr:video | 基于概念图和帧提取的单镜头视频分析 | |
/gr:video-chat | 带渐进式笔记的多回合视频问答 | |
/gr:research | 使用证据层标签进行深入研究 | |
/gr:research-deep | 发布Gemini深度研究代理,并附上面试简报 | |
/gr:research-doc | 基于源文件的证据分层研究 | |
/gr:analyze | 分析任何URL、文件、文本或文档目录 | |
/gr:search | 通过Gemini基础进行网络搜索 | |
/gr:recall [filter] | 从内存中浏览过去的分析 | |
/gr:models [preset] | 切换Gemini型号预设(最佳/稳定/预算) | |
/gr:getting-started | 引导入职和环境检查 | |
/gr:ingest | 将外部结构化知识导入Weaviate | |
/gr:traces [filter] | 查询、调试和评估MLflow跟踪 | |
| `/gr:doctor [quick\ | full]` | 诊断MCP接线、API键、Weaviate和MLflow连接 |
/gr:advisor | 获取工作流建议——哪个/gr命令适合您的任务 | |
| `/ve:explainer | ||
| ` | 创建和管理解释器视频项目 | |
| `/ve:explain-video | ||
| ` | 从项目内容生成完整的解释者视频 | |
| `/ve:explain-status | ||
| ` | 检查渲染进度和管道状态 |
命令如何运行
/gr:video-chat ~/recordings/call.mp4
> "Summarize this meeting, extract action items"
Phase 1 Gemini analyzes the video
Phase 2 Results saved to memory
Phase 2.5 ffmpeg extracts frames (local files only)
Phase 3 Concepts and relationships enriched
Phase 4 Interactive visualization generated (opt-in)
Phase 5 Playwright screenshots it
Phase 6 Everything copied to output//可视化和评论分析作为后台代理运行,因此它们不会阻止对话。
输出结构
output/project-kickoff-2026-02-28/
├── analysis.md # timestamped analysis with YAML frontmatter
├── frames/ # extracted video frames (local files)
├── concept-map.html # interactive visualization
└── screenshot.png # static capture工具
video-research-mcp -- 34 tools
视频 (4): video_analyze, video_create_session, video_continue_session, video_batch_analyze
油管 (3): video_metadata, video_comments, video_playlist
研究 (4): research_deep, research_plan, research_assess_evidence, research_document
深度研究代理 (4): research_web, research_web_status, research_web_followup, research_web_cancel
学术研究 (5): research_paper_search, research_paper_details, research_paper_citations, research_paper_recommendations, research_author_search
内容 (3): content_analyze, content_batch_analyze, content_extract
搜索 (1): web_search
基础设施 (2): infra_cache, infra_configure
知识 (8): knowledge_search, knowledge_related, knowledge_stats, knowledge_fetch, knowledge_ingest, knowledge_schema, knowledge_ask, knowledge_query
video-explainer-mcp -- 15 tools
项目 (4): explainer_create, explainer_inject, explainer_status, explainer_list
管道 (6): explainer_generate, explainer_step, explainer_render, explainer_render_start, explainer_render_poll, explainer_short
质量 (3): explainer_refine, explainer_feedback, explainer_factcheck
音频 (2): explainer_sound, explainer_music
video-agent-mcp -- 2 tools
场景生成 (2): agent_generate_scenes, agent_generate_single_scene
技能
技能教会克劳德如何正确使用工具和工作流程。它们在相关时会自动加载——您永远不会手动调用它们。
研究与分析
| 技能 | 它教什么 |
|---|---|
| 视频研究 | 所有34个视频研究mcp工具——选择、缓存、错误处理 |
| 视频解释器 | 15个解释工具——流水线顺序、渲染、TTS配置 |
| 双子座形象 | 基于分析结果的交互式HTML可视化 |
| 弱化设置 | 指导Weaviate入职和连接设置 |
| mlflow痕迹 | MLflow跟踪查询、调试和评估 |
| 研究简报生成器 | 用于深入研究的结构化研究简报 |
| gr顾问 | 建议正确 /gr 任务的命令 |
媒体制作(v0.6.0中新增)
| 技能 | 它教什么 |
|---|---|
| tts生产 | ElevenLabs TTS——API模式、语音预设、轻松躲避、多语言叙述 |
| ffmpeg制作 | 后处理链顺序、编解码器选择、平台导出预设 |
| 视频生成 | 使用Veo或Sora的AI视频——提供商选择矩阵,从草稿到最终工作流程 |
| 视频制作 | 电影多镜头风格锚点,4种链式模式,帧级QA |
| 图像生成 | mcp图像的样式锚点提示优化(主题上下文样式) |
生产技能使用 渐进式披露:核心模式在触发时加载(每个约1000字),详细的食谱和参考表存在 references/ 并按需加载。
知识库
连接Weaviate,你学到的一切都会被存储起来——可以在项目和会话中搜索。没有它,插件的工作原理是一样的;你只是没有得到持久的语义搜索。
首次连接时创建了13个集合:
| 收藏 | 填表人 |
|---|---|
ResearchFindings | research_deep, research_assess_evidence, research_document |
VideoAnalyses | video_analyze, video_batch_analyze |
ContentAnalyses | content_analyze, content_batch_analyze |
VideoMetadata | video_metadata |
SessionTranscripts | video_continue_session |
WebSearchResults | web_search |
ResearchPlans | research_plan |
DeepResearchReports | research_web_status, research_web_followup |
CommunityReactions | 评论分析(通过 /gr:video 代理人) |
ConceptKnowledge | 从分析中提取概念 |
RelationshipEdges | 概念之间的关系映射 |
CallNotes | 会议/通话分析笔记 |
AcademicPapers | research_paper_search, research_paper_details, research_paper_citations, research_paper_recommendations |
知识图谱
分析工具(content_analyze, video_analyze, research_deep, research_web, research_document, content_batch_analyze)自动提取概念和关系。随着时间的推移,这将在您的所有研究中构建一个可查询的知识图——不需要手动步骤。
八种知识工具查询这些数据:混合搜索和可选的Cohere重新排序、语义相似性、按UUID获取、手动摄取、模式自检和收集统计数据。 knowledge_ask 使用Weaviate的QueryAgent生成带有源引用的人工智能答案。
# install QueryAgent support
uv pip install 'video-research-mcp[agents]'要设置Weaviate,请执行以下操作:
export WEAVIATE_URL="https://your-cluster.weaviate.network"
export WEAVIATE_API_KEY="your-key"配置
| 变量 | 默认值 | 它的作用 |
|---|---|---|
GEMINI_API_KEY | (必填) | 谷歌人工智能API密钥 |
GEMINI_MODEL | gemini-3.1-pro-preview | 主要型号 |
GEMINI_FLASH_MODEL | gemini-3-flash-preview | 快速搜索和摘要模型 |
DEEP_RESEARCH_AGENT | deep-research-pro-preview-12-2025 | 交互API代理 |
WEAVIATE_URL | "" | 编织URL(空=知识库已禁用) |
WEAVIATE_API_KEY | "" | 编织云所需 |
COHERE_API_KEY | "" | 在知识搜索中启用Cohere-reranker |
ELEVENLABS_API_KEY | "" | 用于TTS画外音制作 |
OPENAI_API_KEY | "" | 用于Sora视频生成和OpenAI TTS |
YOUTUBE_API_KEY | "" | YouTube数据API密钥(返回到 GEMINI_API_KEY) |
S2_API_KEY | "" | 语义学者API密钥(更高的速率限制) |
MLFLOW_TRACKING_URI | "" | MLflow服务器URL(空=禁用跟踪) |
EXPLAINER_PATH | "" | 克隆视频_解释器仓库路径 |
EXPLAINER_TTS_PROVIDER | "mock" | TTS提供商:mock、elevenlabs、openai、gemini、edge |
All configuration variables
| 变量 | 默认值 | 它的作用 |
|---|---|---|
GEMINI_THINKING_LEVEL | high | 思维深度(最小/低/中/高) |
GEMINI_TEMPERATURE | 1.0 | 取样温度 |
GEMINI_CACHE_DIR | ~/.cache/video-research-mcp/ | 缓存目录 |
GEMINI_CACHE_TTL_DAYS | 30 | 缓存过期 |
GEMINI_MAX_SESSIONS | 50 | 最大并发视频会话数 |
GEMINI_SESSION_TIMEOUT_HOURS | 2 | 会话TTL |
GEMINI_SESSION_MAX_TURNS | 24 | 每次会话的最大转弯次数 |
GEMINI_SESSION_DB | "" | 会话持久性的SQLite路径(空=内存中) |
MLFLOW_EXPERIMENT_NAME | video-research-mcp | 流体流动实验名称 |
其他安装方法
独立MCP服务器(无插件资产)
{
"mcpServers": {
"video-research": {
"command": "uvx",
"args": ["video-research-mcp"],
"env": { "GEMINI_API_KEY": "${GEMINI_API_KEY}" }
}
}
}克劳德桌面
添加 claude_desktop_config.json:
{
"mcpServers": {
"video-research": {
"command": "uvx",
"args": ["video-research-mcp"],
"env": { "GEMINI_API_KEY": "your-key-here" }
}
}
}来源
git clone https://github.com/Galbaz1/video-research-mcp
cd video-research-mcp
uv venv && source .venv/bin/activate && uv pip install -e ".[dev]"
node bin/install.js --global发展
uv venv && source .venv/bin/activate
uv pip install -e ".[dev]"
uv run pytest tests/ -v # 781 tests, all mocked
uv run ruff check src/ tests/ # lint故障排除
| 问题 | 修复 |
|---|---|
| 没有API密钥错误 | 设置 GEMINI_API_KEY |
| 429/超出配额 | 等待60秒,或切换到 /gr:models budget 更高的利率限制 |
| 视频分析为空 | 视频可能是私人的、年龄限制的或区域锁定的 |
| 未提取帧 | 安装ffmpeg: brew install ffmpeg |
| 可视化缺失 | 确保Node.js在PATH上(Playwright通过npx运行) |
| Weaviate无法连接 | 检查 WEAVIATE_URL 并且实例正在运行 |
| 知识工具为空 | 设置 WEAVIATE_URL 启用知识库 |
weaviate-agents not installed | uv pip install 'video-research-mcp[agents]' |
| MLflow工具不可用 | 设置 MLFLOW_TRACKING_URI 并开始 mlflow server --port 5001 |
| ElevenLabs MCP工具404 | 改用curl API调用--请参阅 tts-production 技能 |
贡献
看 贡献.md 用于开发设置和公关指南。看 ROADMAP.md 用于计划工作。通过以下方式报告安全问题 安全.md.
作者
福斯托·阿尔伯斯 --首席人工智能研发 工业数字双胞胎实验室阿姆斯特丹应用科学大学(HvA)的Jurjen Helmus研究小组。……的创始人 想知道为什么.
学分
- 谷歌双子座 (
google-genaiSDK)——Gemini 3.1 Pro提供了原生视频理解、思维模式、上下文缓存和1M令牌窗口,使所有这些都能正常工作。 - FastMCP --MCP服务器框架。可组合的子服务器模式(
app.mount())在3台服务器上组织51个工具。 - 十一实验室 --带有单词级时间戳的文本到语音转换,用于生成画外音。
- 派丹蒂克 --所有工具I/O的模式验证。通过结构化生成
model_json_schema(). - MLW (
mlflow-tracing)--可选的可观察性。每个Gemini呼叫都会成为一个可追踪的范围,包括令牌计数和延迟。 - 凝聚 --知识搜索中的可选重新排序,以获得更好的结果相关性。
- 远程动议 --解释器管道的基于React的视频渲染。
- Claude代理SDK --支持并行场景生成
video-agent-mcp.
许可证
麻省理工学院
