MCP会议
MCP(模型上下文协议)服务器,提供对LLM模型“秘密会议”的访问,使任何兼容MCP的客户端都能咨询多个前沿模型,以获得不同的意见、同行排名评估和综合答案。
为什么存在
当与人工智能助手合作时,你会得到一个模型的视角。有时,这正是你所需要的。但对于重要的决策——技术架构、业务战略、创意方向、复杂分析,或任何盲点很重要的情况——多种意见会提出你可能会错过的替代方案。
Concave为任何工作流程带来了民主的人工智能共识。
您可以通过Claude Desktop、Claude Code或任何MCP客户端咨询会议,而不是手动查询多个AI服务。从多个前沿模型(GPT、Claude、Gemini、Grok、DeepSeek)中获取排名意见,并获得代表集体AI智慧的综合答案。
用例包括:
- 技术的:架构决策、代码审查、调试、API设计
- 商业:战略分析、提案审查、市场研究综合
- 创意:撰写反馈、头脑风暴、编辑观点
- 研究:文献综述、事实核查、多角度分析
- 决策:利弊分析、风险评估、选项评估
受...启发 安德烈·卡帕斯的llm委员会 概念。该项目将核心思想重新实现为MCP服务器,以便与人工智能辅助的工作流程无缝集成。
运作原理
秘密会议分为三个阶段:
┌─────────────────────────────────────────────────────────────────┐
│ Stage 1: OPINIONS │
│ Query multiple LLMs in parallel for independent responses │
│ (GPT, Claude, Gemini, Grok, DeepSeek, etc.) │
└─────────────────────────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────────┐
│ Stage 2: PEER RANKING │
│ Each model anonymously evaluates and ranks all responses │
│ Aggregate scores reveal best performers (lower = better) │
└─────────────────────────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────────────┐
│ Stage 3: SYNTHESIS │
│ Chairman model synthesizes final answer from collective wisdom │
│ Consensus level reported (strong/moderate/weak/split) │
│ Tiebreaker vote cast if conclave is split │
└─────────────────────────────────────────────────────────────────┘特性
- 分层查询:选择成本/深度权衡(快速|排名|完整)
- 三级议会:高级(前沿)、标准(平衡)、预算(快速/廉价)
- 一致性协议:检测协议级别,在拆分时触发决胜局
- 奇怪的秘密会议规模:确保决胜局投票能够打破僵局
- 轮值主席:每周轮换可防止单一型号偏差
- 主席预设:情境感知主席选择(代码、创意、推理)
- 成本估算:在查询之前,知道你会花多少钱
- 疏散灯:独立基准运行器,用于跟踪随时间变化的性能
安装
先决条件
- 从获取OpenRouter API密钥https://openrouter.ai/keys
- 向您的OpenRouter帐户添加积分(按需付费)
设置
# Clone the repository
git clone https://github.com/stephenpeters/conclave-mcp.git
cd conclave-mcp
# Install dependencies
uv sync
# Optional: Create .env file for running tests locally
# (Not required for MCP usage - API key is passed via client config)
echo "OPENROUTER_API_KEY=sk-or-v1-your-key-here" > .env配置Claude桌面
选项1:桌面扩展(推荐)
- 打开克劳德桌面
- 首选 设置>扩展>高级设置>安装扩展。..
- 导航到
conclave-mcp目录 - 按照提示配置您的
OPENROUTER_API_KEY - 重新启动克劳德桌面
选项2:手动配置
打开克劳德桌面,转到 设置>开发人员>编辑配置,并添加以下内容 claude_desktop_config.json:
{
"mcpServers": {
"conclave": {
"command": "uv",
"args": ["run", "--directory", "/path/to/conclave-mcp", "python", "server.py"],
"env": {
"OPENROUTER_API_KEY": "sk-or-v1-your-key-here"
}
}
}
}替换 /path/to/conclave-mcp 使用您的实际路径,保存并重新启动Claude Desktop。
配置Claude代码
使用CLI添加服务器:
claude mcp add --transport stdio conclave -- uv run --directory /path/to/conclave-mcp python server.py --env OPENROUTER_API_KEY=sk-or-v1-your-key-here或复制 .mcp.json.example 到 .mcp.json 并更新路径:
cp .mcp.json.example .mcp.json
# Edit .mcp.json with your paths and API key证实 /mcp 克劳德代码或 claude mcp list 在终端。
可用工具
conclave_quick
快速平行意见(仅第1阶段)。查询所有秘密模型并返回单个响应。
成本:每次查询约0.01-0.03美元
用于:快速头脑风暴,快速获得不同的观点
conclave_ranked
同行排名意见(第1+2阶段)。显示哪种模型在此特定问题上表现最佳。
成本:每次查询约0.05-0.10美元
用于:代码审查,比较方法,看看哪个模型“获胜”
conclave_full
完成总结(所有3个阶段)。包括共识检测和主席决胜局。
成本:每次查询约0.10-0.20美元
选项:
tier:模型层-"premium","standard"(默认),"budget"chairman:覆盖主席模型(例如。,"anthropic/claude-sonnet-4")chairman_preset:使用预设("code","creative","reasoning","concise","balanced")
用于:重要决策、架构选择、复杂调试
conclave_config
查看当前配置:秘密会议成员、主席轮换状态、共识阈值。
conclave_estimate
在运行查询之前估算成本。
conclave_models
列出所有可用型号及其选择编号。显示按层分组并具有稳定编号的模型:
- 高级级别:1-10
- 标准层:11-20
- 预算级别:21-30
- 主席团:31-40
conclave_select
根据型号创建自定义结论。第一个模型成为主席。
conclave_select(models="31,1,11,21")创建:
- 董事长:#31(deepseek-r1)
- 成员:#1(claude-opus-4.5),#11(claude-sonnet-4.5),#21(双子座-2.5-flash)
自定义选择将一直持续到服务器重新启动或 conclave_reset.
conclave_reset
清除自定义秘密选择并返回基于层的配置。
自定义模型选择
要完全控制哪些模型参与会议:
- 列出可用型号:使用
conclave_models查看所有型号及其编号 - 选择您的阵容:使用
conclave_select(models="31,1,11,21")-第一位是主席 - 查询:使用
conclave_quick,conclave_ranked,或conclave_full照常 - 重置:使用
conclave_reset返回到基于层的配置
工作流程示例:
> conclave_models
## Available Models
### Premium Tier (1-10)
1. anthropic/claude-opus-4.5
2. google/gemini-3-pro-preview
...
> conclave_select(models="31,1,12,21")
## Custom Conclave Created
Chairman (#31): deepseek/deepseek-r1
Members:
- #1: anthropic/claude-opus-4.5
- #12: google/gemini-2.5-pro
- #21: google/gemini-2.5-flash
> conclave_quick("What is the best approach for...")
[Uses your custom selection]
> conclave_reset
## Custom Conclave Cleared配置
编辑 config.py 自定义:
秘密会议层级
每一层都有独特的型号(没有重叠),以实现适当的性价比差异化:
# Premium: 6 frontier models for complex questions (~$0.30-0.50/query)
COUNCIL_PREMIUM = [
"anthropic/claude-opus-4.5", # Claude Opus 4.5
"google/gemini-3-pro-preview", # Gemini 3 Pro
"x-ai/grok-4", # Grok 4 (full reasoning)
"openai/gpt-5.1", # GPT-5.1 (flagship)
"deepseek/deepseek-v3.2-speciale", # DeepSeek V3.2 Speciale
"moonshotai/kimi-k2-thinking", # Kimi K2 Thinking (1T MoE)
]
# Standard: 4 balanced models (default) (~$0.10-0.20/query)
COUNCIL_STANDARD = [
"anthropic/claude-sonnet-4.5", # Claude Sonnet 4.5
"google/gemini-2.5-pro", # Gemini 2.5 Pro
"openai/o4-mini", # OpenAI o4-mini
"deepseek/deepseek-chat-v3.1", # DeepSeek Chat V3.1
]
# Budget: 4 cheap/fast models (~$0.02-0.05/query)
COUNCIL_BUDGET = [
"google/gemini-2.5-flash", # Gemini 2.5 Flash
"qwen/qwen3-235b-a22b:free", # Qwen 3 235B (free tier)
"openai/gpt-4.1-mini", # GPT-4.1 Mini
"moonshotai/kimi-k2:free", # Kimi K2 (free tier)
]主席轮换
主席池使用 仅推理模型 (非聊天模式)用于高质量合成:
CHAIRMAN_ROTATION_ENABLED = True
CHAIRMAN_ROTATION_DAYS = 7 # Rotate weekly
CHAIRMAN_POOL = [
"deepseek/deepseek-r1", # DeepSeek R1 reasoning
"openai/o3-mini", # OpenAI o3-mini reasoning
"anthropic/claude-sonnet-4", # Claude Sonnet 4 (strong reasoning)
"qwen/qwq-32b", # Qwen QWQ reasoning model
]共识阈值
CONSENSUS_STRONG_THRESHOLD = 0.75 # 75%+ agreement
CONSENSUS_MODERATE_THRESHOLD = 0.50 # 50-75% agreement
CHAIRMAN_TIEBREAKER_ENABLED = True # Chairman breaks tiesEval灯
一个独立的基准运行器,用于测试和比较跨层和随时间变化的秘密会议性能。
测试套件概述
eval套房包括 16项任务 穿过 9类,旨在测试不同的模型功能:
| 类别 | 任务 | 难度 | 测试内容 |
|---|---|---|---|
| 数学 | 2 | 简易中等 | 算术、文字题、逐步推理 |
| 代码 | 2 | Easy Medium | 漏洞检测、概念解释、代码示例 |
| 推理 | 2 | 中等难度 | 音节,多步逻辑谜题 |
| 分析 | 2 | 中等 | 逻辑谬误,权衡分析 |
| 摘要 | 2 | 中等 | 技术文档、业务报告 |
| 写作_商务 | 2 | 简易介质 | 专业电子邮件、提案 |
| 写作_创意 | 2 | 简单媒介 | 故事开头,原创隐喻 |
| 创造性的 | 1 | 简单 | 带解释的类比 |
| 事实的 | 1 | 简单 | 面向大众的科学解释 |
运行评估
# Run all 16 tests at standard tier (default)
python eval.py
# Run at different tiers
python eval.py --tier premium # 6 frontier models (~$0.30-0.50/query)
python eval.py --tier standard # 4 balanced models (~$0.10-0.20/query)
python eval.py --tier budget # 4 cheap/fast models (~$0.02-0.05/query)
# Different modes
python eval.py --mode quick # Stage 1 only (fastest, cheapest)
python eval.py --mode ranked # Stage 1 + 2 (adds peer rankings)
python eval.py --mode full # All 3 stages (default, includes synthesis)
# Filter by category
python eval.py --category math
python eval.py --category code
python eval.py --category reasoning
# Don't save results to disk
python eval.py --no-save
# Combine options
python eval.py --tier premium --mode full --category reasoning输出格式
结果保存到 evals/eval___.json 与:
- 元数据:时间戳、层级、模式、主席模型
- 摘要:成功率、总时间、每项任务的平均时间
- 结果:每个任务的详细信息包括:
- 单个模型响应 - 同行排名(排名/完整模式) - 主席综合(全模式) - 共识级别
输出示例
🏛️ Conclave Eval-Light
Tier: standard | Mode: full | Tasks: 16
--------------------------------------------------
[1/16] Running: math_arithmetic (math)
✓ Completed in 12.34s
[2/16] Running: math_word_problem (math)
✓ Completed in 15.67s
...
==================================================
📊 EVAL SUMMARY
==================================================
Tier: standard | Mode: full
Chairman: deepseek/deepseek-r1
Tasks: 16/16 successful
Total time: 287.45s
Avg per task: 17.97s
📋 Results by Task:
✓ math_arithmetic (easy) - 12.34s
✓ math_word_problem (medium) - 15.67s
✓ code_debug (easy) - 11.23s
...
💾 Results saved to: evals/eval_standard_full_20251204_143052.json比较层级
在所有层中运行相同的评估,以比较模型质量与成本:
python eval.py --tier budget --category reasoning
python eval.py --tier standard --category reasoning
python eval.py --tier premium --category reasoning然后比较JSON输出,看看不同的模型层在相同任务上的表现。
用例
| 场景 | 推荐工具 | 为什么 |
|---|---|---|
| “查看此功能” | conclave_ranked | 查看哪种模型捕获的问题最多 |
| “Redis与PostgreSQL的会话?” | conclave_full | 重要决策,需要综合考虑 |
| “此功能的想法” | conclave_quick | 快速多样的头脑风暴 |
| “调试此错误” | conclave_quick | 快速并行诊断 |
| “重写此段” | conclave_full + chairman_preset="creative" | 创意合成 |
| “这个建筑听起来怎么样?” | conclave_full + chairman_preset="code" | 技术综合 |
工具输出示例
## Conclave Full Result
**Consensus: ✅ STRONG** (75% agreement)
---
### Chairman's Synthesis
_Chairman: deepseek/deepseek-r1_
[Synthesized answer incorporating best points from all models...]
---
### Model Rankings (lower is better)
1. **claude-sonnet-4.5**: 1.50
2. **o4-mini**: 2.00
3. **gemini-2.5-pro**: 2.75
4. **deepseek-v3.1**: 3.75
_First-place votes:_ claude-sonnet-4.5=3, o4-mini=1项目结构
conclave-mcp/
├── server.py # MCP server entry point (5 tools)
├── conclave.py # Core 3-stage council logic
├── config.py # Model tiers, chairman rotation, cost estimates
├── eval.py # Standalone benchmark runner
└── evals/ # Saved evaluation results添加模型
OpenRouter支持200多种型号。在以下位置查找型号IDhttps://openrouter.ai/models
# Add to COUNCIL_* lists in config.py
"x-ai/grok-4" # xAI Grok
"meta-llama/llama-4-maverick" # Meta Llama
"mistralai/mistral-large-2" # Mistral
"deepseek/deepseek-r1" # DeepSeek reasoning重要:保持每层模型的唯一性(没有重叠),以便进行适当的区分。
OpenRouter的工作原理
OpenRouter是一个统一的API网关-您不需要使用OpenAI、Google、Anthropic等单独的帐户。一个API密钥,一个信用余额,访问所有模型。
- 注册:https://openrouter.ai
- 添加积分(预付,或启用自动充值)
- 对所有模型使用单个API密钥
许可证
麻省理工学院
归因
受...启发 安德烈·卡帕斯的llm委员会原版是一个用于交互式探索LLM比较的web应用程序。该项目将理事会概念重新实现为MCP服务器,用于与人工智能辅助编辑器集成,增加了共识协议和分层机制。
