LLM基准MCP服务器
MCP服务器,允许AI代理访问LLM基准数据、定价比较和模型建议。
特性
- 比较模型 --LLM(MMLU、HumanEval、MATH、GPQA、ARC、HellaSwag)的并行基准比较
- get_model_details --关于特定模型的详细信息,包括优缺点
- 推荐型号 --为您的任务和预算获得最佳模型推荐
- list_top_models --按类别(编码、数学、推理、聊天)排名的顶级模型
- get_pricing -通过OpenRouter API进行价格比较
支持的型号
GPT-4o、GPT-4o-mini、GPT-4 Turbo、o1、o3 mini、克劳德3.5十四行诗、克劳德3.5 Haiku、克劳德3 Opus、双子座2.0 Flash、双子座2.0 Pro、双子座1.5 Pro、Llama 3.1(8B/70B/405B)、Llama 3.3 70B、西北风大、西北风小、混音8x22B、DeepSeek V3、DeepSeek R1、Qwen 2.5 72B
安装
pip install llm-benchmark-mcp-server使用Claude Desktop
添加到您的 claude_desktop_config.json:
{
"mcpServers": {
"llm-benchmark": {
"command": "benchmark-server"
}
}
}或者通过uvx(无需安装):
{
"mcpServers": {
"llm-benchmark": {
"command": "uvx",
"args": ["llm-benchmark-mcp-server"]
}
}
}示例查询
- “比较GPT-4o与克劳德3.5十四行诗与双子座2.0 Pro”
- “哪种模式最适合低预算编码?”
- “给我看看数学的十大模型”
- “与克劳德相比,GPT-4o的成本是多少?”
- “给我DeepSeek R1的详细信息”
数据源
- 基准测试:来自官方文件和公共排行榜的硬编码(MMLU、HumanEval、MATH、GPQA、ARC挑战赛、HellaSwag)
- 定价:来自的实时数据 OpenRouter API
- 竞技场排名: 聊天机器人竞技场排行榜 (可用时)
______________________________________________________________________
AiAgentKarl提供的更多MCP服务器
| 类别 | 服务器 |
|---|---|
| 🔗 区块链 | 索拉纳 |
许可证
麻省理工学院
