mcp涡轮量子发动机
用于LLM量化的独立Python MCP服务器。将任何HuggingFace模型压缩为 GGUF, GPTQ,或 AWQ 在单个工具调用中格式化。
无需外部CLI——所有量化逻辑都已嵌入。
安装
pip install mcp-turboquant或者直接用uvx运行:
uvx mcp-turboquant可选后端
这 info, check,以及 recommend 工具开箱即用。对于实际的量化,请安装所需的后端:
# GGUF (Ollama, llama.cpp, LM Studio)
pip install mcp-turboquant[gguf]
# GPTQ (vLLM, TGI)
pip install mcp-turboquant[gptq]
# AWQ (vLLM, TGI)
pip install mcp-turboquant[awq]
# Everything
pip install mcp-turboquant[all]配置
克劳德代码
添加 ~/.claude/settings.json:
{
"mcpServers": {
"turboquant": {
"command": "mcp-turboquant"
}
}
}或者使用uvx(无需安装):
{
"mcpServers": {
"turboquant": {
"command": "uvx",
"args": ["mcp-turboquant"]
}
}
}克劳德桌面
添加 claude_desktop_config.json:
{
"mcpServers": {
"turboquant": {
"command": "uvx",
"args": ["mcp-turboquant"]
}
}
}工具
| 工具 | 描述 | 重型deps? |
|---|---|---|
info | 从HuggingFace获取型号信息(参数、尺寸、架构) | 否 |
check | 检查系统上可用的量化后端 | 否 |
recommend | 硬件感知的最佳格式+比特建议 | 否 |
quantize | 将模型量化为GGUF/GPTQ/AWQ | 是 |
evaluate | 对量化模型进行困惑度评估 | 是 |
push | 将量化模型推送到HuggingFace Hub | 否 |
例子
配置后,询问Claude:
“获取关于元骆驼/美洲驼-3.1-8B-指令的信息”
“我的机器上的Mistral-7B应该使用什么量化格式?”
“量化Meta-Calma/Calma-3.1-8b到4位GGUF”
“检查我安装了哪些量化后端”
“在/path/to/model.gguf上评估我的量化模型的困惑程度”
“在HuggingFace上将我的量化模型推送到我的用户/模型GGUF”
运作原理
Claude / Agent MCP Protocol (stdio) mcp-turboquant (Python) llama-cpp-python / auto-gptq / autoawq所有量化逻辑都在进程中运行。不需要外部CLI工具。
直接运行
# As a command
mcp-turboquant
# As a module
python -m mcp_turboquant许可证
麻省理工学院
