用于克劳德代码的Qwen3编码器MCP服务器
此设置通过模型上下文协议(MCP)将Qwen3 Coder(30B参数模型)与Claude Code集成在一起,针对64GB RAM系统进行了优化。
特性
- Qwen3编码器30B:最新、最强大的Qwen编码器型号,具有卓越的编码能力
- 64GB RAM优化:配置已调整,可在高内存系统上实现最大性能
- MCP集成:通过5个专用工具与Claude Code无缝集成
- 高级设置:Flash注意力、优化的KV缓存和并行处理
优化设置
该设置包括对64GB RAM的以下优化:
OLLAMA_NUM_PARALLEL=8:处理8个并行请求OLLAMA_MAX_LOADED_MODELS=4:同时在内存中保存4个模型OLLAMA_FLASH_ATTENTION=1:启用高效的注意力机制OLLAMA_KV_CACHE_TYPE=q8_0:高质量8位缓存OLLAMA_KEEP_ALIVE=24h:保持模型加载24小时
可用工具
1. qwen3_code_review
审查代码的质量、错误和最佳实践。
参数:
code(必填):需审查的代码language(可选):编程语言
2. qwen3_code_explain
提供代码如何工作的详细解释。
参数:
code(必填):解释代码language(可选):编程语言
3. qwen3_code_generate
根据需求生成新代码。
参数:
prompt(必填):生成内容的描述language(可选):目标编程语言
4. qwen3_code_fix
修复现有代码中的错误和问题。
参数:
code(必填):错误代码error(可选):错误消息或描述language(可选):编程语言
5. qwen3_code_optimize
优化代码的性能、内存或可读性。
参数:
code(必填):要优化的代码criteria(可选):优化标准language(可选):编程语言
快速开始
1.启动优化服务器
cd /Users/keith/qwencoder
./start-qwen3-optimized.sh2.重新启动克劳德代码
关闭并重新打开Claude Code以加载MCP服务器配置。
3.在克劳德代码中使用
这些工具将在您的Claude Code会话中自动可用。您可以通过在对话中引用工具名称来使用它们。
手动命令
从优化开始Ollama:
OLLAMA_NUM_PARALLEL=8 OLLAMA_MAX_LOADED_MODELS=4 OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve直接测试模型:
ollama run qwen3-coder:30b "Write a Python function to calculate factorial"测试MCP服务器:
node qwen3-mcp-server.js故障排除
如果Claude Code看不到MCP服务器:
- 检查config.json的路径是否正确
- 完全重新启动Claude代码
- 确认Ollama正在运行:
ollama list
如果模型运行缓慢:
- 确保您有足够的可用RAM
- 检查OLLAMA_FLASH_ATTENTION=1是否已设置
- 使用活动监视器监视系统资源
如果工具不起作用:
- 直接测试Olama:
ollama run qwen3-coder:30b "test" - 在Console.app中检查MCP服务器日志
- 验证是否安装了Node.js依赖项
文件结构
/Users/keith/qwencoder/
├── qwen3-mcp-server.js # MCP server implementation
├── package.json # Node.js dependencies
├── start-qwen3-optimized.sh # Optimized startup script
└── README.md # This file配置文件
- 克劳德配置:
/Users/keith/Library/Application Support/Claude/config.json - MCP服务器:
/Users/keith/qwencoder/qwen3-mcp-server.js
业绩说明
使用64GB RAM,您可以:
- 同时加载多个大型模型
- 处理大量并行请求
- 使用高质量缓存设置以获得更好的性能
- 长时间运行,无内存问题
Qwen3 Coder 30B型号在加载时使用了大约18GB的RAM,为其他应用程序和其他型号留出了足够的空间。
