SLM-MCP Tonypi:语言引导的仿人机器人控制
一种模块化的人形机器人控制系统,通过模型上下文协议(MCP)集成了小语言模型(SLM)和视觉语言模型(VLM),用于自然语言命令执行。
概述
该项目能够使用自然语言直观地控制Hiwonder Tonypi人形机器人。该系统通过将规划、感知和执行组件分离的分布式架构将高级用户命令转换为可执行的机器人动作。
系统架构
- MCP服务器:基于Python的服务器,展示机器人控制工具(运动、感知、操纵)。
- MCP客户端:用于发出命令和执行计划动作的交互式界面。
- 人工智能模型:远程Ollama托管的SLM用于任务规划,VLMs用于视觉接地。
- 机器人:基于Raspberry Pi 5的Hiwonder Tonypi执行物理动作。
快速开始
- 通过在ai_model_communication中运行Ollama FastAPI服务器脚本来启动视觉和语言服务
ollama-server.sh
cd ai_model_communication
bash ollama-server.sh- 对于mcp实现,在不同的终端中运行这两个脚本:
a) 在第一个终端中运行MCP服务器
cd mcp-implement
python main_mcp_server.pyb) 在另一个终端中,运行MCP客户端
cd mcp-implement
python main_mcp_client.py特性
- 自然语言控制:发出“挥手问好”或“拿起红色方块”等命令。
- 视觉感知:使用GroundingDINO进行物体检测,并通过VLM进行场景描述。
- 模块化设计:独立交换规划者、感知模型或机器人硬件。
- 分布式执行:通过VPN进行远程人工智能处理,并由本地机器人驱动。
需求
- Python 3.9+
- 安装了Qwen3(1.7B)和Qwen3VL(2B)型号的Olama
- 接地Dino tiny
- Hiwonder Tonypi机器人与Raspberry Pi 5
- 工作站与机器人之间的VPN连接
引用
如果你使用这项工作,请参考我们的IEEE SoutheastCon 2026论文:“从语言到行动:在模型上下文协议下具有视觉基础的小语言模型驱动的类人控制”
