语音浏览器代理
与控制浏览器的AI对话。 LiveKit+Webfuse MCP。
用户说话。AI正在浏览。“这个页面上有什么?”→ 读它。“打开头条新闻”→ 点击它。“写一个有趣的评论”→ 在文本框中键入一个。
语音输入,浏览器操作输出,语音返回。
先决条件
运作原理
User speaks → LiveKit (WebRTC) → STT → LLM (GPT-4o + Webfuse MCP tools) → TTS → User hears
↓
Browser actions (click, type, navigate)
↓
User sees it happen in real timeLLM可以通过Webfuse的MCP端点访问13个浏览器工具。当你说“打开第一个链接”时,GPT-4o会呼叫 act_click 通过MCP,浏览器点击用户的实时标签。
堆栈
- LiveKit代理,实时语音流水线(STT→ LLM → TTS)
- Webfuse会话MCP,13个浏览器工具,自动发现
- LiveKit云WebRTC传输、部署、推理
- Webfuse扩展侧边栏UI,带麦克风按钮+文字记录
快速开始
1.LiveKit云
注册地址: cloud.livekit.io (免费套餐:每月10000分钟)。
2.代理设置
cd agent
cp ../.env.example .env.local
# Fill in your keys
uv sync
uv run python agent.py download-files
uv run python agent.py dev3.令牌服务器
cd agent
uvicorn token_server:app --port 80834.Webfuse扩展
部署 extension/ 将文件夹添加到您的Webfuse空间。设置 TOKEN_URL env-var到您的令牌服务器URL。
文件
agent/
agent.py , Voice agent (LiveKit + Webfuse MCP)
token_server.py , Generates LiveKit room tokens
pyproject.toml , Python dependencies
extension/
sidepanel.html , Voice UI (mic button, transcript, visualizer)
sidepanel.js , LiveKit client connection
background.js , Extension scaffold
manifest.json , Webfuse extension manifest
proxy/
worker.js , Cloudflare Worker (CORS proxy for token server)现场演示
建筑
语音代理在服务器端运行并加入LiveKit房间。扩展侧边栏通过WebRTC连接到同一个房间。音频实时双向流动。
当LLM决定使用浏览器工具时,它会调用Webfuse MCP端点。Webfuse将操作路由到用户的浏览器选项卡。当代理讲述时,用户看到浏览器移动。
关键见解:LiveKit处理实时语音的难点(转弯检测、中断处理、回声消除)。Webfuse处理浏览器控制。你的代码只是代理逻辑。
其他Webfuse集成
Webfuse MCP适用于任何AI框架:
- OpenAI代理SDK -带浏览器控制的Python代理
- 克劳德桌面/光标/VS代码 -零代码MCP配置
- 语言链/语言图 -多页研究代理
- Vercel AI SDK -Next.js浏览助手
- LiveKit语音代理 -语音控制浏览器
- ChatGPT GPT -使用浏览器工具自定义GPT
- WebMCP演示 -任何网站上的语义工具
许可证
麻省理工学院
