Forge MCP Server
Swarm agents that turn slow PyTorch into fast CUDA/Triton kernels, from any AI coding agent.
Installation · Tools · Resources · Prompts · Security · Development
______________________________________________________________________
概述
Forge通过自动化多代理优化将PyTorch模型转换为生产级CUDA/Triton内核。使用 32个并行AI代理 通过推理时间缩放,它实现了高达 推理速度提高14倍 比 torch.compile(mode='max-autotune-no-cudagraphs') 同时保持100%的数值正确性。
此MCP服务器连接任何 MCP兼容 AI编码代理到Forge。您的代理提交PyTorch代码,Forge在真实的数据中心GPU上使用swarm代理对其进行优化,并返回最快的内核作为替换。
它做什么
- 优化现有内核 -提交PyTorch代码,获取经过优化的Triton/CUDA内核
torch.compile(max-autotune) - 生成新内核 -描述一个操作(例如“融合的LayerNorm+GELU+Dropout”),获得一个生产就绪的优化内核
- 32个并行群代理 -Coder+Judge代理对竞争发现最优内核,同时探索张量核心利用率、内存合并、共享内存平铺和内核融合
- 真正的数据中心GPU基准测试 -每个内核都经过编译、正确性测试,并在实际的数据中心硬件上进行分析
- 250k令牌/秒推理 -结果以分钟为单位,而不是以小时为单位
- 智能检测 -代理会自动识别您的代码何时会从GPU优化中受益
- 一键认证 -基于浏览器的OAuth登录。没有要管理的API密钥。
支持的GPU
所有优化和基准测试都在数据中心级硬件上运行:
| GPU | 架构 |
|---|---|
| B200 | 布莱克威尔 |
| H200 | 料斗 |
| H100 | 料斗 |
| 1940年代 | 阿达·洛夫莱斯 |
| A100 | 安培 |
| L4 | 阿达·洛夫莱斯 |
| A10 | 安培 |
| 四碘甲腺原氨酸 | 图灵 |
支持的客户
______________________________________________________________________
安装
克劳德代码
macOS/Linux:
claude mcp add forge-mcp -- npx -y @rightnow/forge-mcp-server窗户:
claude mcp add forge-mcp -- cmd /c npx -y @rightnow/forge-mcp-server克劳德桌面版
添加到您的 claude_desktop_config.json:
macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
{
"mcpServers": {
"forge": {
"command": "npx",
"args": ["-y", "@rightnow/forge-mcp-server"]
}
}
}Windows: %APPDATA%\Claude\claude_desktop_config.json
{
"mcpServers": {
"forge": {
"command": "cmd",
"args": ["/c", "npx", "-y", "@rightnow/forge-mcp-server"]
}
}
}VS代码/副本
添加到您的 .vscode/mcp.json (工作区)或用户设置:
{
"servers": {
"forge": {
"command": "npx",
"args": ["-y", "@rightnow/forge-mcp-server"]
}
}
}窗户: 使用"command": "cmd"和"args": ["/c", "npx", "-y", "@rightnow/forge-mcp-server"]
光标
添加到光标MCP设置(~/.cursor/mcp.json):
{
"mcpServers": {
"forge": {
"command": "npx",
"args": ["-y", "@rightnow/forge-mcp-server"]
}
}
}窗户: 使用"command": "cmd"和"args": ["/c", "npx", "-y", "@rightnow/forge-mcp-server"]
帆板运动
添加到您的Windsurf MCP配置中:
{
"mcpServers": {
"forge": {
"command": "npx",
"args": ["-y", "@rightnow/forge-mcp-server"]
}
}
}窗户: 使用"command": "cmd"和"args": ["/c", "npx", "-y", "@rightnow/forge-mcp-server"]
OpenCode
添加到您的 opencode.json:
{
"mcp": {
"forge": {
"command": "npx",
"args": ["-y", "@rightnow/forge-mcp-server"]
}
}
}______________________________________________________________________
工具
forge_auth
使用Forge服务进行身份验证。打开浏览器,通过RightNow仪表板登录。在使用任何其他工具之前需要。
- 输入:
- force (boolean,可选):即使存在有效令牌,也强制重新身份验证
- 返回:身份验证状态、电子邮件、计划类型和信用余额
forge_optimize
提交用于GPU内核优化的PyTorch代码。32个swarm代理生成优化的Triton或CUDA内核,在真实的数据中心GPU上对其进行评估,并通过加速指标返回最佳结果。
当代理检测到以下情况时,它将自动使用此工具:
- PyTorch自定义操作(
torch.autograd.Function,自定义forward/backward)
- 可以更快的手动CUDA内核
- 性能关键张量运算(注意、卷积、归一化、softmax)
- 带有注释的代码,如
"slow","bottleneck","optimize"
torch.compile()目标或triton.jit内核
- 任何
nn.Module具有重要的计算能力forward()
- 矩阵乘法、减法或扫描操作
- 具有减少操作的自定义损失功能
- 融合操作机会(例如,LayerNorm+激活)
- 输入:
- pytorch_code (string,必填):完成PyTorch代码进行优化。最大500 KB。 - kernel_name (string,必填):内核的简称(例如。, "flash_attention") - output_format (枚举,可选): "triton" (默认)或 "native_cuda" - target_speedup (数字,可选):目标加速倍数。默认 2.0 - max_iterations (数字,可选):最大优化迭代次数(1-100)。默认 10 - gpu (枚举,可选):目标GPU。默认 "H100".选项: B200, H200, H100, L40S, A100, L4, A10, T4 - user_prompt (string,可选):优化器指南(例如。, "focus on memory bandwidth")
- 返回:优化的内核代码、加速指标、延迟比较、迭代历史
forge_generate
根据自然语言规范从头开始生成优化的GPU内核。Forge创建PyTorch基线,然后将其优化为Triton或CUDA。
- 输入:
- operation (string,必填):操作名称(例如。, "fused_attention", "softmax") - description (string,必填):内核应该做什么的详细描述 - input_shapes (数字\[\]\[\],必填):输入张量形状(例如。, [[8, 512, 768]]) - output_shape (number\[\],可选):预期的输出形状 - dtype (字符串,可选):数据类型。默认 "float16" - output_format (枚举,可选): "triton" (默认)或 "native_cuda" - target_speedup (数字,可选):目标加速。默认 2.0 - max_iterations (数字,可选):最大迭代次数(1-100)。默认 10 - gpu (枚举,可选):目标GPU。默认 "H100" - user_prompt (字符串,可选):附加指南
- 返回:生成的内核代码、加速指标、迭代历史
forge_credits
检查您当前的Forge信用余额。
- 输入:无
- 退货:信用余额、购买总额、使用总额、计划类型
forge_status
检查正在运行或已完成的优化作业的状态。
- 输入:
- session_id (字符串,必填):会话ID来自 forge_optimize 或 forge_generate
- 返回:作业状态、当前迭代、最佳加速
forge_cancel
取消正在运行的优化作业。
- 输入:
- session_id (string,必填):要取消的作业的会话ID
- 退货:取消确认
forge_sessions
列出过去的优化会话及其结果。
- 输入:
- limit (number,可选):要返回的会话数(1-100)。默认 10 - status (枚举,可选):按状态筛选: "all", "completed", "failed", "running".默认值 "all"
- 返回:包含任务名称、GPU、加速、状态和日期的会话表
工具注释
| 工具 | 只读 | 临时 | 破坏性 |
|---|---|---|---|
forge_auth | 否 | 是 | 否 |
forge_optimize | 否 | 否 | 否 |
forge_generate | 否 | 否 | 否 |
forge_credits | 是 | 是 | 否 |
forge_status | 是 | 是 | 否 |
forge_cancel | 否 | 否 | 是 |
forge_sessions | 是 | 是 | 否 |
______________________________________________________________________
资源
| URI | 描述 |
|---|---|
forge://auth/status | 当前身份验证状态(已验证、令牌过期、具有刷新令牌) |
forge://credits | 信用余额、使用情况和计划信息 |
______________________________________________________________________
提示
forge-optimize
优化GPU内核的指导工作流程。指示代理人:
- 检查信用余额
- 分析代码以实现优化目标
- 呼叫
forge_optimize具有适当的参数 - 解释结果并建议整合
forge-analyze
教导代理扫描代码库以寻找GPU优化机会,并按预期影响进行排名:
| 优先级 | 模式 |
|---|---|
| 高 | 自定义签名功能、注意力机制、融合操作 |
| 中等 | 标准 nn.Module 成分,归一化+激活融合 |
| 低 | 按元素操作,简单减少 |
______________________________________________________________________
运作原理
┌──────────────┐ stdio ┌──────────────────┐ HTTPS ┌──────────────────┐
│ AI Agent │ ──────────────>│ Forge MCP │ ──────────────>│ Forge API │
│ (Claude, │ │ Server │ │ (RightNow AI) │
│ Cursor, │=1.1x)收取。失败的运行和取消的作业不收费。
______________________________________________________________________
## 配置
### 认证
不需要API密钥。服务器使用 **OAuth 2.0与PKCE** 对于基于浏览器的安全身份验证:
1. 客服电话 `forge_auth`
1. 您的默认浏览器将打开 `dashboard.rightnowai.co`
1. 登录或创建帐户
1. 授权自动完成
1. 代币存储在本地 `~/.forge/tokens.json` (模式 `0600`)
1. 访问令牌自动刷新,您只需登录一次
### 学分
Forge使用 **预付费的** 信用体系。每次优化或发电运行成本 **1学分**.
|积分|价格|每积分|
|---------|-------|------------|
|1-9 |每人15.00美元| 15.00美元|
|10+| 25%折扣| 11.25美元|
| 50 | $562.50 | $11.25 |
|企业|定制批量定价| [联系我们](https://rightnowai.co/enterprises) |
**免费试用**:优化1个内核,不需要信用卡。
**100%退款保证**:如果Forge不赢 `torch.compile`,你会拿回你的信用。
购买积分 [dashboard.rightnowai.co](https://dashboard.rightnowai.co/login?plan=credits).
______________________________________________________________________
## 基准测试
NVIDIA B200上的端到端延迟。Forge vs `torch.compile(mode='max-autotune-no-cudagraphs')`:
|模型| torch.compile |锻造|加速|
|-------|--------------|-------|---------|
|Llama-3.1-8B | 42.3毫秒| 8.2毫秒| **5.16x** |
|Qwen2.5-7B|38.5ms|9.1ms| **4.23倍** |
|米斯特拉-7B | 35.2毫秒| 10.4毫秒| **3.38x** |
|Phi-3-mini | 18.7毫秒| 6.8毫秒| **2.75倍** |
|SDXL UNet | 89.4毫秒| 31.2毫秒| **2.87倍** |
|耳语大|52.1ms|19.8ms| **2.63倍** |
|BERT大| 12.4ms | 5.1ms| **2.43倍** |
查看完整的基准测试 [rightnowai.co/forge](https://rightnowai.co/forge).
______________________________________________________________________
## 安全
### 令牌保护
- **没有错误的令牌**:所有错误消息都通过正则表达式过滤器进行净化,这些过滤器在到达代理之前会剥离JWT、承载令牌、十六进制令牌和凭据参数
- **仅限本地存储**:代币存储在 `~/.forge/tokens.json` 带文件模式 `0600` (仅限所有者读/写)
- **自动刷新**:访问令牌将在1小时后过期,并使用存储的刷新令牌自动刷新
- **PKCE流量**:OAuth使用验证密钥进行代码交换(SHA-256),防止授权代码被拦截
- **配置中没有秘密**:MCP服务器需要零环境变量或API密钥
### 输入验证
- PyTorch代码输入的上限为 **500 KB** 防止内存耗尽
- 用户提示的上限为 **10 KB**
- 所有字符串输入都通过Zod模式进行最大长度验证
- 数字输入具有最小/最大界限(例如。, `max_iterations: 1-100`)
### 网络安全
- 所有API通信使用 **超文本传输安全协议**
- 非SSE请求具有 **30秒超时** 防止悬挂
- SSE流具有 **10分钟超时** 具有自动清理功能
- 令牌刷新使用 **互斥锁** 防止并发请求产生竞争条件
### 服务器可以访问什么
- **网络**:只有 `dashboard.rightnowai.co` 和 `forge-api.rightnowai.co`
- **文件系统**:仅读/写 `~/.forge/tokens.json`
- **没有代码库访问权限**:MCP服务器从不读取您的文件。代理通过工具参数显式地向其传递代码。
______________________________________________________________________
## 发展
### 从源代码构建
git clone https://github.com/RightNow-AI/forge-mcp-server.git cd forge-mcp-server npm install npm run build
### 在本地运行
npm run dev
### 类型检查
npm run typecheck
### 使用MCP检查器进行调试
npx @modelcontextprotocol/inspector node dist/index.js
这将打开一个web UI,您可以在其中调用每个工具,检查输入/输出,并交互式调试服务器。
### 项目结构
forge-mcp-server/ ├── src/ │ ├── index.ts # Entry point (McpServer + StdioServerTransport) │ ├── server.ts # Registers all tools, resources, prompts │ ├── constants.ts # URLs, client IDs, timeouts, limits │ ├── types.ts # TypeScript interfaces + type guards + sanitization │ ├── auth/ │ │ ├── oauth-client.ts # PKCE flow, token refresh, access token management │ │ └── token-store.ts # ~/.forge/tokens.json read/write/clear │ ├── api/ │ │ ├── forge-client.ts # HTTP client for all Forge API endpoints │ │ └── sse-consumer.ts # SSE stream parser via native fetch + ReadableStream │ ├── tools/ # 7 MCP tools │ ├── resources/ # 2 MCP resources │ └── prompts/ # 2 MCP prompts ├── .github/workflows/ │ ├── ci.yml # Typecheck + build on push/PR │ └── release.yml # npm publish on version tags ├── package.json ├── tsconfig.json └── tsup.config.ts
______________________________________________________________________
## 贡献
欢迎捐款。请先打开一个问题,讨论您想更改的内容。
1. 分叉回购
1. 创建分支(`git checkout -b feature/my-feature`)
1. 进行更改
1. 跑 `npm run typecheck` 和 `npm run build`
1. 承诺并推动
1. 打开拉取请求
______________________________________________________________________
## 许可证
[麻省理工学院](LICENSE)
部分 [Now AI](https://rightnowai.co) 生态系统。成员 [NVIDIA初始计划](https://www.nvidia.com/en-us/startups/).
