Token导航 LogoToken导航TokenDH.com
研究检索操作浏览器github未标认证来源可访问许可证需确认审计提醒

vllm-ascend-deployvllm 提升部署

Agent Skill

用于辅助云资源、部署、容器、基础设施和运维自动化任务。它适合让 Agent 检查配置、整理部署步骤、分析资源状态、生成排障思路或辅助云服务接入。使用时需要明确目标环境、账号权限、区域和资源组,区分本地测试与生产操作;涉及删除资源、重启服务、修改网络或权限配置时,应先确认影响范围。

总安装

261

周安装

11

GitHub Stars

12

下载量

92
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:vllm-ascend-deploy(vllm 提升部署)
来源仓库:https://github.com/ascend/agent-skills
仓库路径:skills/vllm-ascend-deploy
安装命令:
npx skills add https://github.com/ascend/agent-skills --skill vllm-ascend-deploy
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/ascend/agent-skills --skill vllm-ascend-deploy

简介

vllm-ascend-deploy 用于辅助云资源、部署和基础设施管理。

  • 适合让 Agent 检查配置、整理部署步骤或分析资源状态。
  • 使用时需要明确目标环境、账号权限和资源组,区分测试与生产操作。
  • 涉及删除资源或修改网络配置时,应先确认影响范围和操作边界。
  • 当前无更多功能说明,建议查阅来源仓库获取详细使用指南。

SKILL.md

vllm-ascend-deploy

昇腾 NPU 平台 vLLM 大模型推理服务一键部署工具。

核心工作流: SSH 检查 → 解析模型 → NPU 检查 → 配置发现 → 用户确认 → 执行部署 → 监控启动 → 验证服务


部署前准备

1. SSH 连接检查(远程部署时)

ssh -o BatchMode=yes <server> "echo ok"

连接失败时:

  1. 询问用户 SSH 密码
  2. 使用 paramiko 配置免密登录
  3. 验证成功后继续

2. 询问用户配置(优先)⚠️

先问用户:

  • 是否有指定的容器镜像路径?
  • 是否有指定的模型权重路径?
  • 是否有特定的启动参数?

判断标准:

用户回复含义后续动作
具体路径/版本明确提供直接使用,跳过搜索
"你自己确定"、"随便"模糊授权必须搜索文档验证
未回复/跳过未提供必须搜索文档验证

禁止: 将模糊授权当作明确提供,跳过验证步骤

3. NPU 资源检查

npu-smi info          # 检查 NPU 状态和卡数
npu-smi info -t pid   # 检查占用进程

占用处理: NPU 被占用 → 列出进程 → 询问用户(杀进程/等待/取消)

4. 配置发现 ⚠️ 必须执行

关键规则(完整流程见 model-discovery.md):

规则说明
镜像仓库深度搜索文档示例通常只展示一种架构(如 A3),必须进入镜像仓库目录查看完整文件列表
NPU 架构判断npu-smi info 显示 8×910B3 = A2,16×910B3 = A3
镜像匹配A2 用 -a2 后缀,A3 用 -a3 后缀,不匹配可能无法启动
确认清单先展示官方推荐配置,再告知现有资源,让用户选择

信息源优先级:

提取内容: 镜像 + TP 推荐值 + 启动参数 + 环境变量

网络受限时: 使用 browser 独立浏览器工具访问,不猜测参数

禁止:

  • 第一个来源没找到就下结论,必须按优先级继续搜索
  • 看到现有容器就直接用,忽略官方推荐

5. 用户确认 ⚠️ 阻断点

前置条件检查:

  • 配置发现步骤已完成
  • 镜像版本已从文档确认
  • TP 推荐值已从文档确认

任一条件未满足 → 禁止继续,返回 Step 4 搜索文档

确认清单必须包含:

  1. 官方推荐配置(优先展示)
  2. NPU 架构判断(8 × 910B3→A2, 16 × 910B3→A3)
  3. 现有资源检查(已有容器/镜像,仅供参考)
  4. 选择确认:让用户选择使用官方推荐还是复用现有资源

禁止:

  • 看到现有容器就直接用,忽略官方推荐
  • 不告知用户有选择余地

确认后才开始部署,绝不假设或猜测参数。


执行部署

Step 1: 加载镜像(如需要)

docker load -i <IMAGE_TAR_PATH>

Step 2: 创建容器

bash scripts/create_container.sh \
  --mode local \
  --image <IMAGE> \
  --model-path <MODEL_PATH> \
  --container-name <CONTAINER_NAME>

远程部署: 添加 --mode remote --server <IP> --user <SSH_USER>

详见 deployment-procedure.md

Step 3: 启动服务

优先尝试 vllm CLI:

vllm serve <MODEL_PATH> --tensor-parallel-size <TP> ...

CLI 失败时(如 ModuleNotFoundError),使用 Python 模块:

python -m vllm.entrypoints.openai.api_server --model <MODEL_PATH> ...

Step 4: 监控启动 ⚠️ 必须执行

问题: 后台启动服务后,exec 会超时,无法持续监控

方案: 创建 cron job 定期检查,结果通过 sessions_send 通知用户

流程:
1. 启动服务(后台)
2. 创建 cron job(每分钟检查)
3. 告知用户"启动中,完成后自动通知"
4. Cron job 检测到结果 → sessions_send 通知 → 删除 job

创建 cron job: ⚠️ 必须包含完整上下文

Cron job 在 isolated session 运行,没有父会话上下文,必须明确指定所有信息

cron(action="add", job={
    "name": "vllm-status-check",
    "schedule": {"kind": "every", "everyMs": 60000},
    "payload": {"kind": "agentTurn", "message": """检查 vLLM 服务状态:

服务器: <SERVER_IP>
容器名: <CONTAINER_NAME>
端口: <PORT>
日志路径: <LOG_PATH>  # 通常是 /tmp/vllm.log 或其他指定路径
服务地址: http://<SERVER_IP>:<PORT>/health
开始时间: <START_TIME>

检查步骤:
1. SSH 到服务器,执行 docker exec <CONTAINER_NAME> tail -50 <LOG_PATH>
2. curl http://<SERVER_IP>:<PORT>/health
3. 成功 → sessions_send 通知用户 → 删除此 job
4. 失败 → 检查日志错误,超时则报错
"""},
    "sessionTarget": "isolated"
})

禁止: 任务消息中省略日志路径、容器名、服务地址,会导致检查失败

Cron job 检测到结果后通知用户:

sessions_send(
    sessionKey="agent:main:main",  # 用户会话保持不变
    message="✅ 启动成功!服务地址:...",
    timeoutSeconds=0
)

详见 troubleshooting.md

Step 5: 验证部署

curl http://<SERVER_IP>:<PORT>/health
curl http://<SERVER_IP>:<PORT>/v1/models

部署后调用

服务地址:http://<SERVER_IP>:<PORT>

Python SDK:

from openai import OpenAI
client = OpenAI(base_url="http://<IP>:<PORT>/v1", api_key="not-needed")
response = client.chat.completions.create(
    model="<model-name>",
    messages=[{"role": "user", "content": "你好"}]
)

故障排查

详见 troubleshooting.md

常见问题:

  • No module named 'vllm.benchmarks.latency' → 使用 Python 模块方式启动
  • 容器创建失败 → 检查 NPU 设备映射
  • 服务启动失败 → 检查 HCCL 环境变量
  • OOM → 降低 gpu-memory-utilization 或增加 TP

脚本说明

脚本功能
scripts/create_container.sh创建容器(完整 NPU 配置)
scripts/start_service.sh启动 vLLM 服务
scripts/monitor.sh服务监控 + WeLink 通知
scripts/api_test.pyAPI 测试脚本

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

35.42%
按下载量换算33

Claude

31.61%
按下载量换算29

Cursor

21.12%
按下载量换算19

Gemini CLI

9.17%
按下载量换算8

安全审计

Gen Agent Trust Hub

可疑

Socket

可疑

Snyk

可疑

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills