Token导航 LogoToken导航TokenDH.com
运维和基础设施敏感数据github未标认证来源可访问许可证需确认审计异常

verl-async-dapoverl 异步 dapo

Agent Skill

verl-async-dapo 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

272

周安装

11

GitHub Stars

12

下载量

85
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:verl-async-dapo(verl 异步 dapo)
来源仓库:https://github.com/ascend/agent-skills
仓库路径:skills/verl-async-dapo
安装命令:
npx skills add https://github.com/ascend/agent-skills --skill verl-async-dapo
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/ascend/agent-skills --skill verl-async-dapo

简介

用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息。

  • 适合在需要围绕仓库状态、代码变更或协作事项进行整理时使用。
  • 可结合来源仓库和原始 README 进一步验证具体功能与使用方式。
  • 安装命令:npx skills add https://github.com/ascend/agent-skills --skill verl-async-dapo
  • 安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

SKILL.md

Verl 单异步 DAPO 训练

交互式启动流程

启动训练服务前,Agent 必须按以下顺序询问用户:

1. 容器选择

检测到以下容器:
  [1] jins ( 运行中)
  [2] 创建新容器

请选择容器 (1/2):

2. 代理配置(如创建新容器或网络问题)

请提供代理配置(如不需要请回复"无"):
  http_proxy: ?
  https_proxy: ?

3. 特性选择

是否有自定义特性需求?(回复"默认"使用默认配置)

性能特性(默认全开):
  - flash_attn: Flash Attention 加速
  - dynamic_batch: 动态 Batch Size
  - remove_padding: Remove Padding 优化
  - gradient_checkpointing: 梯度检查点

显存特性(默认关闭,OOM 时自动开启):
  - offload: 参数/优化器卸载
  - recompute: 重计算

可选特性:
  - prefix_cache: Prefix Cache
  - chunked_prefill: Chunked Prefill

4. SwanLab 配置(如未配置)

SwanLab 监控配置:
  Host: ?
  API Key: ?

快速开始

# 方式 1: 快速启动脚本 (推荐)
CONTAINER=jins TRAIN_STEPS=100 \
SWANLAB_HOST=http://10.143.2.129:8000 \
SWANLAB_API_KEY=your-key \
bash scripts/quick_start.sh

# 方式 2: 分步执行
# 2.1 训练前检查
bash scripts/preflight_check.sh

# 2.2 启动单异步 DAPO 训练 (使用默认特性进行训练)
export TRAIN_STEPS=4
bash scripts/run_dapo.sh

# 2.3 启动 One-Step-Off-Policy 训练
export TRAIN_STEPS=4
bash scripts/run_one_step_off_policy.sh

One-Step-Off-Policy 训练

One-Step-Off-Policy 是资源隔离的单异步训练模式,Trainer 和 Rollout 使用独立的 GPU 组。

# 基本用法
export TRAIN_STEPS=100
export TRAINER_GPUS=4
export ROLLOUT_GPUS=4
bash scripts/run_one_step_off_policy.sh

# 启用 offload 特性
export ENABLE_OFFLOAD=True
bash scripts/run_one_step_off_policy.sh

# FSDP2 框架
export FRAMEWORK=fsdp
bash scripts/run_one_step_off_policy.sh

配置参数:

变量默认值说明
FRAMEWORKmegatron框架 (megatron/fsdp)
TRAINER_GPUS4训练 GPU 数
ROLLOUT_GPUS4Rollout GPU 数
MAX_RESPONSE_LENGTH8192最大响应长度
ENABLE_OFFLOADFalse是否启用 offload

SwanLab 配置

SwanLab 配置由 swanlab-setup skill 提供,common.sh 启动时自动加载。详见 swanlab-setup skill 的 SKILL.md。

配置按优先级自动获取:环境变量 > 配置文件 > 交互式输入

# 环境变量(推荐)
export SWANLAB_HOST="http://your-swanlab-host:8000"
export SWANLAB_API_KEY="your-api-key"

重要:必须在 trainer.logger 参数中包含 "swanlab" 才能启用监控:

# 正确的 logger 配置(启用 SwanLab 监控)
trainer.logger='["console", "swanlab"]'

# 仅控制台输出(不启用监控)
trainer.logger='["console"]'

SwanLab 环境变量会自动被 verl tracking 模块读取:

  • SWANLAB_API_KEY: API 密钥
  • SWANLAB_LOG_DIR: 日志目录 (默认: swanlog)
  • SWANLAB_MODE: 模式 (cloud/local, 默认: cloud)

代理配置

export http_proxy="http://your-proxy:8080"
export https_proxy="http://your-proxy:8080"

训练监控策略

启动后行为:

  1. 输出 SwanLab 链接供用户自行查看
  2. 后台静默运行,不实时推送进度
  3. 仅在错误时通知用户(OOM、崩溃、配置错误等)

用户自行监控命令:

# 查看当前进度
docker exec {container} grep "Training Progress" /verl/train.log | tail -1

# 实时跟踪日志
docker exec {container} tail -f /verl/train.log

# 检查是否出错
docker exec {container} grep -E "Error|error|OOM|Exception" /verl/train.log | tail -10

特性管理策略

特性分类

类型特性默认状态说明
性能特性flash_attn✅ 默认开Flash Attention 加速
性能特性dynamic_batch✅ 默认开动态 Batch Size
性能特性remove_padding✅ 默认开Remove Padding 优化
性能特性gradient_checkpointing✅ 默认开梯度检查点
显存特性offload❌ 默认关参数/优化器卸载 (OOM 时自动追加)
显存特性recompute❌ 默认关重计算 (OOM 时自动追加)
可选特性prefix_cache❌ 默认关Prefix Cache
可选特性chunked_prefill❌ 默认关Chunked Prefill

特性优先级

用户显式指定 > 默认性能特性 > OOM 自动追加显存特性

重要

  • 用户未指定时 → 使用默认性能特性(全开)
  • OOM 时 → 自动追加显存特性(即使用户指定了其他特性)
  • 用户显式指定的特性永不移除,只在 OOM 时追加

OOM 自动恢复流程

启动训练 (默认性能特性)
    ↓
OOM 错误?
    ├─ 是 → 追加 offload → 重试
    │   └─ 仍 OOM → 追加 recompute → 重试
    │       └─ 仍 OOM → 报告失败,建议调整参数
    └─ 否 → 训练成功(静默完成)

配置参数

环境变量

变量默认值说明
FRAMEWORKmegatron框架 (megatron/fsdp)
MODEL_PATHQwen3-8B模型路径
TRAIN_FILEdapo-math-17k.parquet训练数据
VAL_FILEaime-2024.parquet验证数据
TRAIN_STEPS100训练步数
TRAINER_GPUS4训练 GPU 数
ROLLOUT_GPUS4Rollout GPU 数
USER_FEATURES(空)用户显式指定特性,逗号分隔
MAX_OOM_RETRIES2OOM 最大重试次数
SWANLAB_HOST(从配置获取)SwanLab 服务器地址
SWANLAB_API_KEY(从配置获取)SwanLab API 密钥

详细参考

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Claude

33.75%
按下载量换算29

Codex

32.95%
按下载量换算28

Cursor

17.31%
按下载量换算15

Gemini CLI

8.65%
按下载量换算7

安全审计

Gen Agent Trust Hub

通过

Socket

可疑

Snyk

未通过

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills