Token导航 LogoToken导航TokenDH.com
待分类需要联网github未标认证来源可访问许可证需确认审计提醒

mindspeed-llm-pipelinemindspeed LLM pipeline 命令行

Agent Skill

mindspeed-llm-pipeline 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

218

周安装

9

GitHub Stars

60

下载量

71
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:mindspeed-llm-pipeline(mindspeed LLM pipeline 命令行)
来源仓库:https://github.com/ascend-ai-coding/awesome-ascend-skills
仓库路径:skills/mindspeed-llm-pipeline
安装命令:
npx skills add https://github.com/ascend-ai-coding/awesome-ascend-skills --skill mindspeed-llm-pipeline
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/ascend-ai-coding/awesome-ascend-skills --skill mindspeed-llm-pipeline

简介

用于 LLM 流水线命令行工具的操作支持,处理数据处理流程。

  • 可配置任务调度、数据转换和输出格式控制。
  • 需根据具体部署环境调整参数和路径设置。适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。
  • 运行前应验证输入输出路径和权限配置是否正确。
  • mindspeed-llm-pipeline 属于待分类类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

MindSpeed-LLM 端到端训练部署流水线

本 Skill 串联 MindSpeed-LLM 从环境搭建到模型导出的完整部署流程,确保各阶段参数一致、数据正确流转。

使用顺序

1. 环境搭建  →  2. 模型下载  →  3. 权重转换(HF→MG)
→  4. 数据预处理  →  5. 训练启动
→  6. 推理验证(可选)  →  7. 评估(可选)  →  8. 权重导出(MG→HF,可选)

前置要求

依赖说明参考
CANN + torch_npuNPU 运行环境mindspeed-llm-env-setup
MindSpeed + Megatron-LM分布式训练框架mindspeed-llm-env-setup

快速开始:Qwen2.5-7B LoRA 微调

以下示例展示从零到训练完成的完整流程。

Step 1:环境初始化

source /usr/local/Ascend/cann/set_env.sh
source /usr/local/Ascend/nnal/atb/set_env.sh

# 验证
python -c "import torch; import torch_npu; print(torch.npu.is_available())"

详细安装步骤见 mindspeed-llm-env-setup

Step 2:下载模型权重

mkdir -p ./model_from_hf/Qwen2.5-7B-Instruct && cd ./model_from_hf/Qwen2.5-7B-Instruct

# 下载配置文件和分词器
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct/resolve/main/config.json
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct/resolve/main/tokenizer.json
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct/resolve/main/tokenizer_config.json

# 下载权重分片
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct/resolve/main/model-00001-of-00004.safetensors
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct/resolve/main/model-00002-of-00004.safetensors
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct/resolve/main/model-00003-of-00004.safetensors
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct/resolve/main/model-00004-of-00004.safetensors
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct/resolve/main/model.safetensors.index.json
cd ../..

验证:ls model_from_hf/Qwen2.5-7B-Instruct/ 应包含 config.jsontokenizer.json、4 个 .safetensors 文件。

Step 3:权重转换(HF → Megatron)

python convert_ckpt.py \
    --use-mcore-models \
    --model-type GPT \
    --load-model-type hf \
    --save-model-type mg \
    --target-tensor-parallel-size 1 \
    --target-pipeline-parallel-size 4 \
    --add-qkv-bias \
    --load-dir ./model_from_hf/Qwen2.5-7B-Instruct/ \
    --save-dir ./model_weights/qwen25_7b_mcore/ \
    --tokenizer-model ./model_from_hf/Qwen2.5-7B-Instruct/tokenizer.json \
    --model-type-hf llama2 \
    --params-dtype bf16

验证:ls model_weights/qwen25_7b_mcore/ 应包含 mp_rank_*/ 目录和 latest_checkpointed_iteration.txt

详细参数见 mindspeed-llm-weight-prep

Step 4:数据预处理

# 下载训练数据
mkdir -p dataset && cd dataset
wget https://huggingface.co/datasets/tatsu-lab/alpaca/resolve/main/data/train-00000-of-00001-a09b74b3ef9c3b56.parquet
cd ..

# 预处理为 packed 格式
python ./preprocess_data.py \
    --input ./dataset/train-00000-of-00001-a09b74b3ef9c3b56.parquet \
    --tokenizer-name-or-path ./model_from_hf/Qwen2.5-7B-Instruct/ \
    --output-prefix ./finetune_dataset/alpaca \
    --tokenizer-type PretrainedFromHF \
    --handler-name AlpacaStyleInstructionHandler \
    --prompt-type qwen \
    --workers 4 \
    --log-interval 1000

验证:ls finetune_dataset/ 应包含 alpaca_packed_*_document.bin.idx 文件。

详细格式见 mindspeed-llm-data-prep

Step 5:训练启动

#!/bin/bash
export HCCL_CONNECT_TIMEOUT=1800
export CUDA_DEVICE_MAX_CONNECTIONS=1
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True

NPUS_PER_NODE=8
MASTER_ADDR=localhost
MASTER_PORT=6000
NNODES=1
NODE_RANK=0

DISTRIBUTED_ARGS="
    --nproc_per_node $NPUS_PER_NODE \
    --nnodes $NNODES \
    --node_rank $NODE_RANK \
    --master_addr $MASTER_ADDR \
    --master_port $MASTER_PORT
"

torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \
    --use-mcore-models \
    --tensor-model-parallel-size 1 \
    --pipeline-model-parallel-size 4 \
    --micro-batch-size 1 \
    --global-batch-size 8 \
    --seq-length 4096 \
    --train-iters 2000 \
    --lr 1e-5 \
    --min-lr 1e-6 \
    --bf16 \
    --use-flash-attn \
    --use-fused-rmsnorm \
    --use-fused-swiglu \
    --use-distributed-optimizer \
    --finetune \
    --stage sft \
    --is-instruction-dataset \
    --prompt-type qwen \
    --no-load-optim \
    --no-load-rng \
    --lora-r 8 \
    --lora-alpha 16 \
    --lora-target-modules linear_qkv linear_proj linear_fc1 linear_fc2 \
    --load ./model_weights/qwen25_7b_mcore/ \
    --data-path ./finetune_dataset/alpaca \
    --tokenizer-type PretrainedFromHF \
    --tokenizer-name-or-path ./model_from_hf/Qwen2.5-7B-Instruct/ \
    --save ./lora_output/ \
    --save-interval 1000 \
    --log-interval 1

详细参数见 mindspeed-llm-training

Step 6:推理验证(可选)

训练完成后可使用示例脚本验证模型质量:

bash examples/mcore/qwen25/generate_qwen25_7b_ptd.sh

Step 7:评估(可选)

bash examples/mcore/qwen25/evaluate_qwen25_7b_mmlu.sh

Step 8:权重导出(可选)

训练后将 Megatron 权重转回 HuggingFace 格式以便部署:

python convert_ckpt.py \
    --use-mcore-models \
    --model-type GPT \
    --load-model-type mg \
    --save-model-type hf \
    --target-tensor-parallel-size 1 \
    --target-pipeline-parallel-size 1 \
    --load-dir ./model_weights/qwen25_7b_mcore/ \
    --save-dir ./model_from_hf/Qwen2.5-7B-Instruct/ \
    --tokenizer-model ./model_from_hf/Qwen2.5-7B-Instruct/tokenizer.json \
    --model-type-hf llama2 \
    --params-dtype bf16
MG→HF 时使用 v1 需设 TP=PP=1;v2 无需设置并行参数。输出在 --save-dir 下的 mg2hf/ 子目录。

阶段间数据流转

model_from_hf/Qwen2.5-7B-Instruct/     ← Step 2 输出
    ↓ convert_ckpt.py (HF→MG)
model_weights/qwen25_7b_mcore/          ← Step 3 输出
    ↓ 作为 --load 输入
    ↓
dataset/*.parquet                        ← Step 4 输入
    ↓ preprocess_data.py
finetune_dataset/alpaca_packed_*         ← Step 4 输出
    ↓ 作为 --data-path 输入
    ↓
lora_output/                             ← Step 5 输出
    ↓ convert_ckpt.py (MG→HF,可选)
model_from_hf/.../mg2hf/                 ← Step 8 输出

参数一致性规则

以下参数 必须 在权重转换、训练、推理之间保持一致:

参数转换训练推理
TP(tensor-parallel-size设定匹配匹配
PP(pipeline-parallel-size设定匹配匹配
--add-qkv-bias按模型匹配匹配
--group-query-attention按模型匹配匹配
--num-query-groups按模型匹配匹配
--position-embedding-type按模型匹配匹配
模型架构参数必须正确匹配训练
参数不一致会导致权重加载失败、NaN loss 或输出乱码。

模型特定配置速查

模型--model-type-hf--add-qkv-bias--num-query-groups层数
Qwen2.5-7Bllama2428
Qwen2.5-72Bllama2880
Qwen3-8Bqwen3836
LLaMA-3-8Bllama2832
LLaMA-3-70Bllama2880
DeepSeek-7Bllama23232

预检清单

开始部署前逐项确认:

  • NPU 可用:python -c "import torch_npu; print(torch.npu.is_available())"
  • CANN 环境激活:echo $ASCEND_HOME_PATH
  • MindSpeed-LLM 目录包含 megatron/ 子目录
  • HF 权重下载完整(config.json + tokenizer + safetensors)
  • 确定 TP/PP 配置并记录
  • 确认模型层数可被 PP 整除
  • 数据集已下载

常见问题

Q: 训练报错 .idx and.bin files cannot be found

  1. 微调必须使用 posttrain_gpt.py(不是 pretrain_gpt.py
  2. --data-path 应为前缀(如 ./finetune_dataset/alpaca),不含 _packed

Q: 权重转换后训练报错 Shape mismatch

TP/PP 或模型架构参数不一致。对照上方参数一致性表逐项检查。

Q: 训练 loss 为 NaN

  • 检查 --initial-loss-scale(bf16 建议 4096)
  • 确认 --clip-grad 1.0
  • 确认 --add-qkv-bias 是否匹配模型

Q: $'\\r': command not found

脚本有 Windows 换行符:sed -i "s/\\r//g" your_script.sh

Q: 多机训练超时

export HCCL_CONNECT_TIMEOUT=1800
# 确保 MASTER_ADDR 不是 localhost

相关 Skill

参考资源

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

39.5%
按下载量换算28

Claude

30.45%
按下载量换算22

Cursor

17.28%
按下载量换算12

Gemini CLI

9.91%
按下载量换算7

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

可疑

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills