Token导航 LogoToken导航TokenDH.com
待分类只读github未标认证来源可访问许可证需确认审计通过

mindspeed-llm-trainingmindspeed LLM training 命令行

Agent Skill

mindspeed-llm-training 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

212

周安装

9

GitHub Stars

60

下载量

74
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:mindspeed-llm-training(mindspeed LLM training 命令行)
来源仓库:https://github.com/ascend-ai-coding/awesome-ascend-skills
仓库路径:skills/mindspeed-llm-training
安装命令:
npx skills add https://github.com/ascend-ai-coding/awesome-ascend-skills --skill mindspeed-llm-training
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/ascend-ai-coding/awesome-ascend-skills --skill mindspeed-llm-training

简介

用于 LLM 模型训练流程的命令行操作支持,管理训练任务。

  • 可处理数据集准备、超参数配置和训练监控。
  • 需结合硬件资源和模型架构进行参数调优。适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。
  • 训练过程应定期检查日志和指标变化趋势。
  • mindspeed-llm-training 属于待分类类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

MindSpeed-LLM 分布式训练启动

本 Skill 指导用户在华为昇腾 NPU 上启动 MindSpeed-LLM 分布式训练任务。

入口脚本

入口脚本用途
pretrain_gpt.py预训练(从头训练或继续预训练)
posttrain_gpt.py指令微调(SFT、LoRA、QLoRA、Full)
posttrain_gpt.py偏好对齐(DPO、GRPO)
train_fsdp2.pyFSDP2 后端训练
重要:所有微调任务必须使用 posttrain_gpt.py不要使用 pretrain_gpt.py。只有 posttrain_gpt.py 才能正确路由 --is-instruction-dataset 到 packed 指令数据加载器。

快速开始

LoRA 微调(Qwen2.5-7B)

# 使用示例脚本(推荐)
bash examples/mcore/qwen25/tune_qwen25_7b_4k_lora_ptd.sh

# 或手动启动
bash run_finetune.sh

预训练(Qwen2.5-7B)

bash examples/mcore/qwen25/pretrain_qwen25_7b_32k_ptd.sh

示例脚本

脚本位于 examples/mcore/<model_name>/

脚本模式用途
pretrain_<model>_*.sh预训练启动
tune_<model>_*_full*.sh全参数微调
tune_<model>_*_lora*.shLoRA 微调
generate_<model>_*.sh推理
evaluate_<model>_*.sh评估

支持的模型

模型族规模脚本目录
Qwen2.50.5B - 72Bexamples/mcore/qwen25/
Qwen30.6B - 32Bexamples/mcore/qwen3/
LLaMA 3/3.18B, 70Bexamples/mcore/llama3/
DeepSeek-V2/V3各规模examples/mcore/deepseek/
ChatGLM49Bexamples/mcore/glm4/
Mistral7Bexamples/mcore/mistral/
Baichuan27B, 13Bexamples/mcore/baichuan2/
Qwen3-MoE235Bexamples/mcore/qwen3_moe/
Mixtral8x7Bexamples/mcore/mixtral/

训练参数

并行策略

参数说明典型值
--tensor-model-parallel-size张量并行度(TP)1-8
--pipeline-model-parallel-size流水线并行度(PP)1-8
--context-parallel-size上下文并行度(CP)1-2
--micro-batch-size每 NPU 微批大小1-4
--global-batch-size全局批大小8-64

推荐并行配置

模型规模NPU 数推荐 TP推荐 PP
< 3B1-811
7B-14B81-21-4
32B-72B8-164-82-4
100B+16+84+

通用训练参数

参数说明典型值
--seq-length序列长度2048-32768
--train-iters训练迭代数1000-5000
--lr学习率1e-5 ~ 1e-6
--bf16BFloat16 精度始终推荐
--use-flash-attnFlash Attention始终推荐
--use-fused-rmsnorm融合 RMSNorm始终推荐
--use-fused-swiglu融合 SwiGLU始终推荐
--use-distributed-optimizer分布式优化器多卡推荐
--save-intervalCheckpoint 保存间隔500-1000
--eval-interval评估间隔500-1000

微调专用参数

--finetune                    # 启用微调模式
--stage sft                   # 监督微调阶段
--is-instruction-dataset      # 使用 packed 指令数据加载器
--prompt-type qwen            # 对话模板(qwen, qwen3, llama3, glm4 等)
--no-load-optim               # 不加载优化器状态
--no-load-rng                 # 不加载随机数状态
--no-pad-to-seq-lengths       # 不填充到 seq-length(节省计算)
--reset-attention-mask        # 打包数据需重置注意力掩码
--enable-thinking             # Qwen3 思维链模式(需配合 --prompt-type qwen3)

LoRA 参数

--lora-r 8                    # LoRA 秩(典型:8-16)
--lora-alpha 16               # LoRA 缩放因子(推荐 α/r ≈ 2)
--lora-fusion                 # 启用 CCLoRA(计算通信重叠)
--lora-target-modules linear_qkv linear_proj linear_fc1 linear_fc2

QLoRA 参数

--qlora                       # 启用 QLoRA
--lora-r 8
--lora-alpha 16
--lora-target-modules linear_qkv linear_proj linear_fc1 linear_fc2
QLoRA 使用 4-bit 量化基础模型 + LoRA 适配器,显著减少显存占用。 前提:QLoRA 训练前,权重转换(HF→MG)时须加 --qlora-nf4 生成 NF4 量化权重。 注意:QLoRA 不支持 --lora-fusion,开启无性能收益。

训练启动脚本模板

#!/bin/bash

NPUS_PER_NODE=8
MASTER_ADDR=localhost
MASTER_PORT=6000
NNODES=1
NODE_RANK=0

DISTRIBUTED_ARGS="
    --nproc_per_node $NPUS_PER_NODE \
    --nnodes $NNODES \
    --node_rank $NODE_RANK \
    --master_addr $MASTER_ADDR \
    --master_port $MASTER_PORT
"

# LoRA 微调示例
torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \
    --use-mcore-models \
    --tensor-model-parallel-size 1 \
    --pipeline-model-parallel-size 1 \
    --micro-batch-size 1 \
    --global-batch-size 8 \
    --seq-length 4096 \
    --train-iters 2000 \
    --lr 1e-5 \
    --min-lr 1e-6 \
    --bf16 \
    --use-flash-attn \
    --use-fused-rmsnorm \
    --use-fused-swiglu \
    --use-distributed-optimizer \
    --finetune \
    --stage sft \
    --is-instruction-dataset \
    --prompt-type qwen \
    --no-load-optim \
    --no-load-rng \
    --lora-r 8 \
    --lora-alpha 16 \
    --lora-target-modules linear_qkv linear_proj linear_fc1 linear_fc2 \
    --load ./model_weights/qwen25_7b_mcore/ \
    --data-path ./finetune_dataset/alpaca \
    --tokenizer-type PretrainedFromHF \
    --tokenizer-name-or-path ./model_from_hf/Qwen2.5-7B-Instruct/ \
    --save ./lora_output/ \
    --save-interval 1000 \
    --log-interval 1

DPO 偏好对齐

torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \
    --stage dpo \
    --is-pairwise-dataset \
    --is-instruction-dataset \
    --dpo-beta 0.1 \
    --dpo-loss-type sigmoid \
    --data-path ./dataset/pairwise_data \
    # ... 其他参数同 SFT

可选:模型评估

训练完成后可运行评估:

bash examples/mcore/qwen25/evaluate_qwen25_7b_mmlu.sh

支持的评估基准:MMLU、GSM8K、BBH、C-Eval、CMMLU、HumanEval、HellaSwag、BoolQ、NeedleBench、AGI-Eval。

FSDP2 后端(高级)

使用 FSDP2 替代 Megatron 原生分布式:

torchrun $DISTRIBUTED_ARGS train_fsdp2.py \
    --fsdp2 \
    --fsdp2-reshard-after-forward \
    # ... 其他参数

常见问题

Q: AssertionError:.idx and.bin files cannot be found

两个常见原因:

  1. 入口脚本错误:微调必须使用 posttrain_gpt.py(不是 pretrain_gpt.py
  2. 数据路径错误--data-path 应为前缀(如 ./finetune_dataset/alpaca),不要包含 _packed

Q: $'\r': command not found

训练脚本有 Windows 换行符:

sed -i "s/\r//g" your_script.sh

Q: 训练卡住或 HCCL 超时

export HCCL_CONNECT_TIMEOUT=1800
export CUDA_DEVICE_MAX_CONNECTIONS=1

Q: 多机训练如何配置

# 节点 0(主节点)
NNODES=2 NODE_RANK=0 MASTER_ADDR=192.168.1.100 torchrun ...

# 节点 1
NNODES=2 NODE_RANK=1 MASTER_ADDR=192.168.1.100 torchrun ...

相关 Skill

参考资源

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

36.15%
按下载量换算27

Claude

28.07%
按下载量换算21

Cursor

17.88%
按下载量换算13

Gemini CLI

9.06%
按下载量换算7

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills