Token导航 LogoToken导航TokenDH.com
待分类执行命令github未标认证来源可访问许可证需确认审计通过

training-data-curation训练数据管理

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

1,368

周安装

57

GitHub Stars

149

下载量

456
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:training-data-curation(训练数据管理)
来源仓库:https://github.com/sundial-org/skills
仓库路径:skills/training-data-curation
安装命令:
npx skills add https://github.com/sundial-org/skills --skill training-data-curation
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/sundial-org/skills --skill training-data-curation

简介

用于清洗、标注与增强训练数据集,提升机器学习模型泛化能力。

  • 可自动去除重复项、纠正标签错误或生成合成样本,减少人工干预。
  • 支持 CSV、JSON 等格式输入输出,兼容主流数据处理流水线。
  • 处理敏感字段时应启用匿名化选项,遵守 GDPR 等相关法规要求。
  • 当前介绍较清晰,但仍需确认是否支持在线标注与多人协作功能。

SKILL.md

Training Data Curation Guidelines

Best practices for gathering and preparing training data for LLM fine-tuning.

Data Quality Principles

Quality over quantity. Llama 2 used only 27,540 high-quality SFT examples and outperformed models trained on larger noisy datasets [[1]](#references). Focus on clean, diverse, well-formatted data.

Garbage in, garbage out. The model will learn patterns from your data—including errors, biases, and formatting issues. Inspect samples manually before training.

Match the target distribution. Training data should reflect the tasks and style you want the model to perform. If you want formal responses, don't train on casual chat data.

Format Requirements

Supervised Fine-Tuning (SFT)

Use the messages format (OpenAI/Anthropic/Tinker standard) [[5]](#references):

{"messages": [{"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
  • Each sample is a complete conversation
  • Multi-turn: alternate user/assistant messages
  • System prompts optional: {"role": "system", "content": "..."}
  • JSONL format, one sample per line

Preference Learning (DPO/ORPO/KTO)

Requires paired comparisons [[2]](#references):

{"prompt": "...", "chosen": "...", "rejected": "..."}
  • chosen and rejected must respond to the same prompt
  • Quality difference should be clear and consistent
  • Annotator agreement >70% indicates usable samples [[1]](#references)

For KTO, pairs aren't required—just binary labels on completions [[7]](#references):

{"prompt": "...", "completion": "...", "label": true/false}

Reward Modeling (RLHF)

Needs ranked responses [[1]](#references):

{"prompt": "...", "responses": ["best", "second", "worst"]}

Quality Checklist

Before training, verify:

  • No duplicates — exact and near-duplicate removal [[3]](#references)
  • No empty fields — all required fields populated
  • Consistent format — schema matches throughout
  • Appropriate length — not too short (noise) or too long (truncation)
  • Clean text — proper encoding, no HTML/boilerplate artifacts [[8]](#references)
  • Manual inspection — reviewed random sample of 50-100 examples
  • No PII/sensitive data — unless intentionally included
  • License verified — legal to use for training

Common Quality Issues

IssueDetectionFixSource
DuplicatesHash-based dedupRemove exact matches, MinHash for near-dupes[[3]](#references)
BoilerplateKeyword filterRemove "subscribe", "cookie policy", etc.[[8]](#references)
Repetitive textN-gram analysisFlag if <30% unique trigrams[[4]](#references)
Low-quality textAlpha ratioRemove if <50% alphabetic characters[[8]](#references)
Wrong languageLanguage detectionfastText classifier, filter to target[[3]](#references)
Too shortLength checkMinimum 3-5 sentences, 100+ words for documents[[8]](#references)

Data Sources

High quality:

  • Curated human annotations [[1]](#references)
  • Expert-written examples
  • Filtered high-quality web data [[3]](#references)

Medium quality:

  • Synthetic data from stronger models (distillation)
  • Community Q&A with voting signals
  • Filtered user-generated content

Use with caution:

  • Raw web scrapes
  • Unfiltered synthetic data
  • Data without clear provenance [[6]](#references)

Sizing Guidelines

Dataset SizeUse CaseSource
100-1KQuick experiments, specific behaviors
1K-10KProduction SFT, domain adaptation
10K-100KComprehensive instruction tuning[[1]](#references)
1M+ preference pairsLarge-scale RLHF[[1]](#references)

Llama 2 used ~27K SFT examples and 1M+ preference comparisons [[1]](#references).

File Format

  • JSONL — one JSON object per line, human-readable
  • Parquet — efficient for large datasets, built-in compression [[3]](#references)
  • Sharding — split files >500MB into chunks

References

  1. Llama 2 Paper — Touvron et al. (2023). SFT/RLHF data quality practices, 27K SFT examples, >70% annotator agreement threshold
  2. TRL Library — HuggingFace trainer implementations for SFT, DPO, KTO, ORPO
  3. FineWeb Paper — Penedo et al. (2024). Large-scale filtering: MinHash dedup, language detection, quality classifiers
  4. Data-Juicer — Alibaba's quality filtering toolkit with repetition filters, n-gram analysis
  5. Tinker API — Training API using messages format for SFT, DPO/RLHF support
  6. Data Provenance Initiative — Longpre et al. (2023). Dataset licensing and attribution audit
  7. KTO Paper — Ethayarajh et al. (2024). Binary preference learning without pairs
  8. C4/T5 Paper — Raffel et al. (2020). Foundational filtering: terminal punctuation, min sentences, alpha ratio, boilerplate removal

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

37.85%
按下载量换算173

Claude

27.51%
按下载量换算125

Cursor

19.81%
按下载量换算90

Gemini CLI

8.83%
按下载量换算40

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

执行命令

安装流程涉及命令执行,可能通过 npx skills add https://github.com/sundial-org/skills --skill training-data-curation 联网下载 Skill 或依赖。用户安装前应确认命令来源、仓库内容和执行环境。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills