Token导航 LogoToken导航TokenDH.com
研究检索需要联网github未标认证来源可访问clear审计异常

golden-dataset-curation黄金数据集管理

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

235

周安装

10

GitHub Stars

160

下载量

82
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

3

许可证

MIT

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:golden-dataset-curation(黄金数据集管理)
来源仓库:https://github.com/yonatangross/orchestkit
仓库路径:skills/golden-dataset-curation
安装命令:
npx skills add https://github.com/yonatangross/orchestkit --skill golden-dataset-curation
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。不同来源提供的安装方式可能略有差异;本站展示可直接复制的安装命令,安装前请核对来源页面。

skills.shnpx skills
npx skills add https://github.com/yonatangross/orchestkit --skill golden-dataset-curation

简介

golden-dataset-curation 用于数据整理和表格分析,支持 CSV/Excel 处理。

  • 适合在 Codex、Claude、Cursor、Gemini CLI 中清洗字段、汇总数据和发现异常。
  • 可生成统计口径或分析说明,辅助决策和报告准备。
  • 使用时需确认数据来源、字段含义和时间范围,避免误用样本数据。
  • 涉及敏感数据或批量写回时,应先确认权限和脱敏方式。

SKILL.md

Golden Dataset Curation

Curate high-quality documents for the golden dataset with multi-agent validation

Overview

This skill provides patterns and workflows for adding new documents to the golden dataset with thorough quality analysis. It complements golden-dataset-management which handles backup/restore.

When to use this skill:

  • Adding new documents to the golden dataset
  • Classifying content types and difficulty levels
  • Generating test queries for new documents
  • Running multi-agent quality analysis

Content Types

TypeDescriptionQuality Focus
articleTechnical articles, blog postsDepth, accuracy, actionability
tutorialStep-by-step guidesCompleteness, clarity, code quality
research_paperAcademic papers, whitepapersRigor, citations, methodology
documentationAPI docs, reference materialsAccuracy, completeness, examples
video_transcriptTranscribed video contentStructure, coherence, key points
code_repositoryREADME, code analysisCode quality, documentation

Difficulty Levels

LevelSemantic ComplexityExpected ScoreCharacteristics
trivialDirect keyword match>0.85Technical terms, exact phrases
easyCommon synonyms>0.70Well-known concepts, slight variations
mediumParaphrased intent>0.55Conceptual queries, multi-topic
hardMulti-hop reasoning>0.40Cross-domain, comparative analysis
adversarialEdge casesGraceful degradationRobustness tests, off-domain

Quality Dimensions

DimensionWeightPerfectAcceptableFailing
Accuracy0.250.95-1.00.70-0.94<0.70
Coherence0.200.90-1.00.60-0.89<0.60
Depth0.250.90-1.00.55-0.89<0.55
Relevance0.300.95-1.00.70-0.94<0.70

Evaluation focuses:

  • Accuracy: Technical correctness, code validity, up-to-date info
  • Coherence: Logical structure, clear flow, consistent terminology
  • Depth: Comprehensive coverage, edge cases, appropriate detail
  • Relevance: Alignment with AI/ML, backend, frontend, DevOps domains

Multi-Agent Pipeline

INPUT: URL/Content
        |
        v
+------------------+
|   FETCH AGENT    |  Extract structure, detect type
+--------+---------+
         |
         v
+-----------------------------------------------+
|  PARALLEL ANALYSIS AGENTS                      |
|  Quality | Difficulty | Domain  | Query Gen   |
+-----------------------------------------------+
         |
         v
+------------------+
| CONSENSUS        |  Weighted score + confidence
| AGGREGATOR       |  -> include/review/exclude
+--------+---------+
         |
         v
+------------------+
|  USER APPROVAL   |  Show scores, confirm
+--------+---------+
         |
         v
OUTPUT: Curated document entry

Decision Thresholds

Quality ScoreConfidenceDecision
>= 0.75>= 0.70include
>= 0.55anyreview
< 0.55anyexclude

Quality Thresholds

# Recommended thresholds for golden dataset inclusion
minimum_quality_score: 0.70
minimum_confidence: 0.65
required_tags: 2          # At least 2 domain tags
required_queries: 3       # At least 3 test queries

Coverage Balance Guidelines

Maintain balanced coverage across:

  • Content types: Don't over-index on articles
  • Difficulty levels: Need trivial AND hard queries
  • Domains: Spread across AI/ML, backend, frontend, etc.

Duplicate Prevention Checklist

Before adding:

  1. Check URL against existing source_url_map.json
  2. Run semantic similarity against existing document embeddings
  3. Warn if >80% similar to existing document

Provenance Tracking

Always record:

  • Source URL (canonical)
  • Curation date
  • Agent scores (for audit trail)
  • Langfuse trace ID

Langfuse Integration

Trace Structure

trace = langfuse.trace(
    name="golden-dataset-curation",
    metadata={"source_url": url, "document_id": doc_id}
)

# Log individual dimension scores
trace.score(name="accuracy", value=0.85)
trace.score(name="coherence", value=0.90)
trace.score(name="depth", value=0.78)
trace.score(name="relevance", value=0.92)

# Final aggregated score
trace.score(name="quality_total", value=0.87)
trace.event(name="curation_decision", metadata={"decision": "include"})

Managed Prompts

Prompt NamePurpose
golden-content-classifierClassify content_type
golden-difficulty-classifierAssign difficulty
golden-domain-taggerExtract tags
golden-query-generatorGenerate test queries

References

For detailed implementation patterns, see:

  • references/selection-criteria.md - Content type classification, difficulty stratification, quality evaluation dimensions, and best practices
  • references/annotation-patterns.md - Multi-agent pipeline architecture, agent specifications, consensus aggregation logic, and Langfuse integration

Related Skills

  • golden-dataset-management - Backup/restore operations
  • golden-dataset-validation - Validation rules and checks
  • langfuse-observability - Tracing patterns
  • pgvector-search - Duplicate detection

Version: 1.0.0 (December 2025) Issue: #599

Capability Details

content-classification

Keywords: content type, classification, document type, golden dataset Solves:

  • Classify document content types for golden dataset
  • Categorize entries by domain and purpose
  • Identify content requiring special handling

difficulty-stratification

Keywords: difficulty, stratification, complexity level, challenge rating Solves:

  • Assign difficulty levels to golden dataset entries
  • Ensure balanced difficulty distribution
  • Identify edge cases and challenging examples

quality-evaluation

Keywords: quality, evaluation, quality dimensions, quality criteria Solves:

  • Evaluate entry quality against defined criteria
  • Score entries on multiple quality dimensions
  • Identify entries needing improvement

multi-agent-analysis

Keywords: multi-agent, parallel analysis, consensus, agent evaluation Solves:

  • Run parallel agent evaluations on entries
  • Aggregate consensus from multiple analysts
  • Resolve disagreements in classifications

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

04

需要参考平台分布和安装热度时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Claude Code

26.68%
按下载量换算22

windsurf

24.86%
按下载量换算20

trae

16.03%
按下载量换算13

OpenCode

13.12%
按下载量换算11

Codex

7.09%
按下载量换算6

Antigravity

3.05%
按下载量换算3

安全审计

Gen Agent Trust Hub

未通过

Socket

通过

Snyk

可疑

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。

来源信息

继续浏览同类 Skills