Token导航 LogoToken导航TokenDH.com
运维和基础设施需要联网github未标认证来源可访问clear审计异常

data-engineer数据工程师

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

2,497

周安装

102

GitHub Stars

76

下载量

998
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

3

许可证

MIT

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:data-engineer(数据工程师)
来源仓库:https://github.com/404kidwiz/claude-supercode-skills
仓库路径:skills/data-engineer
安装命令:
npx skills add https://github.com/404kidwiz/claude-supercode-skills --skill data-engineer
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。不同来源提供的安装方式可能略有差异;本站展示可直接复制的安装命令,安装前请核对来源页面。

skills.shnpx skills
npx skills add https://github.com/404kidwiz/claude-supercode-skills --skill data-engineer

简介

data-engineer 提供数据管道、ETL/ELT 工作流和现代数据栈技术专长。

  • 适用于构建可扩展数据管道、设置实时流处理和优化存储成本。
  • 在 Codex、Claude、Cursor、Gemini CLI 中调用,用于数据治理和合规迁移。
  • 安装命令为 npx skills add https://github.com/404kidwiz/claude-supercode-skills --skill data-engineer。
  • 建议确认权限范围和维护状态,避免触发联网或文件读写等敏感操作。

SKILL.md

Data Engineer

Purpose

Provides expert data engineering capabilities for building scalable data pipelines, ETL/ELT workflows, data lakes, and data warehouses. Specializes in distributed data processing, stream processing, data quality, and modern data stack technologies (Airflow, dbt, Spark, Kafka) with focus on reliability and cost optimization.

When to Use

  • Designing end-to-end data pipelines from source to consumption layer
  • Implementing ETL/ELT workflows with error handling and data quality checks
  • Building data lakes or data warehouses with optimal storage and querying
  • Setting up real-time stream processing (Kafka, Flink, Kinesis)
  • Optimizing data infrastructure costs (storage tiering, compute efficiency)
  • Implementing data governance and compliance (GDPR, data lineage)
  • Migrating legacy data systems to modern data platforms

Quick Start

Invoke this skill when:

  • Designing end-to-end data pipelines from source to consumption layer
  • Implementing ETL/ELT workflows with error handling and data quality checks
  • Building data lakes or data warehouses with optimal storage and querying
  • Setting up real-time stream processing (Kafka, Flink, Kinesis)
  • Optimizing data infrastructure costs (storage tiering, compute efficiency)
  • Implementing data governance and compliance (GDPR, data lineage)

Do NOT invoke when:

  • Only SQL query optimization needed (use database-optimizer instead)
  • Machine learning model development (use ml-engineer or data-scientist)
  • Simple data analysis or visualization (use data-analyst)
  • Database administration tasks (use database-administrator)
  • API integration without data transformation (use backend-developer)

Decision Framework

Pipeline Architecture Selection

├─ Batch Processing?
│   ├─ Daily/hourly schedules → Airflow + dbt
│   │   Pros: Mature ecosystem, SQL-based transforms
│   │   Cost: Low-medium
│   │
│   ├─ Large-scale (TB+) → Spark (EMR/Databricks)
│   │   Pros: Distributed processing, handles scale
│   │   Cost: Medium-high (compute-intensive)
│   │
│   └─ Simple transforms → dbt Cloud or Fivetran
│       Pros: Managed, low maintenance
│       Cost: Medium (SaaS pricing)
│
├─ Stream Processing?
│   ├─ Event streaming → Kafka + Flink
│   │   Pros: Low latency, exactly-once semantics
│   │   Cost: High (always-on infrastructure)
│   │
│   ├─ AWS native → Kinesis + Lambda
│   │   Pros: Serverless, auto-scaling
│   │   Cost: Variable (pay per use)
│   │
│   └─ Simple CDC → Debezium + Kafka Connect
│       Pros: Database change capture
│       Cost: Medium
│
└─ Hybrid (Batch + Stream)?
    └─ Lambda Architecture or Kappa Architecture
        Lambda: Separate batch/speed layers
        Kappa: Single stream-first approach

Data Storage Selection

Use CaseTechnologyProsCons
Structured analyticsSnowflake/BigQuerySQL, fast queriesCost at scale
Semi-structuredDelta Lake/IcebergACID, schema evolutionComplexity
Raw storageS3/GCSCheap, durableNo query engine
Real-timeRedis/DynamoDBLow latencyLimited analytics
Time-seriesTimescaleDB/InfluxDBOptimized for time dataSpecific use case

ETL vs ELT Decision

FactorETL (Transform First)ELT (Load First)
Data volumeSmall-mediumLarge (TB+)
TransformationComplex, pre-loadSQL-based, in-warehouse
LatencyHigherLower
CostCompute before loadWarehouse compute
Best forLegacy systemsModern cloud DW

Core Patterns

Pattern 1: Idempotent Partition Overwrite

Use case: Safely re-run batch jobs without creating duplicates.

# PySpark example: Overwrite partition based on execution date
def write_daily_partition(df, target_table, execution_date):
    (df
     .write
     .mode("overwrite")
     .partitionBy("process_date")
     .option("partitionOverwriteMode", "dynamic")
     .format("parquet")
     .saveAsTable(target_table))

Pattern 2: Slowly Changing Dimension Type 2 (SCD2)

Use case: Track history of changes without losing past states.

-- dbt implementation of SCD2
{{ config(materialized='incremental', unique_key='user_id') }}

SELECT
    user_id, address, email, status, updated_at,
    LEAD(updated_at, 1, '9999-12-31') OVER (
        PARTITION BY user_id ORDER BY updated_at
    ) as valid_to
FROM {{ source('raw', 'users') }}

Pattern 3: Dead Letter Queue (DLQ) for Streaming

Use case: Handle malformed messages without stopping the pipeline.

Pattern 4: Data Quality Circuit Breaker

Use case: Stop pipeline execution if data quality drops below threshold.

Quality Checklist

Data Pipeline

  • Idempotent (safe to retry)
  • Schema validation enforced
  • Error handling with retries
  • Data quality checks automated
  • Monitoring and alerting configured
  • Lineage documented

Performance

  • Pipeline completes within SLA (e.g., <1 hour)
  • Incremental loading where applicable
  • Partitioning strategy optimized
  • Query performance <30 seconds (P95)

Cost Optimization

  • Storage tiering implemented (hot/warm/cold)
  • Compute auto-scaling configured
  • Query cost monitoring active
  • Compression enabled (Parquet/ORC)

Additional Resources

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

04

需要参考平台分布和安装热度时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Claude Code

28.92%
按下载量换算289

OpenCode

22.36%
按下载量换算223

Codex

16.36%
按下载量换算163

Cursor

11.4%
按下载量换算114

Gemini CLI

8.35%
按下载量换算83

windsurf

3.22%
按下载量换算32

安全审计

Gen Agent Trust Hub

未通过

Socket

通过

Snyk

可疑

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。

来源信息

继续浏览同类 Skills