Token导航 LogoToken导航TokenDH.com
开发需要联网github未标认证来源可访问许可证需确认审计提醒

data-engineering-core数据工程核心

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

235

周安装

10

GitHub Stars

公开资料未说明

下载量

82
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:data-engineering-core(数据工程核心)
来源仓库:https://github.com/legout/data-platform-agent-skills
仓库路径:skills/data-engineering-core
安装命令:
npx skills add https://github.com/legout/data-platform-agent-skills --skill data-engineering-core
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/legout/data-platform-agent-skills --skill data-engineering-core

简介

用于日常 Python 数据工程任务的技术选型与实现指导。

  • 支持 Polars 懒查询优化、DuckDB SQL 分析及 Parquet 互操作。
  • 提供 ETL 结构、重试机制与幂等性设计模式。
  • 适用于 PostgreSQL 到数据湖/仓库的 ingestion 场景。
  • 优先使用 Arrow 格式提升跨语言数据处理效率。

SKILL.md

Core Data Engineering

Use this skill for day-to-day Python data engineering decisions: dataframe processing, embedded OLAP SQL, Arrow interchange, ETL structure, and resilience patterns.

When to use this skill

Use this skill when the task involves one or more of:

  • Polars transformations and lazy query optimization
  • DuckDB SQL analytics, MERGE/upsert, or Parquet querying
  • PyArrow table/dataset interchange and Parquet scans
  • Python ETL pipeline structure (extract/transform/load, logging, retries, idempotency)
  • PostgreSQL-to-lake/warehouse ingestion patterns

If the task is primarily about cloud storage auth/connectors, use:

  • @data-engineering-storage-remote-access
  • @data-engineering-storage-authentication

If the task is primarily about ACID lakehouse table behavior, use:

  • @data-engineering-storage-lakehouse

Quick tool selection

NeedDefault choiceWhy
DataFrame transformation in PythonPolarsFast lazy engine, strong expression API
SQL over files/DataFramesDuckDBEmbedded OLAP + Parquet/Arrow native
Interchange format between systemsPyArrowZero-copy table/batch ecosystem
OLTP source extractionpsycopg2 / postgres driverStable DB connectivity

Rule of thumb:

  1. Start transformations in Polars lazy.
  2. Use DuckDB for heavy SQL/windowing/joins over files.
  3. Keep boundaries in Arrow/Parquet.

Core implementation rules

1) Prefer lazy execution

  • Use pl.scan_* over pl.read_* for large inputs.
  • Chain filters/projections before collect().
  • Avoid row-wise loops.

2) Push work down

  • Push filtering into file scans (predicate pushdown).
  • Select only needed columns (column pruning).
  • Partition data by query dimensions (typically date/tenant/region).

3) Keep writes idempotent

  • Prefer MERGE/upsert semantics where possible.
  • If append-only, track watermark/checkpoints.
  • Ensure retries do not duplicate side effects.

4) Protect boundaries

  • Use parameterized SQL for values.
  • Treat dynamic identifiers (table/column names) separately and validate.
  • Never hardcode secrets.

5) Instrument and validate

  • Log row counts and stage durations.
  • Validate schema/required columns at stage boundaries.
  • Record checkpoints/watermarks for incremental flows.

Minimal safe ETL shape

import polars as pl
import duckdb

def run_etl(source_path: str, target_table: str) -> None:
    lazy = (
        pl.scan_parquet(source_path)
        .filter(pl.col("value").is_not_null())
        .select(["id", "event_ts", "value", "category"])
    )

    df = lazy.collect()

    with duckdb.connect("analytics.db") as con:
        con.sql("CREATE OR REPLACE TABLE staging AS SELECT * FROM df")
        con.sql(f"""
            CREATE TABLE IF NOT EXISTS {target_table} AS
            SELECT * FROM staging WHERE 1=0
        """)
        con.sql(f"INSERT INTO {target_table} SELECT * FROM staging")

For production-grade structure, use:

  • templates/complete_etl_pipeline.py

Progressive disclosure (read next as needed)

  • patterns/etl.md — canonical ETL pipeline structure
  • patterns/incremental.md — watermark/CDC/incremental loading patterns
  • templates/complete_etl_pipeline.py — full template with logging and checkpoints
  • core-detailed.md — comprehensive reference (extended examples)

Related skills

  • @data-engineering-storage-lakehouse — Delta/Iceberg/Hudi behavior
  • @data-engineering-storage-remote-access — fsspec/pyarrow.fs/obstore cloud access
  • @data-engineering-orchestration — Prefect/Dagster/dbt orchestration
  • @data-engineering-quality — Pandera / Great Expectations validation
  • @data-engineering-observability — OTel + Prometheus monitoring
  • @data-engineering-ai-ml — embedding/vector/RAG pipelines

References

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

36.51%
按下载量换算30

Claude

27.78%
按下载量换算23

Cursor

18.72%
按下载量换算15

Gemini CLI

10.61%
按下载量换算9

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

可疑

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills