Token导航 LogoToken导航TokenDH.com
研究检索只读github未标认证来源可访问clear审计通过

ethics-safety-impact道德安全影响

Agent Skill

ethics-safety-impact 用于查找、检索和筛选相关信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要根据关键词、任务场景或来源线索快速定位候选结果时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

1,603

周安装

49

GitHub Stars

85

下载量

384
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

3

许可证

MIT

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:ethics-safety-impact(道德安全影响)
来源仓库:https://github.com/lyndonkl/claude
仓库路径:skills/ethics-safety-impact
安装命令:
npx skills add https://github.com/lyndonkl/claude --skill ethics-safety-impact
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。不同来源提供的安装方式可能略有差异;本站展示可直接复制的安装命令,安装前请核对来源页面。

skills.shnpx skills
npx skills add https://github.com/lyndonkl/claude --skill ethics-safety-impact

简介

ethics-safety-impact 提供信用评分等高风险系统的伦理与安全影响评估模板,识别弱势群体风险。

  • 适合分析算法歧视、申诉机制缺失或反馈循环危害,输出 mitigation 措施与 stakeholder 沟通策略。
  • 使用时需输入具体应用场景(如贷款审批)、受影响人群与现有控制措施,输出可执行改进建议。
  • 安装前应确认本地监管要求(如 ECOA、Reg B),禁止在无人工复核情况下自动拒绝申请。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

Ethics, Safety & Impact Assessment

Table of Contents

Example

Scenario: Launching credit scoring algorithm for loan approvals

  1. Stakeholders: Loan applicants (diverse demographics), lenders, society (economic mobility)
  2. Harms: Disparate impact from historical bias, opacity preventing appeals, feedback loops perpetuating denials
  3. Vulnerable groups: Racial minorities, immigrants with thin credit files, young adults, people in poverty
  4. Mitigations: Fairness audit across protected classes, reason codes + appeals, alternative data (rent/utilities), human review for edge cases
  5. Monitoring: Approval rate parity within 10% across groups; if disparate impact >20%, escalate to ethics committee

Workflow

Copy this checklist and track your progress:

Ethics & Safety Assessment Progress:
- [ ] Step 1: Map stakeholders and identify vulnerable groups
- [ ] Step 2: Analyze potential harms and benefits
- [ ] Step 3: Assess fairness and differential impacts
- [ ] Step 4: Evaluate severity and likelihood
- [ ] Step 5: Design mitigations and safeguards
- [ ] Step 6: Define monitoring and escalation protocols

Step 1: Map stakeholders and identify vulnerable groups

Identify all affected parties (direct users, indirect, society). Prioritize vulnerable populations most at risk. See resources/template.md for stakeholder analysis framework.

Step 2: Analyze potential harms and benefits

Brainstorm what could go wrong (harms) and what value is created (benefits) for each stakeholder group. See resources/template.md for structured analysis.

Step 3: Assess fairness and differential impacts

Evaluate whether outcomes, treatment, or access differ across groups. Check for disparate impact. See resources/methodology.md for fairness criteria and measurement.

Step 4: Evaluate severity and likelihood

Score each harm on severity (1-5) and likelihood (1-5), prioritize high-risk combinations. See resources/template.md for prioritization framework.

Step 5: Design mitigations and safeguards

For high-priority harms, propose design changes, policy safeguards, oversight mechanisms. See resources/methodology.md for intervention types.

Step 6: Define monitoring and escalation protocols

Set metrics, thresholds, review cadence, escalation triggers. Validate using resources/evaluators/rubric_ethics_safety_impact.json. Minimum standard: Average score ≥ 3.5.

Common Patterns

Pattern 1: Algorithm Fairness Audit

  • Stakeholders: Users receiving algorithmic decisions (hiring, lending, content ranking), protected groups
  • Harms: Disparate impact (bias against protected classes), feedback loops amplifying inequality, opacity preventing accountability
  • Assessment: Test for demographic parity, equalized odds, calibration across groups; analyze training data for historical bias
  • Mitigations: Debiasing techniques, fairness constraints, explainability, human review for edge cases, regular audits
  • Monitoring: Disparate impact ratio, false positive/negative rates by group, user appeals and overturn rates

Pattern 2: Data Privacy & Consent

  • Stakeholders: Data subjects (users whose data is collected), vulnerable groups (children, marginalized communities)
  • Harms: Privacy violations, surveillance, data breaches, lack of informed consent, secondary use without permission, re-identification risk
  • Assessment: Map data flows (collection → storage → use → sharing), identify sensitive attributes (PII, health, location), consent adequacy
  • Mitigations: Data minimization (collect only necessary), anonymization/differential privacy, granular consent, user data controls (export, delete), encryption
  • Monitoring: Breach incidents, data access logs, consent withdrawal rates, user data requests (GDPR, CCPA)

Pattern 3: Content Moderation & Free Expression

  • Stakeholders: Content creators, viewers, vulnerable groups (targets of harassment), society (information integrity)
  • Harms: Over-moderation (silencing legitimate speech, especially marginalized voices), under-moderation (allowing harm, harassment, misinformation), inconsistent enforcement
  • Assessment: Analyze moderation error rates (false positives/negatives), differential enforcement across groups, cultural context sensitivity
  • Mitigations: Clear policies with examples, appeals process, human review, diverse moderators, cultural context training, transparency reports
  • Monitoring: Moderation volume and error rates by category, appeal overturn rates, disparate enforcement across languages/regions

Pattern 4: Accessibility & Inclusive Design

  • Stakeholders: Users with disabilities (visual, auditory, motor, cognitive), elderly, low-literacy, low-bandwidth users
  • Harms: Exclusion (cannot use product), degraded experience, safety risks (cannot access critical features), digital divide
  • Assessment: WCAG compliance audit, assistive technology testing, user research with diverse abilities, cross-cultural usability
  • Mitigations: Accessible design (WCAG AA/AAA), alt text, keyboard navigation, screen reader support, low-bandwidth mode, multi-language, plain language
  • Monitoring: Accessibility test coverage, user feedback from disability communities, task completion rates across abilities

Pattern 5: Safety-Critical Systems

  • Stakeholders: End users (patients, drivers, operators), vulnerable groups (children, elderly, compromised health), public safety
  • Harms: Physical harm (injury, death), psychological harm (trauma), property damage, cascade failures affecting many
  • Assessment: Failure mode analysis (FMEA), fault tree analysis, worst-case scenarios, edge cases that break assumptions
  • Mitigations: Redundancy, fail-safes, human oversight, rigorous testing (stress, chaos, adversarial), incident response plans, staged rollouts
  • Monitoring: Error rates, near-miss incidents, safety metrics (accidents, adverse events), user-reported issues, compliance audits

Guardrails

  1. Identify vulnerable groups explicitly: Prioritize children, elderly, people with disabilities, marginalized/discriminated groups, low-income, low-literacy, geographically isolated, and politically targeted populations. If none are identified, look harder.
  2. Consider second-order and long-term effects: Look for feedback loops (harm leads to disadvantage leads to more harm), normalization, precedent-setting, and accumulation of small harms over time. Ask "what happens next?"
  3. Assess differential impact, not just average: A feature may help the average user but harm specific groups. Check for disparate impact (outcome differences across groups >20% is a red flag), intersectionality, and distributive justice.
  4. Design mitigations before launch: Build safeguards into design, test with diverse users, use staged rollouts with monitoring, and pre-commit to audits. Reactive fixes come too late for those already harmed.
  5. Provide transparency and recourse: At minimum, explain decisions, provide appeal mechanisms with human review, offer redress for harm, and maintain audit trails.
  6. Monitor outcomes, not just intentions: Measure outcome disparities by group, user-reported harms, error rate distribution, and unintended consequences. Set thresholds that trigger review or shutdown.
  7. Establish clear accountability and escalation: Define who reviews ethics risks before launch, who monitors post-launch, what triggers escalation, and who can halt harmful features.
  8. Respect autonomy and consent: Provide informed choice in plain language, meaningful alternatives (not coerced consent), user control (opt out, delete data), and purpose limitation. Children and vulnerable groups need extra protections.

Common pitfalls:

  • Assuming "we treat everyone the same" = fairness: Equal treatment of unequal groups perpetuates inequality. Fairness often requires differential treatment.
  • Optimization without constraints: Maximizing engagement/revenue unconstrained leads to amplifying outrage, addiction, polarization. Set ethical boundaries.
  • Moving fast and apologizing later: For safety/ethics, prevention > apology. Harms to vulnerable groups are not acceptable experiments.
  • Privacy theater: Requiring consent without explaining risks, or making consent mandatory for service, is not meaningful consent.
  • Sampling bias in testing: Testing only on employees (young, educated, English-speaking) misses how diverse users experience harm.
  • Ethics washing: Performative statements without material changes. Impact assessments must change decisions, not just document them.

Quick Reference

Key resources:

Stakeholder Priorities:

High-risk groups to always consider:

  • Children (<18, especially <13)
  • People with disabilities (visual, auditory, motor, cognitive)
  • Racial/ethnic minorities, especially historically discriminated groups
  • Low-income, unhoused, financially precarious
  • LGBTQ+, especially in hostile jurisdictions
  • Elderly (>65), especially digitally less-skilled
  • Non-English speakers, low-literacy
  • Political dissidents, activists, journalists in repressive contexts
  • Refugees, immigrants, undocumented
  • Mentally ill, cognitively impaired

Harm Categories:

  • Physical: Injury, death, health deterioration
  • Psychological: Trauma, stress, anxiety, depression, addiction
  • Economic: Lost income, debt, poverty, exclusion from opportunity
  • Social: Discrimination, harassment, ostracism, loss of relationships
  • Autonomy: Coercion, manipulation, loss of control, dignity violation
  • Privacy: Surveillance, exposure, data breach, re-identification
  • Reputational: Stigma, defamation, loss of standing
  • Epistemic: Misinformation, loss of knowledge access, filter bubbles
  • Political: Disenfranchisement, censorship, targeted repression

Fairness Definitions (choose appropriate for context):

  • Demographic parity: Outcome rates equal across groups (e.g., 40% approval rate for all)
  • Equalized odds: False positive and false negative rates equal across groups
  • Equal opportunity: True positive rate equal across groups (equal access to benefit)
  • Calibration: Predicted probabilities match observed frequencies for all groups
  • Individual fairness: Similar individuals treated similarly (Lipschitz condition)
  • Counterfactual fairness: Outcome same if sensitive attribute (race, gender) were different

Mitigation Strategies:

  • Prevent: Design change eliminates harm (e.g., don't collect sensitive data)
  • Reduce: Decrease likelihood or severity (e.g., rate limiting, friction for risky actions)
  • Detect: Monitor and alert when harm occurs (e.g., bias dashboard, anomaly detection)
  • Respond: Process to address harm when found (e.g., appeals, human review, compensation)
  • Safeguard: Redundancy, fail-safes, circuit breakers for critical failures
  • Transparency: Explain, educate, build understanding and trust
  • Empower: Give users control, choice, ability to opt out or customize

Monitoring Metrics:

  • Outcome disparities: Measure by protected class (approval rates, error rates, treatment quality)
  • Error distribution: False positives/negatives, who bears burden?
  • User complaints: Volume, categories, resolution rates, disparities
  • Engagement/retention: Differences across groups (are some excluded?)
  • Safety incidents: Volume, severity, affected populations
  • Consent/opt-outs: How many decline? Demographics of decliners?

Escalation Triggers:

  • Disparate impact >20% without justification
  • Safety incidents causing serious harm (injury, death)
  • Vulnerable group disproportionately affected (>2× harm rate)
  • User complaints spike (>2× baseline)
  • Press/regulator attention
  • Internal ethics concerns raised

When to escalate beyond this skill:

  • Legal compliance required (GDPR, ADA, Civil Rights Act, industry regulations)
  • Life-or-death safety-critical system (medical, transportation)
  • Children or vulnerable populations primary users
  • High controversy or political salience
  • Novel ethical terrain (new technology, no precedent) → Consult: Legal counsel, ethics board, domain experts, affected communities, regulators

Inputs required:

  • Feature or decision (what is being proposed? what changes?)
  • Affected groups (who is impacted? direct and indirect?)
  • Context (what problem does this solve? why now?)

Outputs produced:

  • ethics-safety-impact.md: Stakeholder analysis, harm/benefit assessment, fairness evaluation, risk prioritization, mitigation plan, monitoring framework, escalation protocol

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

04

需要参考平台分布和安装热度时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Claude Code

27.37%
按下载量换算105

Gemini CLI

23.78%
按下载量换算91

Antigravity

19.55%
按下载量换算75

windsurf

12.32%
按下载量换算47

OpenCode

8.01%
按下载量换算31

github-copilot

3.74%
按下载量换算14

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。

来源信息

继续浏览同类 Skills