Token导航 LogoToken导航TokenDH.com
待分类只读github未标认证来源可访问许可证需确认审计提醒

mixseek-evaluator-configmixseek 评估器配置

Agent Skill

mixseek-evaluator-config 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

250

周安装

10

GitHub Stars

1

下载量

81
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:mixseek-evaluator-config(mixseek 评估器配置)
来源仓库:https://github.com/drillan/mixseek-plus
仓库路径:skills/mixseek-evaluator-config
安装命令:
npx skills add https://github.com/drillan/mixseek-plus --skill mixseek-evaluator-config
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/drillan/mixseek-plus --skill mixseek-evaluator-config

简介

mixseek-evaluator-config 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中围绕项目状态和变更进行整理。

  • 适用于评估器配置相关的协作事项梳理和代码变更分析,可辅助生成可执行下一步。
  • 通过 npx skills add 命令从 GitHub 安装,需确认权限范围和是否触发联网或文件操作。
  • 建议在使用前检查维护状态和实际功能是否符合预期,避免误判技能能力边界。
  • 涉及写入操作时需谨慎授权,确保 token 权限仅限于目标仓库和必要操作。

SKILL.md

MixSeek 評価設定生成

概要

MixSeek-Coreの評価設定ファイル(evaluator.toml)と判定設定ファイル(judgment.toml)を生成します。TUMIXトーナメントにおけるSubmissionの評価基準、スコアリング方法、最終判定ロジックを定義します。

前提条件

  • ワークスペースが初期化されていること(mixseek-workspace-init参照)
  • 環境変数 MIXSEEK_WORKSPACE が設定されていること(推奨)

生成ファイル

ファイル用途配置場所
evaluator.tomlSubmissionのスコアリング設定configs/evaluators/
judgment.toml最終判定の設定configs/judgment/

使用方法

Step 1: 要件のヒアリング

ユーザーに以下を確認してください:

  1. 評価の重点: 何を重視して評価するか(明確性、カバレッジ、関連性など)
  2. 重み付け: 各メトリクスの重要度(均等 or カスタム)
  3. 判定スタイル: 決定論的(temperature=0)or 多様性重視

Step 2: メトリクス設定の提案

標準メトリクスから選択:

メトリクス説明用途
ClarityCoherence明確性と一貫性読みやすさ重視のタスク
Coverageカバレッジ網羅性重視のタスク
LLMPlain汎用LLM評価カスタム評価基準が必要なタスク
Relevance関連性的確さ重視のタスク

Step 3: 設定ファイルの生成

evaluator.toml:

default_model = "google-gla:gemini-2.5-pro"
temperature = 0.0

[[metrics]]
name = "ClarityCoherence"
weight = 0.34

[[metrics]]
name = "Coverage"
weight = 0.33

[[metrics]]
name = "Relevance"
weight = 0.33

judgment.toml:

model = "google-gla:gemini-2.5-pro"
temperature = 0.0
timeout_seconds = 60

Step 4: ファイルの保存

$MIXSEEK_WORKSPACE/configs/evaluators/evaluator.toml
$MIXSEEK_WORKSPACE/configs/judgment/judgment.toml

重要: カスタムパス(configs/evaluators/configs/judgment/)を使用する場合は、必ずorchestrator.tomlでパスを明示的に指定してください。指定しないとデフォルトパス(configs/evaluator.tomlconfigs/judgment.toml)が検索され、設定が反映されません。

# orchestrator.toml
[orchestrator]
evaluator_config = "configs/evaluators/evaluator.toml"
judgment_config = "configs/judgment/judgment.toml"

Step 5: 設定ファイルの検証(必須)

生成後は必ず検証を実行してください。

# Evaluator設定の検証
uv run python skills/mixseek-config-validate/scripts/validate-config.py \
    $MIXSEEK_WORKSPACE/configs/evaluators/evaluator.toml --type evaluator

# Judgment設定の検証
uv run python skills/mixseek-config-validate/scripts/validate-config.py \
    $MIXSEEK_WORKSPACE/configs/judgment/judgment.toml --type judgment

検証が成功したら、ユーザーに結果を報告します。失敗した場合は、エラー内容を確認して設定を修正してください。

標準メトリクス詳細

ClarityCoherence(明確性・一貫性)

回答の読みやすさと論理的一貫性を評価します。

評価観点:

  • 文章構造の明確さ
  • 論理的な流れ
  • 専門用語の適切な使用
  • 結論の明確さ

推奨用途:

  • 説明文の生成
  • レポート作成
  • 教育コンテンツ

Coverage(カバレッジ)

質問に対する回答の網羅性を評価します。

評価観点:

  • 質問の全側面への対応
  • 関連トピックの包含
  • 例示の充実度
  • 補足情報の有無

推奨用途:

  • リサーチタスク
  • FAQ作成
  • 技術ドキュメント

Relevance(関連性)

回答が質問に対してどれだけ的確かを評価します。

評価観点:

  • 質問への直接的な回答
  • 不要な情報の排除
  • 焦点の維持
  • 文脈への適合

推奨用途:

  • Q&A
  • カスタマーサポート
  • 検索結果の評価

LLMPlain(汎用LLM評価)

system_instructionで定義したカスタム評価基準に基づいてLLMが評価します。

特徴:

  • 事前定義された評価ロジックを持たない
  • system_instructionで完全にカスタマイズ可能
  • 特殊な評価基準が必要な場合に使用

推奨用途:

  • ドメイン固有の評価(法律、医療など)
  • プロジェクト固有の品質基準
  • 他のメトリクスでカバーできない観点

設定例:

[[metrics]]
name = "LLMPlain"
weight = 0.5
system_instruction = """
セキュリティ観点から回答を評価してください:
1. 機密情報の漏洩リスク
2. 安全なコーディング実践
3. 脆弱性の有無
0-100のスコアで評価してください。
"""

均等重み付け設定

User: 評価設定を作成して

Agent: 評価設定を提案します。

       メトリクス(均等重み付け):
       - ClarityCoherence: 33.4%
       - Coverage: 33.3%
       - Relevance: 33.3%

       この構成でよろしいですか?

User: はい

Agent: 設定ファイルを生成しました:
       ✓ configs/evaluators/evaluator.toml
       ✓ configs/judgment/judgment.toml

カスタム重み付け設定

User: 正確性を重視した評価設定を作って

Agent: 関連性(Relevance)を重視した設定を提案します。

       メトリクス:
       - Relevance: 50%(重視)
       - ClarityCoherence: 30%
       - Coverage: 20%

       この構成でよろしいですか?

User: はい

生成される設定ファイル例

evaluator.toml(カスタム重み付け):

# MixSeek Evaluator Configuration
# Generated by mixseek-evaluator-config skill

default_model = "google-gla:gemini-2.5-pro"
temperature = 0.0
timeout_seconds = 300
max_retries = 3

[[metrics]]
name = "Relevance"
weight = 0.5

[[metrics]]
name = "ClarityCoherence"
weight = 0.3

[[metrics]]
name = "Coverage"
weight = 0.2

judgment.toml:

# MixSeek Judgment Configuration
# Generated by mixseek-evaluator-config skill

model = "google-gla:gemini-2.5-pro"
temperature = 0.0
timeout_seconds = 60
max_retries = 3

重み付けルール

重み付けには以下のルールがあります:

  1. 全て指定 or 全て省略: 一部のメトリクスだけに重みを指定することはできません
  2. 合計1.0: 全ての重みの合計は1.0(±0.001)である必要があります
  3. 省略時は均等: 重みを省略すると自動的に均等配分されます
# 有効: 全て指定
[[metrics]]
name = "ClarityCoherence"
weight = 0.5

[[metrics]]
name = "Coverage"
weight = 0.5

# 有効: 全て省略(均等配分)
[[metrics]]
name = "ClarityCoherence"

[[metrics]]
name = "Coverage"

# 無効: 一部のみ指定
[[metrics]]
name = "ClarityCoherence"
weight = 0.5  # ❌

[[metrics]]
name = "Coverage"
# weight省略 ❌

トラブルシューティング

重み合計エラー

Error: Weights must sum to 1.0

解決方法:

  • 全ての重みの合計が1.0になるよう調整
  • または全ての重みを省略して均等配分

メトリクス名エラー

Error: Unknown metric name

解決方法:

  • 有効なメトリクス名を使用: ClarityCoherence, Coverage, LLMPlain, Relevance
  • 大文字小文字に注意

判定が不安定

解決方法:

  • judgment.tomltemperatureを0.0に設定(決定論的)
  • seedを固定値に設定

参照

  • TOMLスキーマ詳細: references/TOML-SCHEMA.md
  • 標準メトリクス: references/METRICS.md
  • オーケストレーター設定: skills/mixseek-orchestrator-config/

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

35.32%
按下载量换算29

Claude

30.43%
按下载量换算25

Cursor

19.19%
按下载量换算16

Gemini CLI

9.36%
按下载量换算8

安全审计

Gen Agent Trust Hub

可疑

Socket

通过

Snyk

通过

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills