Token导航 LogoToken导航TokenDH.com
待分类只读github未标认证来源可访问许可证需确认审计未展示

dynamic_batching_triton动态批处理 Triton

Agent Skill

dynamic_batching_triton 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

267

周安装

11

GitHub Stars

公开资料未说明

下载量

87
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:dynamic_batching_triton(动态批处理 Triton)
来源仓库:https://github.com/davidcastagnetoa/skills
仓库路径:skills/dynamic_batching_triton
安装命令:
npx skills add https://github.com/davidcastagnetoa/skills --skill dynamic_batching_triton
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/davidcastagnetoa/skills --skill dynamic_batching_triton

简介

dynamic_batching_triton 配置 NVIDIA Triton Inference Server 的动态批处理参数以优化 GPU 推理吞吐量。

  • 专为 KYC 验证流水线中的面部识别、活体检测与 OCR 模型调度设计。
  • 区别于应用层批处理,聚焦 Triton 内部 scheduling 与 batch size 调优。
  • 需确认 Triton 服务运行状态与模型 registry 可访问性。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

dynamic_batching_triton

Skill para configurar y optimizar el dynamic batching nativo de NVIDIA Triton Inference Server, agrupando requests de inferencia facial, liveness y OCR en batches óptimos para maximizar el throughput GPU. A diferencia del batching genérico a nivel aplicación, esta skill se centra en la configuración específica de Triton y sus parámetros de scheduling para el pipeline de verificación KYC.

When to use

Usar esta skill cuando el model_server_agent necesite configurar, tunear o diagnosticar el dynamic batching dentro de Triton Inference Server. Aplica al desplegar nuevos modelos en Triton, optimizar latencia vs throughput, o resolver problemas de scheduling en modelos del pipeline KYC. Esta skill es complementaria a triton_inference_server (que cubre el servidor completo) y separada de dynamic_batching genérico.

Instructions

  1. Habilitar dynamic batching en el model config de Triton para cada modelo del pipeline: # model_repository/arcface/config.pbtxt name: "arcface" platform: "onnxruntime_onnx" max_batch_size: 32 dynamic_batching {preferred_batch_size: [8, 16, 32] max_queue_delay_microseconds: 100000 # 100ms max wait} input [{name: "input" data_type: TYPE_FP32 dims: [3, 112, 112]}]
  2. Configurar parámetros de batching diferenciados por modelo según su perfil de latencia: # Liveness model - latencia crítica, batches pequeños dynamic_batching {preferred_batch_size: [4, 8] max_queue_delay_microseconds: 50000 # 50ms - más agresivo} # OCR model - tolerante a latencia, batches grandes dynamic_batching {preferred_batch_size: [16, 32, 64] max_queue_delay_microseconds: 200000 # 200ms}
  3. Configurar prioridades de scheduling para que liveness (crítico en UX) tenga prioridad sobre OCR: dynamic_batching {priority_levels: 3 default_priority_level: 2 default_queue_policy {timeout_action: REJECT default_timeout_microseconds: 500000}}
  4. Habilitar métricas de batching en Triton para monitorizar la efectividad: # Arrancar Triton con métricas habilitadas tritonserver --model-repository=/models \ --metrics-port=8002 \ --allow-metrics=true \ --metrics-interval-ms=1000
  5. Monitorizar métricas clave de batching via Prometheus endpoint: nv_inference_request_success # Requests exitosas nv_inference_queue_duration_us # Tiempo en cola nv_inference_compute_infer_duration_us # Tiempo de inferencia nv_inference_exec_count # Batches ejecutados nv_inference_request_duration_us # Duración total
  6. Tunear el max_queue_delay basándose en el SLA de 8 segundos totales del pipeline: # Budget de latencia por modelo dentro del SLA de 8s LATENCY_BUDGET_MS = {"liveness": 500, # Máx 500ms "arcface": 300, # Máx 300ms "paddleocr": 1000, # Máx 1000ms "antifraud": 200, # Máx 200ms} # max_queue_delay = budget * 0.3 (30% del budget para queueing)
  7. Configurar sequence batching para modelos que procesan múltiples frames (liveness con secuencia de frames): sequence_batching {max_sequence_idle_microseconds: 5000000 control_input [{name: "START" control [{kind: CONTROL_SEQUENCE_START}]}]}

Notes

  • El dynamic batching de Triton opera a nivel de inference server, no de aplicación. Esto es más eficiente que batching manual porque Triton conoce el estado exacto de la GPU y puede optimizar la ejecución de kernels CUDA.
  • El parámetro max_queue_delay es el trade-off principal: valores altos mejoran throughput pero aumentan latencia. Para el pipeline KYC con SLA de 8s, mantener delays conservadores en modelos de la ruta crítica (liveness, face_match).
  • Sequence batching es necesario para el módulo de liveness que analiza múltiples frames consecutivos; no confundir con dynamic batching que agrupa requests independientes.

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

37.09%
按下载量换算32

Claude

31.11%
按下载量换算27

Cursor

20.48%
按下载量换算18

Gemini CLI

9.22%
按下载量换算8

安全审计

暂无安全审计结果可展示。

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills