Token导航 LogoToken导航TokenDH.com
开发需要联网github未标认证来源可访问许可证需确认审计通过

llm-api-benchmarkLLM API benchmark 文档

Agent Skill

用于辅助 API 设计、接口文档、请求响应结构和服务集成说明。它适合让 Agent 梳理 endpoint、生成 OpenAPI 草稿、检查字段命名、整理错误码或辅助前后端联调。使用时需要确认真实业务语义、鉴权方式、分页和错误处理规则;涉及生成接口文档时,应避免凭空补字段,最好从现有代码、schema 或接口样例中提取事实。

总安装

419

周安装

18

GitHub Stars

公开资料未说明

下载量

147
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:llm-api-benchmark(LLM API benchmark 文档)
来源仓库:https://github.com/ridewind/my-skills
仓库路径:skills/llm-api-benchmark
安装命令:
npx skills add https://github.com/ridewind/my-skills --skill llm-api-benchmark
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/ridewind/my-skills --skill llm-api-benchmark

简介

llm-api-benchmark 用于辅助 API 设计、接口文档和错误码整理,适合梳理 endpoint 和响应结构。

  • 它能生成 OpenAPI 草稿、检查字段命名,并辅助前后端联调。
  • 通过 npx skills add 命令从指定仓库安装,具体用法请参考原始 README。
  • 使用时需确认真实业务语义和鉴权方式,避免凭空补字段;涉及接口文档时应从现有代码中提取事实。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

LLM API Benchmark

LLM API 端点性能测试工具,支持两种测试模式:

  • Agent 模式:测试真实工作负载响应时间(推荐用于相对性能对比)
  • HTTP 模式:精确测量 TTFT/TPS 指标(使用 Python 脚本直接调用 API)

Quick Start

Agent 模式(推荐)

第一步:确认测试方案

使用 AskUserQuestion 工具确认:

question: "📊 LLM API Benchmark 测试方案

**测试参数**:
- 测试类型: Agent 模式
- 迭代次数: 5(默认)
- 任务类型: implementation(默认,~500-700 tokens)

是否开始测试?"

options:
- "确认开始"
- "修改参数"
- "切换到 HTTP 模式"

第二步:执行测试

用户确认后,使用 Agent 工具启动 orchestrator subagent。

Agent 模式工作原理

  • Orchestrator 会串行执行 N 次迭代
  • 每次迭代中,orchestrator 会记录时间 → 直接回答任务提示词(触发 LLM API 调用)→ 记录结束时间
  • 记录完整的 LLM 输出内容和时间戳
  • 最后计算统计数据并保存 JSON 报告

详细提示词模板见 references/orchestrator-patterns.md

第三步:显示结果

✅ 测试完成!

📊 结果摘要:
- 端点: {endpoint}
- 迭代次数: {iterations}
- 平均响应时间: {avg_time:.2f}s
- 最小: {min_time:.2f}s | 最大: {max_time:.2f}s
- 平均 TPS: {avg_tps:.1f} tokens/s

📁 详细报告: reports/llm-benchmark-subagent/benchmark-{timestamp}.json

HTTP 模式(精确指标)

使用 Python 脚本直接调用 API,获取精确的 TTFT 和 TPS:

# 默认使用 code preset (~500-1000 tokens)
python skills/llm-api-benchmark/scripts/benchmark.py

# 列出可用预设
python skills/llm-api-benchmark/scripts/benchmark.py --list-presets

# 指定预设和迭代次数
python skills/llm-api-benchmark/scripts/benchmark.py --preset throughput --iterations 10

预设列表

PresetDescriptionOutput
quick快速测试~10 tokens
standard中等长度~20 tokens
long长输出测试~100+ tokens
throughput高吞吐测试~300-500 tokens
code代码生成(默认)~500-1000 tokens
jsonJSON 输出测试~30 tokens

Task Prompts

Agent 模式支持多种任务类型,详见 references/task-prompts.md

Task TypeDescriptionTarget OutputUse Case
counting数字序列生成~50 tokensTTFT 测试(最稳定)
structured-list结构化列表~100-150 tokens中等负载测试
code-review代码审查报告~300-400 tokens代码工作负载
implementation完整代码实现(默认)~500-700 tokens吞吐量测试
comprehensive综合分析报告~800-1000 tokens真实工作负载

Compare Endpoints

对比多个端点性能:

python skills/llm-api-benchmark/scripts/compare-results.py

Output Format

JSON Result Structure

{
  "timestamp": "2026-03-05T10:30:45",
  "endpoint": "https://...",
  "task": "implementation",
  "iterations": 5,
  "avg_time": 1.23,
  "min_time": 1.15,
  "max_time": 1.31,
  "avg_tps": 45.2,
  "total_tokens": 275,
  "details": [
    {
      "iteration": 1,
      "start_time": "2026-03-05T10:30:45.123",
      "end_time": "2026-03-05T10:30:46.353",
      "response_time": 1.23,
      "tokens": 56,
      "tps": 45.5,
      "output": "完整的端点输出内容..."
    }
  ]
}

字段说明

  • details[]: 每次迭代的详细记录

- start_time: 迭代开始时间(ISO 格式) - end_time: 迭代结束时间(ISO 格式) - output: 端点输出的完整内容

  • TPS 计算:输出 token 数按 1 token ≈ 4 字符估算,TPS = tokens / response_time

Mode Comparison

FeatureAgent ModeHTTP Mode
TriggerAgent 工具Python 脚本
MeasuresLLM 端点响应时间(通过 Agent 回答任务触发 API 调用)HTTP 响应 + TTFT + TPS(直接调用 API)
Auth prompts一次确认完成所有迭代无需确认
Use case相对性能对比(测试真实 Agent 工作负载)精确性能测量(纯 API 性能)

Troubleshooting

Agent 工具不可用

使用 HTTP 模式:

python skills/llm-api-benchmark/scripts/benchmark.py

端点配置问题

Endpoint: unknown

解决方案:

  • 使用 cc-switch <endpoint-name> 配置
  • 或设置 export ANTHROPIC_BASE_URL=https://your-endpoint

API 调用失败

  1. 检查 API 密钥是否正确设置
  2. 验证端点 URL 是否可访问
  3. 使用 HTTP 模式进行诊断

Scripts

ScriptPurpose
scripts/benchmark.pyHTTP 模式基准测试
scripts/compare-results.py对比多个端点结果

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

35.36%
按下载量换算52

Claude

27.32%
按下载量换算40

Cursor

19.94%
按下载量换算29

Gemini CLI

10.5%
按下载量换算15

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills