Token导航 LogoToken导航TokenDH.com
metrillm (Metri LLM) logo
运维云端stdio官方级别未说明来源级核验

metrillm (Metri LLM)

MCP Server

metrillm@latest

MetriLLM是一款用于本地大语言模型性能和质量基准测试的工具,支持生成综合评分并分享至公共排行榜。

工具数

4

提示词数

0

GitHub Stars

4

资源数

0
TypeScriptClaude性能分析Claude DesktopClaudeCursorWindsurf

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

MetriLLM

提供方

MetriLLM

最后核验

2026/5/17 20:22

运行时

Node.js

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

npx metrillm@latest bench

详细介绍

MetriLLM

![CI](https://github.com/MetriLLM/metrillm/actions/workflows/ci.yml) ](https://nodejs.org/) ![License](LICENSE)

](https://www.npmjs.com/package/metrillm) ](https://www.npmjs.com/package/metrillm) ](https://github.com/MetriLLM/metrillm)

在一个命令中对本地LLM模型进行基准测试。 速度、质量、硬件适应性——具有可分享的分数和公开排行榜。

想想Geekbench,但对于您实际硬件上的本地LLM。
npm install -g metrillm@latest
metrillm bench

![MetriLLM Leaderboard](https://metrillm.dev)

所得

  • 性能指标:令牌/秒、到达第一个令牌的时间、内存使用情况、加载时间
  • 质量评估:推理、编码、数学、指令遵循、结构化输出、多语言(14个提示,6个类别)
  • 全球得分 (0-100):30%硬件匹配+70%质量
  • 裁决:优秀/良好/勉强/不推荐
  • 一键分享: --share 上传您的结果,并为您提供公共URL+排行榜排名

真实基准结果

公开排行榜 --以下所有结果均已提交 metrillm bench --share.
型号机器CPURAMtok/sTTFT全局判决
llama3.2:最新版本Mac Mini苹果M4 Pro64 GB98.9125毫秒77良好
mistral:最新Mac Mini苹果M4 Pro64 GB54.3124毫秒76良好
gemma3:4bMacBook Air苹果M432 GB35.9303毫秒72良好
gemma3:1bMacBook Air苹果M432 GB39.4362毫秒72良好
qwen3:1.7bMacBook Air苹果M432 GB37.93.1秒70良好
llama3.2:3bMacBook Air苹果M432 GB27.8285毫秒69良好
gemma3:12bMacBook Air苹果M432 GB12.3656毫秒67良好
phi4:14bMacBook Air苹果M432 GB11.1515毫秒65良好
mistral:7bMacBook Air苹果M432 GB13.6517毫秒61良好
deepseek-r1:14bMacBook Air苹果M432 GB10.830.0秒25不推荐

关键要点:小型型号(1-4B)在Apple Silicon上飞行。具有思维链的较大型号(14B+)即使在功能强大的硬件上也会窒息。 查看完整排行榜→

安装

需要 节点20+ 以及本地运行时: 奥拉玛LM 工作室.
# Install globally
npm install -g metrillm@latest
metrillm bench

# Alternative package managers
pnpm add -g metrillm@latest
bun add -g metrillm@latest

# Homebrew
brew install MetriLLM/metrillm/metrillm

# Or run without installing
npx metrillm@latest bench

用法

# Interactive mode — pick models from a menu
metrillm bench

# Benchmark a specific model
metrillm bench --model gemma3:4b

# Benchmark with LM Studio backend
metrillm bench --backend lm-studio --model qwen3-8b

# Benchmark all installed models
metrillm bench --all

# Share your result (upload + public URL + leaderboard rank)
metrillm bench --share

# CI/non-interactive mode
metrillm bench --ci-no-menu --share

# Force unload after each model (useful for memory isolation)
metrillm bench --all --unload-after-bench

# Export results locally
metrillm bench --export json
metrillm bench --export csv

上传配置(CLI+MCP)

默认情况下,生产构建会将共享结果上传到MetriLLM官方排行榜(https://metrillm.dev).

  • 标准版本不需要CI秘密注射。
  • 本地/dev运行使用相同的默认行为。
  • 自托管或临时部署可以用以下方式覆盖端点:

- METRILLM_SUPABASE_URL - METRILLM_SUPABASE_ANON_KEY - METRILLM_PUBLIC_RESULT_BASE_URL

如果这些变量设置为占位符值(来自模板),MetriLLM将恢复为官方默认值。

windows用户

PowerShell的默认执行策略阻止npm全局脚本。如果你看到 PSSecurityExceptionUnauthorizedAccess 跑步时 metrillm,运行一次:

Set-ExecutionPolicy -Scope CurrentUser -ExecutionPolicy RemoteSigned

或者,使用 npx metrillm@latest 这完全绕过了这个问题。

运行时后端

后端标记默认URL必需环境
奥拉马--backend ollamahttp://127.0.0.1:11434OLLAMA_HOST (可选)
LM工作室--backend lm-studiohttp://127.0.0.1:1234LM_STUDIO_BASE_URL (可选), LM_STUDIO_API_KEY (可选)

共享运行时环境:

  • METRILLM_STREAM_STALL_TIMEOUT_MS (可选):所有后端的流监视程序,默认 30000, 0 禁用它

LM Studio基准测试现在使用本机REST推理端点运行(/api/v1/chat)用于流媒体和非流媒体生成。 之前的OpenAI兼容推理路径(/v1/chat/completions)已从MetriLLM退役,因此tok/s和TTFT可以在可用时依赖本地LM Studio统计数据。 如果LM Studio响应忽略了本机令牌统计信息,MetriLLM仍会计算一个分数,并将吞吐量显示为 estimated.

对于非常大的型号,调整超时标志:

  • --perf-warmup-timeout-ms (默认值 300000)
  • --perf-prompt-timeout-ms (默认值 120000)
  • --quality-timeout-ms (默认值 120000)
  • --coding-timeout-ms (默认值 240000)
  • --stream-stall-timeout-ms (默认值 30000, 0 禁用任何后端的暂停超时)

基准配置文件v1(应用于所有基准提示):

  • temperature=0
  • top_p=1
  • seed=42
  • thinking 遵循您的基准模式(--thinking / --no-thinking)
  • 上下文窗口保持运行时默认值(context=runtime-default)并以此方式记录在元数据中。

LM工作室无思维警卫:

  • 当基准模式要求不思考时(--no-thinking 如果模型仍然发出推理痕迹(用于结果可比性),MetriLLM现在将中止。
  • 要在LM Studio中为受影响的模型禁用它,请将其放在模型聊天模板的顶部: {%- set enable_thinking = false %} 然后弹出/重新加载模型。

评分工作原理

硬件匹配度得分 (0-100)--模型在您的机器上的运行情况:

  • 速度:50%(相对于您的硬件层,令牌/秒)
  • TTFT:20%(首次代币时间)
  • 内存:30%(RAM效率)

质量评分 (0-100)——模型的回答有多好:

  • 推理:20分|编码:20分
  • 结构化输出:15pts |数学:15pts|多语言:10pts

全球得分 =30%硬件匹配+70%质量

硬件会自动检测,评分会根据您的级别(入门/平衡/高端)进行调整。在8GB机器上达到10 tok/s的型号与在64GB钻机上的得分不同。

完整的方法论→

分享您的结果

您分享的每个基准都丰富了 公开排行榜.无需帐户--选择适合您工作流程的方法:

方法命令/动作最适合
命令行界面metrillm bench --share终端用户
主控程序呼叫 share_result 工具AI编码助手
插件/benchmark 股票期权技巧克劳德代码/光标

所有方法都会产生相同的结果:

  • A. 公共URL 对于您的基准
  • 你的 排名:“全球排名前X%,\[您的CPU\]排名前Y%”
  • A. 共享卡 社交媒体
  • A. 挑战链接 发送给朋友

在排行榜上比较您的结果→

MCP服务器

使用Claude Code、Cursor、Windsurf或任何MCP客户端的MetriLLM,无需CLI。

# Claude Code
claude mcp add metrillm -- npx metrillm-mcp@latest

# Claude Desktop / Cursor / Windsurf — add to MCP config:
# { "command": "npx", "args": ["metrillm-mcp@latest"] }
工具说明
list_models列出本地可用的LLM型号
run_benchmark在模型上运行完整的基准测试(性能+质量)
get_results检索以前的基准测试结果
share_result将结果上传到公共排行榜

完整的MCP文档→

技能

Slash命令在AI编码助手中工作——不需要服务器,只需要一个Markdown文件。

技能触发器描述
/benchmark用户调用以交互方式运行完整基准测试
metrillm-guide自动调用模型选择和结果的上下文指导

技能包括在 插件 下面,或者可以独立安装:

# Claude Code
cp -r plugins/claude-code/skills/* ~/.claude/skills/

# Cursor
cp -r plugins/cursor/skills/* ~/.cursor/skills/

插件

预构建的捆绑包(MCP+技能+代理)用于更深入的IDE集成。

组件描述
MCP配置自动连接到 metrillm-mcp 服务器
技能/benchmark + metrillm-guide
代理商benchmark-advisor --分析您的硬件并推荐型号

安装:

# Claude Code
cp -r plugins/claude-code/.claude/* ~/.claude/

# Cursor
cp -r plugins/cursor/.cursor/* ~/.cursor/

Claude代码插件光标插件 了解详情。

集成

集成状态文档
技能--稳定技能
克劳德代码插件--稳定插件文档
游标插件--稳定插件文档

发展

npm ci
npm run ci:verify     # typecheck + tests + build
npm run dev           # run from source
npm run test:watch    # vitest watch mode

自制配方奶粉维护

tap公式适用于 Formula/metrillm.rb.

# Refresh Formula/metrillm.rb with latest npm tarball + sha256
./scripts/update-homebrew-formula.sh

# Or pin a specific version
./scripts/update-homebrew-formula.sh 0.2.1

更新公式后,提交并推送,以便用户可以安装/更新:

brew tap MetriLLM/metrillm
brew install metrillm
brew upgrade metrillm

贡献

欢迎投稿!请阅读 贡献指南 在提交pull请求之前。所有提交都必须包括DCO签核。

许可证

Apache许可证2.0 --看 通知 获取商标信息。

目录标签

目录标签

TypeScriptClaude性能分析LLM基准测试本地部署模型评估硬件适配质量评估

支持客户端

Claude DesktopClaudeCursorWindsurf

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Node.js

来源包(packageName,安装包名)

metrillm@latest

工具数量(toolCount,工具数)

4

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP