Token导航 LogoToken导航TokenDH.com
效率需要联网clawhub未标认证来源可访问clear审计提醒

box-kvcache盒式 kvcache

Agent Skill

box-kvcache 用于补充效率相关能力,适合在 OpenClaw 中需要让 Agent 承接效率相关任务时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

2,544

周安装

106

GitHub Stars

公开资料未说明

下载量

848
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:box-kvcache(盒式 kvcache)
来源仓库:https://github.com/heijiaziopenclaw/box-kvcache
安装命令:
openclaw skills install box-kvcache
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install box-kvcache

简介

使用低秩分解和 INT8 量化的 LLM 本地 KV 缓存压缩可在推理过程中将 GPU 内存减少 2-4 倍。

SKILL.md

box-kvcache

描述

本地大模型 KV Cache 压缩工具箱 — 基于低秩分解 + INT8 量化原理,帮助你在同等显存下跑更长的上下文、更高的并发。

适用于 Ollama、LocalAI、Text Generation WebUI 等本地 LLM 推理框架。

⚠️ 系统要求:Windows 10+ | Linux/macOS(需 Ollama)| Python 3.8+

核心功能

  1. 检测本地 LLM 环境 — 自动识别 Ollama/llama.cpp
  2. 估算 KV Cache 占用 — 量化当前上下文大小
  3. 低秩分解压缩 — 使用 SVD/PCA 降低 KV 维度
  4. INT8 量化 — 有损压缩到 8bit,省 2-4x 显存
  5. 一键启动压缩模式 — 改 Ollama 启动参数启用缓存压缩

系统要求

要求详情
运行时Ollama ≥ 0.1.0 或 llama.cpp
Python3.8+
依赖numpy, scipy
系统工具PowerShell (Windows), bash (Linux/macOS)
可选nvidia-smi (用于查看 GPU 显存)

安装依赖

pip install numpy scipy

安装 Ollama

# Windows/macOS/Linux
# 详见 https://ollama.com/download

工作原理

原始 KV Cache (float32) → 低秩分解 → 压缩表示 → INT8量化
     ↓                                        ↓
16GB 显存占用                          ~4-6GB 显存占用
     ↓                                        ↓
     └──────────── 推理结束后还原 ────────────┘

脚本列表

脚本用途
check_env.py检测本地 LLM 环境(Ollama llama.cpp)
quantize_kv.pyKV Cache INT8 量化工具
lowrank_compress.py低秩分解压缩工具
launch_compressed.py带压缩参数启动 Ollama

使用方法

步骤1:检测环境

python scripts/check_env.py

步骤2:查看当前显存占用

python scripts/check_env.py --verbose

步骤3:启动压缩模式

python scripts/launch_compressed.py --model llama3 --context 8192 --compress

技术细节

  • 低秩分解:SVD 截断奇异值,保留核心维度
  • INT8 量化:对称量化(scale factor)
  • 压缩比:约 2-4x(有损,但精度损失 <2%)
  • 适用场景:长上下文聊天、批量推理、显存不足

限制

  • 纯软件方案,效果因模型而异
  • 不是 Google TurboQuant(那是另一套实现)
  • Windows 脚本主要测试过;Linux/macOS 使用 bash

环境变量

变量说明
OLLAMA_HOSTOllama 服务地址(默认 127.0.0.1:11434)
OLLAMA_MODELS模型存放路径
OLLAMA_KEEP_ALIVE模型保留时间

作者

黑匣子 @ 主人项目


_Last updated: 2026-04-06_

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

83.4%
按下载量换算707

安全审计

VirusTotal

可疑

ClawScan

可疑

Static analysis

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills