Token导航 LogoToken导航TokenDH.com

狂揽22.2k star!AI智能体上下文压缩工具开源,Token成本直降95%准确率不变

更新时间 2026-06-12来源 智猩猩正文 2641字阅读约 9分钟5 张图片

智猩猩AI整理

编辑:林夕

当AI Agent开始成为开发、运维和办公场景中的基础工具,一个曾经被忽视的问题正在快速放大:上下文越来越贵。

过去一年,无论是Claude Code、Cursor,还是各种基于LangChain、Agno、LangGraph构建的Agent,几乎都在面临同一个挑战——为了获得更准确的结果,系统需要不断向模型提供更多信息。

代码库、日志文件、数据库查询结果、RAG检索内容、历史对话记录……这些数据源共同构成了Agent的上下文。

问题在于,大模型并不会因为上下文增加而无限变聪明。

大量重复信息和低价值内容不仅会消耗巨额Token,还会稀释模型对真正关键信息的关注度。很多开发者都有类似体验:上下文塞得越多,响应速度越慢,成本越高,结果反而未必更好。

最近,一个名为 Headroom 的开源项目在GitHub迅速走红,目前已经获得超过22.2K Star。

图片

它试图解决的正是这个问题。

与其不断扩大上下文窗口,不如在数据进入模型之前,先把无价值内容压缩掉。

图片
  • github链接:

    https://github.com/chopratejas/headroom

01

给AI增加一层“上下文压缩层”


从架构上看,Headroom并不属于Agent框架,也不是新的模型。它更像是一层插在Agent与大模型之间的中间件。

正常情况下,一个Agent会将日志、工具调用结果、代码内容和用户问题直接发送给大模型。

而在接入Headroom之后,这些内容会先经过压缩处理,再进入模型推理流程。Headroom官方将其称为:

Context Compression Layer(上下文压缩层)


图片

图1 Headroom整体架构图

Headroom内部并不是简单的文本压缩器,而是针对不同内容采用不同处理策略。

(1)对于API返回结果、数据库查询和JSON数据,它会交给 SmartCrusher 处理。这个模块主要负责过滤空字段、重复结构和冗余元数据,只保留真正有意义的业务信息。

(2)对于代码文件,则使用CodeCompressor。与传统字符压缩不同,它基于AST抽象语法树理解代码结构,保留函数关系、类定义和关键逻辑,删除大量无关细节。这样既能大幅减少Token,又不会破坏代码语义。

(3)面对对话历史、日志文件和RAG检索结果时,系统会调用Kompress-base模型。

这是Headroom团队专门训练的文本压缩模型,能够识别错误信息、关键事件和重要上下文,同时过滤掉时间戳、重复输出和噪声内容。

不过,真正让Headroom区别于其他压缩工具的,并不是这些压缩算法。

而是CCR,全称为:Context Compression and Retrieval

它解决的是传统压缩工具最大的缺陷,过去无论是摘要还是压缩,本质上都意味着信息丢失。一旦压缩完成,原始内容便无法恢复。

而Headroom采用的是另一种思路。

压缩后的内容会发送给模型,而完整原文则保存在本地缓存之中。如果模型在推理过程中发现信息不足,可以通过检索机制重新获取原始内容。项目将其称为“Reversible Compression(可逆压缩)”。

简单来说:压缩是默认状态。召回是兜底机制。

这样既能节省成本,又不会因为压缩而失去关键细节。

除了压缩能力之外,Headroom还增加了两个比较有意思的功能。

第一个是 Cross-Agent Memory。如果团队同时使用 Claude、Codex、Gemini 等多个Agent,它们可以共享同一个记忆库,实现跨Agent协作。

第二个是 headroom learn。它会自动分析历史会话中的失败案例,总结问题原因,并将经验写入 CLAUDE.md、AGENTS.md 或 GEMINI.md 文件中,相当于给Agent增加了一套自动复盘系统。

02

部署体验:几乎不需要改代码

对于很多企业来说,技术能力并不是最大的障碍,改造成本才是。

Headroom在设计时显然考虑到了这一点,它提供了三种主流接入方式。

(1)Wrap模式

如果你正在使用Claude Code、Cursor、Codex或者Aider,只需要执行一条命令即可完成接入:

    headroom wrap claude

    系统会自动接管Agent与模型之间的通信流程,整个过程几乎不需要修改配置。

    (2)Proxy模式

    这种方式更适合已经上线的大模型应用。开发团队只需要启动本地代理服务:

      headroom proxy --port 8787

      随后把原来的API地址替换为本地代理地址即可,业务代码几乎无需改动。

      (3)SDK模式

      对于自研Agent团队,可以直接在代码中调用:

        from headroom import compresscompressed = compress(messages)

        压缩后的结果直接发送给模型即可。

        从部署体验来看,Headroom更像是在现有架构前增加了一层缓存或者网关,而不是引入全新的基础设施。这也是它能够快速获得开发者认可的重要原因。

        03

        最高节省95%Token

        任何压缩工具最终都要回答一个问题:压缩之后,效果会不会变差?

        Headroom官方公布了一组真实Agent场景测试数据。

        (1)在代码搜索任务中,上下文规模从17765 Token压缩到1408 Token,节省92%。

        (2)在SRE故障排查场景中,从65694 Token压缩到5118 Token,同样节省92%。

        (3)GitHub Issue分析场景节省73%。

        (4)代码库探索场景节省47%。

        图片

        图2 Benchmark结果图

        更关键的是,准确率几乎没有明显下降。

        项目团队在GSM8K、TruthfulQA、SQuAD v2等多个公开Benchmark上进行了验证,压缩后的结果与原始上下文基本保持一致,部分测试甚至略有提升。

        这意味着Headroom并不是通过暴力删减内容来换取成本优势。

        它更像是在帮助模型过滤噪声,让模型把有限注意力放在真正重要的信息上。

        图片

        图3 快速演示GIF

        04

        Agent 时代,

        上下文正在成为新的基础设施

        随着AI Agent的普及,开发者面临的挑战正在发生变化。

        在很多真实场景中,模型能力已经不再是唯一瓶颈。代码文件、日志数据、RAG检索结果、工具调用记录以及历史对话等内容正在持续推高上下文规模。

        当上下文越来越长,成本、延迟和效果都会受到影响。

        因此,如何让模型读取更少但更有价值的信息,正在成为Agent系统优化的重要方向。

        Headroom 提供的正是这样一种思路:

        不是让模型拥有更长的上下文,而是让模型拥有更高效的上下文。

        文章标签模型发布开源智能体
        资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

        继续浏览更多资讯

        返回资讯目录

        相关资讯

        更多