Token导航 LogoToken导航TokenDH.com
memorystress (Omega Memory) logo
运维云端stdio官方级别未说明来源级核验

memorystress (Omega Memory)

MCP Server

MemoryStress是一个针对AI内存系统的纵向基准测试工具,用于测试和比较不同内存系统在长期运行中的性能表现。

工具数

0

提示词数

0

GitHub Stars

2

资源数

0
PythonClaude云端部署ClaudeWindsurfCline

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

omega-memory

提供方

omega-memory

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install memorystress

详细介绍

记忆压力

AI存储系统的第一个纵向基准。

每个现有的内存基准测试都会从少数会话中调用。Memory Stress测试在1000次会话中会发生什么——当事实相互矛盾、记忆衰退、噪音在10个模拟月内累积时。

583 facts  ×  1,000 sessions  ×  300 questions  ×  6 scoring dimensions

为什么记忆压力?

目前的基准测试并没有测试生产中的中断:

基准会话矛盾退化曲线多代理
LongMemEval~40
MemoryAgentBench
BEAM合成
记忆压力1,000是(40条链子)是(4个检查点)

真正的代理——Claude Code、带内存的ChatGPT、自定义OpenAI助手、LangChain代理——运行数月。他们的存储系统面临:

  • 积聚压力:1000次不断增长的噪音
  • 矛盾解决:改变、恢复和部分更新的事实
  • 随时间退化:摄入997后,你还能从第12节中找到一个事实吗?
  • 跨代理召回:跨代理身份共享的信息
  • 冷启动恢复:访问现有内存存储的新代理实例

记忆压力衡量所有这些。

用例

  • 评估生产内存系统 在部署长时间运行的AI代理之前
  • 比较RAG方法:矢量数据库、图形内存、混合检索系统
  • MCP内存服务器基准测试 适用于克劳德代码、克劳德桌面、光标、Cline、Windsurf
  • 测试OpenAI助手API 线程持久性和内存保留
  • 验证自定义内存架构 对照标准化数据集
  • 研究内存退化 随着时间的推移,在会话式人工智能系统中

排行榜

系统模型得分矛盾退化斜率成本/正确性详细信息
欧米茄v1.0GPT-4o32.7% (98/300)21.4%-0.033$0.041结果
原始上下文GPT-4oTBDTBDTBD待定--
模0GPT-4oTBDTBDTBD待定--
Zep--TBDTBDTBD待定TBD待定--
LangMem--TBDTBDTBD待定TBD待定--
ChatGPT内存--TBDTBDTBDTBDTBD--
空(基线)--0%0%0.000--结果
在故意设定的残酷基准上,32.7%是一个强劲的结果。 零基线得分为0%。上下文窗口方法在会话200左右达到其令牌上限。这个基准测试询问了数百次会话中嘈杂的对话中隐藏的单次提及的事实。

提交您的结果:运行基准测试,与您的 results/ 目录。

快速开始

# Install
pip install memorystress

# Download dataset
# Option A: From HuggingFace
pip install huggingface_hub
huggingface-cli download singularityjason/memorystress --local-dir data/

# Option B: Generate your own (~$5 in API costs)
python scripts/generate.py --model gpt-4o --seed 42 --output data/memorystress_v1.json

# Run the null baseline (free, instant)
python scripts/run.py --dataset data/memorystress_v1.json --adapter null --grade

# Run with OMEGA (requires: pip install omega-memory)
python scripts/run.py --dataset data/memorystress_v1.json --adapter omega --grade \
  --extract-facts --query-augment --output-dir results/omega_v5

# Run with Mem0 (requires: pip install mem0ai)
python scripts/run.py --dataset data/memorystress_v1.json --adapter mem0 --grade \
  --output-dir results/mem0

运作原理

1.数据集生成

GPT-4o管道生成:

  • 583事实 6个类别(偏好、决策、技术事实、个人信息、事件、关系)
  • 1000个会话 跨越噪声增加的3个阶段
  • 40条矛盾链 事实更新、还原、积累或部分改变的地方
  • 300个问题 在4个阶段检查点,涵盖7种问题类型

2.压力的三个阶段

Phase 1 (Sessions 1-100)     Low noise, establishing baseline
Phase 2 (Sessions 101-500)   Growing noise, contradictions emerge
Phase 3 (Sessions 501-1000)  Dense, high-entropy, multi-topic stress
Phase 4 (Recovery)           No new sessions — can you still recall?

3.六个评分维度

维度它衡量什么
Recall@Age按事实年龄划分的准确性(0-100、100-500、500-1000次会话)
退化曲线每个相位检查点的精度(斜率=退化率)
矛盾解决系统能否识别最新值?
成本效益每个阶段每个正确答案的美元数
跨代理召回跨代理身份的信息召回
冷启动恢复新代理访问现有内存存储

4.七种问题类型

  • 事实回忆、偏好回忆、矛盾解决、时间排序、跨主体回忆、冷启动回忆、单次提及回忆

添加您的存储系统

构建MCP内存服务器?将OpenAI的助手API与线程一起使用?运行Mem0、Zep、LangMem还是自定义RAG管道?在这里测试一下。

实施4种方法:

from memorystress.adapters.base import MemorySystemAdapter, IngestResult, QueryResult, CostSnapshot

class MyAdapter(MemorySystemAdapter):
    def ingest(self, session: dict) -> IngestResult:
        """Store a conversation session."""
        # session has: session_id, turns, simulated_date, agent_id, phase
        ...

    def query(self, question: dict) -> QueryResult:
        """Answer a question from memory."""
        # question has: question, agent_scope, question_type
        ...

    def reset(self) -> None:
        """Clear all stored data."""
        ...

    def get_cost(self) -> CostSnapshot:
        """Return cumulative token/cost accounting."""
        ...

然后将其添加到 scripts/run.pys create_adapter() 工厂和运行基准。

欧米茄成绩:深潜

退化曲线

Phase 1 (100 sessions):   31.4%  ██████
Phase 2 (500 sessions):   42.4%  ████████    ← peak: more data helps retrieval
Phase 3 (1000 sessions):  27.3%  █████       ← noise dilution, not data loss
Phase 4 (recovery):       25.5%  █████

按类型细分

|问题类型|分数|N| |---------------|:-----:|:-:| |时间排序|41.2%|34| |事实回顾|37.5%|80| |冷启动召回率|37.5%|16| |偏好召回率|37.1%|35| |跨代理召回|31.2%|32| |单次提及召回率|27.7%|47| |矛盾解决|21.4%|56|

按事实年龄回忆

年龄分数
0-100次会议33.8%
100-500次会议39.7%
500-1000次会话21.3%

中档事实(100-500个会话)是最简单的——有足够的时间来强化,不要太老,以至于噪音淹没了它们。

与其他基准的比较

功能记忆压力LongMemEvalMemoryAgentBenchBEAM
会话计数1000~40合成
劣化测量
矛盾链40
多代理
冷启动测试
成本跟踪
时间问题
问题类型74基于任务3

数据集

完整的数据集可以在HuggingFace上找到: 奇异性杰森/记忆应力

数据/README.md 有关格式详细信息和生成说明。

引用

@software{memorystress2026,
  title={MemoryStress: The First Longitudinal Benchmark for AI Memory Systems},
  author={OMEGA Memory},
  url={https://github.com/omega-memory/memorystress},
  year={2026}
}

许可证

阿帕奇-2.0。看 许可证.

目录标签

目录标签

PythonClaude云端部署AI基准测试本地部署内存系统性能评估长期运行测试多会话测试

支持客户端

ClaudeWindsurfCline

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

token

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdiotoken部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP