记忆压力
AI存储系统的第一个纵向基准。
每个现有的内存基准测试都会从少数会话中调用。Memory Stress测试在1000次会话中会发生什么——当事实相互矛盾、记忆衰退、噪音在10个模拟月内累积时。
583 facts × 1,000 sessions × 300 questions × 6 scoring dimensions为什么记忆压力?
目前的基准测试并没有测试生产中的中断:
| 基准 | 会话 | 矛盾 | 退化曲线 | 多代理 |
|---|---|---|---|---|
| LongMemEval | ~40 | 否 | 否 | 不 |
| MemoryAgentBench | 短 | 否 | 否 | 不 |
| BEAM | 合成 | 否 | 否 | |
| 记忆压力 | 1,000 | 是(40条链子) | 是(4个检查点) | 是 |
真正的代理——Claude Code、带内存的ChatGPT、自定义OpenAI助手、LangChain代理——运行数月。他们的存储系统面临:
- 积聚压力:1000次不断增长的噪音
- 矛盾解决:改变、恢复和部分更新的事实
- 随时间退化:摄入997后,你还能从第12节中找到一个事实吗?
- 跨代理召回:跨代理身份共享的信息
- 冷启动恢复:访问现有内存存储的新代理实例
记忆压力衡量所有这些。
用例
- 评估生产内存系统 在部署长时间运行的AI代理之前
- 比较RAG方法:矢量数据库、图形内存、混合检索系统
- MCP内存服务器基准测试 适用于克劳德代码、克劳德桌面、光标、Cline、Windsurf
- 测试OpenAI助手API 线程持久性和内存保留
- 验证自定义内存架构 对照标准化数据集
- 研究内存退化 随着时间的推移,在会话式人工智能系统中
排行榜
| 系统 | 模型 | 得分 | 矛盾 | 退化斜率 | 成本/正确性 | 详细信息 | |||
|---|---|---|---|---|---|---|---|---|---|
| 欧米茄v1.0 | GPT-4o | 32.7% (98/300) | 21.4% | -0.033 | $0.041 | 结果 | |||
| 原始上下文 | GPT-4o | TBD | TBD | TBD | 待定 | -- | |||
| 模0 | GPT-4o | TBD | TBD | TBD | 待定 | -- | |||
| Zep | -- | TBD | TBD | TBD | 待定 | TBD | 待定 | -- | |
| LangMem | -- | TBD | TBD | TBD | 待定 | TBD | 待定 | -- | |
| ChatGPT内存 | -- | TBD | TBD | TBD | TBD | TBD | -- | ||
| 空(基线) | -- | 0% | 0% | 0.000 | -- | 结果 |
在故意设定的残酷基准上,32.7%是一个强劲的结果。 零基线得分为0%。上下文窗口方法在会话200左右达到其令牌上限。这个基准测试询问了数百次会话中嘈杂的对话中隐藏的单次提及的事实。
提交您的结果:运行基准测试,与您的 results/ 目录。
快速开始
# Install
pip install memorystress
# Download dataset
# Option A: From HuggingFace
pip install huggingface_hub
huggingface-cli download singularityjason/memorystress --local-dir data/
# Option B: Generate your own (~$5 in API costs)
python scripts/generate.py --model gpt-4o --seed 42 --output data/memorystress_v1.json
# Run the null baseline (free, instant)
python scripts/run.py --dataset data/memorystress_v1.json --adapter null --grade
# Run with OMEGA (requires: pip install omega-memory)
python scripts/run.py --dataset data/memorystress_v1.json --adapter omega --grade \
--extract-facts --query-augment --output-dir results/omega_v5
# Run with Mem0 (requires: pip install mem0ai)
python scripts/run.py --dataset data/memorystress_v1.json --adapter mem0 --grade \
--output-dir results/mem0运作原理
1.数据集生成
GPT-4o管道生成:
- 583事实 6个类别(偏好、决策、技术事实、个人信息、事件、关系)
- 1000个会话 跨越噪声增加的3个阶段
- 40条矛盾链 事实更新、还原、积累或部分改变的地方
- 300个问题 在4个阶段检查点,涵盖7种问题类型
2.压力的三个阶段
Phase 1 (Sessions 1-100) Low noise, establishing baseline
Phase 2 (Sessions 101-500) Growing noise, contradictions emerge
Phase 3 (Sessions 501-1000) Dense, high-entropy, multi-topic stress
Phase 4 (Recovery) No new sessions — can you still recall?3.六个评分维度
| 维度 | 它衡量什么 |
|---|---|
| Recall@Age | 按事实年龄划分的准确性(0-100、100-500、500-1000次会话) |
| 退化曲线 | 每个相位检查点的精度(斜率=退化率) |
| 矛盾解决 | 系统能否识别最新值? |
| 成本效益 | 每个阶段每个正确答案的美元数 |
| 跨代理召回 | 跨代理身份的信息召回 |
| 冷启动恢复 | 新代理访问现有内存存储 |
4.七种问题类型
- 事实回忆、偏好回忆、矛盾解决、时间排序、跨主体回忆、冷启动回忆、单次提及回忆
添加您的存储系统
构建MCP内存服务器?将OpenAI的助手API与线程一起使用?运行Mem0、Zep、LangMem还是自定义RAG管道?在这里测试一下。
实施4种方法:
from memorystress.adapters.base import MemorySystemAdapter, IngestResult, QueryResult, CostSnapshot
class MyAdapter(MemorySystemAdapter):
def ingest(self, session: dict) -> IngestResult:
"""Store a conversation session."""
# session has: session_id, turns, simulated_date, agent_id, phase
...
def query(self, question: dict) -> QueryResult:
"""Answer a question from memory."""
# question has: question, agent_scope, question_type
...
def reset(self) -> None:
"""Clear all stored data."""
...
def get_cost(self) -> CostSnapshot:
"""Return cumulative token/cost accounting."""
...然后将其添加到 scripts/run.pys create_adapter() 工厂和运行基准。
欧米茄成绩:深潜
退化曲线
Phase 1 (100 sessions): 31.4% ██████
Phase 2 (500 sessions): 42.4% ████████ ← peak: more data helps retrieval
Phase 3 (1000 sessions): 27.3% █████ ← noise dilution, not data loss
Phase 4 (recovery): 25.5% █████按类型细分
|问题类型|分数|N| |---------------|:-----:|:-:| |时间排序|41.2%|34| |事实回顾|37.5%|80| |冷启动召回率|37.5%|16| |偏好召回率|37.1%|35| |跨代理召回|31.2%|32| |单次提及召回率|27.7%|47| |矛盾解决|21.4%|56|
按事实年龄回忆
| 年龄 | 分数 |
|---|---|
| 0-100次会议 | 33.8% |
| 100-500次会议 | 39.7% |
| 500-1000次会话 | 21.3% |
中档事实(100-500个会话)是最简单的——有足够的时间来强化,不要太老,以至于噪音淹没了它们。
与其他基准的比较
| 功能 | 记忆压力 | LongMemEval | MemoryAgentBench | BEAM |
|---|---|---|---|---|
| 会话计数 | 1000 | ~40 | 短 | 合成 |
| 劣化测量 | 是 | 否 | 否 | 不 |
| 矛盾链 | 40 | 否 | 否 | 不 |
| 多代理 | 是 | 否 | 否 | 不 |
| 冷启动测试 | 是 | 否 | 否 | 不 |
| 成本跟踪 | 是 | 否 | 否 | 不 |
| 时间问题 | 是 | 是 | 否 | 否 |
| 问题类型 | 7 | 4 | 基于任务 | 3 |
数据集
完整的数据集可以在HuggingFace上找到: 奇异性杰森/记忆应力
看 数据/README.md 有关格式详细信息和生成说明。
引用
@software{memorystress2026,
title={MemoryStress: The First Longitudinal Benchmark for AI Memory Systems},
author={OMEGA Memory},
url={https://github.com/omega-memory/memorystress},
year={2026}
}许可证
阿帕奇-2.0。看 许可证.
