🔮 BuddenBench:开放式非平凡数学研究问题的标杆
这个基准,被亲切地命名 budden-bench,衡量模型和代理自主解决数学研究中开放和重要问题的能力。与其他问题集(如 埃尔德问题,该基准旨在专门包含在职数学家正在研究的问题。
灵感
该项目的灵感来自LLM之前解决开放猜想的数学软件的历史成功。
工具
- GAP(组、算法、编程):计算离散代数系统,尤其是计算群论
- 精益4:用于形式化和验证数学证明的交互式定理证明器
人工智能生成的解决方案
警告: 没有人工审查,任何人工智能生成的证据都不应该被信任,无论多么正式。
传说: 🟢 成功|🔴 无法正式化|🟡 未验证|🟣 新结果|⚪ 未知
设置
make setup # Install dependencies, build GAP, setup Lean用法
make watch-solve # Launch Claude to solve a random problem
make test # Run test suite问题集
问题来自多个来源:
- 库罗夫卡笔记本:群论中未解决问题的集合
- 直观几何中的未解问题 Klee&Wagon:计算和组合几何中的开放问题
- 100个未解决的问题 本·格林:加法组合学和数论的研究水平问题
- 分析中的一些悬而未决的问题 A.G.Ramm:Radon变换、算子理论和偏微分方程中的开放问题
- 分析和PDE中的七万五千个未解决问题 弗拉基米尔·马齐亚:分析和偏微分方程中开放问题的综合集
引用
如果你在研究中使用这个基准,请引用:
@dataset{vonhippel2025budden,
author={von Hippel, Max},
title={{BuddenBench}: A Benchmark of Open Nontrivial Mathematics Research Problems},
year={2025},
publisher={GitHub},
howpublished={\url{https://github.com/maxvonhippel/budden-bench}},
note={AI benchmark for automated mathematics research in group theory and geometry}
}有关源问题集合的引用,请参见 参考.bib.
*最后更新时间:2026-01-29 05:59:25 UTC*
