Token导航 LogoToken导航TokenDH.com

论文汇总丨Benchmark进入真实世界,斯坦福/清华/Anthropic/Meta/阿里等重新定义AI能力评测

更新时间 2026-09-16来源 超神经HyperAI正文 5559字阅读约 18分钟15 张图片

Benchmark 不再只是给模型「出题打分」,而是逐渐成为连接模型能力、真实任务与科学进步的测量工具。从真实工作流、长期任务到多模态交互,从任务完成度到过程与结果验证,新一代基准正在从单一分数走向更加细粒度、可诊断的能力评估。它不仅告诉我们模型有多强,也开始回答模型为什么失败、还能走多远。

纵观近期研究,从软件工程、科学智能体到可穿戴健康数据和视频生成,传统基准正面临任务趋于饱和、评测结果不可靠、真实场景覆盖不足等问题。研究者开始重新思考:如何设计更贴近真实任务、更具挑战性,也更能定位模型能力边界的评测体系?

本周,HyperAI 为大家精选了 10 篇 Benchmark 领域的最新研究,研究团队涵盖斯坦福大学、卡内基梅隆大学、清华大学、上海交通大学等顶尖高校,以及 Anthropic、Meta、阿里巴巴等领头企业。相关论文聚焦智能体、软件工程、科学智能、机器翻译、视频生成、移动 Agent 等方向,探索如何突破传统评测的局限,更准确地衡量 AI 系统在真实世界中的能力边界。一起来学习吧!⬇️

此外,为了让更多用户了解学术界在人工智能领域的最新动态,HyperAI 官网现已上线「最新论文」板块,及时跟进前沿 AI 研究。

最新 AI 论文:https://go.hyper.ai/hzChC

本周论文推荐

1

Benchmark Radar

论文题目:

Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation

卡内基梅隆大学、清华大学等多机构研究团队推出 Benchmark Radar,这是一个面向 AI 基准测试的动态数据库与搜索引擎,帮助研究者快速发现相关基准,并追踪其论文、代码、数据集及评测结果。该系统整合来自 37 个来源的每日信息流,当前目录收录 1,283 条基准记录及 12,916 条分数观测,并保留来源与引用信息,方便核查评测依据。

Benchmark Radar 覆盖 LLM、Agent、编程、推理、安全等多个领域,并提供分数历史、基准采用趋势和饱和度分析,以及可下载证据、CLI 和 Web 仪表盘,帮助研究者更高效地检索现有基准、比较评测结果,并为新评测的设计提供参考。

论文及详细解读:https://go.hyper.ai/PFsr7

图片

Benchmark Radar 框架示意图

数据集构成与来源:

来源记录是从 arXiv、Hugging Face Hub、GitHub 搜索,再加其他学术索引、数据集托管平台、仓库发布和机构信息流中采集的基准条目。

发现观察每天从 13 个直接连接器和 24 个第一方信息流中采集,记录在公开来源中发现的提及、发布和更新,并通过精确标识符(DOI、arXiv ID、仓库URL)关联到相关对象。发现观察与基准记录计数分开保存。

图片

数据集

2

SWE-Bench Pro Verified


论文题目:

SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

华东师范大学、上海人工智能实验室和复旦大学的研究人员提出 SWE-Bench Pro Verified,针对软件工程智能体评测中可能存在的奖励黑客和任务质量问题,对 SWE-Bench Pro 进行系统验证与优化。该基准通过反黑客防护措施,阻止智能体获取黄金解决方案和隐藏评估信息,并以最小改动修正任务描述与测试范围中的不一致。

SWE-Bench Pro Verified 包含 731 个经过验证的实例。多模型评测结果显示,部分模型在该基准上的表现显著低于此前 SWE-Bench Pro 报告的成绩,表明原有结果可能高估了智能体的真实软件工程能力,为评估软件工程 Agent 提供了更可靠的基准。

论文及详细解读:https://go.hyper.ai/RvWOE

图片

SWE-Bench Pro Verified 框架概述

3

WearableQA


论文题目:

WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

Meta、KAIST 和高丽大学的研究人员提出 WearableQA,用于评估大语言模型对真实世界长期可穿戴数据的推理能力。该基准包含 4,084 道选择题,基于 200 名用户最长 500 天的可穿戴时间序列、血液生物标志物和人口统计数据构建,并保留真实数据中的设备噪声与个体差异。

WearableQA 涵盖数据推理、健康推理、单信号和跨信号等 16 种问题类型,并通过结合文献发现与人群统计模式的双重锚定框架构建题目。对 14 个大语言模型的评测显示,模型准确率为 19.6%–72.9%,大多数低于 60%,表明 LLM 在真实可穿戴数据上的长期健康推理仍面临较大挑战。

论文及详细解读:https://go.hyper.ai/5VzDn

图片

WearableQA 框架示意图

作者构建了 WearableQA,一个用于评估可穿戴健康推理的基准,基于真实世界的用户数据和生物医学文献构建,随后用于测试模型在需要解读长期可穿戴信号和血液面板的多选题上的表现。

图片

数据集


4

LTBv1


论文题目:

Last Translation Benchmark

苏黎世联邦理工学院、约翰霍普金斯大学、穆罕默德·本·扎耶德人工智能大学等多机构研究团队推出 Last Translation Benchmark(LTBv1),针对机器翻译传统基准趋于饱和、自动指标容易奖励黑客且人工评估难以复现等问题,构建了一套更具挑战性的翻译评测基准。该基准收录人工编写并经同行评审的文本、图像、音频和视频翻译样例,专门用于测试领先模型的能力边界。

LTBv1 为每个样例配套手工设计的验证规则,将具体翻译要求转化为可检查的成功标准,从而不仅判断模型是否通过,还能定位信息缺失等具体失败。作为一个持续更新的数据集,LTB 将随着社区贡献不断扩展,为追踪机器翻译能力进展和发现模型改进方向提供更可靠的评测工具。

论文及详细解读:https://go.hyper.ai/Y9AJw

图片

数据集


Last Translation Benchmark 是一个众包数据集,旨在收集和评估困难的翻译示例。作者通过一个自定义在线平台构建该数据集,贡献者提交难以翻译的输入,可以是纯文本,也可以包含图像、音频或视频等多模态内容。

5

APEX–Agents

论文题目:

APEX–Agents

Mercor 推出 APEX–Agents,用于评估 AI Agent 在真实专业工作环境中执行长期、跨应用任务的能力。该基准包含 480 个由投资银行分析师、管理咨询顾问和公司律师设计的任务,要求 Agent 在包含真实文件与工具的工作环境中完成复杂任务,并通过 Pass@1 对 8 个 Agent 进行评测。

APEX–Agents 的排行榜中,Gemini 3 Flash(Thinking=High)以 24.0% 的成绩位居第一,GPT-5.2、Claude Opus 4.5 和 Gemini 3 Pro 紧随其后。Mercor 同时开源完整基准及 Archipelago 执行评估基础设施,为研究长期 Agent 任务提供可复现的评测环境。

论文及详细解读:https://go.hyper.ai/ZKXsw

图片

agents 在 APEX–Agents 基准测试中的表现

图片

数据集

APEX-Agents 基准测试基于对 Mercor 人才市场中 227 位专家的调查构建,涵盖 58 位金融与投资分析师、77 位管理顾问和 92 位律师,平均拥有 10.8 年专业经验。调查要求参与者将时间分配至核心活动、学习、行政、沟通、会议和非生产性时间。核心活动占总时间的 47%,这些活动的自由文本描述被手动归为 18 个类别,直接为基准测试的任务创建提供了依据。

6

TERMINAL-BENCH

论文题目:

Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces

斯坦福大学、Anthropic 及其合作者提出 Terminal-Bench 2.0,用于评估 AI Agent 在真实计算机终端环境中执行复杂、长期任务的能力。该基准包含 89 个受真实工作流程启发的困难任务,每个任务均配有独立环境、人工编写的解决方案和全面的验证测试。

实验覆盖 16 个前沿模型,结果显示顶级模型在 Terminal-Bench 2.0 上的得分仍低于 65%,并暴露出多种典型失败模式。研究团队同时在 tbench.ai 开源数据集与评估框架,为后续 Agent 能力评测和改进提供可复现的测试环境。

论文及详细解读:https://go.hyper.ai/4eKuz

图片

框架示意图

该数据集包含的任务范围从训练机器学习模型,到从源代码构建并运行 Linux,再到逆向工程二进制文件。

图片

数据集

7

PAWBench

论文题目:

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

上海交通大学、上海人工智能实验室及其合作者提出 PAWBench 和 PAWEval,用于评估视频生成模型作为世界模型时能否准确模拟真实世界的多种可能演化。不同于传统评测只关注单条视频是否合理,该基准进一步要求模型在相同初始状态和动作下,通过重复生成恢复正确的行为概率分布。

PAWBench 覆盖 50 个受控场景,并对 11 个当前视频生成系统进行评测。结果显示,没有模型能够在覆盖有效行为范围的同时持续匹配参考概率,表明当前视频生成模型距离概率对齐的世界建模仍存在明显差距。

论文及详细解读:https://go.hyper.ai/ccGYQ


图片

PAWBench 方法示意图

8

FrontierChallenge

论文题目:

FrontierChallenge: Evaluating Scientific Workflow Completion

Apodex 团队推出 FRONTIERCHALLENGE,这是一个面向科学智能体的跨领域基准,包含 300 个端到端科学工作流,目前发布 97 个任务,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学及电化学/环境科学。每个任务均设定明确的科学交付物,用于评估 Agent 是否真正完成完整研究流程。

研究团队使用三种 Agent 脚手架评估了 12 个前沿模型,结果显示最佳配置仅完成 97 个任务中的 20 个,通过率为 20.6%。进一步分析发现,即使部分任务平均得分达到 94.9,也不意味着能够完成全部交付;在未通过的 Claude Code 轨迹中,75.5% 仍以声称完成结束,凸显了端到端工作流与交付物完整性联合评估的必要性。

论文及详细解读:https://go.hyper.ai/qiEBG

图片

数据集

作者构建了一个包含 300 个科学工作流的数据集,这些工作流来源于科学和工程领域的专业实践。任务设计旨在反映需要领域知识、专业软件、实验数据或工程环境的真实工作流,而非简单的问答或孤立的编程练习。

9

VGI-Bench

论文题目:

VGI-Bench: Probing Visual Intelligence in Video Generation Models

伊利诺伊大学厄巴纳-香槟分校、清华大学、滑铁卢大学、麻省理工学院等机构的研究人员提出 VGI-BENCH,用于评估视频生成模型的零样本视觉推理能力。该基准包含 27 个任务和 810 个实例,通过任务领域与技能标签进行分类,并要求模型生成合理且有效的视觉演化过程,而非仅得到正确的最终状态。

研究团队对多种视频生成模型进行了评测,结果显示当前模型虽已具备一定视觉推理能力,但距离可靠推理仍有明显差距,即使 Seedance 2.0 也仅达到 51.0% 的准确率。进一步分析发现,模型存在有限的自我修正能力,后续生成过程更多是在强化早期错误假设,而非真正纠正推理错误。

论文及详细解读:https://go.hyper.ai/haPl9

图片

VGI-Bench 方法示意图

该数据集围绕两级分类体系组织:四个互斥领域和七个非排他性技能标签。四个领域为视觉组织、物理操作、结构化谜题和时空动态。技能标签受视觉认知理论启发,包括空间、时间、规划、属性锚定、物理、拓扑和可供性。这种设计允许对模型能力进行粗粒度和细粒度的诊断。

图片

数据集

10

MobilePA-Bench

论文题目:

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

阿里巴巴 Token Foundry 的 MAI 团队提出 MobilePA-Bench,用于评估移动端 AI Agent 在真实运行环境中的工具调用与规划能力。该基准运行于可执行沙箱,覆盖 13 个功能领域和 212 个真实移动工具,并进一步考察子 Agent 协作、记忆使用和技能调用等高级能力。

实验表明,当前前沿大语言模型在移动场景中仍存在明显可靠性问题,在严格的工具调用顺序、权限限制和运行时错误下性能显著下降。MobilePA-Bench 通过交互式工具调用与基于证据的验证,为移动 Agent 的能力诊断和强化学习提供了更贴近真实场景的评测基础。

论文及详细解读:https://go.hyper.ai/TrKlK

MobilePA-Bench 中一个端到端任务示例

MobilePA-Bench 包含 1,705 个自然语言移动任务,旨在评估中央规划 agent。任务由真实的移动场景合成,并在一个有状态的模拟沙箱中执行。该基准围绕四个能力维度组织,每个维度都通过与证据对齐的查询桶进行验证。

图片

数据集

以上就是本周论文推荐的全部内容,更多 AI 前沿研究论文,详见 hyper.ai 官网「最新论文」板块。

同时也欢迎研究团队向我们投稿高质量成果及论文,有意向者可添加神经星星微信(微信号:Hyperai01)。

下周再见!

文章标签AnthropicMeta学术研究智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多