大模型榜单越来越多,但榜单上的几分差距,到了真实工作中究竟意味着什么,并不容易判断。
在 Artificial Analysis(AA)、Terminal-Bench 4.0 和 CursorBench 4.0 等评测中,Fable 5.1 和 Opus 5 的成绩只相差几分。可如果让它们进入同一家公司,使用同样的软件、学习同样的业务,再连续处理同一批账单,结果却变成了 72% 对 36%。
完成的任务数,差了一倍。
这个结果来自 NeoCognition 最新发布的 ApprenticeBench。与常见的单项能力测试不同,它把 Agent 放进一家模拟建筑公司,让它像新员工一样入职:阅读员工手册和历史资料,使用真实企业软件,并根据主管反馈逐渐摸清公司的业务规则。

ApprenticeBench 主页链接:https://apprenticebench.com/
Agent 没有针对这份工作接受专门训练。它需要一边工作,一边从公司的历史数据和带教过程中学习。在这项评测中,Fable 5.1 和 GPT-6 Astra 分别取得 72% 和 68% 的通过率,也超过了本次表现最好的人类测试者的 51%。

Fable 5.1 和 Astra 出现明显的能力跃升,超过本次人类测试者。图源:ApprenticeBench 博客(https://neocognition.io/blog/apprentice-bench/)
这也带出了一个更大的问题:如果 Agent 能自己熟悉软件、学会业务,今天需要 FDE(前线部署工程师)为每家客户做的部署和适配,未来能不能交给 Agent 自己完成?
一份看似普通的会计工作,为什么能拉开这么大的差距?对正在训练下一代模型的团队,这些差距又意味着什么?
公司的规矩,进公司才知道
会计学知识可以提前学习,但是一家公司具体怎么做账,最近改了什么政策,任何通用模型都不可能,也不应该知道。一个新员工入职后要补的课,Agent 一样要补。
这便是 ApprenticeBench 的核心设计思路:Agent 进入一家模拟建筑公司,使用和人类员工同样的软件(Odoo)处理应付账款。入职时,它拿到员工手册、软件教程和六个月的历史账单,随后连续处理 100 张新账单。在第一个月里,主管会逐单指导,后来只在月底提供稀疏反馈。

从翻阅历史记录,到逐步独立处理业务,Agent 经历与新员工相似的学习过程。图源:ApprenticeBench 博客
真正做起来才会发现,麻烦都藏在细节里 ——the devil is in the details
建筑公司的应付账款工作中,单位写错、保险过期、前任没交接清楚,都不稀奇。同一张账单,几个问题经常一起出现,还得来回沟通好几轮。然而,现有的 benchmark 把真实工作里的这些麻烦都省略了。同时还有很多规矩,根本不会被明确写下来。相同的支出描述,因为用途不同,就可能归入不同成本码(cost code)。Agent 需要从历史账单中自己琢磨,而不能只靠名称猜答案。
这些麻烦都被放进了 ApprenticeBench。100 个任务经过两位合计拥有超过 30 年相关经验的专业人士独立验证,确认它们确实会在工作中发生,也能根据 benchmark 中提供的信息解决。
拥有 20 年经验的建筑业财务主管 Emilie F. 表示: “这些场景很真实。比如项目经理弄丢了东西却没有意识到,这种事比你想象的常见得多。在参与这个项目之前,我从没想过 AI 能处理这类工作。如果它能应付这些邮件、来回沟通和交叉核对,我相信它会成为会计部门真正的帮手。” 有 10 年建筑与项目管理经验的企业经营者 Austen K. 表示: “这些场景非常符合建筑业财务主管会遇到的情况。目前这些工作都由我自己处理。如果 AI 能接手,我就能腾出时间承接更多项目、拓展业务。对我这样规模的公司,这很容易带来每年六位数美元的价值。如果 AI 能学会这些并拿到高分,我很愿意让它到自己的公司试一试。”
这就是团队所说的 “生态效度”(ecological validity)。它还关系到一种更容易推广的部署方式:企业能否用现有的软件、资料和带教流程,让 Agent 真的像新员工一样学会工作?
真实工作,让模型真正拉开差距
单独测试软件操作,两个模型可能表现接近。但做一份完整的工作,Agent 还得从历史记录里学会公司的惯例,根据主管反馈和政策变化调整做法,并与供应商沟通、补齐信息。这些挑战也会相互影响。软件使用不熟练,可能无法精确检索相关历史记录,公司的规则也就学不明白。主管指出的问题没学会改,后面的账单则会继续出错。把这些挑战放在一起,单项测试中不明显的差距就会累积。Fable 5.1 与 Opus 5 从其他榜单上相差几分,到 ApprenticeBench 的 72% 对 36%,正是值得进一步研究的差距。

AA:Fable 5.1 为 53,Opus 5 为 51。图源:Artificial Analysis 排行榜

Terminal-Bench 4.0:Fable 5.1 为 57.9%,Opus 5 为 51.8%。图源:Terminal-Bench 排行榜

CursorBench 4.0:Fable 5.1 Max 为 51.8%,Opus 5 Max 为 46.6%。图源:CursorBench 排行榜
另外值得一提的是,开源权重模型与闭源模型的差距也很直观。Fable 5.1 和 Kimi K3 在 AA 上是 53 和 44,在这里则是 72% 和 18%。这 100 张账单里,一个有 28 张没通过,另一个是 82 张。如果最后由你接手,这个差距恐怕很难忽略。 这套评测提高了复杂案例的比例,不能直接当作日常业务的错误率。不过,那些需要人接手的地方,恰恰值得模型团队仔细看。
下一版模型,该往哪里使劲?
分数拉开了,接下来让我们看看原因。ApprenticeBench 的几组分析,已经给出了一些具体线索。
用鼠标代替 API,模型要交多少 “CUA 税”?
用图形界面做事,到底会拖累模型多少?为了公平比较,ApprenticeBench 团队专门基于 Odoo 的后台接口,定制了一套与图形界面功能对等的 API 工具,让模型分别通过两种方式完成同一份工作。
团队提出了 “CUA 税” 这一概念来衡量 agent 从 API 切换为 GUI 导致的成功率损失:
CUA 税 =(API 成功率 − GUI 成功率)÷ API 成功率

使用 GUI 带来的相对成功率损失随模型代际快速下降。图源:ApprenticeBench 博客
这笔 “税” 随模型迭代逐渐降低。Fable 5.1 的 GUI/API 成功率为 72%/70%,Astra 为 68%/65%。这一结果说明今天最强模型的 CUA 税可能已经消失。
这意味着,Agent 有望直接使用企业现有软件,减少专门开发接口的需要。不过,GUI 的操作成本仍然更高,效率上还有提升空间。
模型原本就会,还是入职后学会的
做对一道题,不一定说明模型学到了新东西。它可能本来就会,也可能只是找到了可以照抄的答案。
团队设置了一个 “聪明的新手”(smart novice)对照:仅保留公司手册和软件教程,拿掉历史账单、主管反馈和跨任务记忆,看模型只靠已有知识能做多少。Fable 5 在这个设置下只通过了 11 张账单。单独加入历史账单,通过数上升到 31 张。单独加入主管反馈,则升到 35 张。两者同时提供时,达到了 43 张。公司里的经验,确实能帮它把工作做得更好。 但找到旧答案,和学会处理新情况,还有一段距离。成本码实验里,当有先例可参考时,受测模型普遍表现不错。需要从历史账单中归纳规则时,Fable 5.1 和 Astra 才明显领先。

左侧是有先例可参考的成本码,右侧需要归纳隐含规则;虚线为 smart novice 参考表现。图源:ApprenticeBench 博客
有些模型看了历史账单、听了主管反馈,提升仍然有限。有些能从旧账单里找到答案,但需要自己归纳规则时,正确率就明显下降。这些对照让我们看清了分数背后模型能力的差距所在。
经验多了,为什么反而干得更慢
人熟悉工作后,通常会越做越快。这次测试里,Agent 却普遍越做越慢。

人类与 Agent 的处理速度、笔记量随任务推进的变化。图源:ApprenticeBench 博客
笔记就是一个例子。Fable 5.1 写下了约 19.2 万词,分散在 122 个文件里。人类测试者中,笔记较多的一位也只写了约 2,800 词。记得多不代表用得好。笔记越积越多,查阅和维护它们也要花时间。还有个很有意思的例子:账单扫描件太模糊,Agent 居然自己写起了图像处理程序,折腾了近两小时,最后还是找供应商要了份清晰的。本来发条消息就能解决,它却绕了一大圈。
这些问题,光看成功率很难发现。把执行过程和消耗的时间、token 一起看,才能知道模型卡在哪里。下一版模型该学会什么、少做哪些无用功,也就有了具体的改进方向。
做得比人好,还得算算账
Fable 5.1 的通过率达到 72%,超过了人类最高的 51%。但每张账单平均花费 18.23 美元,人类是 7.21 美元,差了约 2.5 倍。这里,模型算的是 token 费用,人工算的是工作时间对应的工资。还有一些成本没算进去。处理同样的 100 张账单,Fable 5.1 发出了 1,032 条消息,两位人类测试者分别是 508 条和 450 条。多出来的来回沟通,也需要同事花时间回应。
不过,成本也不只有处理账单时的开销。让 Agent 进入一家企业,摸清业务、对接软件、配置流程,同样需要人力。这就回到了开头的 FDE 问题:这些部署和适配工作,有多少能交给 Agent 自己完成?
ApprenticeBench 的结果让人看到了这种可能。Agent 已经能直接使用现有软件,也开始能从历史记录和主管反馈中学会公司的做法。如果这些能力足够可靠,换一家客户,就有机会让 Agent 自己学习,而不必事事依赖工程师定制。以后业务规则变了,它也需要能继续学、跟得上。
这条路要走通,Agent 还得做得更省、更稳,也更容易与人配合。但它的价值也很具体:少让人花时间翻查记录、核对表单、反复检查细节,多留些精力理解客户、处理例外、做出判断。
NeoCognition 表示,他们期待,人和 AI 一起工作,最终能比今天单靠人力提高十倍乃至百倍的生产力。这个目标能否实现,要看 AI 做对了多少,也要看部署、指导和复核它需要付出多少。最后,整个团队能多做多少事,才是这笔账的答案。
关于 NeoCognition
硅谷 Agent Lab NeoCognition 由苏煜、邓翔和谷雨联合创立,创始团队在 Agent 领域累计拥有超过 30 年的研究经验。他们相信,未来会有大量各有所长的专业 Agent,让更多人和组织用得上过去难以获得的专业能力。公司已获得 Cambium Capital、Walden Catalyst Ventures、Vista Equity Partners,以及 Lip-Bu Tan、Ion Stoica、Dawn Song 等投资人与学者的支持。

Yu-Xiang Wang 近日宣布已从 UCSD 休假全职加入 NeoCognition。图源:X
最后还有个彩蛋:王宇翔(Yu-Xiang Wang)教授近日宣布,已从 UCSD 休假,全职加入 NeoCognition 担任机器学习总监(Director of Machine Learning)。他从今年 7 月起就已与团队并肩工作,而这次发布的 ApprenticeBench,只是他们正在做的事情的一部分。
References:
[1] ApprenticeBench: The first end-to-end benchmark of computer use, continual learning, and long-horizon agentic capabilities, set in a real job. https://neocognition.io/blog/apprentice-bench/
[2] NeoCognition’s $40M seed funding. https://neocognition.io/press
[3] https://x.com/yuxiangw_cs/status/2098150506560659960?s=20







