Token导航 LogoToken导航

多买方多商家Agent商业世界开源

更新时间 2026-09-24来源 智猩猩正文 2790字阅读约 9分钟6 张图片

智猩猩AI整理

论文一作投稿

在 vibe coding 中,人只需用自然语言描述想要的软件,AI 智能体负责把它实现出来。

沿着同一思路,vibe commerce 让用户描述“想买什么”或“想卖什么”,再把搜索、比较、议价、下单和售后交给智能体。

但商业世界比单人使用一个购物助手更复杂。买方希望不超过 100 美元,商家希望不低于 90 美元;双方可以在 95 美元成交,却都不该向对方泄露自己的底价。交易还会改变库存、支付、订单和信誉记录。

此时真正需要评估的,不只是模型最后说了什么,而是谁提出了动作、它是否有权限、平台为何放行,以及共享市场究竟发生了什么变化。

为此,伊利诺伊大学芝加哥分校联合 Springbrand 提出 Agentic Commerce World(ACWorld),一个面向多买方、多商家智能体的持久化商业环境。

它让各角色保留独立身份、私有目标和权限,同时在同一个市场里持续交互,并把每次决策到最终状态变化的完整链路记录下来。

图片
图片
  • 论文题目:

AGENTIC COMMERCE WORLD: AN AUDITABLE AND VERIFIABLE ENVIRONMENT FOR VIBE COMMERCE

01

让“智能体决定什么”与

“谁有权改变市场”分开  

ACWorld 的核心是 Vibe Commerce Protocol(VCP)。

智能体只能提出商业动作,不能直接修改共享状态;平台先验证身份、角色、消息结构与市场规则,只有通过验证的事件才会由 World 原子提交。

一笔交易因此经过四层:

1. Buyer / Merchant Agent 根据各自不可见于对方的 mandate 做决策,并调用角色技能;

2. VCP 把动作绑定到发起者、交易对象和上下文,避免并发协商彼此混淆;

3. Commerce Intelligence Platform 执行权限与规则检查,拒绝无效或越权动作;

4. Verifiable World 更新订单、库存、支付与信任记录,并保存可重放的提交序列。

图片

图 1:买方与商家保留各自的私有目标;VCP 传递提案,平台负责授权,只有 World 能提交交易影响。

这一区分很重要:平台批准一项动作,只说明它合法且格式正确,并不代表它满足用户的商业目标。

 一个买方可能有权购买某件商品,交易也能顺利结算,但它仍可能忽略“质量优先”的要求而买错商品。

ACWorld 会保留这次有效交易,同时把失分定位到模型的选择,而不是误判成平台故障。

02

可验证的不是一句答案,

而是一条执行谱系 

对于每次决策,ACWorld 记录发起者、商业决策、平台验证、执行证据和 World 状态变化。

评估者可以从相同初始状态按顺序重放已接受的提交,比较状态与事件摘要,再在无需重新调用模型的情况下重新评分。

每个任务由若干可程序化检查的 predicate 组成,分别验证证据、选择、执行结果和权限边界。

全部通过才是满分;只完成部分步骤则保留部分分。

整个评分过程不依赖 LLM judge,也不会把环境自动完成的确定性操作算成模型能力。

需要强调的是,论文中的“可验证”指在公开声明的 ACWorld 规则下可重建、可重评分,并不等于形式化证明了规则本身正确,也不代表系统已经达到生产级支付或安全标准。

03

两条赛道:既测能力广度,

也测大规模目录执行 

ACWorld Benchmark 包含两条互补赛道:

  • Capability Coverage:200 个任务,覆盖 10 个商业任务族、80 项能力,包括发现、证据 grounding、偏好、议价、多商品、库存、生命周期、治理、对抗与时机判断;

  • Large Catalog:60 个任务,面向 785,022 条可交易 listing,测试智能体能否在完整目录上完成搜索、证据核验、选择与交易,而不只是从提示词里看到的第一页作答。

图片

图 2:内环展示能力覆盖赛道的买方/商家角色与十个任务族;青色外圈标出大目录赛道覆盖的四个任务族。

十个模型分别完成两条赛道,共得到 2,600 条执行轨迹。

能力覆盖赛道的平均分从 65.9% 到 85.6%,GPT-5.6 Sol 以 85.6% 最高。

大目录赛道从 56.10% 到 91.36%,Gemini 3.5 Flash 与 Gemini 3.6 Flash 分别达到 91.36% 和 91.35%。

两条赛道的排序并不相同,因此论文没有把它们合并成一个总分。

图片

图 3:能力覆盖赛道共 1,139 个满分、757 个部分分和 104 个零分结果;大目录赛道分别为 365、206 和 29。

过程分数还揭示了大目录任务的真正瓶颈:

模型在 Validation 阶段平均达到 94.17%,但 Search 与 Decision 只有 76.11% 和 73.67%。

也就是说,大多数提交到平台的动作都符合格式和权限要求,困难更多发生在“有没有找到全局合适的商品”以及“有没有做出正确选择”。

04

为什么只看最终订单还不够? 

在能力覆盖赛道的 861 条非满分轨迹中,有 99 条(11.5%) 与某条满分轨迹拥有完全相同的最终 World 状态。

若只看最终动作,仍有 54 条发生碰撞;即使查看公开 VCP 动作序列,也还有 45 条无法区分。结果相同,并不代表证据、决策过程和权限处理都相同。

论文又对 95 个定向注入错误做了受控检查,最终 World 状态只能发现 78 个,最终 VCP 动作发现 83 个,公开动作轨迹发现 92 个;完整执行谱系能够观察到全部 95 个。

图片

图 4:证据越完整,可观察到的已知错误越多;完整谱系保留了动作、验证与状态影响之间的归因关系。

失败也不是一个单一数字。861 条非满分轨迹中,314 条主要缺在证据,159 条缺在选择,208 条缺在执行,122 条缺在权限,另有 58 条并列。

与此同时,757 条(87.9%)仍至少通过一个 predicate。

这些中间信号使不完整轨迹有可能成为未来训练中的过程奖励,而不是被整体丢弃;不过,本论文评估的是这些信号的构造与稳定性,并未验证它们能否提升策略学习。

05

从单次购物测试

走向共享市场实验 

ACWorld 不只把网页换成了工具接口。

它允许多个独立角色在同一市场中留下持续影响:在一个固定的 5×5 市场实验里,五个商家分别报价,五个买方在看不到其他买方私有偏好的情况下排序候选,系统处理一次竞争冲突并完成五笔交易。

最终分配达到全局最优福利的 97.8%,且能从有序提交中精确重建。

这项结果说明独立智能体的局部决策可以汇合成一个一致的市场结果,但它只来自一个模型家族和一个随机种子,不能被解读为开放市场中的策略能力排名。

ACWorld 当前仍有明确边界,任务中的其他交易方采用固定策略,目录是静态快照而非实时库存,公开任务可能被针对性优化,重建只能证明结果符合已声明的转移与评分规则,而十个完整性案例也不构成安全证明。

它首先是一个可控、可复现的研究环境,不是生产级商业基础设施。

ACWorld 把智能体商业评估从“最后有没有买成”推进到“谁依据什么做了决定、平台为何允许、市场发生了什么变化,以及这条链路能否被重建和重新评分”。

文章标签模型发布开源智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多