Token导航 LogoToken导航TokenDH.com

GLM-4.7得分超Sonnet-4.5!中科院联合快手开源LLM模拟用户行为评测基准

更新时间 2026-09-16来源 智猩猩正文 3370字阅读约 11分钟12 张图片

智猩猩AI整理

编辑:知知

用大模型扮演真实人类用户,正在成为学术界与工业界共同关注的前沿方向。无论是推荐系统的离线策略验证、电商广告的转化率预估,还是社会仿真与人机交互评估,用户模拟任务都扮演着重要角色。

然而,所有下游应用都依赖同一个前提:大模型模拟的用户必须足够逼真。

现实场景中,用户的一次购买行为可能受几天前偶然刷到的短视频触发,也可能是搜索、直播观看与广告曝光多重因素叠加的结果;一次客服投诉的背后,往往积累了数周甚至更久的消费体验与情绪变化。

这些复杂性真实存在于用户的长周期行为流中,也对评测提出了新的要求:模型需要理解的,是一位具体用户的长期兴趣、决策脉络与情境交织,而非几步理想化的操作记录。

然而,现有评测基准大多局限于单一场景、行为序列短,甚至依赖合成数据。在这样的测试条件下,很难判断大模型是否真正具备理解和复现复杂用户行为的能力。

针对这一挑战,中国科学院软件研究所联合快手推出了 OmniBehavior:一个立足真实工业环境的用户行为模拟评测基准。它跳出"理想化短序列单场景"的传统评估框架,将大模型置于真实平台的完整行为流中,系统性地检验其用户建模能力。目前数据集与评估代码已全部开源。

图片
  • 论文题目:

    Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces

01

212 万条真实交互记录:

完整覆盖用户行为全链路

图片

OmniBehavior 基于主流短视频平台快手的真实工业日志构建,具备三大核心属性:超长序列、跨场景覆盖、行为类型异构

长序列方面,研究团队采集了 3500 名真实用户在 2025 年 9 月至 11 月共三个月的完整交互记录,依据精确时间戳将各场景行为统一排列,形成连贯的超长行为序列。

跨场景方面,涵盖视频浏览、直播观看、电商购物、广告推荐、搜索行为等场景,打破了场景孤岛、串联起用户的全局活动脉络。

行为异构方面,22 类用户动作横跨二分类、连续值预测和客服文本预测三种任务形态。

在此基础上,团队进一步采样出 200 名代表性的用户作为核心评测样本,最终构成包含 212 万条交互记录的评测数据集,为检验大模型在真实环境下复现人类跨场景长期决策逻辑的能力提供了高保真的测试环境。

这些记录既包含浏览、点赞、评论、关注等内容消费类行为,也涵盖搜索、加购、下单、客服对话等主动决策类行为。所有动作按时间线串联,构成贴近真实平台环境的连续行为链。在此设定下,模型面临的挑战从"用户是否会点击"升级为:基于用户画像、完整历史轨迹与当前场景上下文,预测用户在特定场景下的真实行为表现。

预测目标涵盖二分类动作(如点赞、分享、购买)、连续数值(如观看时长)以及文本输出(如客服对话中的用户回复)。这使得 OmniBehavior 更贴近实际应用中的用户模拟需求:模型需要同时把握用户的长期偏好、即时意图、场景语境以及行为间的潜在因果联系。

02

跨场景的必要性:

单场景视角导致用户画像失真

仅凭单一场景的行为记录能否准确理解用户?答案显然是否定的。

真实用户的兴趣与需求天然分布在多个产品场景中。同一个人可能在短视频中展现乡村生活的偏好,在广告中透露家庭健康诉求,在直播间暴露价格敏感度,在搜索框中表达即时购物意图。任何单一场景都只能捕捉到冰山一角。

图片

单一场景只能捕捉用户偏好的一个侧面,多场景数据能够将内容兴趣、消费倾向、家庭需求和搜索意图整合为更完整的用户画像

数据分析进一步验证了这一点:随着纳入场景数量增加,用户兴趣类别与关键词的覆盖面持续扩展,每引入一个新场景平均可带来约 20%—30% 的兴趣覆盖增量。因此,OmniBehavior 的核心价值之一在于:保留了跨场景连续行为之间的互补性与关联性,而非碎片化处理。

图片

随着搜索、电商、广告、直播、视频等场景逐步加入,用户兴趣覆盖率持续提升,表明单场景数据容易造成隧道视野

03

长序列的必要性:

真实决策链往往跨越数天乃至数周

用户模拟是否真的需要长历史窗口?

团队追踪了 180 个高价值转化事件的前序行为链。分析表明,超过 60% 的决策依赖于 3 天以前的行为信号;同时 81.8% 的转化路径横跨多个场景。

图片

高价值转化通常不是由当前场景单点触发,而是多天、多场景行为共同累积的结果

论文给出了一个典型例子:某用户最初搜索"小米发布会",此后在直播、视频、广告、电商等多个场景中持续接触"小米 17 Pro Max"相关信息,历经 12 天后才最终完成下单。

图片

一次购买行为可能始于搜索,经由直播、视频、广告等场景不断强化,最终在电商场景完成转化

这揭示了用户模拟的核心难题之一:如何从漫长的历史中识别出哪些行为真正驱动了当下的决策。截断为短 session 会破坏决策链的完整性,局限于单场景则会遗漏跨场景的因果关系。

04

真实数据的必要性:

合成轨迹无法复现用户的动态复杂性

能否用合成数据替代真实用户轨迹?文中对两者进行了系统对比,两者在兴趣演化模式上存在显著差异。

真实用户的兴趣变化呈现连续性与随机性并存的特点,多个主题交织出现,随时间缓慢升降。而合成用户的行为更像脚本驱动,兴趣往往突然激活、迅速攀升,又快速消退。

图片

合成数据难以再现真实用户偏好的微妙漂移、犹豫、跳变和长尾特征。用户模拟的目标不仅仅是构造一个"看起来合理"的画像,更在于复现行为中的不确定性与个体独特性。

05

实验评测:当前 LLM 与

真实用户模拟之间仍存在显著差距

评测共包含 6000 个行为预测任务,覆盖视频浏览、直播、广告、电商等场景,以及二分类行为、连续观看时长和客服文本回复等任务类型。

图片

即使同期表现最好的 Claude-Opus-4.5 整体得分仅为 44.55,多数模型集中在 32 至 41 分区间。

这意味着尽管当前 LLM 在语言理解与生成层面已非常强大,但面对真实用户模拟任务时仍力有不逮。长序列建模、跨场景依赖捕捉、稀疏行为识别、长尾偏好刻画以及个体差异分析,对现有模型构成了挑战。

既然行为轨迹很长,是否把更多历史塞入上下文就能提升效果?

实验结果否定了这一直觉。团队在 16K 到 128K 不同上下文长度下进行了测试,发现性能并未随窗口增大而稳步提升。模型能获得更多历史,不代表它能有效利用这些信息。

图片图片

团队还对比了截断、RAG、摘要等主流记忆管理策略,发现这些方法仅能带来有限提升。因此,用户模拟真正需要的不是简单增加更多的上下文信息,而是更加结构化的记忆管理机制。

06

结构性偏差:

LLM 倾向于生成“积极平均人”  

论文进一步揭示了模型存在系统性偏差,将其概括为 positivity-and-average bias。大模型倾向于把每个用户都模拟成更加积极、更加礼貌、更加"平均"的形象。具体表现在三个维度:

1、过度活跃:高估用户正向行为


真实用户行为天然稀疏。绝大多数时候用户只是浏览、跳过或沉默,高频互动是少数。

但 LLM 普遍高估了用户的正向行为概率。在视频、直播、广告、电商等各场景中,模型预测的互动率均显著偏高。这种偏差若用于策略评估,将导致对用户参与度和转化率的系统性高估。

图片

2、过度礼貌:低估真实交互中的负面情绪


在电商客服场景中,真实用户经常表达催促、不满、质疑甚至愤怒,尤其在售后与物流纠纷中措辞往往直接而尖锐。

但模型生成的用户回复明显偏向中性与正向情绪,倾向于使用更客气、更缓和的表达方式,难以再现高摩擦场景下的真实用户反应。

图片

真实用户在客服场景中包含大量负面表达,LLM 模拟用户则更集中于中性和正向情绪

3、人格同质化:抹平个体差异和长尾行为


真实用户群体呈现显著的个体异质性:有人高频互动,有人长期沉默;有人冲动消费,有人极度审慎;有人表达含蓄,有人风格犀利。

然而 LLM 生成的模拟用户之间差异大幅缩小。团队基于行为特征为每位用户构建向量表示并比较分布距离,发现真实用户间存在清晰的个体分化,而模拟用户则高度聚拢,趋近于一群面目模糊的"均值用户"。这说明模型不仅存在预测误差,更在系统性地丢失真实用户生态中的长尾特征、负面反馈与个性化差异。

真实用户的个体差异显著;LLM 模拟用户之间高度重叠,说明模型倾向于生成平均化人格。

目前,OmniBehavior 仓库已完全开源,欢迎研究者与行业用户体验、使用并提出宝贵建议。

文章标签GLM智谱模型发布开源大模型学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多