Token导航 LogoToken导航TokenDH.com

计算机视觉的下一个十年:从「看懂世界」到「教会人类」| ECCV 2026

更新时间 2026-09-17来源 数据汪正文 7677字阅读约 24分钟2 张图片
图片

大数据文摘受权转载自AI科技评论

作者丨张岂萍

编辑丨幸丽娟

AI 不应只做更强的观察者,而应成为帮助人学会现实世界技能的 AI Guide。

过去十年,计算机视觉的技术演进主线几乎围绕同一件事展开:让机器看得更准。

从目标检测、姿态估计到三维重建、视频理解,“看懂”正在成为大模型的基础能力。但一个被反复验证的现实是:机器越会“看懂人”,人获得的实际帮助并没有同步增长。

健身 App 能识别动作,却未必知道该让你改哪一寸;教学视频能展示标准动作,却无法判断你卡在哪一步;康复训练需要持续、个性化的提醒,而专业指导依然昂贵且稀缺。行业缺的,正是一个能进入人的行动过程、在关键时刻给出可执行反馈,并最终对“人有没有学会”负责的系统。

这正是 Kristen Grauman 在 ECCV 2026 主会首场 Keynote 上试图回答的问题。她在主题为《 From Machine Perception to Human Expertise》的演讲,提出 AI 必须从 understanding 走向 enabling,从“看懂人”走向“帮助人学会”。

换句话说,视觉 AI 的关键指标,可能不再只是 benchmark 上的识别准确率,而是它能否真正改变一个人的学习过程,让原本稀缺的专业指导变得更可及。

Grauman 长期研究视频理解、第一人称视觉和具身感知,是 Ego4D、Ego-Exo4D 等项目的重要推动者;她曾任 Meta FAIR 研究总监,现任得克萨斯大学奥斯汀分校计算机科学教授。

过去多年,她的研究一直在推动计算机视觉从识别画面,走向理解人在真实世界中持续发生的活动。本次演讲,她将这条脉络凝练为对计算机视觉下一个十年的判断:AI 不应只做更强的观察者,而应成为帮助人学会现实世界技能的 AI Guide,能够理解动作、预判下一步,并在关键时刻给出个性化反馈,最终要回答的是“人有没有真的学会”。

以下是 Kristen Grauman 的演讲分享,AI 科技评论根据其现场演讲进行了不改原意的编辑。

图片

01 从理解世界到帮助人,机器感知的下一步

过去十多年,计算机视觉取得了非常大的进展。从图像分类、目标检测、语义分割、人体姿态估计,到跟踪、深度估计、场景理解、3D 重建,再到今天的图像和视频生成,我们已经看到一系列令人兴奋的突破。

如果把这些进展放在一起,可以看到一条明显的发展路径。早期很多成功集中在 recognition,也就是识别视觉世界里有什么、人在做什么;之后,模型开始理解随时间展开的活动、人与物体之间的交互,以及越来越复杂的视觉推理。但无论这些能力如何发展,它们很大程度上都在做同一件事:让机器成为一个能力越来越强的“观察者”。

今天我想换一个角度来看这个问题:机器感知已经越来越强,这些能力接下来能为人做什么?更具体地说,我们能不能把视觉智能转化成一种帮助人学习的能力? 

假设你正在学习一种新的现实世界技能,它可能是打网球、做饭、木工,也可能是康复训练。

现在想象,你身边有一个 AI Guide,它已经从大量人类活动视频中学习过,能够观察你正在做什么,理解你的动作,再告诉你哪里可以做得更好。它可以持续观察学习进度,在错误发生前主动提醒;当某一步已经完成,也能告诉你什么时候可以继续。

这就是我所说的,从 understanding 走向 enabling。

一对一的个性化专业指导非常有效,但现实中也很稀缺、昂贵,合适的专家未必就在身边,而且真正有效的指导还需要根据每个人的能力、目标和学习方式进行调整。

我感兴趣的是,AI Guide 能不能降低获得专业指导的门槛,让更多人接触到原本稀缺的技能和经验。借助 AI,现实世界中的技能和 know-how,或许也能变得更加普及。

要实现这样的系统,有两个核心技术问题。

  • 第一个是细粒度的人类活动理解:我们需要知道一个人究竟在做什么,以及这些动作会带来什么结果。

  • 第二个是个性化指导的生成:AI 还要判断这个人具体应该改变什么,以及用什么方式告诉或展示给他,才能真正帮助他提升技能。

虽然今天我主要讨论的是帮助人学习,这些能力同样会对具身 AI 和机器人非常重要。

02人类活动不发生在“帧”里,4D 活动理解从预测未来开始

先从活动理解开始。

Ego-Exo4D 为我们提供了一个重要的数据基础。它同时记录人类从第一视角(egocentric)与第三视角(exocentric)完成各种技能活动的过程,包括修自行车、烹饪、舞蹈、音乐和运动等,其中包含 740 名参与者、1286 小时视频,参与者本身也具有不同的技能水平。

第一视角与第三视角提供的信息各有侧重。第三视角能看到完整的人体与环境;第一视角则更接近学习者自己的视野,能观察到注意力的变化、身体的移动以及与物体的交互。数据中还包含眼动、音频、加速度等多种信息。

但在这些数据之上,我们首先需要重新考虑一个更基础的问题:视频究竟应该怎样被表示?

很多视频模型仍然把视频看成一系列二维观测(2D observations),再沿着时间聚合这些信息。但人的活动并不是发生在一张张二维画面里的。一个人在厨房里活动时,即使摄像头当前只看向一个杯子,桌子、橱柜、水槽和其他物体依然存在,他接下来会去哪里、使用什么物体,也会受到整个空间布局的影响。

“Activity takes place in a persistent 3D spatial context.”

人类活动发生在一个持续存在的三维空间环境中。

因此,我们希望把人的活动从一串二维观测(2D observations),重新放回它实际发生的三维环境中。人在什么位置、身体如何运动、周围有哪些物体、交互发生在哪里,这些信息都需要在同一个空间里被表示,并随着时间持续变化。我们想把活动表征从一系列二维观测,升级为真正建立在三维环境中的表示。这就是我所说的 4D。

具体来说,我们先识别环境中的物体,把它们还原到 3D 空间;再从视频中提取人的 3D 身体姿态(3D body pose),结合第一视角相机的位姿,把人体也放回同一个 3D 场景。这样得到的不再只是一张张图像,而是能够同时表示人在什么位置、身体是什么姿态、周围有哪些物体,以及人与物体的交互发生在哪里。

在 FIction 这项 4D 交互预测工作中,我们进一步把问题推进到未来交互:给定一段已经发生的活动,模型要预测接下来交互会发生在哪里,以及人在交互时会呈现怎样的身体姿态。我们关注两个维度:交互接下来会发生在哪里(where),以及人在交互时会呈现怎样的身体姿态(how)。

这里真正重要的是,模型不再只看到摄像机眼前拍到的局部画面,开始理解整个空间对人的行动意味着什么:哪些地方可以到达,哪些物体可能被使用,以及人在当前任务下会怎样利用这个空间。

对 AI Guide 来说,这一步也让“主动帮助”有了前提。系统需要理解人所在的空间和可能的下一步,才有机会在问题发生之前给出提醒。

03 从预测到规划,AI 还要理解人的技能水平

预测一个人接下来可能做什么,还不是终点。 如果 AI Guide 最终要帮助一个人完成目标,我们还需要回答另一个问题:为了达到某个目标,他应该采取什么动作?

这意味着我们要从预判(anticipation)进一步走向规划(planning)。

我们需要一个动作条件世界模型(action-conditioned world model)。给定过去一段第一视角视频和一个动作,模型要预测:执行这个动作之后,接下来看到的世界会变成什么样。

如果能够预测不同动作带来的结果,我们就可以尝试不同的动作序列,让模型分别向前进行推演(rollout),再从中选择最有可能把当前状态带到目标状态的一组动作。这样,任务就从预测“接下来可能发生什么”,进一步走向判断“为了达到目标应该采取什么动作”。

但这里又遇到一个现实问题。

第一视角摄像机戴在人的头上,它非常接近人实际看到的世界,却经常看不到完整身体,手部也可能发生遮挡。同时,第一视角视频的规模虽然正在快速增长,但和互联网上大量的第三视角视频相比,仍然存在明显差距。

这让我想到人本身学习技能的方式:我们并不只是通过亲自做来学习,也会通过观察别人来学习。

因此,我们希望利用规模更大的第三视角数据来训练第一视角世界模型。

在 EgoExo-WM 中,我们用 3D 人体运动(3D human motion)作为两个视角之间的桥梁。我们可以从第三视角视频中提取人的 3D 运动,再利用这些信息引导 Exo-to-Ego 转换,把“从外部看一个人在做什么”转换成“如果是我自己在做,从第一视角会看到什么”。同时,3D 人体运动本身也可以作为世界模型中的 action。

为了让这种转换更加准确,我们还会利用人体姿态来约束生成过程。在细粒度的人类活动中,究竟是哪只手抓住物体、手的位置如何变化、身体怎样运动,这些细节都非常重要。通过这种方式,我们可以利用规模更大、分布更广的第三视角视频,为第一视角世界模型提供更多训练数据。

到这里,我们已经讨论了如何把人的活动放回 3D 空间,如何预测未来交互,也讨论了怎样用世界模型理解不同动作可能带来的结果。

但个性化指导还需要另一种信息:眼前这个人现在处在什么技能水平。第一视角视频恰好记录了与这个人自身有关的线索,包括视线、头部运动和相机轨迹。

摄像机跟随人的头部一起移动,一个人在看哪里、头部怎样运动、相机如何移动,本身都可能透露出关于这个人的信息。

比如,一个钢琴初学者往往会频繁看自己的手和琴键,而更熟练的演奏者会把更多注意力放在乐谱上。攀岩时也类似,新手往往更关注眼前很近的位置,而熟练的人会更早把视线移向远处,为后续动作做准备。

这些差异说明,视角(gaze)本身就在透露一个人的技能水平。

在 SkillSight 中,我们利用视频和视角来预测一个人的技能水平。进一步将模型蒸馏之后,只使用视角也能保持有竞争力的预测能力,同时功耗降低约 73 倍。

类似的思路还可以继续延伸到相机轨迹(camera trajectory)。

相机轨迹本身并不是一个新概念,但我们关心的是:它除了包含几何信息,是否也编码了人在做什么?

不同动作会带来不同的身体和头部运动,因此也会形成不同的第一视角相机轨迹。走路、踢球、篮球上篮,它们对应的轨迹模式并不相同。

在 CamFormer 中,我们尝试把相机轨迹与动作的语言描述联系起来,让这种由身体运动产生的第一视角轨迹,也成为理解人类活动的一种语义信号。

04 看懂还不够,AI 还要知道“哪里该改”

到这里,我们已经讨论了 AI 如何更细粒度地理解一个人的活动。

接下来是第二个挑战:怎样生成真正有用的个性化指导?

问题继续向前一步:我们看到的动作,哪里应该变得不同?

假设一个篮球初学者正在练习投篮。一种很自然的反馈,是给他看一个顶级运动员的标准动作,然后告诉他:“你应该这样做。”但这并不一定是可执行的反馈(actionable feedback),原因很简单:这个专家动作距离学习者当前的状态太远。

真正有用的指导,应该从学习者现在所处的位置出发。我们希望找到一个整体上与他非常相似、但在某个关键技能细节上稍微更好的动作,再识别两者之间那一点真正值得改变的差异。

这就是 ExpertAF 的基本思路。我们从数据中构造三元组:学习者动作、专家针对这个动作的评价,以及一个整体上相似、但关键技能表现更好的专家示范。模型要学会判断:对这个具体的人来说,下一步最应该改什么。

当模型面对一段新的篮球视频时,它可以生成针对这个人的反馈,同时找出一段整体动作和场景都与他比较接近、但关键技能细节做得更好的示范,让学习者看到那一点差异具体是什么样。

但我们还可以继续向前一步。

刚才看到的示范仍然来自另一个人。更个性化的方式,是直接让学习者看到“自己做对”是什么样。

这就是 ExpertEdit 研究的问题。认知科学中有一种方法叫视频自我建模(video self-modeling):人在学习动作时,如果看到一个“接近完美地完成动作的自己”,可能更容易理解应该怎样调整。因此,我们希望在 3D body pose 空间里,只修改学习者动作中真正影响技能表现的关键部分。

我把这个目标形容为“Auto-Tune for human skilled physical behavior”,也就是像 Auto-Tune 调整声音一样,对人的技能动作做有针对性的修正。我们希望保留学习者原本的动作基础,只在技能关键时刻(skill-critical moments)进行调整,让调整后的动作仍然是“你自己”,只是做得更好一点。

这里真正困难的问题其实是:到底应该改哪里?

传统动作编辑(motion editing) 往往需要提前告诉模型,“把手臂伸直”“把腿抬高”。对于 AI Guide 来说,“应该改哪里”需要由模型自己判断,不能依赖人为预先指定。

ExpertEdit 的做法是,只从专家数据中学习熟练动作是什么样。面对新的学习者动作时,会遮挡技能关键阶段,再根据前后的动作把这些部分重建出来,让它更接近熟练者的动作。这样,无论在训练还是推理阶段,我们都不需要事先告诉模型“应该改哪里”。

我们也把生成的结果交给人来做比较。到目前为止,大约有六成的情况下,人们会更倾向于 ExpertEdit 生成的版本。

05 AI Guide 最后要回答:人有没有学会

最后,我想把前面这些能力带到一个真实场景里,看看这样的 AI Guide 能不能真正帮助人学习新的技能。

一开始我提到过,个性化指导往往昂贵而且稀缺;对于一些用户来说,现有的学习工具本身也可能存在使用门槛。因此,我们和盲人及低视力用户合作,让他们戴着智能眼镜,尝试学习新的烹饪任务。

普通的 How-to 视频其实并不是为这些用户设计的。比如视频可能说:“像这样切。”但“这样”究竟是什么,并没有被语言表达出来;也可能说:“等黄油变成棕色的时候关火。”这又需要用户依靠视觉去判断当前状态。

我们部署了 Vid2Coach 的平台,希望把普通 How-to 视频变成真正能在学习过程中提供实时帮助的 AI Guide。它可以补上视频里没有说出的视觉信息,告诉用户某一步有没有更安全、更方便的做法,也能持续观察任务进度,在合适的时候主动提醒用户。

用户还可以在过程中直接提问,比如“现在看起来对吗?”“这里是不是有烟?”系统会根据眼前的视觉状态实时提供反馈。

这让视觉理解开始真正进入人的行动和学习过程。

但接下来还有一个更重要的问题:这样的系统到底应该怎么评价?

如果目标是帮助人学习,评价也需要从标签和回答准确率继续往前走。真正应该关心的是学习成效(successful learning outcomes):用了 AI 之后,一个人到底有没有把这项技能学得更好。

我们让用户第一次学习新的食谱,并比较使用 Vid2Coach 和他们原本已有的学习方式时,最终完成任务的效果。我们真正想看的,是他们最后能不能把这项新的技能完成得更好。

我们展示了两组食谱的完成结果,并把使用 Vid2Coach 的结果与用户原本采用的学习方式作了对比。我们希望衡量的,是系统有没有带来更好的学习结果。

对我们来说,最重要的是系统有没有真正改变一个人的学习过程,让原本难以获得的技能变得更加可及。

这也是我所说的 From Machine Perception to Human Expertise。我们希望构建的 AI,能够利用对人类活动的观察和理解,真正帮助人学习、提升并获得新的技能。

当然,这条路上还有很多问题没有解决。

我们仍然需要能够面对陌生任务和技能的开放世界视觉推理;需要区分以前没有见过、但其实合理的动作,与真正的错误;需要理解非常细微的身体接触,以及细微动作可能造成的物理后果;还需要长期、个性化的记忆,真正理解不同用户的行为和需求。

这些仍然是从 machine perception 走向 human expertise 所需要解决的问题。

06 Q&A 现场问答

Q1(现场观众):现在通用模型进步很快,像 ChatGPT 这类模型在很多视觉任务上也已经表现得很好。你今天讲的这些能力,未来会不会被更强的基础模型直接取代?

Kristen Grauman:我们当然一直在看最新的模型能够做到什么。但总体来说,我们反复看到,真正困难的地方还是我今天选择讨论的这些问题:非常细粒度的人类活动理解,以及怎样从“描述发生了什么”进一步走到“怎么把它修正得更好”。

我们还希望系统能够主动完成这件事,这也是为什么前面会讲 anticipation 和 planning。我认为这些地方仍然处在前沿。

另外还有数据的问题。不管是现有的专有模型,还是我们自己在做的这些工作,都仍然受到数据的限制。所以这两件事,我觉得都还值得继续投入。

Q2(现场观众):对于盲人和低视力用户,你们现在主要还是依靠相机。未来会不会考虑 RGB 之外的其他传感模态,比如红外?

Kristen Grauman:这是个很有意思的问题。我们目前在这个场景里还没有做很多多模态的尝试,现在主要还是语音输入和视频。

我们目前测试的环境基本都是室内、有正常照明,而且相机能够看到环境。不过你这个问题也可以扩展到更一般的情况:是不是可以为不同用户引入更多传感模态,或者甚至考虑不同的输出方式。

比如你刚才提到红外,这确实是一个可以考虑的方向。我们目前还没有测试过,但我觉得很值得继续探索。

Q3(现场观众):你们现在会从视频里估计人体关节和姿态。相比动作捕捉(motion capture),这种方法是不是更适合真实运动场景?另外,如果一个网球运动员握拍方式不对,与其只看最终动作的差异,是不是还应该理解这种错误和结果之间的因果关系?

Kristen Grauman:是的。首先,从普通视频里恢复人体运动这件事本身就很有吸引力,因为你可以直接到真实环境里,比如真实赛场,而不是把运动员放进一个动捕棚里。当然,真实环境也会带来很多遮挡,这些都是问题。

你第二个问题也非常重要。理解动作产生的后果,正是我们希望系统能够做到的事情。

一种方法是比较当前动作和专家动作有什么不同,但我们还希望进一步理解动作和结果之间的关系:什么样的动作,会把当前状态带到另一个状态。前面讲世界模型时,其实就在做这件事。

Q4(现场观众):预测人的动作和行为当然有很多有用的场景,但也很容易被用于监控(surveillance)。你们有没有考虑这类伦理和隐私问题?

Kristen Grauman:这是一个非常重要的问题,而且我觉得它其实适用于这个领域里的很多工作。

具体来说,比如 Vid2Coach 这样的真实部署,或者 Ego4D、Ego-Exo4D 这样的数据采集,我们从一开始就会考虑伦理和隐私问题。包括我们在哪里采集数据、采用什么流程,这些都是可以非常具体地去设计和控制的。

但你问到的还有一个更大的问题:当一种技术真正进入社会以后,它最终会被拿来做什么?这已经超出了单个研究项目能够解决的范围,需要技术界和政策制定者共同参与。

从系统设计的角度,我们还是有一些事情可以做。比如选择使用什么传感模态,尽量采用设备端处理(on-device processing),以及其他保护隐私的设计。这些都可以帮助我们在系统层面尽可能降低风险。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多