
机器人前瞻(公众号:robot_pro)
作者 | 钟宸
编辑 | 漠影
机器人前瞻9月15日报道,今天,由两位斯坦福学生Zipeng Fu和Chen Wang创办的Reward AI,推出其首款机器人基础模型OM-1,该公司称,这一模型可实现任何机器人的零样本泛化,包括桌面机械臂、工业机械臂和人形机器人等。
从演示效果看,OM-1能独立完成调酒、叠衣物、拔网线等精细操作,还可实现多机器人协作,双机械臂可协作包装手机。
同时,当途中出错时,OM-1会自我纠正,受到干扰也能停下或重试,搭载该模型的人形机器人还能完成开冰箱取饮料的全身操作。
Reward AI称,不到30分钟的数据输入,它就能学会一项全新任务,包含复杂的动态和长程任务。
核心思路上,OM-1不用遥操作和机器人数据,而是通过自研的Omnibody Hand直接采集人的操作数据,以“手”为通用接口,经统一的数据管线训练出跨本体通用的模型。
控制层则在仿真中强化学习训练,按自身节拍运行。

Reward AI的联合创始人兼CEO Zipeng Fu博士毕业于斯坦福大学AI Lab,曾在Google DeepMind 公司担任研究员,也是Mobile ALOHA的共同第一作者。

联合创始人兼CTO Chen Wang博士毕业于斯坦福计算机科学专业,曾师从李飞飞和Karen Liu。

目前,在X(原推特)上,这一帖子已获得超过2000点赞。

大多数网友对这一成果表达了赞叹,包括英伟达高级AI研究科学家Jim Fan,他评论道:“恭喜两位创始人!!(演示)太流畅了!”
一、可调酒、打包手机、拔网线,实现快速操作
在Reward AI展示的视频中,最值得关注的就是OM-1展现的长程能力。在视频中,两双机械臂配合对手机进行包装,有意思的是,其中一对机械臂在盖上手机包装盒盖子时,选择首先倾斜一角盖上,在一定程度上体现了拟人性。
该模型还可以独立完成调酒工作,完成从倒入酒液、冰块到摇晃调酒杯、拔开瓶塞、将鸡尾酒倒入杯中等动作,从视频来看,动作均为一次性完成,并未出现失败情况,机械臂运行过程甚至看起来有一些“果断”。
这一模型还可以完成叠衣物的任务,视频中,机械臂先将衣物平摊,随后通过拿起中间部分实现对折、甩动实现卷曲衣物的目标,整个过程仅花费17秒钟。
Reward AI还测试了拔掉以太网线的任务。与USB不同,以太网连接器牢牢锁定,只有在非常精确地按下锁扣时才会松开。OM-1解决了这一精细操作任务。在视频后半段,机械臂还能够意识到自己按错部位,对按压位置进行调整。
OM-1还表现出多种涌现行为,会弥补此前犯下的错误。Reward AI称,这一模型知道何时重试,何时适应对抗扰动,何时在环境剧烈变化时停止。
从视频来看,当上一机械臂没能完成任务时,下一机械臂会帮助其完成任务,面临人类对任务状态进行干扰时,机械臂也能对此进行调整:当人类将酒杯拿走时,模型会选择停止执行倒酒液的任务;当酒杯瓶塞无法拧开时,模型也会重新进行任务,而非报错。
此外,OM-1还可以为人形机器人提供全身操控和导航的能力。在视频中,人形机器人完成了打开冰箱、拿取饮料的操作,且Reward AI表示,所有演示视频均为实时画面,未做加速处理。
二、实现跨本体泛化,采用电磁感测技术
Reward AI还在技术博客中表达了自己的理念,即基于一个核心原则,构建Omnibody系统:一个模型,一个数据接口,适用于任何形态。
Omnibody将整个处理流程集成到一个系统中。它能够以人们实际工作的速度收集操控行为的数据,并从这些行为中学到通用的机器人策略。
这种策略还能在不同的机器人形态中应用,Reward AI以手作为连接这些不同形态本体的通用接口,从而实现跨形态的操作学习。

在Reward AI展示的视频中,不同形态的机器人均可完成分拣物料的工作,视频也未经加速。但值得注意的是,不同形态的本体使用的皆为具有相似形态的夹爪。

为实现对人类操作动作数据的收集,Reward AI基于之前在DexCap项目上的研究成果(一种可扩展、便携的动作捕捉技术),开发了Omnibody Hand可穿戴设备。OM-1正是基于人们在佩戴Omnibody HAnd时收集到的非机器人环境中的人类数据进行学习。

在RewardAI展示的视频中,Omnibody Hand采用紧凑的七自由度设计,能够完成拧螺母、拿取以及放下水管的操作。
该公司表示,Omnibody Hand能让人们在数据采集中自然地展示操控能力,而无需根据机器人的运动学要求调整自己的行为。
这一设备还配备了集成的远端屈曲机制(integrated distal flexion mechanism),可以吸收手指长度差异带来的影响,从而降低数据采集对精确的关节对齐的敏感性,无需针对不同大小的人手进行单独的调整。
为收集迅速的动作数据,Reward AI在该设备上集成了高频触觉反馈、用于判断接触前距离的接近感应功能,以及能够随着动作快速提供视觉上下文的全景相机。
Reward AI还结合使用了电磁感测(electromagnetic sensing)技术来补充视觉惯性追踪在技术上的不足,这种技术能够提供高精度的位置信息,并且不受视觉信息更新时间的限制。

该公司表示,其跟踪算法还能补偿环境中的电磁干扰。经过对每种速度下的十次测试进行平均分析,Reward AI发现,在高速运动时,这一方法能够将平均超调误差降低了60%。
三、输入多模态数据,控制层依靠自我节拍运行
OM-1支持多种需要接触的任务,而且随着人类数据的规模与多样性增加,其性能也会不断提升。

Reward AI称,该模型能够直接从人类的动作中学习生成机器人的行为,它可以将人们在进行需要频繁接触的工作时,所拥有的直觉和潜意识中的物理智能(intuition and subconscious physical intelligence)直接传递给机器人(无中转环节)。
训练数据则以同一形式经One Data Interface传入,预训练和后训练之间没有明确分割。
因此,对于新机器人来说,无需重新收集任何数据,也无需将某些数据视为错误的数据进行训练,扩展OM-1的规模只需添加人类收集的数据即可,而无需为每个机器人、任务或部署场景设计单独的训练阶段。
也就是说,最新收集的数据仍然可以用于训练那些尚未设计完成的机器人本体。
Reward AI还指出,Omnibody Hand和One Data Interface能够收集到人们以自身节奏进行工作的数据,OM-1则通过模仿这些操作,来学习如何在不同的机器人本体之间执行任务。
OM-1 的输入包括由Omnibody Hand采集的多模态数据:图像、触觉信号、手指间的间距以及手的姿态轨迹,每种模态数据都提供了关于交互的详细信息。
OM-1输出的动作包含运动方向、速度、力量以及诸如抓取和移动等关键事件的时机。
OM-1的控制层则将那些用于移动机器人操控与导航的指令,转化为实际的动作执行,同时也能适应特定机械设备的特性。

该控制层通过仿真中的强化学习(reinforcement learning in simulation)进行训练,以处理与速度和加速度相关的动态变化、外部干扰以及系统延迟等问题。
Reward AI认为,按照现实的操作速度,在执行过程中,模型无法暂停,因为需要不断计算新的动作。
因此,OM-1的控制层依靠自己的节拍(clock)运行,即使在模型生成新动作时,控制层也能持续高速运行。这样就能确保推理延迟的波动不会干扰机器人的运动。
不过,Reward AI承认,依靠自己的时钟运行也带来了一些挑战:当新的预测结果出现时,连续的动作可能无法平滑地衔接在一起。
虽然在低速操作下不连续性几乎察觉不到,但这在高速下会影响执行。因此,控制层会在线优化连续预测之间的转换,通过抛掷和摆动等动态行为保持动作平滑连续。
该公司还认为,要达成快速操作,需要策略来保持这些信号的时间顺序。所以,OM-1以传感器本身的采样率来处理每种模态,而不是将每个数据流降频处理,高频的触觉和运动信号与低频的视觉信息一起被保留下来。
此外,OM-1会记录这些数据流的时间历史,从而能够理解接触、运动以及任务进展如何随时间演变。
结语:展现无本体数据采集潜力,后续仍待实际落地验证
从调酒、打包手机到拔掉以太网线,OM-1展示的能力并不在于某个单一动作有多炫,而在于同一条策略能落到不同形态的本体上,并且是在没有遥操作、没有机器人数据的情况下,直接从人的操作里学出来的。
按Reward AI的说法,新机器人不再需要单独采集数据、单独设计训练阶段,最新的人类数据甚至能喂给还没造出来的本体。
当然,视频里的顺畅是一回事,可复现的评测和真实产线的稳定性,是另一回事。“零样本泛化”“任何机器人”这类表述,最终要靠开放测试和第三方验证来兑现。但至少,OM-1指了一条清晰的路:不去迁就机器人的运动学,而是让机器人学习人干活时的操作。
这无疑是对ego、UMI无本体数据采集路线潜力的又一次证明。如果这条路走通,可想而知数据采集的成本将实现几何倍数的下降,只不过眼下,它仍然只是一个值得认真对待的开始。
Reward AI技术博客:https://www.rewardai.com/blog/OM-1/







