

大模型有100万亿token语料,全球高质量机器人物理交互数据仅约50万小时。
两万分之一的差距——这就是具身智能行业最大的“数据荒漠”。
而就在最近这半个月,3个关键节点、5路大军、15家企业,一条名为“无本体数据”的暗线,在几乎没有人提前预警的情况下,掀翻了机器人行业的旧秩序。
五路大军围猎无本体
8月19日,2026世界机器人大会在北京亦庄开幕,数据采集设备从往年展台角落被搬至核心展区,成为全场焦点。
而WRC的展台,正是这场转移的绝佳缩影。
不同出身、不同禀赋的玩家在“无本体数据”的旗帜下完成了一次盛大集结,硬件形态向“头戴设备+夹爪/灵巧手”大范围收敛。
智元孵化的觅蜂科技,带来了完整的MEgo系列无本体采集产品。

MEgo Gripper整机仅560克,支持毫米级空间轨迹定位和亚毫秒级全局同步;MEgo View采用“头部300全景+腕部细节双视角”架构,一人即可独立完成全场景分布式数据采集。
自变量机器人正式发布QUANXTA Zero系列三款梯度硬件——G0(VR头显+背包+双力控夹爪,高端双臂协同)、G1(头环+双夹爪,中型场景)、E0(轻量化头环,入门款),三款统一数据输出标准,接入自变量自有数据管线。

光轮智能发布了全球首个十万小时级全模态人类开源数据集EgoSuite-Open100K,覆盖7大类环境、128类场景、15000余个采集场景,首批在Hugging Face和AtomGit同步开源,并同步推出“5年100亿具身智能数据共建计划”。
京东云一比一还原了京东“两年1000万小时高质量数据采集计划”的家政场景,家政阿姨佩戴自研JoyEgoCam头戴式设备,向观众展示人类实操数据如何被采集。
上游硬件供应商也降维入场。他山科技展出触觉感知指套TS-ECHO与EGO,奥比中光与蚂蚁灵波联合推出EGO RGB-D无本体数采硬件平台。
灵巧手厂商反向延伸:灵心巧手展出Linker Open TeleDex数据采集系统,可同时采集视觉、触觉、本体感知三重模态;章鱼动力发布OctoSense数采套件(鱼眼头环+肌电手环+同构外骨骼手套),主打“肌电跨个体零样本泛化”。
千觉机器人展示XTac UMI G1穿戴式触觉数据采集夹爪;灵巧智能首发OptiUMI高精度便携式多模态数据采集系统,无需复杂安装,便携进入实验室、工厂、家庭等真实场景完成数据采集。

途见科技发布柔性电子皮肤触觉手套TachinGlove并开源首批全手触觉数据集;猿声科技拿出模块化Magic Glove;帕西尼带来同源数采手套与多体联动方案;今年新成立的厘清智能,带来11 IMU方案的T1数采手套,延迟控制在2毫秒以内。
在WRC的论坛现场,星海图首席科学家赵行拆解了VLA模型G0.5——将视觉、语言、动作全部离散化为Token进行自回归输出,并预告8月底将推出全面开源的G0.5 MAX版本。

截至发稿,G0.5 MAX尚未正式发布,这个“留白”恰恰说明:大脑模型的迭代速度,已经跑到了数据供给能力的极限。
G0.5的训练对高质量无本体数据的渴求,正是整条主线最底层的驱动力。
8月23日大会闭幕,《“数”说大会 硕果累累》将柔性触觉数采设备列入44项重大技术成果之一——这是官方层面首次将“数据采集设备”作为独立的技术类别进行定调。
两座数据工厂让单点设备转为集中基建
大会刚结束,数据基建的落地消息从中国的两端同时传来,标志着无本体数据从“工具”升级为“基建”。
8月24日,贵州大数据集团具身智能数据工厂在贵安新区星湖园揭牌启用。建筑面积约3000平方米,内部搭建科研、餐饮、工业、零售、家居、办公6大类16个1:1全真模拟应用场景,配套建设基础采集区、标定间、审核标注区,构建起“场景采集—设备校准—清洗标注”的完整数据闭环体系。一期已部署32台机器人本体遥操设备,每年可产出超1.5万小时高质量有效数据。

贵州大数据集团总经理毛胤强表示,工厂要当好产业生态的“筑巢者”。
值得注意的是,工厂下一步将引入无本体数采设备,拓展产业一线实景数据采集业务——西部这座数据工厂,正在从真机遥操的“1.0模式”,主动向无本体采集的“2.0模式”演进。
几乎同一时刻,北京石景山给出了另一种答案。作为北京首个人形机器人数据训练中心,石景山项目自2025年3月建成运营以来,已形成一、二、三期协同格局:近270台(套)各类机器人满负荷开展训练作业,年生产高质量数据近2000万条。其中二期部署百余台全尺寸双足人形机器人,每年可产出超600万条高质量应用数据;三期聚焦触觉及多模态感知领域,填补精细操作数据集空白。
更具信号意义的是9月4日披露的升级改造方案:石景山一期正在实施技术能力提升改造,重点发力4D高斯光场与世界模型技术路线——通过新建多视点光场采集系统,真实还原物体的运动轨迹、形变过程及光影变化;同时引入世界模型,基于真实采集数据自动推演,生成海量多样化场景,实现数据规模化扩充与仿真生成。

值得关注的是,这座曾经以真机遥操为底色的数据工厂,在2026年悄悄接下了无本体数据采集的千万级订单。运营方披露:2026年第一期无本体数据采集订单完成交付近1.5万小时;2026年8月,成功中标后续大规模无本体采集订单。
贵州与石景山,一南一北,给出了数据基建的两种范式:贵州以“6大类16个1:1场景+32台遥操设备”起步,规划引入无本体数采设备;石景山以“270台机器人+2000万条年产能”的真机遥操网络为基础,叠加4D光场与世界模型,并已在无本体采集上拿到千万级订单。
两座工厂的共同选择说明了一件事:数据基建的竞争焦点,已经从“谁的机器人多”转向“谁能把真机、无本体、仿真三类数据融合进同一条管线”。
从规模化生产到可用性验证的“沪深样本”
8月31日,觅蜂科技宣布第2万台/套MEgo无本体数据采集设备正式下线,同时累计产出超过100万小时高质量无本体数据,成为全球首家百万小时级、可对外售卖无本体数据的数据服务商。
同日,觅蜂与腾讯Robotics X实验室达成无本体数据业务合作,第2万套设备交付京东。
觅蜂CEO姚卯青在现场说:“物理AI的数据电网,今天立下了第一根电线杆。”大模型有100万亿token语料,而全球高质量机器人物理交互数据仅约50万小时——20000:1的差距。
100万小时,意味着无本体数据从学术概念变成了工业化现实。
觅蜂披露的数据结构显示,100万小时覆盖22大类场景、1万余个真实环境、5万余类物体、500余种细分任务;其中“头戴+裸手”约占50%,“头戴+腕戴”约占35%,“头戴+夹爪”约占15%。
目前,觅蜂的百万小时级无本体数据已开始服务于腾讯Robotics X实验室、蚂蚁灵波等模型公司和机器人企业。
3天之后的9月2日,自变量机器人发布TwinDEX——一对孪生的三指九自由度灵巧操作手:一个可穿戴用于数据采集,一个装在机器人上用于真机部署。这是全球首次实现纯无本体数据、零真机遥操作数据驱动的灵巧操作。

TwinDEX的关键设计是“采集端与执行端在运动学、接触力学、视觉外观上高度同构”——从机器人最终执行效果出发反向设计数据采集系统,使两端在自由度、关节轴、连杆比例以及接触材料、几何特性上保持一致,从而降低数据迁移损失。硬件上采用三指九自由度(七主动自由度),在灵巧性、可靠性和成本之间取得平衡。
自变量公布的评测数据显示:无本体数据采集效率为真机遥操作的5.3倍;训练模型时无本体数据近乎100%替代真机遥操作数据;仅用数百条无本体数据后训练,机器人即可自主完成含24个子动作的化学实验。
从8月31日到9月2日,相隔仅3天。
觅蜂证明了“无本体数据可以工业化生产”,自变量证明了“无本体数据可以替代真机数据训出灵巧操作”。
两件事前后脚落地,把“无本体采集”从产品定义期推到了系统验证期。
旧秩序被掀翻之后的路线之争
但必须清醒地看到,这半个月的爆发,并不意味着路线之争已经结束。
同一窗口内,银河通用等公司仍在押注仿真合成数据路线;Figure、特斯拉等海外厂商转向人类视频路线。无本体采集的成本优势是明显的——传统真机遥操作采集500-1000元/小时,而训练一个可用通用具身模型至少需要1000万小时数据。但成本优势不等于终局优势。
仿真合成数据的可扩展性、人类视频的泛化能力,都是无本体路线尚未完全解决的问题。光轮智能联合创始人杨海波就明确指出:单纯依靠真机遥操作难以支撑千万小时级别的训练素材供给,行业需要人类视频数据与模拟合成数据两条路径并行。
更深的水域在定价权与产权归属。目前数据定价尚无行业标准,需根据场景稀缺性、获取难度、交付时间综合判定。而工人在工厂采集的数据归谁?场景方与模型方如何分润?
这是“数据电网”模式的法律暗礁,也是所有“卖铲人”尚未解决的三个坑:开机率、产权、定价权。
此外,无本体数据自身也有“债务”:人的腕部轨迹仍需重定向到关节结构不同的机器人上,人手能顺手完成的动作,未必落在夹爪或灵巧手的可达域内。
行业里无本体数据的良率一般在60%左右,意味着每采集100条数据,40条是无效的——这些无效数据不仅浪费采集成本,还会在训练中引入噪声。
从8月19日WRC开幕,到9月2日自变量TwinDEX发布,半个月,三个节点。无本体数据从展台角落走到聚光灯下,从单点设备走到百万小时级供给,从预训练辅助走到灵巧操作的核心驱动力。
贵州与石景山两座数据工厂的南北呼应,觅蜂2万套下线与自变量TwinDEX的先后落地,共同勾勒出一幅清晰的产业图景:当硬件形态收敛,真正的壁垒将后移到数据治理、本体迁移和模型反馈。
这条路线的“路线定义权”,当前在中国公司手中。
觅蜂的“数据电网”、自变量的“同构闭环”、贵州与石景山的“混合基建”,代表了三种最典型的“中国方案”,它们的胜负,才将决定具身智能的下一站。
而那个暂时留白的G0.5 MAX,或许正是检验这批百万小时数据成色的第一个真正考场。







