Token导航 LogoToken导航

觅蜂科技发布觅蜂派数据众包平台

更新时间 2026-09-24来源 全天候科技正文 3587字阅读约 12分钟6 张图片
图片
作者 | 刘艺晨 

9月23日,觅蜂科技正式发布数据众包平台“觅蜂派”,尝试把具身智能的数据采集大规模开放给社会大众。

觅蜂科技成立于2026年2月,业务覆盖真机数据、无本体数据和仿真数据的采集与处理,并将自身定位为面向全行业的第三方数据平台。

借助“觅蜂派”平台,普通人可以申领MEgo设备,通过App接取采集任务,再由平台按照审核后的有效数据时长结算报酬。 

觅蜂同时开放“机器人训练师”招募,并联合酒店、商超、制造等领域的50余家企业和机构发起场景数据联盟。公司希望把原本集中在数采工厂里的数据生产,拆散到更多真实工作和生活场景中。

过去一年,具身智能行业对“数据从哪里来”的答案正在快速变化。早期最直接的办法,是把机器人集中到数采中心,由人遥操作真机反复完成抓取、搬运、整理等任务。

但真机昂贵、采集效率有限,也很难依靠线性增加机器人和采集员,把数据规模从百万小时推到千万乃至亿级小时。

于是,行业开始把更多数据生产从机器人本体上拆出来。

觅蜂选择进一步开放生产端:让更多人带着轻量设备进入真实场景,再由平台把这些分散产生的数据统一加工成模型可以使用的训练数据。

当具身数据开始尝试众包化生产,它究竟是一张可以快速扩张的数据网络,还是一门更加复杂的劳务生意?

图片


数据版美团,账怎么算?

对于普通人来说,参与觅蜂派大致需要经过几个步骤:下载App、租用MEgo设备、领取任务,在生活或工作场景中完成指定操作,再将数据上传,根据有效数据时长获得佣金并提现。

用户可以在任务大厅选择任务,进行中的任务采用时长配额制。MEgo设备租金为39元一天,推广期折扣价为19元一天,App显示的任务基础回报约为每有效小时20元。

这并不是采集者最终到手的统一时薪。

按照公司的说法,报酬由城市基础定价和动态补贴组成:前者参考不同地区的收入水平,后者取决于任务完成效率和数据质量。

任务从几分钟到一个多小时不等,最终按照审核通过的有效时长结算。

某类数据采够后,平台便可以停止分发;对于稀缺或者较难进入的场景,则通过额外补贴提高吸引力。

图片

目前开放的采集任务覆盖生产维修、餐饮服务、物流搬运、养老照护和家务整理等超过20个领域,小到羽毛球馆清点球筒、便民服务站补充饮水杯等日常操作,也被纳入采集范围。

“众包”很容易让人联想到外卖骑手模式的变体:平台连接需求与分散的劳动者,再通过任务规则和价格进行调度。

但两者的交付难度并不相同。

外卖只需将商品送达指定地点,具身数据却要满足模型对场景、动作和质量的具体要求,而分散的采集者在操作习惯、职业技能和工作环境上又存在很大差异。

从商业模式看,觅蜂认为众包首先可以降低采集端的人力成本。

传统集中式数采需要专门雇佣采集员,在固定场地内反复完成任务。

众包模式则希望把采集嵌入参与者原有的生活和工作。平台支付的是新增的数据贡献,而不是完整雇佣一名专职采集员的成本。

相应地,后台运营的复杂度也会提高。

模型公司的需求首先需要被拆解成普通人能够理解的任务,明确动作步骤、设备位置、完成标准和验收规则。

平台还需要通过线下服务站点完成基础培训、设备领取和流转,尽量减少不同采集者在操作上的偏差。

统一设备解决了一部分输入差异。通过初筛的数据还要继续经过动作切分、标注、轨迹提取和人工抽检,才能成为模型可以使用的数据。

觅蜂不会把数据简单划分为“可用”和“不可用”,而是按照质量和使用价值进行分级。

明显拍摄失效的数据会被剔除,其余数据则可能分别用于预训练、具体任务训练、模型评测或长尾场景学习。

觅蜂科技董事长兼CEO姚卯青称,通过结算初筛的数据中,超过95%经过后处理后最终仍可以被利用。

按照觅蜂披露的数据,觅蜂派内测一个月内注册用户达到2万人,累计产生1.3万份任务提交,收入最高的参与者单月超过5000元。


场景越分散,运营越复杂

觅蜂在这个时间点推出众包平台,背后是下游数据需求同时发生了两个变化:客户需要的数据量越来越大,需求的场景也越来越细。

姚卯青称,百万小时正在从行业供给目标变成单个客户的训练需求,部分客户已经提出千万小时级需求,一些头部客户甚至要求供应商一周交付5万—10万小时。

但如果只是把同一种数据多生产十倍,众包的价值仍然有限。

过去具身数据采集集中在家庭场景,大量团队反复采集叠衣服等任务,这类数据已经趋于饱和。更稀缺的开始变成模型没有见过的新技能、新环境和新操作流程。

觅蜂事实上正在需求端和供给端双向开拓场景。

觅蜂科技表示,公司会定期召开生产计划评审会,汇总市场订单,先判断哪些需求可以由现有库存满足,缺少的部分再根据订单价值和资源条件分配到不同采集路径。

姚卯青同时提到,头部客户在真实场景、空间精度和动作语义标签上已经形成部分共性要求,但具体需求仍会继续下沉到不同工序和动作。

集中式数采中心可以复制厨房、客厅和桌面等标准环境,却很难在固定场地中复刻汽车维修、酒店服务、农业生产或者具体工厂产线。

靠一支专职团队逐个寻找这些场景,成本高、速度也慢。众包则把场景寻找和数据采集分散给原本就在不同行业工作的人,更容易触达长尾职业场景及其操作技能。

图片

同时,觅蜂科技希望借助“场景数据联盟”提前连接工厂、社区、酒店、商店、物流中心等场景方,在客户需求到来之前,解决安全、授权和合作关系等问题。

觅蜂派业务副总裁张智富还提到,未来平台可能根据采集者的职业和历史任务进行匹配,并开放场景自主申报,平台审核后再判断是否与下游需求匹配。

在他的解释中,仅靠平台内部团队,很难提前列出成千上万种值得采集的任务。真正身处农业、维修和生产一线的人,更清楚自己拥有哪些场景和技能。

觅蜂最终想要的不是一个更大的数采工厂,而是一张能够按照订单调度的场景网络。

这也使运营成为具身数据公司的核心能力之一。

姚卯青判断,当行业真正进入规模化和盈利阶段后,会“非常看重运营能力”:

既要把模型公司的数据缺口转化成任务,找到对应的人和场景,又要把高度异质的数据加工成统一规格,在按期交付的同时维持成本优势。

更重要的是,随着采购量扩大,客户对供应商规模、质量和交付能力的要求也在提高。姚卯青据此判断,具身数据供应商可能进一步集中,甚至出现寡头化趋势。

觅蜂称,支撑千万小时级数据生产,需要在采集设备、人员结算、数据存储和算力基础设施上投入数亿元固定资产。

产业链未来可能出现硬件、运营和数据后处理的进一步分工,但端到端覆盖整条链路,并不是一般创业团队能够轻易完成的业务。

此外,对于需要百万乃至千万小时数据的模型公司而言,同时管理几十家供应商,意味着还要自行处理不同硬件、格式和质量体系带来的差异。

供应商数量越多,数据清洗、转换和训练验证的成本也越高。

换句话说,场景可以是分散的,但交付接口最好是集中的。 

而无论扩大数据量还是打通场景,最终争夺的都不只是当前订单,而是在需求持续变化之前,提前占据数据生产和场景入口的生态位。

谁来为下一亿小时买单?

觅蜂派众包所代表的Ego无本体采集数据,现阶段主要服务于具身智能公司、世界模型公司和通用大模型公司的预训练。

模型从人类操作中学习物体、动作和环境之间的关系,以扩大对不同场景和技能的覆盖。

简单来说,无本体解决模型“见得够不够多”,真机解决机器人“能不能具体做出来”。

姚卯青称,如果只是完成一个特定任务Demo,使用目标机器人采集真机数据,效果会更加直接;Ego数据在样本量较小时,对单一任务的提升并不明显,其价值更多在规模扩大后体现为面对新任务和新环境时的Zero-shot泛化能力。

随着模型开始进入物理世界进行决策,需要补充的不只是更多小时数,也包括更丰富的场景、更高的空间精度和更完整的动作语义。模型能力越强,能够学习和进入的任务越复杂,新的数据缺口也可能随之出现。

至少在当前训练范式下,无本体数据并非机器人数量不足时的临时替代品。

更长周期的变量,是机器人自身开始生产数据。

对于搬箱、分拣和固定产线操作等已经成熟的任务,运行中的机器人可以直接记录关节状态、控制指令以及成功、失败和异常情况。

这些数据与目标本体天然一致,随着机器人规模部署,人类采集在成熟任务中的相对重要性会下降。

对觅蜂而言,更关键的问题是,即使行业仍然需要大量数据,客户是否还会长期向第三方平台采购。

一旦头部机器人公司形成自己的装机规模、场景网络和数据回流体系,自采的经济性会提高,成熟任务的数据生产权也可能转向机器人运营方。

人类数据仍有价值,并不自动等于第三方数采平台仍有价值。

姚卯青将觅蜂定位为“交钥匙”的数据服务。

他认为,多数具身公司仍然倾向于把资源集中在硬件本体和模型算法研发,而把设备、人力、场景和数据运营等重资产、重运营环节交给专业平台。部分标准化数据还可以跨客户多次销售,减少相似数据的重复采集。 

人类众包能走多远,最终取决于两件事:机器人还有多少尚未进入的世界,以及第三方平台能否比客户自己更低成本地找到并生产这些数据。

图片
图片
文章标签机器人
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多