网约车运营人员李国英利用下班做家务的间隙,佩戴数据采集设备记录浇花、整理桌面等动作,完成审核后获得收益;仁昌顺苏式糕点制作技艺传承人陆小星,通过采集记录揉制、包馅、压模的动作力度与节奏,将传统手艺转化为可供机器人学习的数据,为非遗传承开辟新路径……9月23日,觅蜂科技推出全球首个全品类高质量物理AI数据众包服务平台 “觅蜂派”,被业内视作 “中国版 Index”。平台面向全社会招募 “机器人训练师”,普通人佩戴自研MEgo采集设备,在家庭、仓储、制造、零售等真实场景完成指定操作,即可按有效采集时长获取报酬。采集后的原始数据,经过平台治理、分级处理,供给具身大模型训练,支撑机器人在千行百业落地应用。
今年8月,海外企业Figure发布Index平台,以付费众包方式征集真实场景任务视频,搭建具身模型训练数据集。同样采用众包采集思路,觅蜂派定位有明显差异:Index服务于Figure自身模型训练,形成内部数据闭环;觅蜂派面向全行业,为不同模型厂商、机器人企业、数据采购方按需定制数据生产方案,对外交付标准化数据产品与服务。面向多元客户,平台需要覆盖更广行业、长尾任务场景,对采集规范、数据治理、稳定交付能力提出更高要求,而 “全品类” 与 “高质量” 正是觅蜂派的两大核心关键词。
当前具身智能行业正从实验室研发走向产业落地,真实交互数据短缺成为核心瓶颈。与大语言模型海量文本语料不同,抓取物品、拧瓶盖、折叠衣物等日常物理动作,缺少可直接用于模型训练的大规模数据集。传统方案多采用真机遥操,依靠手柄、VR设备操控机器人采集示范数据,数据匹配度高,但受制于机器人硬件、场地与操作人员,采集成本高、规模化难度大。
行业逐步形成三类数据互补的分工体系:无本体采集拓展场景规模,真机遥操提供适配机器人本体的数据,现场部署持续迭代优化模型。业内普遍判断,要实现具身通用人工智能,训练数据需要从百万小时扩容至亿级小时,依靠传统采集方式难以线性实现,众包模式成为快速放大数据产能的重要路径。Figure 此前实验验证,Index众包预训练数据,可将机器人在陌生住宅环境的零样本任务成功率从9%提升至56%。
觅蜂派降低了机器人训练师的参与门槛,参与者无需掌握算法与编程知识,只需佩戴MEgo设备,在熟悉环境中完成任务。仓储、零售、制造从业者可依托原有工作经验参与采集。为期一个月内测期间,平台注册用户达2万人,累计收到1.3万份采集任务。
支撑 “全品类” 能力的,一方面是国内完备的产业场景基础,另一方面是觅蜂发起的场景数据联盟。发布会现场,觅蜂联合场景方、采集网络、机器人与模型企业,打通场景需求、数据采集、模型训练、落地验证的产业闭环。联盟首批50余家成员,覆盖商超、酒店、餐饮、养老、医疗、制造、物业等赛道。平台目前覆盖22大类场景、5000余项任务、5万余个真实环境,囊括取放搬运等通用操作,以及装配、养老照护等专业任务,为机器人训练环境感知、精细操控、风险判断能力提供数据支撑。
众包模式在快速扩大数据体量的同时,数据质量管控是行业难题。不少第一视角采集要求参与者刻意放慢动作、固定流程,方便算法解析,但会丢失真实世界里遮挡、动态纠错、非标准操作等行为,造成模型学习样本失真。觅蜂对高质量数据的理解,兼顾硬件采集能力与数据应用价值。
平台配套自研MEgo无本体采集设备,采用多视角、多模态方案,300°全景搭配腕部特写,结合三维触觉实现毫米级轨迹重建,硬件层面做到亚毫秒级多通道数据同步,减少视觉、姿态、触觉信息偏差。依托MEgo Engine基础设施,完成数据感知、标注、位姿重建,把人体、手部、环境信息统一转化为空间数据。目前已有2万套MEgo设备投入各类真实场景,累计产出百万小时有效数据。
同时平台建立ManiEval多维度质检分级体系,提出 “不过滤,只分级” 的思路,依据传感器、动作、语义等维度评估数据,不同特征的数据匹配差异化训练需求,让每一条真实场景数据都能找到应用场景。当前觅蜂百万小时无本体数据,已经供给腾讯Robotics X实验室、蚂蚁灵波等头部客户。
觅蜂科技表示,此前已经完成采集硬件研发、百万小时数据积累、数据处理引擎搭建以及头部客户验证,觅蜂派平台补齐社会化数据生产网络与多元场景入口。伴随具身智能数据需求从百万小时迈向亿级小时,能够持续接入真实场景、按需交付高质量数据的基础设施价值愈发凸显。觅蜂派的目标,就是搭建一张持续生长的物理AI数据网络,为国产具身智能产业提供源源不断的真实世界素材。