具身智能数据缺口巨大:众包模式或成破局关键
2026-09-03 15:16:32未知 作者:徽声在线
徽声在线记者 | 徐美慧
徽声在线编辑 | 文姝琪
在机器人技术发展的新阶段,数据已成为推动行业进步的核心要素,机器人的下一轮竞争焦点愈发聚焦于数据领域。
据中国信通院人工智能研究所等机构于今年8月发布的《具身智能训练场研究报告(2026年)》揭示,截至2026年6月底,国内已建成并投入使用的具身智能训练场数量已超过70家,另有46家正处于建设或规划阶段。然而,随着训练场数量的激增,一个根本性问题依然悬而未决:究竟哪些数据具有真正的价值,又该如何实现数据规模的快速扩张?
近日,由智元机器人孵化的觅蜂科技宣布,其第2万套MEgo无本体数据采集设备已正式下线,并累计生产了超过100万小时的无本体数据,这一消息引起了业界的广泛关注。
从真实物理交互数据的采集方式来看,目前主要分为真机和无本体两大类。真机数据通过遥操作或机器人自主运行的方式采集,直接关联到机器人的关节、动作等信息,但其成本和产能受到机器人本体数量的限制。而无本体数据则主要由人员佩戴第一视角、腕部等设备进行采集,不依赖于特定型号的机器人,因此更容易覆盖多样化的场景。不过,这类数据在采集后还需经过空间重建、动作映射和数据治理等复杂处理过程。
觅蜂科技董事长兼CEO姚卯青在接受徽声在线等媒体采访时表示,无本体数据和真机数据并非相互替代的关系,而是相辅相成。无本体数据更多用于预训练阶段,帮助模型学习通用表征;而真机数据则负责后训练,确保模型能够在实际任务中精准落地。任何一个任务要真正实现应用,都离不开对应本体的真机数据支持。
训练场密集落地的直接原因,在于当前具身智能领域存在庞大的数据缺口。上述报告指出,要使具身基础模型达到类似“ChatGPT时刻”的突破,至少需要千万小时级的真实数据作为支撑。然而,目前全球可用的高质量真实数据仅为数十万至百万小时级,远不能满足需求。
根据IDC发布的《中国人工智能基础数据服务市场研究报告,2025》显示,2025年中国AI基础数据服务市场规模已达到62.62亿元,同比增长27.8%,并预计在2026年增长至78.34亿元。报告还观察到,数据需求正在从单纯的大规模采集转向更加精细化的任务数据采集,客户群体也从传统的AI企业扩展至自动驾驶、具身智能等新兴领域。
随着数据市场的不断发展,谁在购买这些数据也变得愈发清晰。
姚卯青透露,目前数据的需求方主要包括大模型公司和机器人公司。大模型公司希望利用人的操作数据来训练多模态认知、决策和世界模型;而机器人公司则更关注动作轨迹、任务拆解以及向机器人关节动作的映射等方面的数据,这些数据可用于模型的预训练,并在后续与真机数据相结合,提升模型性能。
在觅蜂科技的活动现场,第2万套MEgo设备被交付给京东,同时宣布与腾讯Robotics X实验室开展无本体数据业务合作。京东科技集团副总裁何贺表示,京东既是数据的采购方、采集方,也是场景方,京东此前提出的目标是两年内采购1000万小时的数据,以支持其业务发展。
与2万套设备一同亮相的,还有觅蜂科技披露的100万小时无本体数据。据介绍,这批数据全部来自开放环境中的真实采集,覆盖了22大类场景、1万余个真实环境、5万余类物体及500余种细分任务。数据场景广泛,包括居住、办公、零售、生产、仓储、餐饮、文娱休闲、交通出行等八大主要场景,并延伸至公共服务、物流、医疗、教育、养老、文旅、汽车服务、农业生产等长尾场景。
觅蜂科技表示,其百万小时级的无本体数据已经开始服务于腾讯Robotics X实验室、蚂蚁灵波等客户,为这些企业的具身智能研发提供了有力支持。
百万小时数据助力具身智能发展。图片来源:觅蜂
然而,拥有大量数据只是第一步,真正拉开差距的是这些数据在客户手中能否得到有效利用。
姚卯青提到,今年上半年行业还在快速试错阶段,但到下半年,头部客户的需求开始趋于收敛。60FPS、1080P、双目、深度等要求逐渐成为行业标配,对时间同步、空间标定精度、设备重量和稳定性的要求也显著提高。
他说,年初时,使用手机、运动相机等简单设备采集的数据还能找到市场,但现在这类需求已经逐渐减少,随着专业化产品的出现,客户对数据质量的要求越来越高。
尽管行业对数据质量的要求在不断提高,但目前还远未达到统一的标准。中国科学院科技战略咨询研究院曾发文指出,具身智能高质量数据集建设目前仍面临技术路线不统一、建设主体分散、共享机制不畅等问题。不同企业和科研机构在数据格式、语义标注、机器人传感器配置和控制模态上存在差异,导致数据难以跨主体、跨场景复用。
因此,小时数只是进入数据市场的第一道门槛。姚卯青提到,如果只是重复做同一种任务,即使很快堆到100万小时,也可能没有太大的训练价值。客户还会关注场景覆盖的广泛性、动作的自然性、手部位姿的精度以及数据最终是否通过验收等方面。
数采工厂的效率差异也很大。有的工作人员工作8小时能产出4个小时的有效数据,而有的只能产出1小时。管理、培训和设备稳定性都会直接影响产能。据姚卯青透露,行业目前较常见的结算方式也是按有效小时计算,而不是人员实际工作时间。
工作人员利用MEgo无本体数据采集设备进行高效数据采集。图片来源:徽声在线记者 摄影
这使得数据采集越来越像一门运营生意,而不仅仅是销售硬件那么简单。
另一个显著的变化是,数据采集开始走出专业的数采工厂。姚卯青称,目前已经有社区退休人员、宝妈等群体参与到数据采集工作中来。公司通常与同时具有人力和场景资源的合作方一起运营,以扩大数据采集的规模和范围。
在姚卯青看来,如果数据量要从百万小时迈向亿小时级别,仅靠数采工厂的线性复制是不现实的。众包模式可能是必须跨过的一步,通过众包可以充分利用社会闲置资源,提高数据采集的效率和覆盖范围。
他设想,数据采集会从集中式走向半集中式,最终出现类似骑手、网约车司机的灵活就业模式。让不同行业的人把技能、时间和经验变成可以量化结算的数据,从而推动数据采集行业的快速发展。
类似的众包尝试也已经在海外出现。8月25日,Figure推出Index平台,用户可以自行上传第一视角操作视频,也可以预约Creator到家庭或企业场景完成任务。Figure称,过去4个月已有超过26万次应用下载,并计划未来12个月在数据和算力上投入超过10亿美元,以进一步推动其业务发展。
姚卯青评价表示,从Figure目前公开的介绍来看,Index展示的内容仍有较多家务类场景,而觅蜂科技则希望把众包覆盖到更多行业,以满足不同客户的需求。
不过,众包模式也面临着诸多挑战。众包意味着采集人员更多、场景更分散,设备如何流转、人员如何培训、进入真实家庭和商业场所如何获得授权等问题都会提高质量管理和合规成本。因此,如何在保证数据质量的同时降低管理和合规成本,是众包模式需要解决的关键问题。
此外,这些数据如何销售也是行业目前正在摸索的问题。
姚卯青称,目前具身数据没有标准的定价机制,价格会随着场景稀缺程度、进入难度和交付周期的变化而波动。行业常见的交易方式有两种:一种是出售使用权,产权仍由数据公司持有,买方不能进行二次商业化;另一种是独享买断,产权转移给客户,数据提供方需要删除自身服务器上的对应数据。由于数据不同于实体商品,如何确认使用范围、避免未经授权的二次流通也是数据交易需要解决的问题。
对于行业格局的未来走向,姚卯青的判断是具身数据最终会走向寡头分布。
他的理由首先是投入门槛高。按其说法,这个行业目前是重投入行业,几万套设备需要亿元级的投入,能够存储数百PB乃至上千PB数据的数据中心同样需要较大的资金投入。同时还考验企业的工程和运营能力,只有具备强大实力的企业才能在竞争中脱颖而出。
此外,姚卯青还提到一个眼下无解的问题:同一家模型公司混用多家来源的第一视角数据往往训不出理想的效果。短期解法只能是集中选一到两家供应商进行合作,以确保数据的一致性和质量。这也进一步加剧了行业向寡头分布的趋势。

