“四肢”渐强“大脑”仍饥,具身智能如何填补千万小时数据缺口?|WRC观察
2026-08-21 23:08:05未知 作者:徽声在线
徽声在线8月21日消息(记者郭松峤)在科技飞速发展的当下,机器人产业正成为备受瞩目的焦点。机器人本质上是由AI驱动的,而AI的发展与数据紧密相连,数据的质量和数量直接决定了AI的能力水平。在2026世界机器人大会(简称WRC)上,宇树科技创始人、董事长王兴兴就人形机器人产业的发展方向发表了见解,他强调了数据对于机器人产业发展的关键作用。
当下,宇树科技正积极加大在机器人数据采集和模型训练方面的投入。一方面,充分利用海量的真人数据以及互联网数据进行预训练,为机器人构建初步的知识体系;另一方面,借助真实机器人的运行数据,让机器人能够更好地适应复杂的物理世界,提升其在实际场景中的应用能力。
徽声在线记者在WRC现场采访时发现,具身智能正经历着从实验室的“炫技”阶段向工厂与家庭的“实干”阶段转变。如今,机器人的“四肢”已经逐渐变得灵活,能够完成一些较为复杂的动作,但“大脑”却面临着严峻的挑战,严重缺乏理解物理世界所需的大规模训练数据,这成为了制约具身智能进一步发展的关键因素。
在今年的大会上,众多与会企业不约而同地将目光聚焦在了同一个重要命题上——为具身智能构建坚实的数据底座。这已然成为产业实现规模化落地的当务之急,只有解决了数据问题,具身智能才能在更多领域得到广泛应用。
在本届WRC上,京东云具身智能数据生态能力展台正式亮相,吸引了众多参观者的目光。优必选等公司也纷纷落地了规模化数据采集中心,为具身智能的发展提供数据支持。光轮智能更是在大会期间发布了全球首个十万小时级全模态人类行为开源数据集,这一举措无疑为具身智能的研究和发展注入了新的活力。
数据需求呈爆发式增长
业界普遍认为,2026年是具身智能从样机走向量产的关键一年。这一年,具身智能将迎来从实验室走向市场的重大转折,其发展前景备受期待。
致同发布的《【致同咨询行业洞察】具身智能机器人行业研究》报告指出,随着头部产品在宝马、比亚迪等产线开展常态化实训,人形机器人正加速跨越从“实验室样机”到“产线生产力”的鸿沟。这意味着人形机器人将逐渐从理论研究走向实际应用,为工业生产带来新的变革。
然而,《报告》也同时提醒,这一进程具有明显的时间窗口属性。真实世界数据的采集效率以及仿真到现实的迁移成功率,都可能对产业路径产生重要影响。如果数据采集效率低下或者仿真到现实的迁移不成功,可能会导致具身智能的发展受阻,错过最佳的发展时机。
事实上,数据缺口之大远远超出了人们的想象。具身智能的发展面临着巨大的数据挑战,如何获取足够的数据成为亟待解决的问题。
光轮智能联合创始人兼总裁杨海波在接受徽声在线记者采访时表示,2026年是具身智能数据规模化的元年。行业对数据的需求正呈现出爆发式增长,从去年的几百、几千小时,跃升到今年的上百万小时,增幅达百倍乃至千倍。这种快速增长的数据需求,对数据采集和处理能力提出了更高的要求。
他进一步解释道,不同于拥有互联网数十年文本积累的大语言模型,具身智能面对的是非结构化的物理世界。在物理世界中,需要采集视觉、力觉、触觉等多维度的交互信息,这些信息的采集和处理难度较大,对数据采集设备和技术提出了更高的挑战。
记者了解到,目前行业已经形成共识,实现可用的具身智能至少需要千万小时量级的多模态数据。但当前全球有效积累的数据尚不足需求的5%,数据缺口巨大。这意味着具身智能的发展还有很长的路要走,需要不断加大数据采集和积累的力度。
如果说“量”的匮乏是具身智能发展面临的显性危机,那么“质”的获取则更具难度。高质量的数据对于具身智能的发展至关重要,但目前获取高质量数据面临着诸多困难。
墨奇智能联合创始人兼CTO黄青虬在接受徽声在线等媒体采访时指出,当前数据采集设备普遍面临着精度与便携性的博弈。如果想要定位精度极高、动作捕捉精准,设备往往就会变得笨重不便携;而如果追求便携性,捕捉精度又难以保证。这种矛盾使得数据采集设备难以同时满足高精度和便携性的要求,影响了数据的质量和采集效率。
行业积极探索突围之路
徽声在线记者在WRC现场采访了解到,面对海量的数据缺口,行业正从多个方向积极探索突围之路。其中,通过人类示范提供“教科书”以及利用仿真打造“练兵场”是两种主要的方式。
光轮智能在大会期间发布的全球首个十万小时级全模态人类行为开源数据集EgoSuite - Open100K,为具身智能的研究提供了重要的数据支持。该数据集覆盖了128类场景与超1.5万项任务,采用头、腕双视角采集精细操作与全身位姿信息,能够为开发者提供丰富、多样的数据资源。
杨海波对记者表示,当前具身智能迫切需要高质量、多样性、大规模的数据供给。然而,行业在采集口径、标注规范、数据格式和时序组织上存在差异,不同设备产生的数据难以组合复用。EgoSuite—Open100K的开放,旨在让更多开发者以统一、可复用的数据基础开展模型研究,构建开放繁荣的机器人持续学习生态,促进具身智能技术的快速发展。
在开放生态建设方面,光轮智能推出了5年100亿具身智能数据共建计划。杨海波介绍了该计划的三项主要工作。一是开放数据标准,统一不同采集设备的数据模态、标注、时序、格式和质量标准,让数据具备跨设备、跨任务和跨模型复用的基础,提高数据的利用效率。二是评测驱动的数据闭环,从模型失败中定位数据需求,定向生成和补采数据,再通过基准评测持续检验模型提升,形成一个不断优化的数据循环。三是数据与模型协同设计,共同优化仿真数据、第一视角人类数据、遥操作数据与评测数据等的组合方式,提高数据的质量和模型的性能。
优必选则展示了另一条技术路线——自研全栈式技术体系。其自主研发的基座大模型Thinker,以“小参数、高性能、全开源”突破行业技术瓶颈,重点突破了两大核心能力。一是机器人第一视角下的场景认知与任务规划能力,让机器人能够像人一样理解周围的环境并规划任务;二是支撑物理交互的精准感知与空间理解能力,使机器人能够准确地感知物理世界并进行交互。
聚焦高端科研工业赛道的源络科技同样值得关注。在现场,Monte02机器人完整展示了长序列移液、微孔板自主转运、移液枪吸头装退等一系列标准化实验操作,展现了其在科研领域的强大应用能力。
据了解,源络科技依托此前在国家级平台的落地实践,持续探索具身智能在自主实验室场景的落地应用。创新形成了“白天人工精细操作、夜间机器人自主补位”的人机协同工作模式,有效提升了科研设备利用率与实验室整体运转效率,让机器人能够深度扎根工业与科研实景场景,为科研工作带来新的助力。
源络科技工作人员对记者介绍,物理原生模型能够让机器人自主识别实验的上一步、预判下一步,识别周边物体摆放位置,梳理整套实验流程,真正像人一样自主做实验。这一模型的应用,将大大提高实验的效率和准确性,推动科研工作的进步。
具身智能数据采集技术的应用有哪些趋势呢?一位展商告诉记者,当前具身智能数据采集正从“单一路径依赖”走向“混合增强”。头部玩家普遍采用“仿真预训练 + 真实数据微调 + 遥操作兜底”的融合策略,充分发挥各种方法的优势,提高数据采集的质量和效率。同时,数据采集正从“人教机器”向“机器自主探索”演进,自监督学习和世界模型的引入,正在降低对人工标注的依赖,让机器能够更加自主地学习和探索世界。
普渡机器人具身智能产品线总经理吴翔对徽声在线记者表示,普渡已经通过规模化商业部署积累了大量真实运行数据。截至目前,每年产生超过5000万小时真实运行数据,年导航数据3650万小时,年操作数据1580万小时。这些真实数据为普渡机器人的性能提升和模型优化提供了有力支持。
“随着公司业务的持续增长和场景的不断拓展,每一台新增部署的机器人都意味着一个新的真实场景数据源。业务增长越快,新场景越多,数据回流越快,PuduFM的进化就越快,飞轮就转得越快。”吴翔表示。这意味着普渡机器人将通过不断积累数据,实现自身的快速发展和进化。
致同报告强调,国家层面持续推进高质量数据集建设,叠加大模型在多模态感知领域的突破,使得机器人“看懂”世界的能力呈指数级增长。但需要看到,这一进程具有明显的时间窗口属性:真实世界数据的采集效率、Sim - to - Real(仿真到现实)的迁移成功率,均可能对产业路径产生扰动。率先搭建私有高质量数据飞轮的企业,将抢占通用具身智能能力涌现的先发优势,在未来的市场竞争中占据有利地位。
(徽声在线记者 郭松峤)



