“四肢”灵活了,“大脑”仍饥饿,具身智能如何填补千万小时数据缺口?|WRC深度观察
2026-08-21 20:09:35未知 作者:徽声在线
徽声在线8月21日消息(记者郭松峤)在2026世界机器人大会(WRC)的现场,宇树科技创始人兼董事长王兴兴发表了关于人形机器人产业未来走向的深刻见解。他指出:“机器人本质上是由AI驱动的,而AI的进步高度依赖于数据的积累。数据量,尤其是高质量数据的量,直接决定了AI的能力边界。”这一观点揭示了数据在机器人技术发展中的核心地位。
当前,宇树科技正积极加大在机器人数据采集和模型训练方面的投入。一方面,他们利用海量的真人数据和互联网数据进行预训练,为机器人打下坚实的知识基础;另一方面,通过真实机器人运行数据的反馈,让机器人更好地适应和理解物理世界的复杂性。
徽声在线记者在WRC现场采访中了解到,具身智能机器人正从实验室的“炫技”阶段迈向工厂与家庭的“实干”阶段。尽管机器人的“四肢”已经越来越灵活,能够完成各种复杂动作,但其“大脑”却仍然面临着理解物理世界的大规模训练数据匮乏的严峻挑战。
在本届WRC上,与会企业不约而同地将目光聚焦在了同一个关键问题上——为具身智能构建坚实的数据底座。这已成为推动产业规模化落地的当务之急,也是机器人技术能否真正融入人类生活的关键所在。
京东云在本届大会上正式亮相了其具身智能数据生态能力展台,展示了其在数据采集和处理方面的强大实力。同时,优必选等公司也已落地规模化数据采集中心,为机器人提供源源不断的高质量数据。光轮智能更是在大会期间发布了全球首个十万小时级全模态人类行为开源数据集,为机器人学习人类行为提供了丰富的素材。
数据需求激增,行业面临百倍乃至千倍增长挑战
业界普遍认为,2026年将是具身智能从样机走向量产的关键转折点。这一年,机器人技术将迎来前所未有的发展机遇,同时也将面临巨大的挑战。
致同咨询发布的《具身智能机器人行业研究》报告指出,随着头部产品在宝马、比亚迪等产线的常态化实训,人形机器人正加速跨越从“实验室样机”到“产线生产力”的鸿沟。然而,这一进程并非一帆风顺,真实世界数据的采集效率与仿真到现实的迁移成功率,都可能成为制约产业发展的瓶颈。
事实上,数据缺口的庞大程度远超想象。光轮智能联合创始人兼总裁杨海波在接受徽声在线记者采访时表示,2026年将是具身智能数据规模化的元年。行业对数据的需求正从去年的几百、几千小时,跃升至今年的上百万小时,增幅达到百倍乃至千倍。这一变化对数据采集、处理和分析能力提出了极高的要求。
他进一步解释说,与拥有互联网数十年文本积累的大语言模型不同,具身智能面对的是非结构化的物理世界。这要求机器人不仅需要采集视觉信息,还需要获取力觉、触觉等多维度的交互信息,以更全面地理解周围环境。
记者了解到,目前行业内的共识是,实现可用的具身智能至少需要千万小时量级的多模态数据。然而,当前全球有效积累的数据量尚不足需求的5%,这无疑给机器人技术的发展带来了巨大的挑战。
如果说数据量的匮乏是显性危机,那么数据质的获取则更具难度。墨奇智能联合创始人兼CTO黄青虬在接受徽声在线等媒体采访时指出,当前数据采集设备普遍面临着精度与便携性的博弈。高精度的设备往往笨重不便携,而便携的设备又难以保证捕捉精度。这一矛盾给数据采集工作带来了极大的困扰。
行业突围:多路径并举,破解数据难题
面对海量数据缺口,行业正从多个方向突围。一方面,通过人类示范提供“教科书”式的数据,让机器人学习人类的行为模式;另一方面,利用仿真技术打造“练兵场”,让机器人在虚拟环境中进行大量训练,提高其实战能力。
光轮智能在大会期间发布的全球首个十万小时级全模态人类行为开源数据集EgoSuite-Open100K,就是这一思路的具体实践。该数据集覆盖了128类场景与超1.5万项任务,采用头、腕双视角采集精细操作与全身位姿信息,为机器人学习提供了丰富的素材。
杨海波对记者表示,当前具身智能迫切需要高质量、多样性、大规模的数据供给。然而,行业在采集口径、标注规范、数据格式和时序组织上存在差异,导致不同设备产生的数据难以组合复用。EgoSuite-Open100K的开放,旨在让更多开发者以统一、可复用的数据基础开展模型研究,构建开放繁荣的机器人持续学习生态。
在开放生态建设方面,光轮智能还推出了5年100亿具身智能数据共建计划。该计划包括三项核心工作:一是开放数据标准,统一不同采集设备的数据模态、标注、时序、格式和质量标准;二是评测驱动的数据闭环,从模型失败中定位数据需求,定向生成和补采数据;三是数据与模型协同设计,共同优化仿真数据、第一视角人类数据、遥操作数据与评测数据等的组合方式。
优必选则展示了另一条技术路线——自研全栈式技术体系。其自主研发的基座大模型Thinker,以“小参数、高性能、全开源”为特点,突破了行业技术瓶颈。该模型重点提升了机器人第一视角下的场景认知与任务规划能力,以及支撑物理交互的精准感知与空间理解能力。
聚焦高端科研工业赛道的源络科技同样值得关注。其现场展示的Monte02机器人完整展示了长序列移液、微孔板自主转运、移液枪吸头装退等一系列标准化实验操作。这得益于源络科技依托此前在国家级平台的落地实践,持续探索具身智能在自主实验室场景的落地应用。
据了解,源络科技创新形成了“白天人工精细操作、夜间机器人自主补位”的人机协同工作模式。这种模式有效提升了科研设备利用率与实验室整体运转效率,让机器人深度扎根工业与科研实景场景。源络科技工作人员对记者介绍,其物理原生模型能够让机器人自主识别实验的上一步、预判下一步,识别周边物体摆放位置,梳理整套实验流程,真正像人一样自主做实验。
具身智能数据采集技术的应用有哪些趋势?一位展商告诉记者,当前具身智能数据采集正从“单一路径依赖”走向“混合增强”。头部玩家普遍采用“仿真预训练+真实数据微调+遥操作兜底”的融合策略,以提高数据采集的效率和准确性。同时,数据采集正从“人教机器”向“机器自主探索”演进,自监督学习和世界模型的引入正在降低对人工标注的依赖。
普渡机器人具身智能产品线总经理吴翔对徽声在线记者表示,普渡已经通过规模化商业部署积累了大量真实运行数据。截至目前,每年产生超过5000万小时真实运行数据,年导航数据3650万小时,年操作数据1580万小时。这些数据为普渡机器人的持续优化和升级提供了有力支持。
“随着公司业务的持续增长和场景的不断拓展,每一台新增部署的机器人都意味着一个新的真实场景数据源。业务增长越快,新场景越多,数据回流越快,PuduFM的进化就越快,飞轮就转得越快。”吴翔表示。这充分说明了数据在机器人技术发展中的重要作用。
致同报告强调,国家层面持续推进高质量数据集建设,叠加大模型在多模态感知领域的突破,使得机器人“看懂”世界的能力呈指数级增长。然而,这一进程具有明显的时间窗口属性:真实世界数据的采集效率、Sim-to-Real(仿真到现实)的迁移成功率,均可能对产业路径产生扰动。因此,率先搭建私有高质量数据飞轮的企业将抢占通用具身智能能力涌现的先发优势。
(徽声在线记者 郭松峤)


