“四肢”灵活“大脑”饥饿,具身智能如何填补千万小时数据缺口?|WRC深度观察

2026-08-21 19:07:13未知 作者:徽声在线

徽声在线8月21日消息(记者李明轩)在机器人技术迅猛发展的当下,一个核心问题逐渐凸显:机器人虽拥有灵活的“四肢”,但其“大脑”却因缺乏足够的训练数据而显得“饥饿”。在2026世界机器人大会(WRC)上,宇树科技创始人兼董事长王兴兴深入剖析了人形机器人产业的发展路径,他强调:“机器人本质上由AI驱动,而AI的进步高度依赖于数据。数据量,尤其是高质量数据的量,直接决定了AI的能力边界。”

当前,宇树科技正加大在机器人数据采集和模型训练上的投入。一方面,他们利用海量的真人数据和互联网数据进行预训练,为机器人打下坚实的知识基础;另一方面,通过真实机器人的运行数据,让机器人更好地适应和交互于物理世界,实现从理论到实践的跨越。

徽声在线记者在WRC现场采访时发现,具身智能正从实验室的“炫技”阶段迈向工厂与家庭的“实干”领域。尽管机器人的“四肢”已经越来越灵活,但其“大脑”却仍面临着理解物理世界的大规模训练数据匮乏的严峻挑战。

在此次大会上,与会企业不约而同地将目光聚焦在了同一个关键议题上——为具身智能构建坚实的数据底座,这已成为推动产业规模化落地的当务之急。

本届WRC上,京东云具身智能数据生态能力展台惊艳亮相,优必选等公司也已建立了规模化数据采集中心。更引人注目的是,光轮智能在大会期间发布了全球首个十万小时级全模态人类行为开源数据集,为具身智能的发展注入了新的活力。

数据需求激增,行业面临百倍乃至千倍增长挑战

业界普遍认为,2026年将是具身智能从样机走向量产的关键转折点。

致同发布的《【致同咨询行业洞察】具身智能机器人行业研究》报告指出,随着头部产品在宝马、比亚迪等产线上的常态化实训,人形机器人正加速跨越从“实验室样机”到“产线生产力”的鸿沟,展现出巨大的商业潜力。

然而,《报告》也警示称,这一进程具有明显的时间窗口属性。真实世界数据的采集效率以及仿真到现实的迁移成功率,都可能对产业路径产生重大影响,甚至决定产业的成败。

事实上,数据缺口的严重性远超想象。

光轮智能联合创始人兼总裁杨海波在接受徽声在线记者采访时透露,2026年将是具身智能数据规模化的元年。行业对数据的需求正从去年的几百、几千小时,猛增至今年的上百万小时,增幅达到了百倍乃至千倍,这对数据采集和处理能力提出了前所未有的挑战。

他进一步解释说,与拥有互联网数十年文本积累的大语言模型不同,具身智能面对的是复杂多变的非结构化物理世界,需要采集视觉、力觉、触觉等多维度的交互信息,这对数据采集和处理技术提出了更高的要求。

记者了解到,目前行业内的共识是,实现可用的具身智能至少需要千万小时量级的多模态数据。然而,当前全球的有效积累尚不足需求的5%,数据缺口之大可见一斑。

如果说数据量的匮乏是显性的危机,那么数据质的获取则更具挑战性。

墨奇智能联合创始人兼CTO黄青虬在接受徽声在线等媒体采访时指出,当前数据采集设备普遍面临着精度与便携性的矛盾。高精度的设备往往笨重不便携,而便携的设备又难以保证捕捉的精度,这给数据采集工作带来了极大的困扰。

行业积极突围,探索数据采集与处理新路径

面对海量数据缺口,行业正从多个方向积极突围。一方面,通过人类示范为机器人提供“教科书”般的指导;另一方面,利用仿真技术为机器人打造“练兵场”,进行预训练和测试。

光轮智能在大会期间发布的全球首个十万小时级全模态人类行为开源数据集EgoSuite-Open100K,就是这一探索的重要成果。该数据集覆盖了128类场景和超1.5万项任务,采用头、腕双视角采集精细操作和全身位姿信息,为具身智能的研究提供了丰富的数据资源。

杨海波对记者表示,当前具身智能迫切需要高质量、多样性和大规模的数据供给。然而,行业在采集口径、标注规范、数据格式和时序组织上存在差异,导致不同设备产生的数据难以组合复用。EgoSuite-Open100K的开放,旨在让更多开发者能够在统一、可复用的数据基础上开展模型研究,共同构建开放繁荣的机器人持续学习生态。

在开放生态建设方面,光轮智能还推出了5年100亿具身智能数据共建计划。杨海波介绍了三项核心工作:一是开放数据标准,统一不同采集设备的数据模态、标注、时序、格式和质量标准;二是建立评测驱动的数据闭环,从模型失败中定位数据需求,定向生成和补采数据;三是实现数据与模型的协同设计,共同优化仿真数据、第一视角人类数据、遥操作数据和评测数据等的组合方式。

优必选则展示了另一条技术路线——自研全栈式技术体系。其自主研发的基座大模型Thinker,以“小参数、高性能、全开源”的特点突破了行业技术瓶颈,重点提升了机器人第一视角下的场景认知与任务规划能力,以及支撑物理交互的精准感知与空间理解能力。

聚焦高端科研工业赛道的源络科技同样值得关注。其现场展示的Monte02机器人完整演示了长序列移液、微孔板自主转运、移液枪吸头装退等一系列标准化实验操作,展现了具身智能在科研领域的巨大潜力。

据了解,源络科技依托此前在国家级平台的落地实践,持续探索具身智能在自主实验室场景的落地应用。他们创新形成了“白天人工精细操作、夜间机器人自主补位”的人机协同工作模式,有效提升了科研设备利用率和实验室整体运转效率,让机器人深度扎根于工业与科研实景场景。

源络科技工作人员对记者介绍说,他们的物理原生模型能够让机器人自主识别实验的上一步、预判下一步,识别周边物体摆放位置,梳理整套实验流程,真正像人一样自主做实验,这为科研领域的自动化和智能化提供了新的可能。

具身智能数据采集技术的应用有哪些新趋势?一位展商告诉记者,当前具身智能数据采集正从“单一路径依赖”走向“混合增强”。头部玩家普遍采用“仿真预训练+真实数据微调+遥操作兜底”的融合策略,以提高数据采集和处理的效率和准确性。同时,数据采集正从“人教机器”向“机器自主探索”演进,自监督学习和世界模型的引入正在降低对人工标注的依赖,推动具身智能向更高水平发展。

普渡机器人具身智能产品线总经理吴翔对徽声在线记者表示,普渡已经通过规模化商业部署积累了大量真实运行数据。截至目前,每年产生超过5000万小时真实运行数据,年导航数据3650万小时,年操作数据1580万小时。这些数据为普渡机器人的持续优化和升级提供了有力支撑。

“随着公司业务的持续增长和场景的不断拓展,每一台新增部署的机器人都意味着一个新的真实场景数据源。业务增长越快,新场景越多,数据回流越快,PuduFM的进化就越快,形成良性循环。”吴翔表示。

致同报告强调,国家层面持续推进高质量数据集建设,叠加大模型在多模态感知领域的突破,使得机器人“看懂”世界的能力呈指数级增长。然而,这一进程具有明显的时间窗口属性:真实世界数据的采集效率和Sim-to-Real(仿真到现实)的迁移成功率都可能对产业路径产生扰动。因此,率先搭建私有高质量数据飞轮的企业将抢占通用具身智能能力涌现的先发优势,引领行业未来发展。

(徽声在线记者 李明轩)

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
机器人产业迈向规模化,产业链协同成关键|WRC 2026深度观察机器人产业迈向规模化,产业链协同成关键|WRC 2026深度观察 韦东奕B站账号更新引关注,上架数学练习册受热捧韦东奕B站账号更新引关注,上架数学练习册受热捧 比特币突破74000美元 加密货币市场全面走强比特币突破74000美元 加密货币市场全面走强 车展直击丨风云T7开启全球攻势 奇瑞李学用:原生全球化是破局关键车展直击丨风云T7开启全球攻势 奇瑞李学用:原生全球化是破局关键 车展聚焦丨深蓝G318携双智驾方案亮相 深蓝汽车冲刺百万销量目标车展聚焦丨深蓝G318携双智驾方案亮相 深蓝汽车冲刺百万销量目标 车展聚焦丨“全国畅行”!全新梅赛德斯-奔驰长轴距GLE SUV全球首发车展聚焦丨“全国畅行”!全新梅赛德斯-奔驰长轴距GLE SUV全球首发