前苹果AI核心架构师领衔:RoboScience以物体轨迹突破具身智能瓶颈
2026-06-30 18:05:14未知 作者:徽声在线
徽声在线记者 | 陆柯言(化名)
徽声在线编辑 | 刘方远(化名)
在具身智能技术发展的关键节点,行业关于未来技术路径的探索迎来全新突破。一家新兴科技企业通过架构创新,为具身大模型的落地提供了差异化解决方案。
2024年6月下旬,具身智能领域迎来重要里程碑。RoboScience机器科学正式发布通用具身大模型Visics及其核心技术架构VLOA(Vision-Language-Object-Action视觉-语言-物体轨迹-行动四维架构)。在发布会现场,该公司通过机器人自主完成宜家家具拼装、动态修复拆解部件等复杂操作,验证了模型在三维空间中的轨迹预测与任务执行能力,这项突破被业界视为具身智能从实验室走向产业化的重要信号。
这家成立于2024年末的科技新锐,由前苹果AI Platform核心架构师田野与新加坡国立大学人工智能实验室负责人邵林教授联合创立。据公开融资信息显示,公司已完成总额超15亿元的多轮融资,其中2024年5月的A轮融资即达10亿元,投资阵容涵盖零一创投、京东战略投资部、招商局创投等产业资本,以及商汤国香资本、普华资本等财务投资者,累计融资规模在具身智能赛道位居前列。
当前具身智能领域存在两大技术流派:以波士顿动力为代表的VLA(Vision-Language-Action视觉-语言-动作)路线,通过海量人类示教数据训练机器人模仿动作,该方案虽能直接理解自然语言指令,但存在硬件绑定性强、跨场景迁移成本高等缺陷;另一派系的世界模型路线,则试图通过构建物理世界模拟器预演动作后果,虽然理论上具备更强泛化能力,却面临训练数据获取难、工程实现复杂度高等挑战。
RoboScience提出的VLOA架构创造性地在视觉-语言与动作执行之间引入「物体轨迹」维度。技术白皮书显示,该架构通过连续3D点云轨迹建模,将物体在三维空间中的形态变化转化为可计算的数字特征,相当于为具身智能系统创建了统一的「空间语言」。这种设计使模型训练与具体机器人硬件解耦,理论上可适配任何构型的机械臂或人形机器人。
公司CTO田野在技术解读中强调:「具身智能的通用性需要同时解决任务多样性、物体属性和机器人构型三个维度的挑战。VLOA架构中的物体轨迹相当于智能体的空间记忆,就像大语言模型中的Token机制,为不同场景下的动作生成提供统一坐标系。」
Visics大模型采用双引擎架构:具身世界模型负责根据视觉输入和语言指令推演物体运动轨迹,通用操作模型则将轨迹数据转化为具体机器人的控制指令。这种设计使系统既能理解「把红色方块移动到蓝色圆盘右侧」这类抽象指令,又能生成不同品牌机械臂可执行的微秒级控制信号。技术验证显示,该模型在跨机器人平台的任务迁移效率较传统方案提升3-5倍。
数据获取难题始终困扰具身智能发展。据RoboScience执行总裁汪涛披露,行业现有真机采集方案存在明显瓶颈:单条数据采集成本约2-5元,熟练工人日均采集量不足300条,全行业月产能仅万条级别。更严峻的是,实验室环境采集的数据与真实工业场景存在显著分布差异,导致模型在实际部署时泛化能力下降40%以上。
针对这一痛点,RoboScience构建了「仿真-真实」双阶段数据引擎。在预训练阶段,系统通过解析互联网上的2000万小时操作视频,结合自研的RoboMirage物理仿真引擎生成十亿级轨迹数据。这种虚拟数据生成方式使单条数据成本降至0.03-0.15元,仅为传统方案的1/20至1/200。进入场景适配阶段后,系统再通过少量真机数据优化模型在边缘场景的表现,形成「大数据基础能力+小样本场景微调」的训练范式。
发布会现场演示的机器人系统展现了惊人的环境适应能力:在完成宜家书架拼装任务时,当实验人员故意拆除已装配的隔板,机器人能自动识别结构变化并重新规划装配路径;在精细操作测试中,系统成功完成打领带、立硬币、抓取薯片等需要毫米级精度的任务,其中打领带动作完全基于仿真数据训练实现,验证了虚拟数据的有效性。
对于行业关注的商业化节奏,田野提出「通用基座+场景验证」的双轮驱动战略。不同于多数企业选择垂直场景深耕的策略,RoboScience优先构建具备跨场景能力的基座模型,再通过物流分拣、商超补货等标准化场景验证技术可行性。这种路径虽然需要更大的前期投入,但能避免陷入「小数据过拟合」的技术陷阱,为后续拓展工业检修、医疗护理等复杂场景奠定基础。
在硬件协同方面,公司正在研发新一代六轴机械臂,其关节模组采用模块化设计,可与VLOA架构深度适配。这种软硬一体化的研发模式,使机器人本体能根据场景需求动态调整自由度配置,在3C装配场景使用4自由度轻量化臂,在汽车焊接场景则切换为6自由度重型臂,显著提升设备利用率。
商业化路径上,RoboScience已形成三级盈利体系:基础层通过License模式向机器人厂商输出视觉-语言-轨迹算法包,目前已与5家头部企业达成合作;中间层提供搭载Visics模型的域控制器,可兼容主流工业机械臂协议;顶层则推出自研机器人本体,构建「算法-硬件-数据」的闭环生态。据内部测算,当年度出货量突破5000台时,硬件毛利率可达35%,软件授权收入占比将超过40%。
汪涛透露,公司已与顺丰科技、永辉超市等企业建立联合实验室,重点攻关物流场景的轨迹规划算法。在零售场景测试中,搭载Visics系统的机械臂分拣效率较传统方案提升60%,能耗降低32%。对于盈利时间表,他表示:「当年度部署量超过10万台时,硬件成本可下降至行业平均水平的60%,届时将迎来规模化盈利拐点。」
随着8月自研机器人本体的正式发布,RoboScience将面临真正的技术大考。其VLOA架构能否在动态工业环境中保持95%以上的任务成功率,物体轨迹预测的误差率能否控制在3毫米以内,这些指标将决定这家科技新锐能否在具身智能赛道建立技术壁垒。据知情人士透露,公司已启动B轮融资,目标募资20亿元用于扩大仿真数据规模和自建机器人产线,这场技术豪赌的最终成果,或将重新定义具身智能的产业化路径。
