超越通用具身模型崇拜:异构策略编排引领具身智能新方向
2026-08-04 02:23:26未知 作者:徽声在线
在机器人控制领域,VLA、WAM、RL、TAMP、MPC等多样化策略正各自展现其独特优势。然而,如何精准界定这些策略的能力范围,并在恰当的时机为不同子任务匹配最适宜的策略,已成为机器人完成复杂且长时序任务的核心挑战。
- 论文标题:RoboHarness: 基于记忆驱动的异构机器人策略编排,实现长时序规划
- 项目主页:https://robo-harness.com
- 论文链接: https://arxiv.org/abs/2607.18060
当前,具身智能领域正经历着一场模型能力的激烈竞赛:VLA在模型规模扩展上不断突破,WAM致力于弥合未来预测与动作生成之间的鸿沟,RL通过精细的奖励设计来强化执行稳定性,而TAMP则凭借其严密的逻辑推理能力进行长序规划…
每种策略都在其擅长的领域内展现出独特优势,但真实世界的复杂性往往要求机器人同时具备高度的语义理解、闭环控制、几何精度以及长时序推理能力,这远远超出了单一控制策略所能覆盖的范围。因此,对于“通用具身模型”的追求,虽然令人向往,但道路依然漫长且充满挑战。
RoboHarness:摒弃最强模型幻想,聚焦最合适策略选择。
为何需要异构策略编排?
与其坐等未来某个通用模型能够解决所有问题,不如思考如何协同利用现有的控制策略,以应对当前挑战。毕竟,协同的力量往往大于个体之和。
回顾具身智能技术的发展历程,我们可以看到VLA在视觉语义理解与开放词汇指令方面的卓越表现,RL在特定分布内的稳定闭环行为,TAMP在逻辑与几何规划方面的专长,以及WAM通过预测未来来辅助决策的能力…这些策略的能力并非相互排斥,而是在某些方面高度互补。
既然单一策略难以满足复杂任务的所有需求,那么为何不让异构策略携手合作,在不同阶段发挥各自所长呢?
从模型竞争到异构策略编排的转变
RoboHarness主要致力于解决异构策略协同中的两大关键难题:一是如何选择最适合当前任务的策略;二是如何确保异构策略之间的平稳交接。它将VLA、RL、TAMP等控制策略封装为可调用的技能,由coding agent负责高层任务拆解及子任务路由。在相邻异构策略状态分布不兼容时,系统能够生成桥接轨迹,确保任务连续进行。值得注意的是,该系统无需底层策略共享结构、动作空间或训练数据,也无需进行联合训练,即可轻松接入新的底层控制策略,如WAM、VLN或MPC等。
图 1|RoboHarness总体架构概览。
RoboHarness提供三类结构化辅助技能:Understanding Skills通过调用一系列分析技能,从原始输入中提取更丰富的信息以辅助决策;Memory Skills则检索相关的历史执行经验,显式重建下一控制策略熟悉的状态分布,并据此引导机器人进入该分布,实现不同策略之间的稳定交接;Evolution Skills则利用在线反馈来更新策略元数据、参数与Harness逻辑,确保系统持续优化。
第一步:动态识别策略的能力边界
策略的能力边界并非一成不变,而是受到多种因素的影响。例如,VLA在原始相机位姿下能够稳定执行的任务,在输入图片质量下降后可能会失败。因此,系统需要能够判断在当前场景、观测质量和机器人状态下,哪个控制策略最有可能成功。RoboHarness利用Understanding Skills从原始输入中深入获取更丰富的信息(如语义相似度、位姿不确定性、图像曝光等多维指标),以刻画控制策略的能力边界,从而辅助高层执行策略的选择。
图 2|不同扰动下的策略调用比例及VLA独立成功率与调用比例之间的关系。
表 1|LIBERO与LIBERO-Plus成功率对比(%),RoboHarness集成了pi0.5和TAMP两种底层策略
在LIBERO-Plus的多类扰动测试中,RoboHarness能够根据底层策略的实际可靠性动态调整调用比例。当VLA表现稳定时,系统更倾向于调用它;而当机器人状态、语言或感知条件超出其能力边界时,则更多地将任务路由至TAMP。通过多策略协作,RoboHarness在LIBERO-Plus上取得了93.2%的平均成功率,显著高于其他现有方法。
第二步:解决异构策略之间的“交接断层”问题
在异构策略协同工作中,两个策略之间常常存在“交接断层”问题。由于各控制策略独立设计,前一策略结束的位置可能恰好是后一策略从未见过、无法稳定启动的状态。为了解决这一问题,Memory Bridge根据下一子任务和当前观测从多模态记忆中检索下一目标策略的成功轨迹,提取末端位姿和关节状态,并在线拟合“机器人状态—执行进程”的空间分布,显式重建下一控制策略熟悉的状态分布。系统随后综合分布内置信度与运动代价选择目标状态,生成桥接轨迹,再将控制权交给下一策略。
图 3|Memory Bridge构造通路示意图。
长时序任务凸显单一模型的能力局限
长时序任务是检验单一策略能力壁垒的有效试金石。在约为原始LIBERO四倍长度的LIBERO-LoHo上进行的零样本测试中,π0.5的完整成功率仅6.4%;即使通过世界模型(H-WM)、LLM(LLM-guided)或规划语言(Logic-guided)分层拆解任务后再交由VLA执行,完整成功率最高也仅为64.8%。这充分证明了单一模型始终难以突破现有的能力壁垒。而RoboHarness通过协同调用多种底层控制策略并确保稳定交接,将完整成功率提升至95.2%,展现了其卓越的性能。
表 2|LIBERO-LoHo零样本长时序评估结果。RoboHarness集成了三种底层策略:pi0.5、经RL训练的OpenVLA和TAMP。各项结果为任务进度/完整成功率(%)。
准确刻画能力边界与实现策略间稳定交接,二者相辅相成
缺一不可,共同构成异构策略编排的基石
消融实验表明,协同并非简单地将模型串联起来。如果缺少Understanding Skills,系统将因无法准确理解各底层策略的能力边界而出现任务分解和路由错误;如果移除Memory Bridge,即使选对了策略,也可能因交接状态不兼容而失败;而如果缺少Evolution Skills,系统则难以根据执行反馈修正能力判断并在线更新各策略的能力边界。因此,理解、适应与交接三者缺一不可,共同构成了异构策略编排的稳固基石。
图 4|消融实验结果:理解、进化与Memory Bridge分别解决错误分解、能力估计失准和策略交接失败问题。
具身智能的竞争焦点
正从模型层面转向系统层面
虽然“通用具身模型”仍是所有具身智能研究者的终极目标,但在追逐这一目标的漫长道路上,机器人必须正视每种策略的能力边界、输入依赖以及分布外脆弱性。异构策略编排提供了一条现实可行的路径:它不要求单一模型立即掌握所有能力,而是让系统理解不同策略在何时可靠、如何分工以及如何交接。这样,机器人就能在复杂多变的环境中更加灵活、高效地完成任务。
随着RoboHarness不断积累跨策略、长时序数据,这些数据将为未来统一具身模型的训练提供宝贵的反哺资源。
因此,RoboHarness并非通用模型的对立面,而是具身智能从模型能力走向系统能力的必经之路。


