今天看啥  ›  专栏  ›  AI思想会

机器人控制性能跃迁!具身Test-Time Scaling Law来了,从合成数据到低延迟部署全攻略

AI思想会  · 公众号  · AI  · 2025-10-29 18:15
    

主要观点总结

文章介绍了研究团队在RoboMonkey项目中关于Vision-Language-Action(VLA)模型的研究进展。研究团队发现,在推理阶段采用“生成-验证”范式增加计算量可以显著提升VLA模型的泛化能力与可靠性。文章详细描述了研究团队如何通过实验验证具身Test-Time Scaling Law,并探讨了验证器训练、合成数据扩展和高效推理部署等核心问题。此外,文章还介绍了研究的背景、方法、实验结果和总结。

关键观点总结

关键观点1: 研究团队提出了具身Test-Time Scaling Law,并通过实验证明在多个VLA模型中,动作误差与采样数量之间呈现幂律关系。

研究团队通过大量实验发现,在推理阶段增加候选动作的生成数量时,VLA的动作误差会持续下降。这一发现揭示了动作验证器的重要性,并推动了通用机器人模型更稳健的落地路径。

关键观点2: 研究团队提出了可扩展的验证器训练流程,并基于此训练了VLM动作验证器。

为了提升VLA的稳定性,研究团队利用机器人数据集训练了动作验证器。他们首先通过VLA为每个状态采样候选动作,并构建合成偏好数据来微调基于VLM的动作验证器。该验证器的训练损失函数遵循Bradley-Terry模型,并在此基础上加入了对偏好强度的修正项。

关键观点3: 研究验证了Test-Time Scaling的有效性,并证明了所提出的test-time scaling框架能够在无需重新训练VLA的前提下显著增强VLA模型的表现。

实验结果表明,将VLA模型与RoboMonkey结合可以带来显著性能提升,在真实世界的out-of-distribution tasks上提升25%,在in-distribution SIMPLER环境上提升9%,在LIBERO-Long benchmark上提升7%。此外,扩展合成数据集规模对验证器性能有显著提升作用。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照