今天看啥  ›  专栏  ›  机器之心

RewardMap: 通过多阶段强化学习解决细粒度视觉推理的Sparse Reward

机器之心  · 公众号  · AI  · 2025-10-21 11:40
    

主要观点总结

本研究由西湖大学ENCODE Lab牵头,联合其他三所大学共同完成。团队在大模型强化学习与多模态推理方向有深厚研究基础。针对大语言模型和多模态大模型在真实场景如图看懂图中的问题和挑战,该团队首次揭示了问题的核心所在并提出了RewardMap解决框架。该框架旨在解决在高分辨率地铁图等真实场景下的视觉理解和空间推理难题,具有解决细粒度奖励稀疏和多阶段课程学习问题。此外,团队还构建了ReasonMap-Plus数据集,用于提供更细密的监督与可拆解的目标。RewardMap框架通过难度感知的细节奖励和多阶段强化学习来解决奖励稀疏问题,并在多个基准测试中表现优异。未来展望中,RewardMap的价值不仅在于刷榜,更在于为高分辨率、强结构的视觉任务提供一套可复用的强化学习范式。

关键观点总结

关键观点1: 研究团队由西湖大学ENCODE Lab牵头,联合其他三所大学共同组成,具有深厚的大模型强化学习与多模态推理研究基础。

该团队面临的核心挑战是解决大语言模型和多模态大模型在真实场景如图看懂图中的问题和挑战。

关键观点2: 首次揭示了问题的核心所在并提出了RewardMap解决框架。

RewardMap旨在解决高分辨率地铁图等真实场景下的视觉理解和空间推理难题,特别是解决细粒度奖励稀疏和多阶段课程学习问题。

关键观点3: 构建了ReasonMap-Plus数据集。

该数据集用于提供更细密的监督与可拆解的目标,覆盖30座城市和4018个问题样本。

关键观点4: RewardMap框架通过难度感知的细节奖励和多阶段强化学习来解决奖励稀疏问题。

该框架在多基准测试中表现优异,并且在空间推理、细粒度视觉和通用视觉问答三大类别上均取得一致提升。

关键观点5: 未来展望中,RewardMap的价值不仅在于刷榜。

它也为高分辨率、强结构的视觉任务提供一套可复用的强化学习范式,并将地图数据作为真实数据应用于多模态大模型的训练中,提升其通用能力。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照