专栏名称: 新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  新智元

20个样本,搞定多模态思维链!UCSC重磅开源:边画框,边思考

新智元  · 公众号  · AI  · 2025-06-18 16:50
    

主要观点总结

新智元报道,加州大学圣克鲁斯分校研究人员提出GRIT模型,实现多模态大语言模型的图像思维。GRIT能让模型通过生成自然语言和图像框坐标结合的推理链进行图像思维,仅需要20个训练样本即可实现优越性能。GRIT采用的Grounded Reasoning范式,具备高关联和轻量级的特性,建立在多模态大语言模型的视觉定位与语言推理能力之上。该模型可以边写自然语言边在需要时插入框坐标,实现思路和证据同步。通过GRPO-GR训练,模型在极小的数据量下就学会画框来辅助推理。该模型可以在推理链里插入框坐标,直接画出推理的依据。尽管面临跨域推理的挑战,但随着数据规模的增加,模型的准确率逐步提高。

关键观点总结

关键观点1: GRIT模型能够让多模态大语言模型实现图像思维。

通过生成自然语言和图像框坐标结合的推理链,让模型能够条理清晰的思考,并将推理过程落到画面上。

关键观点2: GRIT模型的高关联和轻量级特性。

模型可以在思考链里随时插入框坐标,实现真正的「图像思维」。采用Grounded Reasoning范式,建立在多模态大语言模型的视觉定位与语言推理能力之上。其训练方法GRPO-GR具备三重奖励,实现零人工标注,仅用少量图像与问答的训练数据就能教会模型画框+推理。

关键观点3: GRIT模型的训练方法和效果。

通过GRPO-GR训练,模型在推理结果的准确性上相对于基线模型有明显提高。即使只使用20个样本进行训练,模型也能表现出优秀的性能。

关键观点4: GRIT模型面临的挑战和未来的发展方向。

尽管模型在数据规模增加时能够进一步提高准确率,但跨领域泛化仍是难点。未来需要更丰富、更异质的训练数据。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照