专栏名称: 专知
专知,为人工智能从业者服务,提供专业可信的人工智能知识与技术服务,让认知协作更快更好!
TodayRss-海外RSS稳定源
目录
相关文章推荐
今天看啥  ›  专栏  ›  专知

【NeurIPS 2025】以语言为中心的全模态表征学习的可扩展性研究

专知  · 公众号  ·  · 2025-10-15 11:00
    

主要观点总结

本文探讨了多模态大语言模型(MLLMs)结合对比学习(CL)进行微调的多模态嵌入方法的优越性,指出其源于生成式预训练过程中隐式形成的跨模态对齐。通过实证分析,文章证实了MLLM表征内部存在潜在对齐关系,并基于此提出了一种以语言为中心的全模态嵌入框架(LCO-EMB),在多种主干网络与基准任务上取得了当前最先进的表现。文章还揭示了生成–表征缩放定律(GRSL),建立了MLLM的生成质量与表征性能之间的联系,并在低资源视觉文档检索任务上验证了相关理论。

关键观点总结

关键观点1: 多模态大语言模型结合对比学习的优越性

文章探讨了多模态大语言模型结合对比学习进行微调的方法,并指出其表现出的优越性源于生成式预训练过程中的跨模态对齐。

关键观点2: LCO-EMB框架的提出与应用

基于跨模态对齐的洞见,文章提出了一种以语言为中心的全模态嵌入框架(LCO-EMB),并在多种任务上取得了当前最先进的表现。

关键观点3: 生成–表征缩放定律(GRSL)的揭示

文章揭示了生成–表征缩放定律(GRSL),该定律表明模型的生成能力与表征质量之间存在正相关关系,并进行了理论解释和实证分析。

关键观点4: 在低资源视觉文档检索任务上的验证

文章在一个挑战性的低资源视觉文档检索任务上验证了相关理论,结果显示持续开展生成式预训练能够进一步释放模型的嵌入潜力。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照