专栏名称: 新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  新智元

视频模型假装在推理?MME-CoF新基准评估12个推理维度

新智元  · 公众号  · AI  · 2025-11-07 19:36
    

主要观点总结

新智元报道,视频生成模型如Veo-3虽然能生成逼真视频,但其推理能力存疑。香港中文大学、北京大学、东北大学的研究者开展了实证研究,全面评估以Veo-3为代表的视频模型在零样本场景下的推理潜力。研究发现,视频模型存在局限性,尚不具备独立推理能力,更像是“演”推理。这项研究为社区提供了深刻的洞察和清晰的评估基准。

关键观点总结

关键观点1: 视频生成模型的现状和发展趋势

近年来,以Veo、Sora为代表的视频生成模型已经能够合成高度逼真且连贯的视频,表明它们可能成功编码了大量世界知识。谷歌的最新研究指出,这类模型正展示出了“涌现能力”,如感知、建模和推理等。

关键观点2: 视频模型的推理能力评估问题

虽然视频生成模型表现出强大的生成能力,但它们的推理能力仍然存在疑问。为了回答这个问题,来自香港中文大学、北京大学、东北大学的研究者们开展了实证研究,全面评估了以Veo-3为代表的视频模型在零样本场景下的推理潜力。

关键观点3: MME-CoF基准的建立

基于以上实证研究,研究团队建立了MME-CoF基准,这是一个专门用于量化视频模型推理潜力的基准,涵盖了12个大类、共59个精心设计条目。这个基准通过巧妙的提示设计,将抽象推理问题转化为具体「视频生成任务」,以便更好地评估模型的CoF推理过程。

关键观点4: 视频模型的局限性

研究发现,当前视频模型尚不具备独立推理能力,更像是在“演”推理。它们更注重视觉合理性,而非逻辑严谨性。此外,研究还发现视频模型在多个维度上存在的局限性,如真实世界空间推理、物理推理、视觉追踪推理等。

关键观点5: 未来研究方向

虽然当前视频模型存在局限性,但它们在未来有望成为强大的「互补视觉引擎」,与推理模型协同工作。这项研究为社区提供了深刻的洞察和清晰的评估基准,揭示了当前视频模型在迈向真正「通用视觉模型」道路上的重要障碍。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照