专栏名称: 新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  新智元

LeCun预言成真!790年长视频,炼出最强开源「世界模型」

新智元  · 公众号  · AI  · 2025-11-03 12:30
    

主要观点总结

北京智源研究院发布了多模态世界模型Emu3.5,它采用统一的自回归架构,通过学习蕴含了长时程、高一致性等世界知识的长视频数据,实现了对多模态世界的原生理解与生成。模型通过大规模预训练和大规模多模态强化学习,实现了Scalings的第三种范式。同时,它具有出色的生成和编辑能力,能够理解高层语义、数字和空间,并展现出强大的视觉叙事、视觉指导、世界探索和具身操作能力。智源研究院以开放的姿态邀请全球社区共同探索这一新的技术路径。

关键观点总结

关键观点1: 多模态世界模型Emu3.5的发布

北京智源研究院发布了其悟界·Emu系列的最新成果——Emu3.5,这是一个多模态世界模型,具有强大的生成和编辑能力。

关键观点2: Emu3.5的技术特点

Emu3.5采用统一的自回归架构,能够像人一样从连续、长时程的视觉经验中学习,用统一的自回归架构实现了对多模态世界的原生理解与生成。

关键观点3: Emu3.5的数据来源

Emu3.5的学习数据主要是来自互联网的长视频,这些数据包含了丰富的时空连续性、因果逻辑和上下文一致性,是理解世界模型的绝佳养料。

关键观点4: 第三种Scaling范式的实践

通过大规模预训练和大规模多模态强化学习,Emu3.5实现了继语言模型预训练、后训练之后的「第三种Scaling范式」。随着模型参数、视频数据和算力的增加,多模态世界模型的能力将持续提升。

关键观点5: Emu3.5的出色表现

Emu3.5在图像生成、编辑、高层语义理解、数字与空间理解、视角变换等方面都表现出了出色的能力,甚至在视觉叙事、视觉指导、世界探索和具身操作等任务上的表现超越了其他生成模型。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照