主要观点总结
SEED-Story是一个多模态长篇故事生成系统,由MLLM驱动,可以从用户提供的图片和文本开始生成故事。它包括三个阶段的训练过程,旨在生成丰富、连贯且多模态的故事。故事可以跨越多达25个序列,尽管在训练期间仅使用最多10个序列。本文还介绍了其使用的注意力机制以及数据集和实验评估。
关键观点总结
关键观点1: 系统概述
SEED-Story能够从用户提供的图片和文本开始生成多模态长篇故事,且模型、代码与数据都已开源。
关键观点2: 训练过程
SEED-Story的训练过程包括三个阶段:预训练去标记化器、训练MLLM以及调整SD-XL增强生成图片中的角色和风格一致性。
关键观点3: 注意力机制
SEED-Story在多模态故事生成中使用了多种注意力机制,包括密集型注意力图、窗口型注意力和多模态注意力汇聚,这有助于模型生成比训练序列更长的序列。
关键观点4: 数据集与实验评估
介绍了StoryStream数据集和现有多模态故事生成数据集的样本数据。实验证明了SEED-Story模型在多模态故事生成方面的先进性。
免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。
原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过
【版权申诉通道】联系我们处理。