今天看啥  ›  专栏  ›  PaperAgent

腾讯SEED-Story:生成丰富、叙事连贯及风格一致图文故事的大模型

PaperAgent  · 公众号  · 科技自媒体  · 2024-07-16 11:41
    

主要观点总结

SEED-Story是一个多模态长篇故事生成系统,由MLLM驱动,可以从用户提供的图片和文本开始生成故事。它包括三个阶段的训练过程,旨在生成丰富、连贯且多模态的故事。故事可以跨越多达25个序列,尽管在训练期间仅使用最多10个序列。本文还介绍了其使用的注意力机制以及数据集和实验评估。

关键观点总结

关键观点1: 系统概述

SEED-Story能够从用户提供的图片和文本开始生成多模态长篇故事,且模型、代码与数据都已开源。

关键观点2: 训练过程

SEED-Story的训练过程包括三个阶段:预训练去标记化器、训练MLLM以及调整SD-XL增强生成图片中的角色和风格一致性。

关键观点3: 注意力机制

SEED-Story在多模态故事生成中使用了多种注意力机制,包括密集型注意力图、窗口型注意力和多模态注意力汇聚,这有助于模型生成比训练序列更长的序列。

关键观点4: 数据集与实验评估

介绍了StoryStream数据集和现有多模态故事生成数据集的样本数据。实验证明了SEED-Story模型在多模态故事生成方面的先进性。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照