专栏名称: AI前线
InfoQ十年沉淀,为千万技术人打造的专属AI公众号。追踪技术新趋势,跟踪头部科技企业发展和传统产业技术升级落地案例。囊括网站和近万人的机器学习知识交流社群。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  AI前线

千问团队开源图像基础模型 Qwen-Image

AI前线  · 公众号  · AI  · 2025-09-02 14:49
    

主要观点总结

千问大模型团队最近开源了图像基础模型Qwen-Image,该模型支持从文本到图像和从文本图像到图像的编辑任务,并在多项基准测试中表现卓越。Qwen-Image使用Qwen2.5-VL处理文本输入,使用变分自编码器处理图像输入,并通过多模态扩散变换器进行图像生成。模型的训练数据集包含了大量的图像文本对,涵盖了自然、设计、人物和合成数据等类别。Qwen-Image的架构和性能在多个方面都有创新,包括模型的后训练策略和生成图像的多样性等。此外,该模型还支持多种任务,如目标检测、语义分割等。用户可以在GitHub上找到Qwen-Image的代码,并从Huggingface下载模型文件。

关键观点总结

关键观点1: Qwen-Image模型的特点和性能

Qwen-Image支持从文本到图像和从文本图像到图像的编辑任务,并在多项基准测试中表现卓越。它使用变分自编码器和多模态扩散变换器进行图像生成。模型的训练数据集包含了大量的图像文本对,涵盖多个类别。该模型还具有多种功能,如目标检测、语义分割等。

关键观点2: Qwen-Image的训练数据集

千问团队为创建Qwen-Image模型,收集并标注了数十亿对图像文本对。数据涵盖了自然、设计、人物和合成数据等类别,其中自然图像占比较大。初始数据集经过筛选,去除了低质量的图像。团队还设计了一个标注框架,为每张图像生成详细的标题和元数据。

关键观点3: Qwen-Image的模型架构和训练策略

Qwen-Image的模型架构进行了预训练,并采用多种策略逐步改进模型的输出。团队采用逐步提升图像分辨率的策略,并引入包含渲染文本的图像、具有更多样化领域和分辨率分布的图像以及合成图像进行训练。模型的后训练分为两个阶段:监督微调(SFT)和强化学习(RL)。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照