国内刊号:61-1525/N
国际刊号:2097-1915
发布日期:
作者:梁成名,李云红,李丽敏,苏雪平,朱绵云,朱耀麟
单位:西安工程大学电子信息学院,西安,710048\
关键词:文本生成图像;语义分割图像;生成对抗网络;注意力机制;仿射变换
基金:国家自然科学基金(62203344);陕西省自然科学基础研究重点项目(2022JZ-35);陕西高校青年创新团队项目
针对生成对抗网络生成图像存在结构不完整、内容不真实、质量差的问题,提出一种结合语义分割图的注意力机制文本到图像生成模型(SSA-GAN)。首先采用一种简单有效的深度融合模块,以全局句子向量作为输入条件,在生成图像的同时,充分融合文本信息。其次结合语义分割图像,提取其边缘轮廓特征,为模型提供额外的生成和约束条件。然后采用注意力机制为模型提供细粒度词级信息,丰富所生成图像的细节。最后使用多模态相似度计算模型计算细粒度的图像-文本匹配损失,更好地训练生成器。通过CUB-200和Oxford-102 Flowers数据集测试并验证模型,结果表明:所提模型(SSA-GAN)与StackGAN、AttnGAN、DF-GAN以及RAT-GAN等模型最终生成的图像质量相比,IS指标值最高分别提升了13.7%和43.2%,FID指标值最高分别降低了34.7%和74.9%,且具有更好的可视化效果,证明了所提方法的有效性。
来源:2024年第4期
《空军工程大学学报》期刊编辑部