声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:梁先达, 曾上游, 邱泓语
单位:广西师范大学 电子与信息工程学院/集成电路学院,广西 桂林 541000;
关键词:图像描述,Transformer,多特征融合,区域特征,网格特征,空间信息
基金:国家自然科学基金(61976063)。
现有的图像描述模型仅关注了网格特征或区域特征的单一应用,没有充分考虑图像中对象之间的空间相关性以及多特征融合对描述生成的重要性。针对这一问题,提出了一种基于Transformer多特征融合的图像描述方法。构建视觉特征提取器提取初级视觉特征,通过所构建空间增强注意力模块,实现网格视觉特征与空间信息有效结合,克服了在全局上下文中不能充分识别对象间空间关系的问题。为了解决多头注意力机制独立并行建模可能导致的图像元素语义关系特征遗漏问题,设计了多头关联注意力机制,有效地弥补了不同注意力通道间的元素语义关系。设计了多特征融合模块,通过动态调节不同特征对描述文本的影响,有效解决了多特征融合带来的语义噪声问题。通过在MSCOCO数据集上进行了广泛的实验,验证了所提出的改进方法的有效性。
来源:2026年第6期
《计算机工程与应用》期刊编辑部