计算机工程与应用

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2127/TP

国际刊号:1002-8331

计算机工程与应用杂志2026年第3期:融合关键区域增强与双向语义引导的视听定位

发布日期:

作者:章佳妍, 续欣莹, 谢珺, 程兰, 张喆, 刘潇威

单位:1.太原理工大学 电气与动力工程学院,太原 030024;2.太原理工大学 电子信息与光学工程学院,山西 晋中 030600;

关键词:多模态学习,视听融合,视听定位,自监督学习

基金:山西省科技合作交流专项(202104041101030);山西省自然科学基金(202103021224056);山西省重点研发计划项目(202102020101002);虚拟现实技术与系统全国重点实验室开放课题基金项目(VRLAB2023A06)。

视听定位的目的是对给定图像中发出声音的物体进行定位。定位结果主要依据视听特征的相似性,然而由于数据涵盖范围广,复杂的环境与多变的场景影响了定位效果,针对此问题,提出了融合关键区域增强与双向语义引导的视听定位。模型采用自监督对比学习框架,利用初步视听特征计算多尺度候选关键区域,将其视为声源目标所在位置后过滤源图像获得多个区域掩码并利用动态权重分配机制聚合,起到增强发声区域抑制未发声背景的作用。为了抑制视听信号的语义噪声同时促进多模态融合,提出了一种视听双向语义引导模块,一方面利用跨模态感知辅助图像特征融合音频语义,另一方面细化图像的深度空间特征并提取其语义引导音频特征。经损失约束,实现对声源的视觉定位。实验结果表明,模型在公开视听数据集Flickr-SoundNet和VGG-Sound上均达到了最佳的性能。

来源:2026年第3期

《计算机工程与应用》期刊编辑部

查看计算机工程与应用杂志2026年第3期

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89055542
  • E-mail:ceaj@vip.163.com

咨询工作人员

该杂志刊期列表

2026年
8期
7期
6期
5期
4期
3期