计算机工程与应用杂志

计算机工程与应用杂志2026年第5期

  • 大模型时代自动问答系统及评价体系综述 
    崔龙飞, 王宗水, 鲍盈旭, 赵红
    大模型时代,自动问答系统呈现出诸多新的特征。通过文献阅读和梳理,对自动问答系统特征和评测体系进行总结与归纳,从问答模型推理训练的训练数据、预训练框架、模型后处理、模型高效微调等阶段,对比大模型发展初期“追求数据和参数规模”的训练方法和如今“注重数据和模型效率”之间的差异,系统分析基于大模型的自动问答系统新的特征。总结当前各种类型的自动问答大模型评测体系,并详细梳理自动化评价体系HELM(holistic evaluation of language model)在自动问答任务上的数据集、评价指标和量化计算方法。未来基于大模型的自动问答系统研究将会围绕多模态融合、高安全性、高可解释性、低资源消耗,以及结合大模型和自动化的综合评价体系这几个方面进一步拓展与深化。
  • 基于DETR的视频时刻检索方法综述
    高杜娟, 吴媛媛, 林文龙, 谢天圻, 嘉昊阳, 冯昭天
    视频时刻检索旨在根据自然语言查询精确定位视频中的特定片段,是视频理解下的重要任务之一。传统方法依赖冗余候选生成和手工特征设计,难以兼顾检索精度与计算效率。近年来,基于Detection Transformer(DETR)的端到端方法借助可学习查询机制和直接回归预测策略,简化了框架的同时提升了检索性能。对DETR在视频时刻检索中的关键技术进展进行了系统综述,回顾了DETR模型的基础原理及其在该任务中的适配改进;对DETR的模型框架结构的优化研究方法进行了分类,细分为基于输入建模的特征增强、基于跨模态对齐的交互机制优化以及基于解码器结构与时刻回归机制这三个优化方向。对主流方法进行了系统梳理与检索精度比较;结合实验结果,分析了不同优化策略对模型性能的影响,并总结了各方法在主流数据集上的表现差异。最后,针对面向真实应用场景的泛化、跨模态交互走向语义整合机制以及面向开放领域与个性化检索的扩展这三个未来发展方向进行了讨论展望,为后续研究提供理论参考与实践指导。
  • 多移动机器人协作搬运中的协同智能技术综述
    满都娜, 林民, 策力木格, 兴安, 朝力萌, 李孝海
    多移动机器人协作搬运技术在智能物流、制造业和智能仓储等领域展现了巨大的应用潜力,成为推动工业自动化和智能化转型的重要驱动力。通过协同智能技术的高度集成与协调能力、实时数据感知与处理能力,以及高效任务分配,多移动机器人系统能够在动态复杂的环境中实现精准导航和高效协同任务,从而显著提升搬运任务效率与系统适应性。综述了多移动机器人协作搬运中的协同智能技术,介绍了相关基本概念与系统架构,并强调其在智能制造、智能物流和仓储系统中的应用价值。重点分析了多移动机器人的通信架构、任务分配、环境定位与感知、路径规划等核心技术,结合图和表并引用文献中的实验数据,探讨了这些技术的实现原理、方法分类、优缺点及其在典型仿真或实验环境中的性能表现。最后,讨论了当前技术面临的主要挑战,并展望了未来的研究重点和技术发展趋势,旨在为研究人员与工程师全面梳理多移动机器人协作搬运领域的技术背景、现存问题及未来方向,以推动该领域的技术进步与实际应用。
  • Transformer在图像分割领域的应用与加速优化技术综述
    李霞, 刘俊, 朱克峰
    综述了基于Transformer的图像分割方法及其加速优化技术。Transformer模型以其优越的全局上下文建模能力,已在图像分割领域取得显著成就,成为主流选择。回顾了图像分割的基本原理和任务分类,介绍Transformer在这一领域的应用,包括语义分割、实例分割和全景分割;系统总结了Transformer模型在图像分割中的典型架构,如编码器-解码器架构和基于对象查询的检测与分割方法;对各类加速技术进行了深入探讨,重点介绍了剪枝、量化和知识蒸馏等压缩方法及其混合应用,强调了这些技术在提升模型效率、降低计算复杂度方面的作用和挑战。旨在为未来的研究提供理论参考,并为实际应用中的模型优化设计提供实践指导;通过全面分析与讨论,为理解基于Transformer的图像分割技术及其优化策略提供了全景视角。
  • 大语言模型毒性治理研究综述
    李实, 张朔
    大语言模型在自然语言处理和生成式AI领域的应用日益广泛,其在提升生产效率的同时也带来了显著的伦理问题,尤其是毒性内容生成问题。毒性内容是指具有攻击性、歧视性或侮辱性的语言输出,这可能对社会秩序、文化多样性和道德标准构成负面影响。随着深度学习技术的不断创新和发展,大语言模型毒性治理问题受到越来越多的关注,现阶段缺少综述性文章对现有的毒性治理技术进行分析和总结。从概念出发,详细阐述了毒性内容的内涵、数据集和毒性分类;围绕毒性治理的两个关键步骤:毒性检测和毒性缓解进行了归纳和总结,然后在此基础上分析了当前毒性治理体系面临的主要挑战,并探讨了可能的改进方向。
  • PCSED-YOLO:复杂环境下跨尺度多目标穿戴检测算法研究
    薛光辉, 闫朝阳, 吴冕
    车间工人在作业期间若未按规定穿戴安全装备,不仅可能对其健康造成影响,还可能导致伤亡等安全事故。基于此,计算机视觉的穿戴检测技术是目前研究的热点领域。然而,由于生产车间内设备繁多,环境复杂且恶劣,生产过程中产生的大量粉尘会使穿戴目标变得模糊或部分被遮挡。此外,穿戴目标的尺寸分布范围宽,属于复杂环境下跨尺度多目标检测范畴。现有的算法在检测精度方面存在不足,特别是对口罩等小目标的误检和漏检率较高。为此,提出了一种基于YOLO模型的改进目标检测算法:PCSED-YOLO。在C3k2中融合了并行补丁感知模块,以增强小目标特征提取及多尺度目标检测能力;将交叉卷积注意力融合模块嵌入C2PSA,实现局部特征感知与全局上下文信息的互补,从而提升粉尘场景中的目标识别能力;引入空间到深度卷积替代原有的卷积层,通过重组空间维度信息至通道维度,实现无损下采样,提升小目标和低分辨率目标的检测性能;融合SEv2(squeeze-and-excitation network v2),创新改进空间金字塔池化层,增强模型对复杂场景的全局上下文把控能力,提升多类别、跨尺度目标的特征提取能力;在检测头引入动态卷积Dynamic-Conv,通过动态调整卷积核的大小和形状,提升跨尺度目标检测的精度;增加更高分辨率的P2检测层,提高小目标检测精度。制备了工人穿戴数据集,并进行了消融和对比实验。实验结果显示,PCSED-YOLO算法模型在处理小目标、中目标和大目标时均表现出色,与基准模型相比,mAP@0.5达到了0.946,提升了0.077;AP@0.5mask(小目标)达到了0.887,提升了0.236;AP@0.5no-helmet(中目标)提升了0.037至0.958;AP@0.5vest(大目标)提升了0.006至0.991;F1-Score和P-R曲线指标较基准模型也有明显改善。与几种先进的检测模型相比,PCSED-YOLO模型在制备的数据集上取得了最佳的检测性能,表明该模型具有较强的复杂环境跨尺度多目标检测能力和泛化能力,为复杂环境下跨尺度多目标穿戴检测提供了新的算法方案。
  • 改进YOLOv11的低光照目标检测方法研究
    李俊林, 张雪松, 宋存利, 李光宇
    针对低光照复杂场景下检测的性能瓶颈,提出一种改进YOLOv11的低光照目标检测算法ELS-YOLO(enhanced low-light scene-YOLO)。引入EfficientNetV2替换主干网络,简化模型结构的同时,提升局部细节和全局背景的复杂交互。提出了一种频域感知模块,进一步提升网络对图像细节的感知效果,帮助模型更好地识别低光照条件下的目标轮廓和暗部细节。设计了一种基于灵慧阶梯增益分配策略的损失函数,在提升光照和噪声变化的适应能力基础上持续提升检测精度。算法的消融实验和对比实验在ExDark、NOD(night object detection)和VOC2012数据集上进行,结果表明,在三个数据集上,提出的算法相较于基线模型在mAP@0.5和mAP@0.5:0.95指标上分别提升了4.2和2.6个百分点、2.4和0.7个百分点、0.7和0.3个百分点。实验结果验证了该算法在低光照目标检测场景中的有效性。
  • DBA-YOLO:双骨干轻量化无人机小目标检测算法
    余长同, 赖惠成, 汤静雯, 高古学
    针对无人机小目标检测特征表达不足、信息流受阻以及模型参数量、计算量过大的问题,提出双骨干轻量化无人机小目标检测算法DBA-YOLO。设计高低分辨率双骨干并配合跨尺度门控特征交互模块(cross-scale gated feature interaction module,CSGF),奠定全局-局部协同语义骨架;设计两阶段汇聚-折返颈部网络,通过尺度-边缘融合块(scale-edge fusion block,SEFBlock)和卷积门控混合块(Conv gated mixer block,CGMBlock)强化边缘细节与通道选择;设计多分支重参数化检测头(diverse branch block head,DBBHead),通过异构路径构建丰富的特征通路,增强模型的特征表达能力,同时兼顾推理效率。在模型压缩上,集成层自适应幅度剪枝算法,并为各子模块自定义剪枝器,显著削减参数量和计算量;对剪枝后的模型进行知识蒸馏,提升精度和泛化性。实验表明,相较于基础YOLOv11s模型,在公开数据集VisDrone2019测试集上,mAP50提升5.96个百分点,参数量从9.42×106减少至3.45×106,压缩63.38%。在极小目标数据集TinyPerson测试集上,mAP50提升8.19个百分点,参数量从9.41×106减少至2.66×106,压缩71.73%。
  • 改进YOLOv11n的输电线路缺陷检测算法
    刘方轩, 李为相, 肖迪, 宋张民杰, 陈闯
    针对输电线路缺陷检测任务中目标尺度多样、背景复杂、目标遮挡,以及现有目标检测算法难以在实时检测的前提下保证检测精度而出现漏检、误检的问题,提出一种改进YOLOv11n的输电线路主要缺陷检测算法。提出了全新的门控混合聚合模块(mixed aggregation network with faster-block and convolutional GLU,MANet-FC),实现了浅层、空间和深层语义的多尺度融合,在保证模型轻量化的同时提高检测速度;使用GOLD-YOLO中的聚集分发机制(gather-and-distribute,GD)与注意力尺度序列融合模块(attentional scale sequence fusion,ASSF)进行创新得到GOLD-YOLO-ASF,有效整合不同尺度的特征信息,提升模型对各种尺寸目标的检测能力;引入多目标注意力检测头(multi SEAM head,MSH),有效提升了模型在遮挡场景下的检测精度与鲁棒性;引入Focaler-ShapeIoU损失函数考虑框的形状匹配关系,同时通过线性区间映射重构原有IoU损失。实验结果表明,改进模型相较于基线模型mAP值提升了5.2个百分点,准确率和召回率分别提升了4.5和3.9个百分点;并且在输电线路金具数据集的实验结果中,所改进模型平均精度均值mAP@0.5相比YOLOv11n提升了3.7个百分点,准确率提升了2.6个百分点,召回率提升了1.9个百分点,较其他主流检测方法能够展现出更优的目标检测性能。
  • MSF-YOLO:基于声呐图像的下水道缺陷检测模型
    夏嘉雨, 韩庆邦, 葛考
    为了在水下环境中实现对下水道缺陷的有效检测,研究提出了一种集成声呐图像采集与深度学习算法的下水道缺陷检测方法。采用遥控潜水器(remote operated vehicle,ROV)搭载多波束声呐对下水道进行声呐图像的采集并制作数据集;进一步,提出了一种基于YOLO(you only look once)的多尺度特征融合框架(MSF-YOLO)。为了提升模型检测准确度,提出了CSP_MSF模块,采用部分卷积与多尺度融合技术提升模型的特征表达能力。针对传统自注意力机制在计算复杂度上的瓶颈问题,研究提出了C2TSSA模块。针对该研究制作的下水管道缺陷数据集中含有低质量示例的问题,引入Wise-IoU的损失函数。相比于基线模型YOLOv11m,该模型的参数量减少了0.64×106,FLOPs减少了1.1×109,FPS增加了26.6,mAP50和mAP50-95分别提升了1.5和1.2个百分点。
  • 互信息与遗传算法融合的多维分类特征选择算法
    李二超, 张宝新, 贾彬彬, 包寅寅, 杨宏强
    多维分类(multi-dimensional classification,MDC)模型在处理高维特征时面临计算效率与泛化性能的挑战。特征选择通过筛选有效特征子集,可同时降低维度并提升分类器性能。已有的MDC研究主要集中于显式地建模类空间之间的依赖关系,而面向MDC的特征选择方法仍需深入探索。针对MDC数据的特点,设计了一种互信息与遗传算法融合的多维分类特征选择算法MIGA(multi-dimensional classification feature selection algorithm based on fusion of mutual information and genetic algorithm)。该算法设计基于类空间综合相关性的种群初始化策略,以增加种群的多样性并加速收敛;提出自适应变异策略,依据特征综合得分动态调整变异概率以平衡全局探索与局部开发能力;融合MDC三项指标构建负加权和形式的适应度函数以适配GA优化框架。在10个MDC数据集上的实验结果表明:相较于特征映射降维方法(PCA、MDS)、监督式MDC降维方法SDeM(supervised dimensionality reduction for MDC)以及专用于MDC的过滤式特征选择算法MIFS(mutual information feature selection),MIGA所获特征子集显著提升了多维分类模型的泛化性能。
  • 求解VRP的混合强化学习驱动超启发式自适应遗传算法
    武保同, 陈志祥
    针对带有容量约束的车辆路径问题,提出了一种混合强化学习驱动的超启发式自适应遗传算法进行求解。采用随机贪婪策略生成初始解,设计基于局部搜索策略的路径内优化和两阶段多路径间协同优化框架。提出局部解码策略和基于禁忌搜索的并行加速策略通过批搜索加快搜索效率。混合强化学习方法在高层策略域内通过对环境的自适应识别,对4种路径内局部搜索策略和16种路径间搜索策略组合决策以诱导搜索到达优质解集中的区域。为说明算法的有效性,采用3组经典测试集中的不同规模的算例,将该算法与遗传算法、蚁群算法、多种强化学习方法驱动的超启发式自适应遗传算法和Gurobi求解器进行对比。对比实验和消融实验结果证明了所提出的混合强化学习驱动的超启发式自适应遗传算法在求解质量上的优越性,为企业优化配送方案决策提供参考依据。
  • 基于大模型文档知识抽取的领域知识图谱增量构建
    陈俊臻, 王淑营, 罗浩然
    针对工业领域知识图谱构建中面临的标注样本稀缺、文档多源异构、语义结构复杂等挑战,提出一种基于大型预训练语言模型的领域知识图谱增量构建方法LLM-KG。该方法利用GPT-4模型自动生成高质量的标注样本,降低人工标注成本的同时提升训练数据的覆盖性与准确性;借助LoRA(low-rank adaptation)技术对轻量级语言模型进行领域微调,实现对领域文档中实体与关系的高精度抽取。为提升新增实体和关系的对齐质量,LLM-KG引入语义块划分机制,并结合向量数据库进行Top-[k]实体召回,最终由大语言模型对召回结果进行语义一致性判断与筛选,从而实现更加准确的实体融合与关系补全。在公开数据集DDI及风电装备数据集上进行了实验验证,结果表明,LLM-KG在准确率、召回率和F1值上均优于对比方法,展现出良好的领域适应性与增量构建能力。
  • 基于对称性BEV-U桥的高性能实时单目三维环境感知
    双丰, 杨海锋, 周扬眉, 李志腾, 赵剑楠
    为缓解三维语义占用预测算法FlashOcc在高度维度细节损失导致精度不足的问题,提出了一种改进的高性能实时单目三维占用预测算法(monocular flash occupancy prediction,Mono-FlashOcc)。该方法创新性地设计了对称性BEV-U桥,结合了高度转通道和通道转高度模块,通过对称的全连接层逐层保留和还原高度信息,实现了三维体素特征与二维BEV特征之间的平滑转换。实验结果表明,Mono-FlashOcc在SemanticKITTI数据集上展现出有竞争力的检测性能和实时的推理速度。BEV-U桥在保持模型轻量化的同时,有效捕捉和保留高度信息,显著提升了检测精度,尤其在行人和骑行者等小尺度目标的检测中表现出色。通过TensorRT加速,模型的推理速度达到31.18 FPS,满足自动驾驶系统的实时性需求。总之,Mono-FlashOcc为自动驾驶领域提供了一个具备实际部署潜力的高性能、轻量化三维环境感知解决方案。
  • 双图融合驱动下说话人感知增强的多模态会话情感分析
    董凯, 蔡国永, 邓天生, 王顺杰
    以往的多模态会话情感分析主要侧重于上下文信息建模,但在说话人性格特征的提取,不同说话人之间交互以及互补信息的传递上具有一定的局限性,同时在跨模态融合中未能充分捕获上下文情感线索。针对上述问题,提出了一种双图融合驱动下说话人感知增强的方法。通过跨模态注意力机制分层捕获模态内和模态间的上下文情感线索,设计提示模板结合大语言模型提取说话人的性格特征,构建多维度的说话人感知依赖图,包括同一说话人内部依赖图和不同说话人之间的交互依赖图,并与性格特征融合后,利用图注意力传递话语之间的依赖信息,通过交互模块实现不同感知依赖图之间的信息交换与融合,并引入交互损失以增强图间的敏感度。在两个公开的多模态数据集上进行广泛实验,实验结果充分证明了该方法的有效性。
  • 基于时间信息建模和特征融合的多模态藏酋猴行为识别
    薛维刚, 谭迎春, 施小刚, 程跃红, 张晋东, 李德生, 宁纪锋
    在野外环境中,准确识别藏酋猴的行为对于保护濒危物种、维护生态平衡以及研究人类进化具有重要意义。然而,与人类行为识别方法的广泛研究相比,由于野生藏酋猴数据难以获取,目前大多数研究主要集中在实验室环境中,野外环境下的研究较少。基于ILA行为识别模型,结合藏酋猴行为特点,提出了一种用于藏酋猴行为识别的方法,通过增强时间信息建模能力、融合图像和视频特征以及充分利用文本模态信息,实现野外环境下藏酋猴的行为识别。由于藏酋猴的行为变化迅速,具有高度的动态特征,因此采用ATM(arithmetic temporal module),通过对视频帧特征进行基本算术运算捕捉时间线索,增强模型对时间信息建模的能力。由于藏酋猴的行为具有复杂性和相似性,且其行为发生的背景与行为本身有着密切关系,因此设计特征融合机制,有效整合帧级图像特征和视频全局特征,提升模型对视觉特征的表达能力。设计适当的文本提示模板,充分发挥文本模态信息的作用,有效利用大规模视觉-语言预训练模型的先验知识提高模型对视频内容的理解能力,从而进一步提高野外环境下藏酋猴行为识别的准确性和鲁棒性。在LoTE-Animal数据集的藏酋猴数据集上进行的实验结果表明,所提模型在ViT-B/16架构上的Top-1正确率上达到了80.00%,相较于标准ILA模型提高了10.20个百分点,并显著优于现有代表性的行为识别模型,同时消融实验验证了所提改进模块的有效性。所提方法为野外环境下藏酋猴的行为识别提供了一种有效的解决方案。
  • 激光SLAM中动态物体剔除算法研究
    李兆强, 苏惠杰, 张岳
    同时定位与建图(simultaneous localization and mapping,SLAM)技术是无人驾驶流程中的重要环节,其中建图的精度直接影响到定位、导航以及路径规划等任务,影响精度的关键因素之一是地图中存储的动态物体残影。对此问题,提出一种基于多目标运动估计(multiple object motion estimation,MOME)对点云进行离线处理的动态物体剔除方法,使用领域图来构建空间中动态物体的运动轨迹,通过帧间观测的变换矩阵作为标签来描述物体的轨迹,用凸优化的方式最小化成本函数,使标签逐步收敛到合适的轨迹。最终通过高斯-牛顿迭代估计状态参数,依据动态物体在雷达坐标系和地固坐标系之间的差异性运动对其分割并剔除。该算法在SemanticKITTI数据集和Argoverse 2数据集的不同场景下进行验证,结果表明,该动态物体剔除方法相比于近年来的经典动态物体剔除方法,具有更优秀的精度和效果。
  • 用于捆绑推荐的双视图对比学习
    张尧, 王绍卿, 郑菁桦, 韩小波, 孙福振
    捆绑包能一次性满足用户多种偏好。现有的大多数捆绑推荐模型都致力于从不同角度捕捉用户偏好。但这些方法面临两个问题:(1)不能完整地捕获用户对潜在交互捆绑包的偏好;(2)未充分提取捆绑包之间的相关性。针对这两个问题,设计了一个用于捆绑推荐的双视图对比学习模型(DCLBR)。具体来说,在项目视图中,DCLBR引入项目级超图来捕获用户对潜在交互捆绑包的偏好,并使用注意力网络自适应地聚合相关性项目的表示得到捆绑包表示。在捆绑包视图中构建捆绑包级带权图来挖掘捆绑包之间的关联性。为了让捆绑包更加匹配用户兴趣,分别基于重要项目和不重要项目的掩码进行数据增强,生成消极和积极捆绑包,并应用对比学习使最终的捆绑包表示能够自适应于项目的重要性。在三个公共数据集上的实验结果表明,所提出的模型优于基线模型。
  • 基于增强跨度信息表示的中文命名实体识别
    杨力益, 邢树礼, 毛国君
    命名实体识别是自然语言处理领域中的一项基本任务。以往的中文命名实体识别方法大多未能充分利用文本跨度本身蕴含的语义信息,导致特征提取不足,影响模型识别效果。此外,邻近跨度间的关系也常未得到重视。为解决上述问题,提出一种基于增强跨度信息表示的中文命名实体识别方法。该方法包含两个核心模块:跨度筛选器负责判别实体与非实体,其使用嵌入位置信息的首、尾词元特征表示向量来计算评分;跨度分类器使用融合边界与内部信息的跨度信息表示,按实体类型计算跨度评分,同时辅以单个二维卷积层作跨度间交互从而校正评分。两个模块的输出评分之和用于确定每个跨度的预测结果。该法在Resume、MSRA、CLUENER2020和CMeEE-V2四个中文命名实体识别任务上的F1值分别达到了96.71%、96.15%、81.88%和75.28%。消融实验结果验证了各个组件的有效性。
  • 基于文本层次化信息增强的多模态情感分析
    程艳, 房成兴, 文煜
    多模态情感分析旨在从文本、视觉和音频信息中识别人类情绪。以往的方法没有充分考虑利用文本特征增强视觉和音频模态中存在的情感信息,以及不同模态之间的相关性。针对上述问题,提出了一种基于文本层次化信息增强的多模态情感分析模型(multimodal sentiment analysis model based on text hierarchical information enhancement,THIE)。该模型使用Transformer提取具有重要语义信息的文本、视觉和音频模态特征;设计文本层次化信息增强模块,利用不同层次上的文本模态分别融合视觉和音频模态中的相关情感信息,从而达到增强情感的效果;提出基于跨模态注意力和门控机制的多模态融合模块,用于增强不同特征信息之间存在的相关性,提高重要特征的权重,抑制相对不重要的特征,从而减少冗余信息。在公共数据集CMU-MOSI、CMU-MOSEI和CH-SIMS上进行实验表明,与主流方法相比,该模型在性能上有所提高。
  • 改进循环生成对抗网络的低光照图像增强方法
    孙福艳, 吕准, 吕宗旺, 龚春艳, 王尔墙
    针对现有低光照图像增强方法在解决噪声和色偏等问题上的局限性,提出了一种基于改进循环生成对抗网络(low light generative adversarial network,LLGAN)的低光照图像增强方法。该方法提出了一种多尺度残差块用于提取图像多尺度特征;同时,使用一种特殊的卷积StarConv,以便在低维空间中有效地学习非线性特征;使用了一种特征聚合模块,并提出了一种可学习的混合注意力机制,来同时去噪和增强图像亮度;利用门控机制LGAG减少跳跃连接引起的信息丢失;提出一种全局-局部判别器减少在增强过程中细节的丢失。结果表明,提出的LLGAN模型在提升图像饱和度和减少噪声方面具有显著效果,其PSNR、SSIM、NIQE分别达到了22.321 5 dB、0.863 5、3.796 8,与现有主流方法相比具有优异的表现。
  • 动态图融合的图像和谐化方法
    程显贺, 孟祥瑞, 纪昂霄, 张立华
    图像和谐化是计算机视觉领域的一项关键任务,其核心在于实现前景与图像背景的自然融合。为解决现有的局部区域匹配和谐化方法所存在的背景信息利用不足、前景区域视觉连贯性被破坏的问题,提出了动态图融合网络(DGFNet)。该网络中,设计的图融合模块可依据不同输入图像,自适应构建前景与背景、前景与前景间的匹配融合关系。背景分支通过动态阈值筛选,建立前景与高相似背景区域的动态连接,并借此实现细粒度调整;前景自融合分支则构建前景关联特征的动态连接来实现前景内部匹配融合,提升图像的局部视觉一致性。此外,DGFNet配备的全局感知解码器,利用全局背景信息进一步对前景进行全局校准。实验表明,DGFNet在iHarmony4和ccHarmony公开数据集上均达到最先进水平。
  • 融合语义流的门控自适应交通场景语义分割算法
    谢新林, 段泽云, 王荃毅, 谢刚
    针对现有交通场景语义分割算法难以同时准确分割目标主体和目标边缘,导致小目标易融入到周围背景和纤细条状目标分割不连续等问题,提出一种融合语义流的门控自适应交通场景语义分割算法。构建基于局部与全局上下文的并行互补自适应门控模块,通过自适应融合多头自注意力机制与深度卷积提取的互补特征信息,克服不同类别之间的相似特征编码问题,以增强不同对象之间的判别表示。根据卷积的感受野优势和归纳偏置特性,构建基于深度可分离卷积的轻量级局部特征提取模块,在多个不同尺度上捕获特征图的局部细节信息,以增强网络对小目标的表示能力,同时避免网络结构冗余。构建语义流引导的跨层聚合模块,对齐和聚合下采样操作下的相邻特征图进一步建模全局上下文,并缓解纤细条状目标分割不连续的问题。交通场景数据集Cityscapes和CamVid上的实验结果表明,所提算法能够取得80.16%和84.78%的平均交并比,并能够在精炼目标分割边缘的同时提高小目标和纤细条状目标的分割精度。
  • 轻量级深度特征交互融合的车辆重识别网络研究
    徐岩, 刘国荣, 张晓迪, 崔海青, 薛威海, 朱国生
    车辆重识别要求模型既关注车辆的整体轮廓,又关注车辆在不同阶段的微妙局部细节,在更深层次上提取区别特征。为解决上述问题,构建了一个具有轻量级大感受野的金字塔分支,在仅引入少于0.84×106个额外参数的同时,显著提高了骨干网络的性能,可使模型专注于网络深层的全局纹理。为了使金字塔分支学习有效的特征表示,提出了骨干引导融合(backbone guided fusion,BGF)模块,可将金字塔分支特征与骨干特征进行自适应融合,以帮助金字塔分支学习到有效信息。此外,采用了图像去模糊(image deblurring,ID)技术对输入特征进行预处理,并结合并行注意力机制来加强对特征细节的关注。在Veri-776和VehicleID数据集上进行的实验表明,所提出的轻量化方法有效提高了车辆重识别的准确性和泛化能力。
  • 基于运动平均的无地图视觉定位方法
    刘锦江, 欧阳奇, 谭文洲
    针对基于结构的视觉定位方法中预构建点云地图耗时且受重建误差影响的问题,提出了一种无地图的视觉定位方法,直接从查询图像与数据库图像的匹配对中预测位姿,并利用运动平均对多个预测位姿进行融合优化。结合极线几何误差加权匹配点迭代估计基础矩阵;根据基础矩阵和数据库图像位姿计算预测位姿,在李代数空间内采用L1和L2混合优化算法对旋转预测进行平均;在旋转一致性较高的内点上,通过最小化相机中心角度误差的优化平移预测。实验结果表明,该方法能够达到与主流方法接近的精度,并且在室内场景中表现最好。在实际的BishanHall场景中,平均旋转和重投影误差高出同配置对比方法0.02°和1.172 pixel,运行时间缩短约0.442 s,省去预构建点云地图减少约38%的存储空间。
  • 基于ConvNeXt-Mamba的双编码器图像伪造检测
    潘苗绒, 王燚
    图像伪造检测在网络安全领域中是一项基础且关键的任务。卷积神经网络(CNN)是当前图像伪造检测领域的主流方法,但CNN通常只能提取局部特征,难以捕获全局特征。为此,该研究提出了融合Mamba和ConvNeXt的双编码器结构,其中Mamba负责捕获全局上下文特征,ConvNeXt则聚焦于局部细节特征,通过两者的协同实现特征的综合提取。为了进一步强化关键特征表达,引入通道注意力模块(SE block),通过自适应调整特征通道的权重提升特征表达能力。针对伪造区域边界复杂带来的漏检问题,增加了边缘损失以提高模型对伪造轮廓的识别准确性。在CASIAv1等4个基准数据集上的实验表明,该方法在曲线下面积(AUC)分数和F1分数上分别平均提升0.015和0.054,显著优于现有方法,尤其在复杂伪影和模糊边界场景下展现出更强鲁棒性。
  • 数据驱动的资源受限项目调度问题求解器推荐研究
    曾鸣, 戴业东, 刘万安
    资源受限项目调度问题(RCPSP)广泛存在于工程管理等领域,高效求解该问题对项目管理至关重要。然而,RCPSP固有的NP-hard特性,使得现有求解方法的性能表现出强烈的项目实例依赖性,难以找到一种通用的高效算法。为此,提出一种基于数据驱动的RCPSP求解器推荐框架,实现针对不同项目实例的智能化算法选择,从而克服现有算法选择方案的盲目性,提升求解效率。该框架的构建源于对RCPSP问题特征与算法性能之间复杂关系的洞察,试图利用机器学习方法挖掘这种潜在关系,并将其转化为指导算法选择的知识。构建了包含网络拓扑、资源和时间三个维度特征集的RCPSP求解算法推荐数据集;结合特征选择方法提取最优特征子集,构建基于树集成算法的推荐模型,以学习这种复杂映射关系的内在规律,实现精准的算法推荐;利用SHAP模型对推荐模型进行归因分析,剖析影响算法选择的关键项目特征,为项目管理人员提供更具解释性的决策支持。实验结果表明,所提出的推荐框架在四个数据集上的推荐准确率均超过70%,且在各项指标上均优于其他推荐算法。资源强度、项目工期下界和网络宽度等特征被证实对算法选择具有重要影响,该研究验证了数据驱动方法在破解RCPSP算法选择难题方面的可行性和有效性,为项目管理人员提供了科学化、智能化的算法选择方案,有效降低了决策难度,有助于提升项目管理效率。
  • 多尺度卷积与自注意力融合下的蛋白质翻译调控
    周渴一, 崔竞松, 李娇娇, 齐浩
    为了提高对于蛋白质翻译起始效率的预测水准并挖掘5端非翻译区(5’untranslated region,5’UTR)序列的隐式语义信息,提出了一种基于多尺度卷积和自注意力机制相结合的预测模型RiboTIEP(ribosome translation initiation efficiency predictor)。该模型通过多尺度卷积层的多维度局部特征提取,以及自注意力机制下的全局特征并行提取,能够有效捕获不同核苷酸组合形式的生物语义特征与序列的上下文依赖关系。在原有单一的特征拼接方法的基础上,引入注意力机制来自适应地分配不同高维特征的权重以实现特征融合,并通过多层感知机进行回归预测。实验结果表明,RiboTIEP模型在多个数据集上的皮尔逊相关系数(Pearson correlation coefficient,PCC)均达到了0.88及以上;与单一的CNN模型架构相比,PCC最少可提升4.20%,最多可提升7.86%;与单一的LSTM模型架构相比,PCC最少可提升3.70%,最多可提升44.63%。
  • 考虑车辆侧翻稳定性的无人车自适应路径规划
    杨秀建, 郭兴瑞, 姜壁刚, 张生斌
    针对现有非结构化环境下的无人车辆全局路径规划的安全性和稳定性问题,提出了一种考虑车辆斜坡侧翻稳定性的EA-A*算法(evaluation of adaptation A*,EA-A*)。建立车辆在斜坡时的动力学模型,获取车辆在斜坡安全行驶的极限参数;基于数字高程模型(DEM)提取坡度模型、起伏度模型和粗糙度模型并整合成具有各个地形参数的适应度地图模型;增加车辆侧翻稳定性约束完善代价函数,并采用自适应分辨率EA-A*规划算法得到优化路径。仿真表明:相比传统三维A*算法,EA-A*算法所规划的路径更为合理,危险道路显著减少,平均坡度由30.43°降低到7.78°;采用了自适应分辨率的规划方法后减少了96.27%的规划时间,更满足现实需求。
  • 考虑混入自动驾驶车辆的机非混合交通流元胞自动机仿真
    钱勇生, 杨紫龙, 曾俊伟, 魏谞
    使用标线隔离的机非混合路段普遍存在非机动车越线变道的现象,严重影响正常交通,同时自动驾驶技术的应用使得现有针对机非混合路段的研究出现了局限性。为了探究和复现城市机非混合路段使用标线隔离而发生的混行现象,针对自动驾驶、人工驾驶车辆以及非机动车不同的特性分别提出了一种改进的元胞自动机模型,并以此为基础建立机非混合交通流元胞自动机模型。通过数值模拟结果表明:自动驾驶车辆的渗透率对道路通行能力和交通流速度波动有显著影响,无论对于机非混合交通流以及纯机动车流的运行状况都有着明显的提升作用。而非机动车的越线行为会对正常行驶的机动车流造成严重干扰。此外,还发现相比于标线隔离,物理隔离的方式在一定程度上可以提高交通流速度,降低速度波动。
计算机工程与应用封面

中文名称:计算机工程与应用

杂志社官网:http://cea.ceaj.org/

英文名称:Computer Engineering and Applications

语言:中文

类别:自动化技术、计算机技术

主 编:谭继红

创刊时间:1964

出版周期:半月

国内刊号:11-2127/TP

国际刊号:1002-8331

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89055542
  • E-mail:ceaj@vip.163.com