国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:高杜娟, 吴媛媛, 林文龙, 谢天圻, 嘉昊阳, 冯昭天
单位:成都理工大学 计算机与网络安全学院,成都 610059;
关键词:视频时刻检索,Detection Transformer(DETR),深度学习
基金:四川省中央引导地方科技发展专项(2024ZYD0263);成都市重点研发支撑计划项目(2024-JB00-00012-GX);成都理工大学2023年中青年骨干教师发展资助计划(10912-JXGG2023-06470)。
视频时刻检索旨在根据自然语言查询精确定位视频中的特定片段,是视频理解下的重要任务之一。传统方法依赖冗余候选生成和手工特征设计,难以兼顾检索精度与计算效率。近年来,基于Detection Transformer(DETR)的端到端方法借助可学习查询机制和直接回归预测策略,简化了框架的同时提升了检索性能。对DETR在视频时刻检索中的关键技术进展进行了系统综述,回顾了DETR模型的基础原理及其在该任务中的适配改进;对DETR的模型框架结构的优化研究方法进行了分类,细分为基于输入建模的特征增强、基于跨模态对齐的交互机制优化以及基于解码器结构与时刻回归机制这三个优化方向。对主流方法进行了系统梳理与检索精度比较;结合实验结果,分析了不同优化策略对模型性能的影响,并总结了各方法在主流数据集上的表现差异。最后,针对面向真实应用场景的泛化、跨模态交互走向语义整合机制以及面向开放领域与个性化检索的扩展这三个未来发展方向进行了讨论展望,为后续研究提供理论参考与实践指导。
来源:2026年第5期
《计算机工程与应用》期刊编辑部