国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:曹青跃, 王雅栋, 王庆, 张羽佳, 阳媛
单位:1.东南大学 仪器科学与工程学院,南京 210096;2.微惯性仪表与先进导航技术教育部重点实验室,南京 210096;
关键词:深度强化学习(DRL),自主导航,目标遮挡,死角避免
基金:国家自然科学基金(42074039);中交建筑集团科技项目(8522008786)。
针对强化学习导航存在训练效率低、稳定性差及在多死角场景中目标遮挡时导航性能差的问题,对此提出了一种融合专家经验与混合奖励机制的深度强化学习导航方法。筛选高质量专家经验并基于此预训练了行为克隆模型初始化策略,用于提高训练效率;构建了包含死角避免约束的稠密奖励函数,实现目标牵引与死角避让之间的平衡;采用标准化折扣回报方式降低不同轨迹的回报方差以提高训练稳定性。仿真实验表明所提出的方法在随机起止点测试中取得了91.3%导航成功率,在固定起止点测试中取得了95%导航成功率且耗时最短。结果表明,该方法能够灵活调整目标牵引和死角避让策略,有效提高多死角场景中机器人自主导航水平。
来源:2026年第8期
《计算机工程与应用》期刊编辑部