国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:史明伟, 林民, 孙艳茹, 张树钧, 斯日古楞, 王玉荣
单位:1.内蒙古师范大学 计算机科学技术学院,呼和浩特 010022;2.内蒙古电子信息技术学院,呼和浩特 010070;3.内蒙古师范大学 文学院,呼和浩特 010022;4.内蒙古民族大学 计算机科学与技术学院,内蒙古 通辽 028000;5.内蒙古师范大学 数学科学学院,呼和浩特 010022;
关键词:相似性匹配,知识蒸馏,孪生网络,预训练语言模型,中文古籍
基金:国家自然科学基金(62266033);无穷维哈密顿系统及其算法应用教育部重点实验室开放课题资助项目(2023KFZD03)。
现有基于“预训练+孪生网络”范式的语义相似性匹配算法在数据丰富的语种文本中表现优异,但在低资源语种上效果显著下降,尤其在古籍文本中更为明显。古文数据稀缺且标注困难,缺乏专门的相似性匹配数据集,导致现有方法难以有效应用。为此,提出一种基于多阶段知识蒸馏的古籍文本相似性匹配算法。该方法以易获得的文白句对数据集为基础,采用白话文预训练语言模型作为教师模型,古文预训练语言模型作为学生模型,通过多阶段知识蒸馏将白话文模型的相似性匹配知识迁移到古文模型,从而提高古文模型的相似性匹配能力。同时,为解决模型臃肿问题,在蒸馏过程中引入模型压缩策略,使得模型在保持性能的同时,便于部署。实验结果表明,采用多阶段知识蒸馏框架(multi-stage distillation framework,MSDF)的模型在《二十四史》数据集上性能优于其他方法,并且模型缩小至原来的25%时,依然保持较高的匹配精度,为古籍整理和数字人文研究提供支持。
来源:2026年第7期
《计算机工程与应用》期刊编辑部