国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:张洪溪, 才智杰
单位:1.青海师范大学 计算机学院,西宁 810016;2.省部共建藏语智能信息处理及应用国家重点实验室,西宁 810008;
关键词:自然语言处理,藏文,模板,机器阅读理解,TiQuAD数据集
基金:国家自然科学基金(61966031,61866032);青海省藏文信息处理与机器翻译重点实验室(2020-ZJ-Y05);藏文信息处理教育部重点实验室(2013-Z-Y17,2014-Z-Y32,2015-Z-Y03)。
机器阅读理解是自然语言处理领域的重要研究方向,旨在使机器理解文本并回答与之相关的问题,机器阅读理解技术的进步依赖于高质量的数据集。目前机器阅读理解数据集主要采用人工方式构建,严重制约了机器阅读理解技术的发展和应用。针对藏文机器阅读理解数据集匮乏、采用人工方式构建效率低和成本高的问题,提出了一种结合模板的藏文机器阅读理解数据集自动构建方法,该方法通过分析藏文动词结尾型句子和对应问题的句法特征,利用模板自动构建藏文机器阅读理解数据集。为了验证该方法的有效性,采用经典的机器阅读理解模型BiDAF、RNet和QANet以及大语言模型Tibetan-Alpaca和Deepseek-V3对构建的数据集TiQuAD进行了实验验证。实验数据表明,数据集TiQuAD在BiDAF、RNet、QANet和Deepseek-V3模型上取得了较好的性能,特别在大语言模型Tibetan-Alpaca上性能提升显著。
来源:2026年第3期
《计算机工程与应用》期刊编辑部