国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:崔龙飞, 王宗水, 鲍盈旭, 赵红
单位:1.北京信息科技大学 计算机学院,北京 100192;2.北京信息科技大学 商学院,北京 100192;3.中国科学院 数学与系统科学研究院,北京 100190;4.岭南大学 社会科学学院,香港 999077;5.中国科学院大学 经济与管理学院,北京 100190;
关键词:大模型(LMs),自动问答(QA)系统,系统特征,HELM评价体系
基金:国家自然科学基金(71972175);新疆维吾尔自治区重点研发任务专项(2024B03026);北京市教委优秀青年人才培育计划(BPHR202203237);中国博士后基金面上项目(2025M770691);高等教育研究专题(2023GXJK570)。
大模型时代,自动问答系统呈现出诸多新的特征。通过文献阅读和梳理,对自动问答系统特征和评测体系进行总结与归纳,从问答模型推理训练的训练数据、预训练框架、模型后处理、模型高效微调等阶段,对比大模型发展初期“追求数据和参数规模”的训练方法和如今“注重数据和模型效率”之间的差异,系统分析基于大模型的自动问答系统新的特征。总结当前各种类型的自动问答大模型评测体系,并详细梳理自动化评价体系HELM(holistic evaluation of language model)在自动问答任务上的数据集、评价指标和量化计算方法。未来基于大模型的自动问答系统研究将会围绕多模态融合、高安全性、高可解释性、低资源消耗,以及结合大模型和自动化的综合评价体系这几个方面进一步拓展与深化。
来源:2026年第5期
《计算机工程与应用》期刊编辑部