国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:仲宝才, 杨帆
单位:1.成都东软学院 计算机与软件学院,成都 611844;2.暨南大学,广州 510632;
关键词:大语言模型,数据污染,动态数据评估,布鲁姆分类法
基金:四川省哲学社会科学重点研究基地川菜发展研究中心科研项目(CC23W31)。
随着大型语言模型(LLMs)在超大规模语料库上开展预训练,数据污染问题逐渐凸显,这对模型性能评估的准确性构成了直接威胁。提出了一种创新的动态数据评估方法EdEval(equal distribution dynamic evaluation),旨在降低数据污染对评估准确性的影响。EdEval通过提取核心知识点与主旨,确保生成的评估问题在本质上与静态数据一致,并结合联网检索对知识点进行深入阐述,生成具有高质量知识支撑的评估样本。此外,EdEval通过控制问题数量和复杂度,实现动态对齐与灵活调节,以匹配静态数据的难度水平并满足不同复杂度的需求。采用布鲁姆分类法,EdEval从记忆、理解、应用、分析、评价和创造六个维度对LLMs进行综合评估。实验结果表明,EdEval在多个数据集上有效减轻了数据污染的影响,显著提高了评估的公正性和准确性。
来源:2026年第6期
《计算机工程与应用》期刊编辑部