国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:陈俊臻, 王淑营, 罗浩然
单位:1.西南交通大学 计算机与人工智能学院,成都 611756;2.北京邮电大学 计算机学院,北京 100876;
关键词:知识图谱(KG),大模型微调,文档信息抽取,增量构建
基金:国家重点研发计划项目(2022YFC3005203);四川省重大科技专项项目(2022ZDX0003)。
针对工业领域知识图谱构建中面临的标注样本稀缺、文档多源异构、语义结构复杂等挑战,提出一种基于大型预训练语言模型的领域知识图谱增量构建方法LLM-KG。该方法利用GPT-4模型自动生成高质量的标注样本,降低人工标注成本的同时提升训练数据的覆盖性与准确性;借助LoRA(low-rank adaptation)技术对轻量级语言模型进行领域微调,实现对领域文档中实体与关系的高精度抽取。为提升新增实体和关系的对齐质量,LLM-KG引入语义块划分机制,并结合向量数据库进行Top-[k]实体召回,最终由大语言模型对召回结果进行语义一致性判断与筛选,从而实现更加准确的实体融合与关系补全。在公开数据集DDI及风电装备数据集上进行了实验验证,结果表明,LLM-KG在准确率、召回率和F1值上均优于对比方法,展现出良好的领域适应性与增量构建能力。
来源:2026年第5期
《计算机工程与应用》期刊编辑部