国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:李燕, 王钢, 王浩
单位:内蒙古工业大学 智能科学与技术学院(网络空间安全学院),呼和浩特 010080;
关键词:生成式大模型(GLMs),越狱攻击,安全挑战,防御策略,安全性研究
基金:内蒙古自治区高校网络安全和教育管理信息化工程研究中心专项(RZ2200000611)。
近年来,生成式大模型广泛应用于文本生成、对话交互、内容创作等多个关键场景。然而,越狱攻击正成为生成式大模型的新威胁,越狱攻击能够绕过生成式大模型内置的安全机制,诱使经过其产生有害输出,带来伦理风险、隐私泄露以及模型滥用等安全挑战。针对这一威胁,全面综述了近年来大语言模型与多模态大模型这两类主流的生成式大模型的越狱攻击研究进展。从越狱攻击类型、防御策略、安全评估框架三个方面,详细总结了当前越狱攻击方法的基本原理、实施方法与研究结论,为后续的研究提供了有效参考。基于上述研究,进一步总结了当前两类主流生成式模型在越狱攻击安全性研究方面存在的不足,并提出了未来生成式大模型安全性研究所面临的主要挑战与发展机遇,为研究人员在生成式大模型的复杂应用和安全性研究领域提供指导建议。
来源:2026年第6期
《计算机工程与应用》期刊编辑部