国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:熊思云, 杜彦辉
单位:中国人民公安大学 信息网络安全学院,北京 100038;
关键词:生成式人工智能安全,文生图模型,NSFW内容检测,生成式防御
基金:中央高校基本科研业务费项目(2024JKF14)。
近期,文生图模型面临的NSFW(not safe for work)图像生成威胁引发了学术界的密切关注。现有生成式防御方法依赖大语言模型对输入提示进行复写,进而对复写后的文本进行审核,此类方法高昂的推理开销极大程度上限制了其使用范围。针对此问题,提出一种将文生图模型的文本引导嵌入翻译回文本以进行对抗样本检测的新型生成式审核框架——Latent Translator。不同于现有生成式防御方法的仅解码器(decoder-only)结构,Latent Translator采用编码器-解码器(encoder-decoder)结构,通过所提出的块稀疏多头交叉注意机制(block sparse multi-head cross attention,B-MHCA)实现文本引导嵌入和生成文本序列之间的信息交互,在确保模型能够根据文本引导嵌入准确恢复语义信息的同时,显著降低了推理成本。实验结果表明,Latent Translator在多个对抗样本数据集上表现出卓越的检测性能,相比现有防御方法展现出更强的鲁棒性。
来源:2026年第3期
《计算机工程与应用》期刊编辑部