国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:史登辉, 奚雪峰, 崔志明, 朱润, 王坚
单位:1.苏州科技大学 电子与信息工程学院,江苏 苏州 215000;2.苏州市虚拟现实智能交互及应用技术重点实验室,江苏 苏州 215000;3.苏州科技大学 智慧城市研究院,江苏 苏州 215000;4.昆山市数据局,江苏 昆山 215301;5.昆山市公安局,江苏 昆山 215301;
关键词:大语言模型(LLM),注意力机制,多头潜在注意力机制(MLA),MoE架构
基金:国家自然科学基金(62176175,62372318);苏州市水利水务科技项目(2025004)。
自从注意力机制(attention mechanism)提出后,基于注意力机制的Transformer架构很快确立了大模型的核心地位,大语言模型迎来了新的发展方向,推动了自然语言处理、计算机视觉等众多领域取得了丰厚的成果。近年来,随着大模型迅猛发展,模型的参数规模持续增长,传统的Transformer架构已经难以满足庞大的模型训练要求。除了堆积算力之外,模型架构的调整以及对于注意力机制的进一步挖掘是解决这一挑战的有效途径,成为了研究的热点。介绍传统的Transformer架构以及近年来对于Transformer架构及其变体的研究现状,分析其核心自注意力机制的原理及其面临的瓶颈。分析总结近年来注意力模块的改进,以DeepSeek为例,探索其爆火背后基于Transformer的MoE架构和多头潜在注意力机制(multi-head latent attention,MLA)的核心技术路径。总结优化注意力机制的研究现状,并展望未来研究方向。
来源:2026年第8期
《计算机工程与应用》期刊编辑部