技术作者Jamie Dborin在Hacker News发表文章,详细阐述了Kimi模型所采用的Kimi Delta Attention(KDA)线性注意力机制的完整推导过程。文章从标准softmax注意力机制出发,通过逐步去除规范化步骤得到线性注意力形式,进而引入delta规则以解决线性注意力中的干涉问题。
Kimi团队发布了Kimi Linear混合线性注意力架构,在短上下文、长上下文和强化学习等多个场景中首次超越全注意力机制。该架构的核心创新是Kimi Delta Attention(KDA)模块,采用精细的门控机制和专用的对角线加低秩转移矩阵算法,显著降低了计算成本。预训练的3B激活参数模型相比全MLA架构性能更优…