头版Folia Daily Briefing
← 返回头版
科技人工智能

Kimi Delta Attention机制:从标准注意力到线性化的推导之路

技术作者Jamie Dborin在Hacker News发表文章,详细阐述了Kimi模型所采用的Kimi Delta Attention(KDA)线性注意力机制的完整推导过程[1]。文章从标准softmax注意力机制出发,通过逐步去除规范化步骤得到线性注意力形式,进而引入delta规则以解决线性注意力中的干涉问题[1]。

KDA机制的核心创新在于其状态转移方程,采用对角矩阵替代标量保留门,从而为每个通道实现独立的遗忘控制[1]。这一设计基于Gated DeltaNet的基础,将其标量保留门扩展为向量形式[1]。该机制的关键数学结构采用对角加低秩(DPLR)形式,表示为Λ_t - β_t k_t k_t^T[1]。

在工程实现层面,文章介绍了Triton核心的两种执行模式:递推型适合自回归解码场景(单token处理),而分块KDA则适用于训练和长前缀填充等需要矩阵运算的场景[1]。


Kimi Delta Attention线性注意力机制DeltaNetAI模型架构Triton核心