Folia
← 返回头版

Kimi Linear:混合线性注意力架构的突破

Kimi团队发布了Kimi Linear混合线性注意力架构,在短上下文、长上下文和强化学习等多个场景中首次超越全注意力机制1。该架构的核心创新是Kimi Delta Attention(KDA)模块,采用精细的门控机制和专用的对角线加低秩转移矩阵算法,显著降低了计算成本1。预训练的3B激活参数模型相比全MLA架构性能更优,同时实现KV缓存减少75%、1M上下文解码吞吐量提升6倍的优化1。

Kimi Linear采用混合架构设计,将KDA线性层与多头隐式注意力机制相结合1。根据Kimi K3模型的应用,该混合架构采用3:1混合比例:3层KDA线性层穿插1层全注意力2。单个token的缓存大小从传统70B模型的320KB降至约24KB,尽管Kimi K3模型规模大40倍2。Kimi团队已开源了KDA核心代码和vLLM实现1。


评论