头版Folia Daily Briefing
← 返回头版
科技人工智能

Kimi Linear:混合线性注意力架构的突破

Kimi团队发布了Kimi Linear混合线性注意力架构,在短上下文、长上下文和强化学习等多个场景中首次超越全注意力机制[1]。该架构的核心创新是Kimi Delta Attention(KDA)模块,采用精细的门控机制和专用的对角线加低秩转移矩阵算法,显著降低了计算成本[1]。预训练的3B激活参数模型相比全MLA架构性能更优,同时实现KV缓存减少75%、1M上下文解码吞吐量提升6倍的优化[1]。

Kimi Linear采用混合架构设计,将KDA线性层与多头隐式注意力机制相结合[1]。根据Kimi K3模型的应用,该混合架构采用3:1混合比例:3层KDA线性层穿插1层全注意力[2]。单个token的缓存大小从传统70B模型的320KB降至约24KB,尽管Kimi K3模型规模大40倍[2]。Kimi团队已开源了KDA核心代码和vLLM实现[1]。


Kimi Linear线性注意力机制大模型架构AI效率优化开源模型大模型架构创新Kimi K3芯片断供与技术突围Transformer改造长文本优化