头版Folia Daily Briefing
← 返回头版
科技人工智能

Kimi K3公开基础设施优化方案,但核心技术难以复制

月之暗面发布了Kimi K3的技术报告,详细披露了大模型训练中的AI基础设施(Infra)层设计细节[1]。该报告阐述了三项核心优化方案:KDA线性注意力机制、AttnRes注意力残差机制和MoonEP负载均衡方法[1]。这些方案的共同目标是消除串行等待、减少计算重复和实现动态负载均衡,而非简单依靠堆积GPU硬件[1]。

在训练效率评估方面,模型浮点运算利用率(MFU)成为行业标准指标[1]。字节跳动MegaScale达到的55.2% MFU被视为公开最高纪录之一[1],而xAI的MFU仅为11%,远低于业界正常水准的35%-45%[1]。

Kimi K3在具体优化上采用了多项创新。KDA机制通过FlashKDA和KCP方法,借助分块计算和上下文并行来优化串行依赖[1]。AttnRes在约8个块的配置下即可实现大部分性能优势[1]。MoonEP则从理论层面证明,只需为每个GPU配置固定数量的冗余专家便可确保负载均衡——例如在100个专家、20个GPU的配置中,每个GPU仅需5个冗余专家[1]。


Kimi K3AI基础设施大模型训练月之暗面模型架构