头版Folia Daily Briefing
← 返回头版
科技人工智能

Kimi K3可在消费级MacBook Pro上运行 WASTE引擎实现高效推理

WASTE是一款用C语言编写的推理引擎,能够在消费级硬件上运行超大规模语言模型[1]。该引擎使得拥有64GB内存的MacBook Pro M5 Pro可以运行参数量达2.78万亿的Kimi K3大模型[1],推理速度达到0.49-0.54 tokens/秒[1]。

WASTE通过将模型主干保留在内存中、从磁盘流式加载专家权重的方法,解决了消费级设备上运行超大模型的难题[1]。转换后的模型容量为982 GiB[1],最小内存需求约27.28GB[1],推荐内存预算为46GB,其中包括17.56GB的专家缓存[1]。该引擎利用混合专家激活率(每token约4%)的特性进行优化[1]。WASTE已作为开源项目发布,采用Apache 2.0许可证[1]。


Kimi K3大模型推理WASTE引擎消费级硬件混合专家模型