苹果A20 Pro芯片在端侧AI性能上取得显著提升。iPhone 18 Pro可在本地运行270亿参数的AI模型Bonsai-27B,其处理速度相比iPhone 17 Pro提高了2倍。这一性能飞跃得益于芯片架构的创新升级。

研究人员成功在AMD MI355X GPU上部署了参数量达2.8T的大模型Kimi K3 。该模型需要超过1.5TB的显存 ,在1024-token输入/400-token输出的基准测试中,MI355X实现了952 tok/s/node的吞吐量 。
WASTE是一款用C语言编写的推理引擎,能够在消费级硬件上运行超大规模语言模型。该引擎使得拥有64GB内存的MacBook Pro M5 Pro可以运行参数量达2.78万亿的Kimi K3大模型,推理速度达到0.49-0.54 tokens/秒。
Deltafin项目成功在Apple M1 Max笔记本电脑上实现了参数量为2.8万亿的Kimi K3大模型的本地推理。该项目通过专门的优化技术,证明了在消费级硬件上部署大规模混合专家模型的可行性,项目代码采用MIT许可证开源。