头版Folia Daily Briefing
← 返回头版
科技人工智能

Apple Silicon虚拟机LLM推理性能大幅提升 Metal兼容层技术突破

Francesco Bonacci和Johnny Franks团队公布了一项研究成果,通过在macOS虚拟机中部署Metal能力兼容层,显著改善了大语言模型的推理效率 [1]。在M1 Ultra处理器上,TinyLlama 1.1B模型的提示词处理速度提升11.08倍,令牌生成速度提升16.36倍;Google Gemma 4 12B模型的对应性能分别提升7.20倍和14.54倍 [1]。

该技术在性能接近程度上表现突出 [1]。TinyLlama提示词处理达到裸机98%的性能水平,Gemma 4的提示词处理达到裸机性能的99.59%,生成速度达到94.82% [1]。具体数据显示,TinyLlama提示词处理速度从每秒432个令牌提升至4,787个令牌,Gemma 4提示词处理从71.66提升到515.76个令牌/秒,生成速度从3.41提升至49.67个令牌/秒 [1]。本次测试在配备48核GPU的M1 Ultra、macOS 26.6.1主机和Tahoe Cua映像(macOS 26.5.2)上进行,使用llama.cpp b10167版本和官方模型作为基准 [1]。该研究成果已在Lume和Cua项目下开源发布 [1]。


Apple SiliconmacOS虚拟机LLM推理优化llama.cppMetal GPULume虚拟化