头版Folia Daily Briefing
← 返回头版
科技人工智能

AirLLM 开源工具实现大模型在低端GPU上推理

AirLLM 是一个开源项目,通过创新的推理方法使大型语言模型能在配置受限的 GPU 上运行[1]。该工具无需应用量化、蒸馏或剪枝等传统优化技术,即可在单个 4GB GPU 上运行 70B 参数模型[1]。其核心方案是每次仅在 GPU 上保留一个模型层,通过流式加载的方式实现内存优化,使 VRAM 需求取决于单层大小而非总参数量[1]。

该项目支持多个大规模模型的部署[1]。405B 参数的 Llama 3.1 可在 8GB GPU 上运行,671B 参数的 DeepSeek-V3 可在约 12GB GPU 上运行,而 2.8T 参数的 Kimi K3 则可在 3.72GB VRAM 上运行[1]。此外,AirLLM v3.0 版本新增对 FP8 模型的支持,包括 DeepSeek-V3 和 Qwen3 系列[1]。该工具还支持 4bit 和 8bit 块级量化压缩功能,能将推理速度提升至 3 倍[1]。


AirLLM大语言模型推理GPU内存优化开源工具