一名开发者在Hacker News上展示了slotstream项目,该项目实现了在仅有48GB内存的Mac上本地运行104GB的Qwen3.8-Flash-Next模型,推理速度约12token/秒。这一方案通过流式从SSD读取权重、动态内存管理等技术优化,使普通消费级硬件也能运行大型语言模型。