一位开发者在Hacker News上分享了在M4 Pro Mac mini上搭建本地大语言模型服务器的完整技术方案。该系统采用48GB RAM的硬件配置,部署耗时约30分钟,通过oMLX推理服务器运行Qwen 3.6-35B和Gemma-4等多个模型。其中Qwen 3.6-35B-A3B-OptiQ-4bit模型占用…