Folia
← 返回头版

Magnitude推出自优化推理引擎 性能较llama.cpp显著提升

Y Combinator S25批次初创公司Magnitude推出了一款自优化推理引擎,专门为本地Agent运行设计1。该引擎采用设备端编译调优、混合分页注意力等技术,在多个平台上相比llama.cpp实现了显著的性能提升1。

在Mac M4 Pro 48GB上,Magnitude的解码速度从llama.cpp的30 tok/s提升至57 tok/s,快92%;预填充速度从466 tok/s提升至507 tok/s,快9%1。在CUDA(DGX Spark)环境下,解码速度从49 tok/s提升至58 tok/s,快19%;预填充速度从2,033 tok/s提升至2,507 tok/s,快23%1。同时,该引擎还将内存使用量分别减少了28%(Mac)和27%(CUDA)1。

Magnitude采用Apache 2.0开源协议,用Rust编写,包含自定义GPU内核运行时和自动调优器1。基准测试采用Qwen 3.6 35B A3B(4 bit)模型、64k上下文长度、无推测解码配置1。该引擎支持Mac、Linux、Windows跨平台运行,并兼容Pi、OpenCode、Hermes、Codex等多个Agent框架1。

Magnitude由Anders和Tom创立,两人此前开发的开源浏览器Agent项目获得4000多个星标和100万次以上下载1。


评论