Folia
← 返回头版

ShapeLearn发布Qwen 3.8 27B完整量化版本,性能达BF16基准99.63%

ShapeLearn团队发布了Qwen 3.8 27B模型的完整量化版本,相比此前的ShapeLearn-Lite版本提升了性能表现1。该完整版本包含五个不同量化级别的模型,在6种GPU配置下的测试中均实现了质量与速度的帕累托最优1。

其中GPU-5量化版本达到BF16聚合基准的99.63%性能,吞吐量在59.2至93.7 token/秒之间波动(具体数值取决于GPU型号),在RTX Pro 6000上达到90.4 token/秒,在RTX 5090上达到93.7 token/秒1。GPU-4版本在内存占用11.0 GB的情况下实现了98.72%的BF16性能1。

研究引入了MTP和DFlash2两种推测解码方法来进一步提升效率1。其中DFlash2的吞吐量提升倍数为1.34至2.10倍,MTP为1.28至1.66倍1。KLD评估基于约500万个token的数据集,涵盖长上下文和Agent任务场景1。该研究论文已被EMNLP Industry Track接收1。


评论