头版Folia Daily Briefing
← 返回头版
科技人工智能

阿里巴巴发布Qwen3.8开源大模型FP8量化版本

阿里巴巴Qwen团队推出了Qwen3.8-2.4T大语言模型的FP8量化版本[1],这是Qwen开源模型家族中首次发布Qwen-Max级别的开源模型[1]。该模型拥有2.4T总参数和95B激活参数[1],采用细粒度FP8量化方法,块大小为128[1],性能指标与原始模型基本相同[1]。

模型在部署和推理上具有多项特性[1]。原生上下文长度支持262,144令牌,可扩展至1,010,000令牌[1]。推理深度方面,模型支持通过reasoning_effort参数进行调整,选项包括xhigh、medium和low[1]。默认启用preserve_thinking功能,以保留历史消息的推理上下文[1]。该模型支持vLLM、SGLang、TokenSpeed等多种推理框架部署[1]。建议的采样参数配置为temperature=1.0、top_p=0.95、top_k=20[1]。


Qwen3.8大语言模型开源模型推理框架FP8量化

来源

  1. Hacker NewsQwen3.8-2.4T