头版Folia Daily Briefing
← 返回头版
科技人工智能

DeepSeek V4 Flash成功部署在单块AMD MI300X GPU上

开发者在Hacker News上发布了DeepSeek-V4-Flash-0731模型在单块AMD MI300X GPU上的生产部署方案[1]。该配置提供了完整的Docker Compose堆栈、补丁修复和优化调优表,针对vLLM官方配置不支持MI300X的问题进行了系统解决[1]。

部署方案的关键突破在于解决了多个技术障碍[1]。其中最重要的是FP8格式兼容性问题——MI300X采用AMD专有的FNUZ E4M3标准(float8e4b8,FP8_MAX=224.0),而非行业标准的OCP E4M3规范,这种差异可能导致缩放因子二倍的错误[1]。此外,方案还修复了MoE路由和CUDA图捕获等关键问题[1]。

在性能表现方面,该部署在2-8个并发流处理下运行,峰值可达64个流[1]。预填充性能方面,在2048令牌调度器预算下达到6,988-7,019 tok/s,而在8192令牌预算下可达7.90-7.99K tok/s[1]。模型加载占用156.67 GiB显存,GPU KV缓存最多可处理262,144个令牌,热高水位标记为204.5/205.8 GB显存占用[1]。该方案未采用权重量化即可在单卡上完整装载该模型[1]。

MI300X GPU具备192GB HBM3显存和5.3TB/s内存带宽,成本约为H100 SXM5的一半[1]。部署使用的技术栈包括vLLM ROCm nightly版本0.26.1rc1.dev229+g124154a88.rocm723和AITER版本0.1.19[1]。该配置还支持DSpark-7推测解码、概率草稿生成和块拒绝机制[1]。


DeepSeek V4 FlashAMD MI300XvLLM模型部署FP8量化