vLLM项目在AMD GPU平台上成功实现了投机解码技术。这一方法通过轻量级草稿组件提出候选token,再由目标模型在单次验证中从左到右逐一接受或拒绝这些token,从而在单轮推理中提交多个token,显著提升大语言模型的推理吞吐量。
在芯片短缺的背景下,AI行业正将焦点转向充分挖掘现有GPU的潜力。卡内基梅隆大学研究发现,GPU整体上有近20%的执行时间和约11%的能耗被浪费在等待上,推理场景问题更为突出——Azure Code负载有65%能耗消耗在空转上,OpenAI Chat类请求达52%。一台NVIDIA GB200 NVL72机柜采购成本…