Folia
← 返回头版

"榨"出硅的极限:AI企业如何提升GPU利用率

在芯片短缺的背景下,AI行业正将焦点转向充分挖掘现有GPU的潜力。1卡内基梅隆大学研究发现,GPU整体上有近20%的执行时间和约11%的能耗被浪费在等待上,推理场景问题更为突出——Azure Code负载有65%能耗消耗在空转上,OpenAI Chat类请求达52%。1一台NVIDIA GB200 NVL72机柜采购成本约400万美元,若软件栈优化不足致GPU利用率仅50%,相当于浪费200万美元。1

围绕这一问题,开源推理引擎SGLang和vLLM相继推向商业化,融资规模均超1亿美元。1孵化SGLang的RadixArk公司推出了包括KV Cache复用、Prefill/Decode分离等优化技术方案。1Anthropic通过KV Cache优化直接将成本砍了90%,其推理队伍拥有200多人,在三年内从基础设施极度不稳定发展到稳定,并实现了二季度盈利。1

市场对GPU利用率优化的需求推动了相关企业的快速增长。1Baseten一年收入增长20倍,估值从21亿美元暴涨至130亿;fireworks七个月估值翻四倍达175亿美元,年化营收突破10亿美元。1这种增长背景是全球AI基础设施投资的持续扩大——Meta、Google、Microsoft等科技巨头今年合计资本开支预计超1万亿美元,黄仁勋预测到2030年,全球AI基础设施年投资规模将达4万亿美元。1


评论