头版Folia Daily Briefing
← 返回头版
科技人工智能

"榨"出硅的极限:AI企业如何提升GPU利用率

在芯片短缺的背景下,AI行业正将焦点转向充分挖掘现有GPU的潜力。[1]卡内基梅隆大学研究发现,GPU整体上有近20%的执行时间和约11%的能耗被浪费在等待上,推理场景问题更为突出——Azure Code负载有65%能耗消耗在空转上,OpenAI Chat类请求达52%。[1]一台NVIDIA GB200 NVL72机柜采购成本约400万美元,若软件栈优化不足致GPU利用率仅50%,相当于浪费200万美元。[1]

围绕这一问题,开源推理引擎SGLang和vLLM相继推向商业化,融资规模均超1亿美元。[1]孵化SGLang的RadixArk公司推出了包括KV Cache复用、Prefill/Decode分离等优化技术方案。[1]Anthropic通过KV Cache优化直接将成本砍了90%,其推理队伍拥有200多人,在三年内从基础设施极度不稳定发展到稳定,并实现了二季度盈利。[1]

市场对GPU利用率优化的需求推动了相关企业的快速增长。[1]Baseten一年收入增长20倍,估值从21亿美元暴涨至130亿;fireworks七个月估值翻四倍达175亿美元,年化营收突破10亿美元。[1]这种增长背景是全球AI基础设施投资的持续扩大——Meta、Google、Microsoft等科技巨头今年合计资本开支预计超1万亿美元,黄仁勋预测到2030年,全球AI基础设施年投资规模将达4万亿美元。[1]


AI推理引擎GPU利用率优化SGLangvLLMAI基础设施