头版Folia Daily Briefing
← 返回头版
科技人工智能

CPU在大语言模型推理中重获重视

随着Agent AI的兴起和本地化小型模型部署的增加,CPU在大语言模型推理中的角色正在重新定义。传统训练工作负载中CPU与GPU的比例为1:8,但在推理阶段已提升至1:4,在Agent工作负载中更是趋向1:1,部分客户的部署比例甚至达到4:1。[1]

业界领导者纷纷调整战略以适应这一转变。Intel首席执行官Lip-Bu Tan在Computex 2026表示:"对于强化学习、编排和Agent,CPU是更好的选择。"[1] 根据Intel Q1 2026财报,其Data Center and AI部门营收达51亿美元,同比增长22%。[1] Arm首席执行官Rene Haas估计,传统AI数据中心需要约3000万CPU核心/GW,而在Agent时代这一需求上升至1.2亿CPU核心/GW,增长了4倍。[1]

CPU在Agent工作负载中的重要性源于其在工具处理上的优势。Georgia Tech与Intel的联合研究表明,Agent工作负载中CPU侧工具处理占总端到端延迟的50-90%。[1] 硬件层面,NVIDIA推出的Vera CPU相比主流x86 CPU性能大幅提升,沙箱性能快1.8倍,内存带宽快2倍,单核带宽快3倍。[1] NVIDIA的NVL72机架架构体现了这一转变,配置72个Rubin GPU和36个Vera CPU,CPU:GPU比例从传统的1:8转变为1:2。[1]

市场增长前景广阔。OpenAI与AWS在2025年11月签订了为期7年、价值380亿美元的基础设施合作协议,涵盖数百万NVIDIA GPU和数千万CPU。[1] 摩根士丹利预计,Agent CPU的这一转变将在2030年前产生325亿至600亿美元的增量CPU市场增长。[1]


CPU推理Agent AILLM推理架构NVIDIA Vera CPUvLLM