Folia
← 返回头版

研究团队提出面向高效张量计算的线程-寄存器解耦GPU执行模型FIBER

2026年8月20日,FIBER架构研究团队提出了一种用于高效张量计算的线程-寄存器解耦GPU执行模型 1。该研究提出的FIBER架构扩展了GPU的SIMT执行模型,将执行实例(fiber)与私有寄存器所有权解耦 1。在这种设计下,执行实例仅携带最小控制状态,并通过共享视图访问流式多处理器(SM)寄存器,从而实现动态并行度缩放和细粒度寄存器级数据流调度 1。

该架构扩展了指令集、微架构和编译器 1。在典型混合精度大语言模型(LLM)服务场景下,该架构在Ampere上实现了2.25倍的端到端加速(原始FP16计算为1.15倍),在Hopper上实现了1.8倍加速,在Blackwell上实现了2.09倍端到端加速 1。此外,其内核级增益最高达2.49倍 1。


评论