Folia
← 返回头版

研究人员逆向工程分析苹果神经引擎架构设计

一项技术研究详细揭示了Apple Neural Engine(ANE)在M1芯片中的内部架构设计。1研究通过反向工程方法,分析了ANE的计算核心、调度器、内存层次和DMA引擎等关键组件。1

M1芯片中的ANE配备16个计算核心,每个核心拥有128条FP16(或256条INT8)乘法累加通道,共计2048条并行MAC通道。1整体性能达到11 TOP/s,系统DRAM带宽为68 GB/s。1ANE采用固定功能数据流引擎设计,通过任务描述符进行配置,而非使用通用GPU指令集。1

在内存架构方面,ANE包含1 MiB的内核存储、16个L1暂存区和2 MiB的共享L2 SRAM。1数据传输层面,KernelDMA的读带宽为37.99 GB/s,TileDMA的读带宽为59.08 GB/s,而GPU读带宽可达77.70 GB/s。1研究指出,kernel和tile DMA请求按顺序而非并行执行,这一设计限制了DRAM的整体吞吐量。1

ANE架构原本为CNN工作负载优化,但在M5芯片中已被整合到GPU核心中,标志着独立NPU设计时代的终结。1


评论