Folia
← 返回头版

AI系统自主设计推理硬件加速器

开源项目openTPU展示了人工智能系统自主开发硬件加速器的能力1。该项目完成了一个完整的AI推理加速器的设计和实现,包括硬件设计、指令集、编译器和主机软件等全套组件1。这一加速器已在Xilinx Kintex-7 xc7k480t FPGA卡上成功验证,配备两个DDR3通道1,能够运行包括LFM2-2.6B、SmolLM3-3B、Phi-4-mini、Qwen3.5等十个现代语言模型1。

在性能方面,该硬件加速器实现了显著的优化。相比之前版本,最新构建的解码速度提升了8-10%,同时DRAM利用率从82-87%提升至91-94%,达到DDR3-1066峰值带宽17.1 GB/s的82-94%1。此外,加速器支持4-bit量化权重,相比int8方案的解码速度提升幅度达到40-45%1。该项目包含完整的开源工具链,涵盖SystemVerilog硬件设计、ISA模拟器、内核语言编译器和主机软件1。


评论