头版Folia Daily Briefing
← 返回头版
科技半导体

16张B200才能跑的Kimi K3,8张AMD就装下了

Wafer AI在AMD MI355X显卡上成功部署了Kimi K3大模型。[1]Kimi K3拥有2.8万亿参数,模型权重需要超过1.5TB显存。[1]原本需要16张NVIDIA B200跨越两台服务器运行的模型,现在仅需8张MI355X在单台服务器上完成。[1]8张MI355X合计约2.3TB显存。[1]

在性能对标方面,MI355X展现出明显优势。[1]MI355X峰值总吞吐量达952 Token/s,而16张B200双节点部署总吞吐量仅为498 Token/s,单节点吞吐量约为B200双节点部署的3.8倍。[1]在成本效率上,MI355X每美元提供约48 Token/s的峰值吞吐量,相比B200约7 Token/s和B300约33 Token/s更具竞争力。[1]MI355X与B300均拥有288GB单卡显存。[1]

AMD为该模型部署提供了首发级的软件支持。[1]Wafer AI通过推测解码优化使单路性能提高2.2倍,并通过补零将12个注意力头补到16个,优化预填充速度从4000-7000 Token/s提升到1.3万Token/s。[1]


AMD MI355XNVIDIA B200Kimi K3GPU性能对比数据中心加速