Folia
← 返回头版

AMD MI355X运行Kimi K3大模型性价比超越NVIDIA B300

研究人员成功在AMD MI355X GPU上部署了参数量达2.8T的大模型Kimi K3 1。该模型需要超过1.5TB的显存 1,在1024-token输入/400-token输出的基准测试中,MI355X实现了952 tok/s/node的吞吐量 1。

性能成本方面,MI355X的运营成本为每小时每GPU 2.50美元,而NVIDIA B300为每小时每GPU 6.00美元 1。相比之下,MI355X在成本效益上优于B300 1.65倍 1。单流延迟方面,MI355X达到118 tok/s,低于B200在TP16部署下249 tok/s/node的表现 1。

研究团队通过修复ROCm框架中采样验证器的NameError缺陷,使单流性能提升了约2.2倍 1。同时,他们优化了prefill算法,利用AITER MLA kernel将172k-token冷prefill的耗时从约51秒降低至每秒约13k token的稳态性能 1。这些优化举措充分展示了AMD GPU在大规模模型推理服务中的竞争潜力 1。


评论