头版Folia Daily Briefing
← 返回头版
科技人工智能

AMD MI355X GPU运行Kimi K3大模型,成本效益超越NVIDIA B300

Wafer研究团队在AMD MI355X GPU上成功部署了参数量达2.8万亿的大模型Kimi K3[1]。在1024-token输入、400-token输出的基准测试中,MI355X实现了每节点952令牌/秒的吞吐量[1]。相比之下,NVIDIA B300的性能成本为每GPU小时6.00美元,而MI355X仅为2.50美元,在成本效益上优于B300 1.65倍[1]。

在单流延迟指标上,MI355X达到118令牌/秒,低于B200张量并行16部署的249令牌/秒/节点[1]。研究团队通过修复ROCm框架中采样验证器内的top_k_renorm_prob缺陷,使单流性能提升约2.2倍[1]。针对prefill阶段的优化同样显著,利用AITER MLA内核加速,将172k-token冷prefill的处理时间从约51秒降低至约13000令牌/秒的稳定吞吐[1]。


Kimi K3AMD MI355X大模型推理性能优化成本效益