头版Folia Daily Briefing
← 返回头版
科技人工智能

Kimi K3自托管推理性能测试:硬件成本增加20%,任务完成率提升24个百分点

一项针对Kimi K3模型自托管推理的评测显示,该模型在8×B300节点配置下需要1.4TB权重,硬件成本相比采用8×B200节点的GLM-5.2高约20%[1]。尽管投入更高,K3在SWEBench Pro基准测试中的任务完成率达到86.4%,较GLM-5.2和Opus 4.8的62.5%高出24个百分点[1]。在16并发会话场景下,K3的中位任务时间为38分钟,token吞吐量达到122 tok/s[1]。

评测基于对64个SWEBench Pro任务约100次运行的测试数据[1]。研究团队还对多种GPU硬件配置进行了成本效益分析,包括DGX Spark、H200、HGX H200及HGX B200等[1]。分析表明,即使B200 GPU机架仅保持15%的利用率,其成本效益也能超越前沿API定价模式[1]。

根据调查数据,中位员工年度AI API使用支出约为140美元,第90百分位数接近7,300美元,第99百分位数接近90,000美元[1]。主要编码用例占大型模型提供商年度经常性收入的70%以上[1]。


Kimi K3模型自托管推理GPU硬件成本任务完成率开源模型