Folia
← 返回头版

Kimi K3自托管推理性能测试:硬件成本增加20%,任务完成率提升24个百分点

一项针对Kimi K3模型自托管推理的评测显示,该模型在8×B300节点配置下需要1.4TB权重,硬件成本相比采用8×B200节点的GLM-5.2高约20%1。尽管投入更高,K3在SWEBench Pro基准测试中的任务完成率达到86.4%,较GLM-5.2和Opus 4.8的62.5%高出24个百分点1。在16并发会话场景下,K3的中位任务时间为38分钟,token吞吐量达到122 tok/s1。

评测基于对64个SWEBench Pro任务约100次运行的测试数据1。研究团队还对多种GPU硬件配置进行了成本效益分析,包括DGX Spark、H200、HGX H200及HGX B200等1。分析表明,即使B200 GPU机架仅保持15%的利用率,其成本效益也能超越前沿API定价模式1。

根据调查数据,中位员工年度AI API使用支出约为140美元,第90百分位数接近7,300美元,第99百分位数接近90,000美元1。主要编码用例占大型模型提供商年度经常性收入的70%以上1。


评论