Folia
← 返回头版

Kimi K3与Fable模型性能对标研究发布

近期研究对开源模型Kimi K3与闭源模型Fable 5进行了全面对标测试1。此项评估涵盖约1030个智能体任务1,旨在比较两款模型在性能与成本方面的差异。

在SWE基准测试中,K3得分达92.4%,Fable为92.6%1,两者性能接近。但在成本效益方面,K3展现出明显优势。在Oracle路由测试中,有72-96%的任务由K3处理达到最优结果1。

具体来看,在SWE任务上,K3平均消耗55轮和130万tokens完成,而Fable消耗21轮和130K tokens1。在长终端任务中,Fable消耗64轮和150万tokens1。研究指出,通过提示词缓存技术,即使K3读取10倍tokens,仍然保持成本优势1。

研究表明,两个模型在不同任务类型上各有专长,通过实施任务级路由机制,可实现比单一模型更优的综合性能1。


评论