Benzi是一款代码智能工具,在SWE-bench Verified基准测试中展示了其性能表现。该工具在500个真实GitHub问题的测试中解决了78.2%,单个问题的处理成本低于10美分。测试涵盖了24个GitHub issues和10种编程语言,对标对象包括Claude Code和CodeGraph等代码智能方案。
近期研究对开源模型Kimi K3与闭源模型Fable 5进行了全面对标测试。此项评估涵盖约1030个智能体任务,旨在比较两款模型在性能与成本方面的差异。