Folia
← 返回头版

Benzi代码智能工具在基准测试中对标Claude Code和CodeGraph

Benzi是一款代码智能工具,在SWE-bench Verified基准测试中展示了其性能表现1。该工具在500个真实GitHub问题的测试中解决了78.2%,单个问题的处理成本低于10美分1。测试涵盖了24个GitHub issues和10种编程语言1,对标对象包括Claude Code和CodeGraph等代码智能方案1。

Benzi在成本效益上显示出优势1。根据对比数据,DeepSeek系列模型的成本约为Claude Sonnet的二十分之一1。在难度递增的问题处理上,Claude Code的成本增长斜率最陡,而Benzi展现出相对更缓和的成本增长曲线1。


评论