一份针对软件工程任务的AI模型性能评测排行榜已发布,涵盖13个模型和4个Agent在Go、Java、Python、Rust、TypeScript等编程语言上的表现。本次基准测试基于111个问题和来自65个开源仓库的数据进行评估。