头版Folia Daily Briefing
← 返回头版
科技人工智能

13个AI模型和4个Agent在多编程语言软件工程任务上的性能对比发布

一份针对软件工程任务的AI模型性能评测排行榜已发布,涵盖13个模型和4个Agent在Go、Java、Python、Rust、TypeScript等编程语言上的表现[1]。本次基准测试基于111个问题和来自65个开源仓库的数据进行评估[1]。

排行榜已进行多轮更新。2026年7月1日新增的模型包括GLM 5.2、DeepSeek-V4 Pro、DeepSeek-V4 Flash、MiMo V2.5 Pro、Qwen 3.6系列和Gemma 4 31B[1]。此前在2026年5月27日曾新增gpt-5.5系列、Claude Opus 4.7和Kimi K2.6[1]。评测框架在2025年9月4日引入了Cost per Problem和Tokens per Problem两项新指标[1]。所有排行榜问题的Docker镜像和HuggingFace数据集已于2025年7月11日发布[1]。


AI模型评测SWE任务代码生成多语言编程模型排行榜