Folia
← 返回头版

Real-SWE基准测试发布:评估AI模型在企业私有代码库上的能力

一项名为Real-SWE的新基准测试发布,用于衡量前沿AI模型在私有、真实企业代码库中的表现1。该基准采用来自实际生产环境的任务,涵盖具有商业影响的复杂工程问题,被测试的企业包括拥有200K+用户的社交平台竞争对手、处理100K+银行账单的消费金融平台,以及企业AI销售平台1。

测试结果显示AI模型面临显著挑战1。短期执行(10分钟以内)失败率达71.4%,长期执行失败率为73.4%1。最常见的失败原因是遗漏需求,占所有失败中最大的比例1。另一个关键发现是,99%的真实企业代码库中的token对前沿模型均为隐藏的1,这意味着这些模型在训练过程中未曾接触过相关代码。基准测试预估单个任务的执行成本范围从$2.50到$6.961。


评论