头版Folia Daily Briefing
← 返回头版
科技人工智能

Claude Opus 5在长期编程基准测试中表现略优但仍存局限

Claude Opus 5在SlopCodeBench长期编程任务基准测试中的严格通过率达到24%(在17个检查点的测试子集中获得4项通过),相比前代Opus 4.6的17%略有提升[1]。尽管成绩改善,但这一表现反映出当前AI模型在处理真实软件工程工作时的根本性能局限。

在此次评测中,Opus 5写入的函数数量是Opus 4.8的5倍[1],代码冗长性指标中93%触发规则违规,与Sonnet 5的89%相近但高于Opus 4.8的98%[1]。然而,所有参与测试的模型都未能在任何单个挑战的最后检查点实现全部通过[1]。在代码重复率方面,Opus 4.8从4.6%增至16.8%,而Opus 5表现相对稳定,从2.41%至2.64%基本持平[1]。

评测表明,对于需要增量维护的真实软件工程工作,当今AI模型不足以在无人值守的情况下可靠运行[1]。


SlopCodeBenchClaude Opus 5代码质量评估AI编程基准长期代码维护