长期代码维护

科技人工智能

Claude Opus 5在长期编程基准测试中表现略优但仍存局限

Claude Opus 5在SlopCodeBench长期编程任务基准测试中的严格通过率达到24%(在17个检查点的测试子集中获得4项通过),相比前代Opus 4.6的17%略有提升。尽管成绩改善,但这一表现反映出当前AI模型在处理真实软件工程工作时的根本性能局限。