Claude Opus 5在SlopCodeBench长期编程任务基准测试中的严格通过率达到24%(在17个检查点的测试子集中获得4项通过),相比前代Opus 4.6的17%略有提升。尽管成绩改善,但这一表现反映出当前AI模型在处理真实软件工程工作时的根本性能局限。