基于Earendil公司的研究,科研人员提出了衡量大语言模型生成代码质量问题的新方法。尽管大语言模型在生成形式正确的代码方面已接近完美,但其产出的代码存在不必要的抽象、重复代码片段和不良设计决策等问题。
Claude Opus 5在SlopCodeBench长期编程任务基准测试中的严格通过率达到24%(在17个检查点的测试子集中获得4项通过),相比前代Opus 4.6的17%略有提升。尽管成绩改善,但这一表现反映出当前AI模型在处理真实软件工程工作时的根本性能局限。