Slopcodebench

科技人工智能

大语言模型代码生成存在"松散度"问题 研究揭示AI生成代码质量缺陷

基于Earendil公司的研究,科研人员提出了衡量大语言模型生成代码质量问题的新方法。尽管大语言模型在生成形式正确的代码方面已接近完美,但其产出的代码存在不必要的抽象、重复代码片段和不良设计决策等问题。

科技人工智能

Claude Opus 5在长期编程基准测试中表现略优但仍存局限

Claude Opus 5在SlopCodeBench长期编程任务基准测试中的严格通过率达到24%(在17个检查点的测试子集中获得4项通过),相比前代Opus 4.6的17%略有提升。尽管成绩改善,但这一表现反映出当前AI模型在处理真实软件工程工作时的根本性能局限。