头版Folia Daily Briefing
← 返回头版
科技人工智能

禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了

在禁用第三方库和最小化提示词的测试条件下,Claude Opus 5和GPT-5.6的性能差异得以显现。[1]一项代码bug检测测试中,两个模型都成功找到了6个预设的bug,包括比较运算符错误、浮点精度污染、折扣优惠规则混淆、重复优惠券叠加、缺少价格下限保护和运费计算错误。[1]但Opus 5的表现更为深入——它额外发现了运费计算中的浮点精度问题,即3.0000000000000004经过math.ceil取整后的溢出风险。[1]

在第二项测试中,两个模型被要求从4秒、44100Hz采样率、16位PCM格式的单声道WAV文件(包含176400个采样点)生成波形图,且禁用所有外部库。[1]两个模型都超预期完成了任务,但方案效率存在差异——Opus 5采用了struct.unpack的批量解包方法,相比GPT-5.6逐个调用unpack_from的方式更加高效。[1]此外,Opus 5在解决方案中展现了更强的产品思维。[1]


Claude Opus 5GPT-5.6AI模型对比代码生成问题诊断能力