Folia
← 返回头版

前沿语言模型物理能力被严重低估 专家重新评分揭示基准测试缺陷

研究人员通过专家重新评分发现,前沿语言模型在物理基准测试上的报告分数存在重大偏差。1经过审计和纠正,GPT-5.6-Sol在HLE-Physics基准上的评分从47.3%大幅上升至78.7%,在CMT-Benchmark上从61.0%上升至87.2%,表明当前物理基准测试严重低估了这些模型的实际能力。1

研究发现,大多数初步被评估为错误的情况源于基准测试本身的问题、参考解答错误或问题表述不明确,而非模型的推理缺陷。1在保留的54个CritPt挑战上,GPT-5.6-Sol的corrected pass@4达到94.4%,进一步证实了这一点。1


评论