物理基准测试

科技人工智能

前沿语言模型物理能力被严重低估 专家重新评分揭示基准测试缺陷

研究人员通过专家重新评分发现,前沿语言模型在物理基准测试上的报告分数存在重大偏差。经过审计和纠正,GPT-5.6-Sol在HLE-Physics基准上的评分从47.3%大幅上升至78.7%,在CMT-Benchmark上从61.0%上升至87.2%,表明当前物理基准测试严重低估了这些模型的实际能力。