科学推理

科技人工智能

前沿语言模型物理能力被严重低估 专家重新评分揭示基准测试缺陷

研究人员通过专家重新评分发现,前沿语言模型在物理基准测试上的报告分数存在重大偏差。经过审计和纠正,GPT-5.6-Sol在HLE-Physics基准上的评分从47.3%大幅上升至78.7%,在CMT-Benchmark上从61.0%上升至87.2%,表明当前物理基准测试严重低估了这些模型的实际能力。

科技人工智能

OpenAI下一代模型Astra解决十项数学领域重大开放问题

OpenAI的下一代主要模型Astra的内部版本成功解决了十个数学、量子复杂性和理论计算机科学领域的重大开放问题。根据EpochAI Research的评估标准,这些成果的重要程度经过了系统分类和评价。