TypeSafe公司推出的通用分类器Jev声称采用强化学习校准决策(RLCD)训练方法,能够返回已校准的概率值。然而,分析认为这一说法在实际应用中存在重大问题。模型的校准性能不仅取决于模型本身,更依赖于数据分布的特征;即使同一模型在特定数据集上表现良好,也无法保证在用户实际数据上维持相同的校准效果。
SpaceXAI于2026年9月21日发布了推理大模型Grok 4.7(xhigh版本)。该模型在人工智能指数上获得46分的评分,相比同价位竞品的中位数24分表现更优。从定价角度看,Grok 4.7具有竞争力,输入令牌定价为每百万2美元,输出令牌为每百万6美元。
研究人员通过专家重新评分发现,前沿语言模型在物理基准测试上的报告分数存在重大偏差。经过审计和纠正,GPT-5.6-Sol在HLE-Physics基准上的评分从47.3%大幅上升至78.7%,在CMT-Benchmark上从61.0%上升至87.2%,表明当前物理基准测试严重低估了这些模型的实际能力。