头版Folia Daily Briefing
← 返回头版
科技互联网

AGI Ranker审计AI排名系统 所有模型评分下调6-15分

AGI Ranker发布了对其AI模型排名系统的全面审计报告,在v2.0.0版本中实现了方法论的重大调整[1]。该更新于2026年7月29日发布,涉及人类基准线重新测量和算法优化,导致所有模型的评分均出现下降,幅度介于6至15分之间,但模型间的相对排名顺序基本保持不变[1]。

此次调整的核心改进包括三个方面[1]。首先是人类天花板的重新验证,系统从原有的11个基准中精简至仅4个具有真实人类测量结果的基准,其余11个改为采用1.00的标准基准值[1]。其次是Agency组件的重建,采用了4个独立评估器——包括SWE-bench Verified、Terminal-Bench 2.1、τ³-Banking和LiveBench Agentic Coding——以减少对单一评估机构的依赖[1]。此外,评分权重也进行了重新分配,Artificial Analysis的占比从45%降至26%,而Knowledge组件从此前的97%单一来源改为52/48的双源分布[1]。

为提升透明度,系统现已将所有156个评分单元都与记录来源关联,使来源信息成为评分的必要条件而非可选项[1]。报告指出,评分下降约6分源于天花板调整,而进一步的下降则来自Agency组件的重建[1]。此外,AGI Ranker还修复了社交媒体预览卡片的缓存问题,改采版本化URL方案来强制重新获取数据,解决了旧文件缓存导致预发布数据被分享的问题[1]。


AI Leaderboard评分审计基准测试方法论更新数据质量