YuE2是一套集音乐生成与编辑于一体的前沿系统,在SongBench基准测试中以6.9632的得分超越Suno v5的6.8721。该系统的核心由两个专门模型组成:MERT2音乐编码模型在MARBLE基准的15项指标中达成14项最优性能,SheetSage2转录模型则在节拍、降拍、音阶、和弦、结构、旋律等6项转录任务…
苹果推出了iPhone 18 Pro和iPhone 18 Pro Max两款新机型,两者均采用性能更强的A20 Pro芯片。这次发布实现了苹果7年来iPhone发布节奏的最大改变,也是新任首席执行官Tim Ternus上任后首次推出新产品。
近期大语言模型发布后,社交媒体上出现大量相同类型的演示,包括Minecraft重建、MS Paint绘画和SVG动画等。然而评论指出,这些演示基准测试存在根本缺陷:它们是固定、众所周知的目标,可被AI实验室通过针对性优化完美解决,因此衡量的是准备程度而非真实能力。研究表明,实验室可在8周内对这些测试进行过度拟合。

深度求索(DeepSeek)于7月31日正式发布DeepSeek-V4-Flash-0731模型的API公测版本。该模型拥有304亿参数,在Artificial Analysis Intelligence Index评测中获得50分,与GPT-5.6 Luna性能相当,但单任务成本低约60%。
DeepSeek于7月31日宣布DeepSeek-V4-Flash正式版API上线公测。该版本在多项Agent基准测试中表现出色,Terminal Bench 2.1达到82.7分,NL2Repo得分54.2分,Cybergym达到76.7分,DSBench-FullStack为68.7分,DSBench-Hard为…
AGI Ranker发布了对其AI模型排名系统的全面审计报告,在v2.0.0版本中实现了方法论的重大调整。该更新于2026年7月29日发布,涉及人类基准线重新测量和算法优化,导致所有模型的评分均出现下降,幅度介于6至15分之间,但模型间的相对排名顺序基本保持不变。
研究者发布了Handbook.md基准测试,用于评估语言模型agent在执行长期政策文档约束下的能力。该基准包含65项agentic任务,涉及金融、医疗账单、保险、物流和人力资源五个领域,每项任务均配置20至124页由专家编写的标准操作程序。评测通过824项编程标准进行确定性评分。