成立于2024年的初创公司Vals最近完成了由Andreessen Horowitz领投的4000万美元A轮融资。该公司专注于为人工智能模型提供更可靠的基准测试服务,通过评估模型在法律、金融、编码、心理健康、网络安全、生物安全和武装冲突法等特定行业的复杂任务完成能力,区别于传统基准测试方法。
中国人工智能实验室Z.ai证实,此前在OpenRouter平台上匿名发布并登顶多项基准测试与排行榜的神秘开源模型Ox Alpha,正是出自该团队之手 。Z.ai确认,Ox Alpha是其GLM系列的最新迭代版本,这是一款专为编码、持续代理工作和生产负载设计的推理模型 。
ARC-AGI-3排行榜对不同AI系统在适应新型交互环境任务中的表现进行了评估对比 。该排行榜的核心衡量指标为单任务成本与性能的关系,重点评估在有限计算资源约束下AI系统解决问题的效率 。
研究人员通过系统实验检验了一个假设:顶级AI实验室是否针对"生成pelican骑自行车"这一著名基准任务对模型进行了优化。
研究人员发表论文探索利用MUD(文本冒险游戏)来评估大型语言模型,总耗资仅99美元。研究对四个行为维度进行评分,其中两个依赖LLM分类器。