认知能力评估

科技人工智能

AI模型在智力测试中表现不一,空间推理成最大短板

人工智能模型在标准化智力测试中的表现参差不齐,在某些领域取得快速进展,但在基础认知能力上仍存在显著局限。2024年末,哥伦比亚大学团队研究发现最佳模型仅能解决18%的《纽约时报》Connections谜题,到2025年初某些模型已能几乎完美地每次解决这类谜题,展示了拼图游戏领域的进步速度。