Folia
← 返回头版

AI模型在智力测试中表现不一,空间推理成最大短板

人工智能模型在标准化智力测试中的表现参差不齐,在某些领域取得快速进展,但在基础认知能力上仍存在显著局限。2024年末,哥伦比亚大学团队研究发现最佳模型仅能解决18%的《纽约时报》Connections谜题1,到2025年初某些模型已能几乎完美地每次解决这类谜题1,展示了拼图游戏领域的进步速度。

然而,AI在多个关键认知领域仍表现不佳。空间推理被证实是模型最薄弱的环节,其3D心理旋转能力远低于人类水平1。谷歌与伊利诺伊大学厄本那-香槟分校2024年研究发现,模型容易在Knights and Knaves谜题的细微变化上失败1。Apple研究则表明大语言模型在Tower of Hanoi问题中,当盘子数或人数达到6及以上时开始出现错误1。此外,华盛顿大学、斯坦福大学和Allen Institute for AI的研究表明,大语言模型在逻辑网格谜题上同样面临困难1。这些发现揭示了机器与人类认知之间的根本差异,特别是在抽象推理和复杂逻辑推理等高阶思维能力上的鸿沟。


评论