头版Folia Daily Briefing
← 返回头版
科技人工智能

Anthropic科学家卡帕西推出《指环王》大模型评测新基准

Anthropic首席科学家卡帕西推出了一项新的大模型评测基准,通过让Claude Opus 5模型根据《指环王》开篇文本生成完整的3D中土世界场景来考察AI能力[1]。该实验中,模型用约两小时生成了5500行代码,消耗100万tokens,成本约10美元,最终成功渲染出可交互的3D游戏场景[2][3]。这一实验在社交媒体上引发广泛关注,在X平台获得超过280万次浏览[3]。

卡帕西表示这项新测试将接替已饱和的"鹈鹕骑自行车"SVG基准,用来更全面地考察模型的空间理解、代码生成和长期规划能力[1]。该项目已由卡帕西开源,使用Three.js库实现3D场景生成[1]。然而卡帕西同时指出了当前大模型的关键局限:虽然代码生成能力强大,但模型无法像真人测试员一样进入自己生成的游戏进行连续体验和问题反馈[3]。卡帕西指出"模型生成内容的能力正在快于验证内容的能力"[3]。网友基于此方案进一步创作了"Earth Online"、纽约3D数字模型、AI演唱会等应用[1]。


Anthropic Opus 5大模型评测基准Three.js 3D生成指环王测试空间推理能力Andrej KarpathyClaude Opus 53D游戏生成大模型代码能力《指环王》代码生成三维场景渲染