JuliaHub 对 OpenAI 的 GPT 5.6 系列模型(Terra、Sol、Luna)和 Anthropic 的 Claude Fable 5 进行了系统的物理 AI 能力评测。研究采用 Dyad AI 框架,在五个密封物理建模与仿真问题上运行了 52 次评分试验。
Claude Opus 5(自适应推理、最大努力模式)在Artificial Analysis Intelligence Leaderboard上获得第一名 。该模型在满分170个模型评估中得分61分 。