头版Folia Daily Briefing
← 返回头版
科技人工智能

GPT-5.6 与 Claude Fable 5 物理 AI 能力对标:性能与成本权衡

JuliaHub 对 OpenAI 的 GPT 5.6 系列模型(Terra、Sol、Luna)和 Anthropic 的 Claude Fable 5 进行了系统的物理 AI 能力评测[1]。研究采用 Dyad AI 框架,在五个密封物理建模与仿真问题上运行了 52 次评分试验[1]。

在物理建模准确性方面,Claude Fable 5 表现最佳,难度加权得分达 0.889,是唯一完全通过四个核心问题的 12 次试验的模型[1]。而 GPT 5.6 Sol 的得分为 0.814,虽然略低于 Fable 5,但在性价比上优势明显——其成本仅为 Fable 5 的五分之一,分别为每次试验 1.74 美元和 9.60 美元[1]。值得注意的是,所有模型都能生成可编译运行的代码,但物理准确性存在显著差异[1]。

研究还揭示了框架工具对模型性能的影响远超模型本身的差异[1]。使用 Dyad 框架的模型得分达 0.899,而通用编码代理的得分仅为 0.533,框架差异高达 0.366 点,超过最佳与最差模型之间的差异 0.162 点[1]。五个评测问题包括以 NASA HL-20 飞行器为代表的难度最高的问题,目前没有模型能完全解决[1]。


物理AI评测GPT-5.6Claude Fable 5模型性能对比Dyad AI