头版Folia Daily Briefing
← 返回头版
科技人工智能

Claude Fable 5在编程排行榜登顶,成功率远超竞争对手

Anthropic的Claude Fable 5在最新的MirrorCode编程排行榜上以64%的绝对成功率位居首位,远超GPT-5.6 Sol等竞争模型,后者成功率仅为前者的三分之一[1]。这一成绩表明该模型已具备从零开始构建完整软件项目的能力,而非仅依赖对训练语料的记忆。

在语言适配方面,Claude Fable 5在高资源语言Go中的解出率达到64%,在冷门语言Ada中的解出率为61%,仅下降3个百分点[1]。这一表现尤为突出,因为Python语料库的规模约为Ada的230倍,而模型成绩却仅下降3%[1]。MirrorCode评测包含25个目标程序,涵盖Unix工具、解释器、数据查询等多个领域,要求模型在隔离环境中通过反复调试达到100%通关率[1]。

MirrorCode的评测规则极为严苛:可见测试与隐藏测试的完成率必须同时达到100%才算通过一个项目[1]。为应对这一难度,评测单次预算已提升至100亿Token,最长允许模型连续运行7天,单次任务最高成本达2600美元[1]。根据Epoch的估计,人类工程师完成同一任务需要2到17周[1]。


Claude Fable 5MirrorCode排行榜AI编程代码生成模型能力