Folia
← 返回头版

AI新模型四连发,AGI要来了吗?

9月1日至3日,Anthropic、OpenAI、Meta、谷歌四家美国AI龙头企业密集发布新款大模型,核心能力提升集中在Agent方向,从让AI回答问题转向让AI完成工作1。其中,Anthropic推出的Fable 5.1能连续数小时处理编程、研究和知识工作1;谷歌发布Gemini 3.8 Flash,在DeepSWE v1.1基准测试中得分达73.7%,相比前代3.7 Flash版本提升约8个百分点1;Meta推出Muse Spark 1.3,通过降低工具调用次数约20%和Token使用量约25%来优化编码任务表现1;OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中的成绩从GPT-5.6 Sol的7.8%飙升至99.9%1。

对于这波新模型浪潮的意义,观点存在分歧。OpenAI总裁格雷格·布洛克曼宣称"AGI时代已来"1。然而专业机构指出,GPT-6 Astra的高分存在明显局限性1:其使用Provider Adapter框架后才达到99.9%的最高得分,单次运行成本约1.88万美元,高分严重依赖豪华外挂和昂贵算力1。这些成绩无法代表真实世界的复杂性1。


评论