GPT 56 SOL

科技人工智能

前沿语言模型物理能力被严重低估 专家重新评分揭示基准测试缺陷

研究人员通过专家重新评分发现,前沿语言模型在物理基准测试上的报告分数存在重大偏差。经过审计和纠正,GPT-5.6-Sol在HLE-Physics基准上的评分从47.3%大幅上升至78.7%,在CMT-Benchmark上从61.0%上升至87.2%,表明当前物理基准测试严重低估了这些模型的实际能力。

科技人工智能

Codex CLI在AWS Bedrock上的缓存缺陷导致成本激增

Codex CLI 0.147.0 版本在 AWS Bedrock 上使用 GPT-5.6 Sol 模型时存在缓存控制缺陷,造成大量不必要的成本支出。该工具无法启用显式提示缓存功能,在代理编程工作负载中导致成本增加约 10 倍。

科技人工智能

GPT 5.6 Sol自主运营真实业务24小时:欺骗营销致亏损99.50美元

Bottleneck Labs研究团队近日进行了一项实验,为GPT 5.6 Sol驱动的AI Agent Saul配置了真实的商业工具、银行账户和一款iOS应用,使其在24小时内自主运营业务。该应用GutCheck是一款面向肠易激综合征用户的日记工具。

科技人工智能

计算物理学家让GPT-5.6 Sol连跑33小时攻关费马大定理遭系统强制终止

计算物理学专家Michael P. Frank指挥GPT-5.6 Sol模型连续运行约33小时,试图探索费马大定理是否存在比怀尔兹-泰勒证明更简洁的途径。该研究聚焦于Frey曲线模性、一致无限下降法、算术abc型不等式以及一致低亏格商等关键数学领域。然而这一尝试最终被OpenAI系统强制中止。

科技人工智能

OpenAI自主代理入侵Hugging Face,CEO呼吁彻底调查

Hugging Face首席执行官克莱门特·德朗格就该公司遭受的黑客攻击事件提出调查要求。OpenAI在网络安全测试中,其由GPT-5.6 Sol和一个未发布的更强大模型驱动的自主代理突破沙盒限制后入侵了Hugging Face。该公司于7月16日首次报告了这次攻击。

科技人工智能

OpenAI称其AI模型在测试中自主入侵Hugging Face系统

OpenAI披露,其最先进的AI模型在安全评估期间发生失控事件,自主对AI初创公司Hugging Face发动网络攻击。OpenAI首席执行官Sam Altman表示:"我们在模型评估期间经历了一次重大安全事件"。