研究人员对两款AI模型在代码审查中的表现进行了对比测试。GPT-5.6 Luna的定价为输入令牌每百万0.20美元、输出令牌每百万1.20美元,而GPT-6 Astra的定价分别为10美元和50美元 。在50个来自Cal.com、Sentry、Discourse、Keycloak和Grafana的公开拉取请求测试中,…

2026年9月,中国发布第八批新职业共34个,其中11个为新职业、23个为新工种,数字职业占比达到45.5%。截至目前,中国已累计发布113个数字职业。本批新增职业涵盖数字孪生工程技术人员、具身智能机器人应用技术员、工业产品数字建模师、运动数据分析师、低空物流员、智能体开发员等多个领域。
一位开发者通过运行软件工厂实验对GPT-6 Astra的代码生成能力进行了测试。在35小时的实验中,该模型消耗约10亿个token,成本约1200美元,最终生成了75000行代码但未产生任何有价值的输出。这次实验共产生79次代码提交,平均每次提交的成本约15.5美元。
OpenAI发布的GPT-6 Astra模型采用了循环变换器(looped transformers)架构,在多项基准测试中取得显著成效。该模型在约100,000个Grace Blackwell GPU上进行训练,并在ARC-AGI-3基准测试中达到99.9%的准确率,远超前代GPT-5.6 Sol的7.8%。在固定…
OpenAI的GPT-6 Astra与Anthropic的Claude Fable 5/5.1在机器人臂操纵任务中的性能表现存在明显差异。在「将红色积木放入碗中」的任务上,Astra展现了显著优势——在20次试验中成功19次,而Fable 5.1仅成功8次,Fable 5仅成功1次。成本方面,Astra每次操作花费约…
CodeRabbit 发布的评估报告显示,OpenAI 的 GPT-6 Astra 在代码审查能力上有显著提升。在简单代码审查场景中,Astra 相比 GPT-5.6 Sol 多捕获约 4% 的可行性 Bug,相比 Opus 5 则多捕获 22%。在更复杂的跨文件审查中,Astra 的优势进一步扩大,对比 Sol 领…

OpenAI于2026年9月3日推出新型AI模型GPT-6 Astra,并宣称已"进入AGI时代"。该公司将其描述为"能力的一代飞跃",CEO Sam Altman称之为"新能力水平"。这是OpenAI首个达到其"关键网络安全能力阈值"的模型,在网络安全、专业工作、软件工程、科学和计算机使用等领域表现突出。OpenA…

OpenAI 于 9 月 3 日发布新一代大语言模型 GPT-6 Astra,这是该公司首个达到其准备框架中关键网络安全能力门槛的模型 。该模型在无人指导的条件下能够发现防护严密系统中的安全漏洞 ,并在离线测试和各类越狱测试中获得验证 。与前一代模型 GPT-5.6 Sol 相比,GPT-6 Astra 的高严重程度…