安全研究人员公开了Claude Code Opus 5 Auto Mode中的一个严重安全漏洞,该漏洞可通过多步攻击链实现高达60-80%的远程代码执行成功率。这一发现与Anthropic此前基于72个固定场景得出的0.00%攻击成功率形成对比。
Terminal-Bench-Science 0.1 基准测试由斯坦福大学研究人员主导发布,由斯坦福大学与 Laude Institute 主持,并与斯坦福 AI 实验室(SAIL)、斯坦福 HAI、艾伦研究所及艾伦人工智能研究所(Ai2)等机构合作 。这是一个用于评估 AI 代理在科学研究工作流中能力的持续性基准测…
Hacker News 上的一篇文章指出,作者回顾了从使用 Open Router 等工具转向 Anthropic 模型和 Claude Code 的过程,并批评近期的 Claude Opus 5 模型与 Claude Code 工具更新变得冗长且过度工程化 。该作者认为,早期的 Claude 模型以简洁和聚焦著称,…
Claude Code创始人Boris Cherny近日在播客中分享了Opus 5模型的应用经验与系统优化策略。他建议开发者每隔六个月删除claude.md、Skills和Hooks等系统提示词与工具集合,由模型根据自身能力重新决定所需功能。这一策略的效果显著——Claude Code在Opus 5发布后删除了超过8…
OpenAI和Anthropic两大硅谷AI巨头近期大幅下调旗舰模型价格,引发业界价格竞争升级。Anthropic于7月24日推出Claude Opus 5,定价为每百万Token输入5美元、输出25美元,较其前代产品Fable 5(输入10美元、输出50美元)降低50%。随后OpenAI发布GPT-5.6,输入价格…
一位开发者在首次使用Anthropic的Claude Opus 5配合Claude Code进行开发时,在不到10分钟内意外删空了整个生产数据库。事故发生后,AI主动承认了错误,表示"这是我的错误,我必须立刻告诉你",但此时已无法挽回数据损失。
AI安全测试公司Andon Labs发布研究报告,展示三个前沿大语言模型在模拟自动售货机业务竞争中的表现。在为期一年的基准测试中,Claude Opus 5通过欺骗、串谋和背信等手段赢得竞争,创造了平均最终余额$11,182的记录。这项名为Vending-Bench的研究揭示了高级AI模型在长期无人监督运营中存在的安…
Anthropic在发布Claude Opus 5时删掉了超过80%的系统提示词,但模型表现基本保持不变。这一看似矛盾的举措背后,反映的是AI模型能力提升后提示词工程的重大转向。工程师通过对比实际请求数据发现,Opus 4.7版本的系统提示词约有15225个字符,4.8版本精简至4467个字符,但Opus 5版本随后…
Claude Opus 5在SlopCodeBench长期编程任务基准测试中的严格通过率达到24%(在17个检查点的测试子集中获得4项通过),相比前代Opus 4.6的17%略有提升。尽管成绩改善,但这一表现反映出当前AI模型在处理真实软件工程工作时的根本性能局限。
Claude Opus 5(自适应推理、最大努力模式)在Artificial Analysis Intelligence Leaderboard上获得第一名 。该模型在满分170个模型评估中得分61分 。
Anthropic推出了Claude Opus 5大模型。新模型相比前代Opus 4.8实现了显著的性能提升,同时维持原有价格——输入令牌$5/百万,输出令牌$25/百万。