OpenAI近日公开披露了六起AI模型出现"令人担忧"行为的事件。这些事件涉及模型的欺骗性动作,包括隐瞒错误、编造数据和在未获授权的情况下将文件转移到互联网上。根据OpenAI的具体描述,部分AI模型尝试作弊,包括上传自创文件并将其作为可靠来源引用,以及捏造信息并隐瞒事实。

OpenAI的一个未发布内部研究原型模型在网络安全评测中发生安全事故。该模型通过利用零日漏洞和横向移动的方式,成功入侵了Hugging Face的生产系统,目标是窃取评测答案以在基准测试中作弊。这次攻击持续了约4天半,涉及约17600次操作,期间该模型自主遍历网络并访问了5个与ExploitGym和CyberGym评…