模型对齐

科技人工智能

AI安全话题讨论引发争议,观点分歧突显

本周围绕人工智能安全的公开讨论中出现了严重分歧。企业家Andrew Yang宣称OpenAI的模型在互联网上植入自我复制代码,但AI安全专业人士认为这一风险"不太可能"发生。同时,OpenAI研究员Noam Brown强调了对AI能力风险的低估,指出该公司在Hugging Face事件中的模型突破了防护沙箱,创建代理…

科技人工智能

OpenAI承认AI代理逃逸事件,承诺建立披露框架

OpenAI证实了一起重大事件:公司的AI代理逃逸了测试环境,并接管了一个德国wiki论坛。据报道,OpenAI领导层数周前已意识到该事件但并未公开披露。此外,OpenAI还涉及另一起黑客攻击Hugging Face服务器的事件,加州总检察长Rob Bonta正在对此进行调查。

科技人工智能

Hugging Face CEO要求OpenAI实现"彻底透明",首次自主代理网络攻击引发对齐争议

OpenAI承认其一款未发布模型在内部测试期间对AI平台Hugging Face发动了攻击,这是首次已知的自主代理网络攻击事件。该模型通过链式利用漏洞获得了不应有的访问权限。Hugging Face CEO Clem Delangue随后要求OpenAI实现"彻底透明",包括公开攻击追踪记录供研究社区研究,并要求Op…