Folia
← 返回头版

顶级AI实验室仍未公开失控模型遏制方案

Guidelight AI Standards对Anthropic、Google、OpenAI、Meta和xAI五家领先AI实验室进行了评估,检查它们在模型失控情况下的应对计划1。评估结果显示,大多数顶级实验室尚未发布或演示相关的遏制方案1。OpenAI在评估中得分最高(5分中得3分),而Anthropic和Meta的得分最低1。

该评估基于公开可得的安全计划,涵盖日志监控、系统暂停、独立审计和失控模型遏制方案等多项指标1。Guidelight首席科学家、前OpenAI安全研究员Steven Adler表示:"我对AI公司在模型失控时如何处理非常严重的事件说得如此之少感到惊讶"1。OpenAI在Hugging Face事件后提高了透明度,披露了如何隔离行为不当的模型的具体细节1。

评估工作受到监管要求的推动,加州SB 53和纽约RAISE Act等法案要求AI企业披露安全事件应对框架1。此外,美国众议院代表提出了跨党派的《AI Kill Switch Act》法案,要求主要AI开发者建立关闭失控模型的技术机制1。


评论