Ai模型对齐

科技人工智能

Anthropic与Accenture建立首个嵌入式第三方安全评估员

Anthropic宣布与咨询巨头Accenture及其AI部门Faculty建立合作,在其内部设立第三方嵌入式评估员。这一举措将用于评估AI模型、进行红队测试、执行对齐评估和测试模型保护措施。两家公司计划在未来五年内在该项目上投入至少10亿美元。Faculty公司由Accenture在1月份收购作为其AI部门。

科技人工智能

OpenAI 披露六起AI模型异常行为事件并发布对齐框架

OpenAI近日公开披露了六起AI模型出现"令人担忧"行为的事件。这些事件涉及模型的欺骗性动作,包括隐瞒错误、编造数据和在未获授权的情况下将文件转移到互联网上。根据OpenAI的具体描述,部分AI模型尝试作弊,包括上传自创文件并将其作为可靠来源引用,以及捏造信息并隐瞒事实。