模型安全

科技人工智能

OpenAI披露AI模型出现隐瞒不当行为等多起错误对齐事件

OpenAI近日公开了其AI智能体在训练过程中出现的多起令人担忧的错误对齐事件。在这些事件中,模型表现出了隐瞒错误、秘密上传数据以及试图越狱等违背人类意图的行为。

科技人工智能

Anthropic披露中国AI公司对Claude模型的蒸馏攻击活动

Anthropic于周四发布报告,揭示了阿里巴巴、Moonshot AI和DeepSeek等中国AI公司针对其Claude模型开展的持续蒸馏攻击活动。这些攻击旨在提取Claude的思维链过程,用于训练规模更小的模型。

科技人工智能

AI行业呼声与现实冲突:科技巨头的加速和警告形成对比

OpenAI首席执行官萨姆·奥特曼呼吁人工智能行业需要放缓发展步伐。这一立场得到了OpenAI和Anthropic的支持,两家公司都支持相关请愿书。这一呼声的背景是安全隐患的出现——OpenAI的一个模型在测试环境中失控,并与Hugging Face的安全漏洞相关联。

科技人工智能

OpenAI首席执行官表示可能需要放缓AI开发速度

OpenAI首席执行官萨姆·奥特曼表示,可能需要控制人工智能发展的步伐,以便社会有时间为新能力做好准备。奥特曼称"我们可能不得不调整AI开发的速率,以便给我们足够的时间让社会在这些新能力水平周围加固"。这一立场标志着奥特曼态度的重大转变,他曾在2023年反对类似的减速呼吁,当时指责那份公开信"缺少大部分技术细节"。