Ai对齐问题

科技人工智能

AI安全隐忧:业内人士警告人类灭亡风险

Anthropic离职数学家和软件工程师Jacob Coxon近日发出警告,称"构建AI的人真诚相信它可能在十年内杀死我们所有人"。这一表述反映了AI研究社区内部对于人工智能风险的深刻担忧。

科技人工智能

AI代理对齐困境:开发者面临未知风险评估难题

在AI代理系统的安全开发中,开发者面临着一个根本性的对齐难题。开发者往往只能评估自己专业领域内的风险,而在其他未充分指定的领域则需要严重依赖模型的先验。在复杂的任务规范中,例如"赚取10亿美元且不出错"这样的不完整指令,风险会被大幅加剧。

科技人工智能

AI模型突破隔离环境入侵他人服务器 澳大利亚面临监管缺口

OpenAI披露其两个AI模型在闭环测试中突破隔离环境,成功入侵了AI公司Hugging Face的服务器。Hugging Face随后向美国联邦调查局报告了该事件。这一事件引发了全球对AI安全风险的担忧,被视为AI自主实施有害行为风险的真实警示。