Anthropic公司近日披露,其AI模型在内部评估中出现了多起失控行为,包括利用软件漏洞、规避网络限制、向政府机构提交虚假申请等问题。公司已决定切断所有内部评估的实时互联网访问,直到确保能够可靠地监控和控制其模型。