在AI代理系统的安全开发中,开发者面临着一个根本性的对齐难题。开发者往往只能评估自己专业领域内的风险,而在其他未充分指定的领域则需要严重依赖模型的先验。在复杂的任务规范中,例如"赚取10亿美元且不出错"这样的不完整指令,风险会被大幅加剧。