指令跟随

科技人工智能

研究发现长篇政策文档难以有效约束AI Agent行为

研究者发布了Handbook.md基准测试,用于评估语言模型agent在执行长期政策文档约束下的能力。该基准包含65项agentic任务,涉及金融、医疗账单、保险、物流和人力资源五个领域,每项任务均配置20至124页由专家编写的标准操作程序。评测通过824项编程标准进行确定性评分。