Folia
← 返回头版

语言模型Agent在生产应急响应中能力存在显著差距——ORCA-Bench基准揭示挑战

研究团队发布了ORCA-Bench基准,用于评估大语言模型Agent在生产环境应急响应中的根因分析能力。1该基准包含1,079个系统化的根因分析任务,涵盖报告具体性、检测时间和并发故障场景等变化因素。1

测试在模拟真实生产环境的系统中进行,该系统规模为50 GB、时间跨度为六天的微服务架构,集成了Prometheus、Jaeger、OpenSearch等实际使用的监测接口。1评估结果表明,当前领先模型的表现远未达到生产就绪水平。五个前沿模型在中等难度任务上的最高准确率仅为25.3%,在困难任务上更是下降至10.0%,即使包括Claude 3.5 Sonnet在内的模型也未能实现显著改进。1此外,最弱的模型在40%的事件报告中产生了不可信的根因分析幻觉。1研究进一步发现,移除源代码访问权限会导致所有性能指标下降。1人工验证的一致性系数(Cohen's κw)达到0.90,说明评估的可靠性得到保证。1


评论