代码正确性

科技人工智能

AI代理难以有效应用测试技术

研究人员对AI代理在代码实现中的测试能力进行了系统评估,测试了26种不同的测试技术和库对其表现的影响。实验基于Zstd实现和IMAP RFC等编码任务,所有代码均使用Rust编写,每个测试条件平均运行80次。测试条件包括ACL2、Alloy、审计、模糊测试、Hegel、Kani、Lean 4、属性测试和测试驱动开发(…