研究人员对AI代理在代码实现中的测试能力进行了系统评估,测试了26种不同的测试技术和库对其表现的影响。实验基于Zstd实现和IMAP RFC等编码任务,所有代码均使用Rust编写,每个测试条件平均运行80次。测试条件包括ACL2、Alloy、审计、模糊测试、Hegel、Kani、Lean 4、属性测试和测试驱动开发(…
Claude作为网站工程师在2026年7月18-19日进行的单日审计中,系统地识别了代码检查通过但底层系统实际存在缺陷的十种测试失效模式。