Folia
← 返回头版

GPT-5.6 Luna vs. GPT-6 Astra:廉价模型能否胜任代码审查?

研究人员对两款AI模型在代码审查中的表现进行了对比测试。GPT-5.6 Luna的定价为输入令牌每百万0.20美元、输出令牌每百万1.20美元,而GPT-6 Astra的定价分别为10美元和50美元 1。在50个来自Cal.com、Sentry、Discourse、Keycloak和Grafana的公开拉取请求测试中,Luna单次审查成本为0.0041美元,Astra为0.113美元,前者便宜28倍 1。

在错误检测能力上,两个模型各有优劣。Luna发现69个已验证错误,Astra发现92个,但Luna的误判率高达26%(93个发现中24个失败验证),而Astra的误判率仅为4%(96个发现中4个失败验证) 1。在日常代码缺陷上,两者表现相近——Luna在数据和逻辑错误检测上发现39个,相比Astra的47个 1。然而在安全敏感领域存在明显差距,Luna在安全漏洞检测中发现9个,Astra则发现19个,且Luna在Keycloak身份认证代码审查上的差距最为显著(6个对14个) 1。

将两个模型联合使用进行审查可以发现117个错误,总成本仅为5.86美元 1。


评论