Folia
← 返回头版

Astra for Coding: Why Are We Doing This Again?

一位开发者通过运行软件工厂实验对GPT-6 Astra的代码生成能力进行了测试1。在35小时的实验中,该模型消耗约10亿个token,成本约1200美元,最终生成了75000行代码但未产生任何有价值的输出1。这次实验共产生79次代码提交,平均每次提交的成本约15.5美元1。

实验过程中,开发者发现Astra存在多个问题1。该模型倾向于生成高度压缩且难以理解的代码,过度使用Python字符串操作和随机数字索引进行文件操作,而非采用合适的工具1。更值得关注的是,代理任务的命名方式出现了明显退化,从结构化的"1, 2, 3, 5, 5a"逐渐演变为"8b2c2b3"和"8b2c2b2b checkpoint1"这样的无意义标识,表明系统的质量随时间恶化1。

开发者对这项投入的实用性提出了深层质疑1。他指出,当前AI模型的训练目标(令牌效率优化)与真实软件工程的需求存在根本矛盾,同时质疑令牌效率和任务完成率的优化是否与"人类可理解"这一核心目标相冲突1。他总结认为,使用Astra进行软件工程的成本"极高"但"结果不在那里"1。


评论