Folia
← 返回头版

40亿参数开源模型生成查询计划速度超越PostgreSQL81%

研究人员成功训练了一个40亿参数的开源语言模型,使其能够生成比PostgreSQL默认查询计划快81%的数据库查询执行方案1。该模型在Join Order Benchmark的113条查询上实现了1.81倍的几何平均加速和44.7%的总延迟降低1。

这项工作采用了监督微调与强化学习相结合的方法1。研究人员通过GPT-6 Astra生成420条演示轨迹进行离线策略蒸馏1,并设计了自定义GRPO变体以应对测量噪声1。模型使用仅含21.2百万个可训练参数的LoRA微调方案1。为解决Linux页面缓存噪声问题,研究团队将shared_buffers从128MB提升至2GB,使得无操作误导率下降了4倍1。整个项目的总训练成本约为1200美元,其中包括Lambda H100节点租赁成本800美元和OpenAI API成本400美元1。这一成果证明了小型开源模型在特定领域任务上的可行性,同时支持最多3次尝试采样以获得最佳查询计划结果1。


评论