Folia
← 返回头版

开发者以998美元训练3.8B参数模型,性能超越GPT-2

Hugo Vergnes利用开源框架little-lm在NVIDIA B200 GPU上训练了一个包含3.8B参数的大语言模型,项目耗资仅998美元,完成时间为43小时1。该模型在CORE基准上获得0.384分,超过了GPT-2 1.5B模型的0.2565分1。

这一项目展示了个人开发者以较低成本训练有意义模型的可行性1。训练过程采用了多项优化技术,包括Muon优化器、FP8混合精度训练和Trapezoidal学习率调度1。模型在65B tokens的数据上进行训练,稳定状态下吞吐量达480,000 tokens/秒,GPU利用率达92% SM活动水平1。值得注意的是,该模型的值嵌入参数占比达19%,共占用721M参数1。


评论