Folia
← 返回头版

研究团队推出JiT-DDT架构 文本生成图像模型训练速度提升3.6倍

Linum团队发布了JiT-DDT架构,一种改进的文本到图像模型训练方法1。相比Linum v2基线,该方法将训练速度提升3.6倍(以GPU小时数计),同时生成的图像像素数增加为4倍1。

JiT-DDT通过采用x-prediction和v-loss流匹配等技术创新来克服像素空间模型在生成精细细节方面的难题1。其架构采用编码器-解码器设计,其中编码器负责预测8倍下采样图像(从512×512降采样至64×64),解码器则处理高频细节以生成全分辨率图像1。该团队还引入了PixelREPA辅助损失、SwiGLU激活函数、Muon优化器和Qwen3.5-4B文本嵌入等多项改进措施1。

代码和模型权重已在Apache 2.0许可证下开源发布,作为研究工件形式推出1。该团队由两位兄弟组成,致力于从零开始训练文本到视频模型,目标是使动画制作更加易于获取1。


评论