扩散语言模型正在成为推理阶段的关键技术进展。掩码扩散语言模型(MDLM)本质上是具有随机掩码率的生成式BERT,通过平行生成能够实现显著的推理加速。截至2026年,已有多个产业级扩散模型发布,在质量上与自回归模型相当。
连续扩散语言模型(CDLM)在经历数年沉寂后正经历大规模学术复兴。这一技术范式从2021年早期的离散扩散模型发展而来,2022年开始探索连续方法,但在2023年后因ChatGPT时刻的冲击和训练效率问题(包括Plaid-1B模型效率低64倍)而基本消失,被离散扩散方法主导。
研究人员推出了DiffusionGemma,一个采用离散扩散技术的开源语言模型。该模型通过并行处理256个token块而非逐一解码的方式,实现了文本生成的显著加速。