DeepSeek推出了V4.1 Flash模型,这是一个拥有552B参数的多模态混合专家模型,能够支持高达1百万tokens的上下文长度。该模型采用Causal Encoder-Decoder架构、CSA2压缩机制和FP4量化等技术手段,在KV缓存存储方面取得显著进展。
开源开发者发布了一个独立复现的Jev类模型实现。该模型是对TypeSafe商业模型Jev的启动复现,设计方案未经官方公开。不同于传统逐词生成的方式,该模型可以从给定的文本选项列表中进行单遍选择。
研究人员提出了持久状态机(PSM)框架,用于在FPGA上实现大语言模型的注意力操作。该框架采用INT4量化的内存单元设计,通过在Zynq-7000和UltraScale+两个硬件平台上的实现验证,展示了低功耗和高集成度的特性。