注意力机制

科技人工智能

DeepSeek发布V4.1 Flash模型,推进KV缓存压缩技术

DeepSeek推出了V4.1 Flash模型,这是一个拥有552B参数的多模态混合专家模型,能够支持高达1百万tokens的上下文长度。该模型采用Causal Encoder-Decoder架构、CSA2压缩机制和FP4量化等技术手段,在KV缓存存储方面取得显著进展。

科技人工智能

反向工程的Jev类模型开源实现发布

开源开发者发布了一个独立复现的Jev类模型实现。该模型是对TypeSafe商业模型Jev的启动复现,设计方案未经官方公开。不同于传统逐词生成的方式,该模型可以从给定的文本选项列表中进行单遍选择。

科技半导体

持久状态机:基于INT4内存单元的大语言模型注意力硬件架构

研究人员提出了持久状态机(PSM)框架,用于在FPGA上实现大语言模型的注意力操作。该框架采用INT4量化的内存单元设计,通过在Zynq-7000和UltraScale+两个硬件平台上的实现验证,展示了低功耗和高集成度的特性。