Folia
← 返回头版

DeepSeek发布V4.1 Flash模型,推进KV缓存压缩技术

DeepSeek推出了V4.1 Flash模型,这是一个拥有552B参数的多模态混合专家模型,能够支持高达1百万tokens的上下文长度1。该模型采用Causal Encoder-Decoder架构、CSA2压缩机制和FP4量化等技术手段,在KV缓存存储方面取得显著进展1。

在性能指标上,V4.1 Flash的推理速度接近420 Tokens/s1,其中Prefill阶段激活参数为8B,Decode阶段激活参数为16B1。该模型将KV缓存存储相比V4-Flash版本压缩至运行时缓存的1/4和持久化缓存的1/8,实现了4倍的KV缓存压缩,全局KV缓存存储成本降低至890字节/token1。同时,该模型支持视觉输入功能,最大支持1024个视觉tokens,可处理约1344×1344像素的图像1。


评论