研究人员提出了Cache-to-Cache(C2C)范式,使大型语言模型能够实现直接的语义通信。该方法通过神经网络投影和融合源模型的KV-Cache与目标模型的KV-Cache,避免了基于文本通信的信息损失和生成延迟。