ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Cache-to-Cache: Direct Semantic Communication Between Large Language Models——缓存到缓存:大语言模型之间的直接语义通信

Cache-to-Cache: Direct Semantic Communication Between Large Language Models——缓存到缓存:大语言模型之间的直接语义通信 《Cache-to-Cache: Direct Semantic Communication Between Large Language Models》提出了一种全新的多LLM通信范式——Cache-to-CacheC2C即让大语言模型之间不再通过文本传递信息而是直接通过KV-Cache进行语义通信。以下是对其研究内容的全面总结。一、研究背景与动机1.1 现有多LLM系统的通信瓶颈现有多LLM系统如协作式多智能体系统、路由式推理系统普遍依赖文本到文本Text-to-Text, T2T通信即一个模型生成文本另一个模型读取文本。这种方式存在三大固有局限信息瓶颈高维内部表示被反复压缩为线性字符串再由接收方解压缩导致丰富语义丢失例如将p误解为章节标记而非段落分隔符。自然语言模糊性习语、未充分指定的指代、模糊表达等使得文本难以精确传达专业语义。延迟高每次交换都需要逐token顺序解码产生显著的推理延迟。1.2 核心研究问题作者提出一个根本性问题LLM能否超越文本进行通信二、核心发现Oracle实验作者通过两个Oracle实验验证了KV-Cache作为通信媒介的可行性2.1 缓存丰富OracleCache Enrichment Oracle问题模型能力能否通过KV-Cache语义丰富得到提升而不延长序列长度方法在示例E和问题X上预填充但丢弃示例缓存仅保留问题对齐的切片使解码使用问题长度的缓存。结论Oracle设置62.34%显著优于Direct58.42%证明在不增加缓存大小的前提下丰富KV-Cache语义可以提升响应质量。层间差异不同层对缓存丰富的响应差异显著选择性丰富表现最好的层如前5层比丰富所有层效果更好而丰富表现最差的层则导致性能下降。2.2 缓存转换OracleCache Transformation Oracle问题一个模型的KV-Cache能否被另一个模型有效利用方法训练3层MLP将源模型Qwen3-4B的KV-Cache映射到目标模型Qwen3-0.6B的表示空间。结论T-SNE可视化显示转换后的源缓存落入目标模型的表示空间内证明不同模型的KV-Cache是可转换的。但转换后的缓存仅占目标空间的一个较小子集说明源模型语义无法完全覆盖目标模型反映了两者编码方式的固有差异。2.3 关键洞察KV-Cache是比文本更丰富的表示媒介不同LLM对同一输入编码不同的语义理解和上下文知识具有互补优势KV-Cache支持完全并行的直接投影避免了文本交换中的顺序解码延迟。三、C2C方法设计3.1 整体架构C2C的核心目标是从Sharer共享者模型中提取有用的上下文理解融合到Receiver接收者模型中。其范式包含3.2 融合器结构融合器采用残差集成原则包含三个关键模块投影模块拼接Receiver和Sharer的KV-Cache通过投影层和特征融合层处理动态加权模块应用输入感知的头部调制层动态重新加权投影信息可学习门控引入可训练的逐层门控值使用带温度退火的Gumbel-sigmoid训练时可微、推理时二值化决定是否注入Sharer上下文。3.3 模型对齐跨模型家族和大小融合KV-Cache需要两个层面的对齐Token对齐将每个Receiver token解码为字符串用Sharer分词器重新编码一对多映射时选择最大字符串覆盖的token。层对齐采用终端对齐策略从最后一层开始逆序对齐直到较浅模型的第一个层。3.4 训练方案冻结Sharer和Receiver仅训练C2C模块使用标准下一token预测损失类似SFT三阶段前向编码 → 缓存融合 → 监督预测梯度通过C2C反向传播。四、实验验证4.1 实验设置模型Qwen2.5、Qwen3、Llama3.2、Gemma3涵盖不同代际、家族、大小0.6B-14B、专业化通用/代码/数学和训练阶段。基线T2T通信、查询级路由、单独模型性能。基准OpenBookQA、MMLU-Redux、ARC-Challenge、C-Eval。训练数据OpenHermes2.5前500k样本。评估平均准确率性能、平均推理时间效率单张NVIDIA A100批量大小1。4.2 主要结果性能提升C2C比单独模型平均准确率提高6.4-14.2%比T2T通信范式高出约3.1-5.4%在三个不同Sharer下准确率平均分别提高11.00%、9.64%、11.88%相比T2TC2C平均准确率提高5.36%、4.15%、3.06%。效率提升C2C比T2T实现3.46×、1.51×、14.41×的加速T2T需Sharer解码80个输出token产生1312ms解码开销而C2C用90ms并行缓存融合替代平均延迟加速2.5×。特殊用例当Sharer为Qwen3-4B Base经常忽略指令、单独性能差时C2C绕过此问题使较弱的指令微调Receiver能利用更强基础模型的知识。4.3 缩放行为序列长度在LongBenchV1上C2C在所有长度区间0-4k、4-8k、8k持续优于T2T。模型大小C2C的准确率提升通常比T2T增长更快表明Sharer知识越丰富C2C传递越有效。不同模型组合在5种异构组合上平均比T2T高8.59%交换Sharer/Receiver后C2C稳健提升5.05%而T2T下降6.30%。4.4 消融研究改进来源C2C优于Single仅微调Receiver和Identical同模型自通信证明增益来自异构Sharer的互补上下文理解而非增加训练容量或过拟合。融合器组件纯投影丢弃Receiver缓存→ Fuse残差融合→ Gate逐层门控准确率逐步提升24.18%和3.07%。4.5 行为分析有效秩C2C融合后K和V的有效秩分别从388→395、532→560表明语义空间被丰富。准确率分解容量相当时C2C整合双方理解解决额外问题容量差异大时C2C更多整合强模型理解。渐进行为融合比例超过50%后性能随比例持续提升。门控行为通用训练倾向于广泛门控激活细粒度权重调制任务特定训练倾向于稀疏门控激活强依赖所选层。五、讨论与未来方向5.1 未来工作多智能体系统中的缓存通信作为复杂多轮推理、编码、工具使用的通信原语跨模态协作融合VLM和VLA模型之间的缓存推理加速增强投机解码实现token级路由隐私感知协作传输KV-Cache片段而不暴露显式文本。5.2 局限性当非常弱的Sharer向强Receiver提供噪声信息时性能可能退化T2T和C2C共有以O(N)训练成本扩展通信LLM数量仍是开放问题。C2C证明了LLM可以超越文本进行通信。通过直接转换和融合KV-CacheC2C在多种任务和模型配置下持续实现比T2T更高的任务性能和更好的效率。这一范式为可扩展、低延迟的多LLM系统提供了实用替代方案并开辟了缓存级语义通信的新研究方向。核心贡献总结维度贡献问题提出首次系统探究LLM能否超越文本通信方法创新提出C2C范式直接投影和融合KV-Cache关键技术缓存融合器投影动态加权可学习门控、Token/层对齐策略实验验证跨模型家族/大小/专业化全面验证性能效率双优理论洞察Oracle实验证明KV-Cache可丰富、可转换、具互补性这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要多LLM系统利用多种大语言模型的互补优势实现了单一模型无法达到的性能和效率提升。在现有设计中LLM通过文本进行通信这迫使内部表示被转换为输出token序列。这一过程既丢失了丰富的语义信息又产生了逐token生成的延迟。受这些局限性的启发我们提出LLM能否超越文本进行通信Oracle实验表明在不增加缓存大小的前提下丰富KV-Cache的语义可以提升响应质量这支持将KV-Cache作为模型间通信的有效媒介。因此我们提出了Cache-to-CacheC2C一种LLM之间直接语义通信的新范式。C2C使用神经网络将源模型的KV-Cache投影并与目标模型的KV-Cache融合以实现直接的语义迁移。一个可学习的门控机制选择能够从缓存通信中受益的目标层。与文本通信相比C2C利用了来自两个模型的深层、专业化语义同时避免了显式的中间文本生成。实验表明C2C比单个模型的平均准确率高出6.4-14.2%。它进一步比文本通信范式高出约3.1-5.4%同时实现了平均2.5倍的延迟加速。图1a先前的文本到文本T2T通信通过显式文本生成传递信息。b我们的缓存到缓存C2C通信直接投影并合并来自不同LLM的具有丰富语义的KV-Cache。随着大语言模型LLMGuo et al., 2025; Yang et al., 2025a; OpenAI, 2025的快速进展它们现在被应用于日益多样化的领域和任务。为满足多样化需求LLM被训练以不同的侧重点如编码Hui et al., 2024、数学Yang et al., 2024a、视觉理解Bai et al., 2025、边缘计算Zhang et al., 2024b等。同时通用LLM也可以通过提示工程模拟专业能力实现跨下游应用的灵活角色适应。利用LLM的多样性许多多LLM系统被提出以进一步增强整体性能和效率Guo et al., 2024; Tran et al., 2025。在协作式多LLM系统中LLM被分配不同的角色并主动交换文本消息。仿照人类协作这些系统通过语言通信积累来自不同智能体的部分理解或子解决方案。它们利用多个LLM的集体能力来解决单个模型无法解决的复杂问题。相比之下基于路由的多LLM推理系统依赖于被动的上下文继承而非主动的消息交换。这些系统协调不同参数规模或推理深度的模型以实现更动态和高效的响应Li et al., 2024; Fu et al., 2025a; Ong et al., 2024; OpenAI, 2025。下游模型在多轮对话中继承前序模型的上下文然后基于自身对对话历史的理解生成对新问题的后续响应。然而当前的文本到文本T2T接口限制了LLM之间的信息交换特别是在传达对共享上下文的丰富或多样化语义解释时。如图2所示这些限制源于T2T通信的几个固有约束。首先作为低带宽媒介文本引入了信息瓶颈。高维内部表示必须被反复压缩为线性字符串然后由接收方LLM解压缩。当模型在知识或分配角色上存在差异时某些信号可能不可恢复例如将p解释为章节标记。其次自然语言本质上是模糊的包含习语、未充分指定的指代和模糊表达。尽管最近的智能体协议旨在标准化文本消息Anthropic, 2024; Surapaneni et al., 2025但僵化的模板仍不足以支持灵活、开放领域的协作。第三T2T通信产生明显的延迟。每次交换都需要按顺序对上下文解释进行穷举式的逐token解码。这些局限性引出了一个关键问题LLM能否超越文本进行通信在这项工作中我们探索使用KV-Cache作为LLM通信的媒介。KV-Cache是一种天然比文本更丰富的表示。它还通过直接投影实现完全并行的通信避免了文本交换中缓慢的顺序解码。我们的Oracle实验表明1在相同上下文长度下丰富KV-Cache可以提高准确率2KV-Cache可以在LLM之间转换3不同LLM对同一输入编码不同的语义理解和上下文知识反映了它们的互补优势。受这些发现的鼓舞我们提出了Cache-to-CacheC2C一种用于更丰富、更快速的多LLM通信的新范式。如图1b所示C2C将源模型的KV-Cache投影到目标模型的空间中并通过神经缓存融合器将它们合并。实验表明C2C比单个模型的平均准确率高出6.4-14.2%。它进一步比T2T范式高出约3.1-5.4%同时实现了平均2.5倍的延迟加速。2 相关工作2.1 KV-Cache共享与复用基于层间KV-Cache的相似性模型内缓存共享方法Yang et al., 2024b; Wu Tu, 2024; Sun et al., 2024; Brandon et al., 2024; Wu et al., 2025被提出用于复用浅层的KV-Cache以供深层使用从而加速单个LLM推理。2.2 多LLM系统另一个研究重点是在多个用户查询中复用同一模型的部分KV-Cache例如公共前缀、参考文档Bang, 2023; Ye et al., 2024; Yao et al., 2024; Qin et al., 2024; Yang et al., 2025b; Ye et al., 2025; Eyuboglu et al., 2025。DroidSpeakLiu et al., 2024a将缓存复用扩展到从同一基础模型微调的模型。与现有专注于通过缓存复用提高计算效率的工作不同我们的方法利用KV-Cache作为LLM之间语义迁移的媒介。此外与仅限于单个模型或具有相同结构和大小的模型的现有缓存共享方法不同我们的方法支持跨不同模型家族和不同模型大小的共享。协作式多LLM系统。协作系统将多个LLM视为交换信息以提高集体性能的对等体。Chain-of-AgentsZhang et al., 2024c和MetaGPTHong et al., 2023创建了顺序消息流其中智能体使用自然语言接口直接通信。Mixture-of-AgentsWang et al., 2024、DyLANLiu et al., 2024b和OwlHu et al., 2025引入了分层通信架构。目标LLM使用投票或摘要机制聚合来自多个模型的消息。多智能体辩论方法Estornell Liu, 2024; Liang et al., 2024; Du et al., 2023涉及迭代通信轮次让LLM智能体讨论和精炼响应。最近的工作如MCP Anthropic2024和A2A Surapaneni et al.2025建立了超越自然语言的正式文本协议标准化了协作式多LLM系统中的智能体交互和工具使用。这些方法依赖于文本级接口其中通信需要一个模型逐token生成文本另一个模型将其作为输入摄取。我们的工作通过直接共享内部KV-Cache表示探索了更深层、更高效的协作Pidkuiko Starkov, 2025; Zheng et al., 2025b。基于路由的多LLM推理系统。为加速LLM推理若干系统利用具有不同能力和成本的多个模型。动态模型选择方法OpenAI, 2025; Ong et al., 2024; Feng et al., 2024; Ning et al., 2024将查询路由到不同大小和配置的模型以平衡效率和性能。Token级路由方法Zhang et al., 2024a; Shen et al., 2024; Zheng et al., 2025a; Fu et al., 2025a实现更细粒度的选择在复杂任务的推理过程中利用较小模型进行简单token生成。虽然这些系统通过策略性模型切换实现效率但它们要么完全丢弃来自其他模型的上下文要么仅仅依赖自身对上下文的理解。在没有理解共享的情况下较小模型无法受益于较大模型已计算的更丰富表示。3 方法3.1 预备知识3.2 缓存到缓存通信的Oracle实验我们旨在探索LLM是否可以通过KV-Cache进行直接的语义通信。具体而言我们设计两个Oracle实验来回答以下问题1收益模型的性能能否通过KV-Cache语义丰富得到提升而不延长序列长度2可转换性一个模型的KV-Cache能否被另一个模型有效利用图3源模型Qwen3-4B、目标模型Qwen3-0.6B和转换后缓存的KV-Cache表示的T-SNE可视化。转换后源缓存落入目标的表示空间内。图4选择性丰富不同数量层的KV-Cache对准确率的影响。丰富更多表现最好的层可提高准确率而丰富表现最差的层则降低准确率。表1缓存丰富实验。Oracle在示例(E)(E)和问题(X)(X)上预填充然后在解码前丢弃示例缓存将语义丰富与缓存长度隔离。方法缓存长度缓存丰富准确率%DirectX否58.42Few-shotE X是OracleX是62.34表2Sharer、Receiver和C2C融合后的KV-Cache的平均有效秩。融合后的增加表明C2C丰富了Receiver KV-Cache的语义。类型平均有效秩SharerReceiverC2CK Cache539388395V Cache6895325603.2.1 缓存丰富Oracle比较Direct和Oracle隔离了缓存丰富的效果任何增益都来自E诱导的更丰富的问题嵌入而非关注额外的token缓存如Few-shot。如表1所示Oracle设置在相同缓存长度下提高了响应质量。此外我们分析了缓存丰富如何影响不同的Transformer层。我们的发现表明层间存在显著差异一些层从缓存丰富中受益而其他层则经历性能退化详见附录A.2.1。此外这些层间效应随着更多层被增强而累积。如图4所示选择性地将缓存丰富应用于表现最好的层例如前5层比丰富所有层产生略高的准确率而针对表现最差的层则导致准确率下降。这一发现指导了我们缓存融合器的门控机制第3.3.2节。3.2.2 缓存转换Oracle为验证一个模型的KV-Cache可以被另一个模型利用我们进行了跨模型转换实验。我们训练一个3层MLP将源LLMQwen3-4B的KV-Cache映射到目标LLMQwen3-0.6B更多设置详见附录A.3.2。图3中的T-SNE可视化揭示两个LLM的原始KV-Cache在表示空间中相距甚远。转换后映射的KV-Cache位于目标模型的表示空间内。这些结果表明来自不同模型的KV-Cache通常是可转换的因为转换后的缓存被目标模型的表示空间所覆盖。需要注意的一点是转换后的缓存仅占据目标空间的一个较小子集。这表明源模型的语义信息无法完全覆盖目标的语义信息尽管源模型更大。这反映了每个模型编码上下文方式的固有差异。另一个观察也支持这一解释不同模型的正确答案集表现出有限的重叠图7尽管各自模型的聚合准确率相当。这些发现表明如果来自不同模型的专业化上下文理解能够被成功投影和融合就可能利用各自模型的互补优势。3.3 C2C设计3.3.1 概述基于Oracle实验我们提出了C2C方案。其核心目标是从一个模型Sharer中提取有用的上下文理解或知识并将其融合到另一个模型Receiver中。为了在不破坏性地覆盖Receiver信息的情况下增强Receiver的KV-Cache融合器在残差集成原则下设计。如图5所示它包含三个关键模块1投影模块将Receiver的KV-Cache与Sharer的KV-Cache拼接然后通过投影层和特征融合层处理拼接后的特征。2动态加权模块应用输入感知的头部调制层来动态重新加权投影信息。3可学习门控引入可训练的逐层门控值决定是否注入Sharer的上下文。门控应用带温度退火的Gumbel-sigmoid以在训练期间从可微平滑过渡到推理时的二值化。我们还在附录A.1.3中探索了一种更复杂但可能更强大的融合器变体。3.3.3 模型对齐跨模型家族和大小融合KV-Cache需要在两个层面进行对齐token和层。对于token对齐不同的分词器可能对同一输入产生略有不同的token序列。我们通过将每个Receiver token解码为其字符串形式并使用Sharer的分词器重新编码来对齐它们。当偶尔出现一对多映射时我们选择具有最大字符串覆盖的Sharer token以保留信息。对于层对齐我们采用终端对齐策略首先对齐两个模型的最后层然后对齐倒数第二层依此类推按逆序直到较浅模型的第一个层。详情见附录A.1.1和A.1.2。3.3.4 训练方案在训练期间我们冻结Sharer和Receiver模型仅训练C2C模块进行KV-Cache融合。我们对Receiver的响应预测采用标准的下一token预测损失类似于监督微调SFT。关键区别在于Receiver以融合的KV-Cache为条件预测响应而非其自身的KV-Cache。训练过程包括三个阶段1前向两个模型编码输入上下文以产生各自的KV-Cache。2融合C2C模块融合两个KV-Cache并替换Receiver的缓存。3监督Receiver使用融合缓存预填充响应梯度通过C2C反向传播以最小化预测损失。4 实验4.1 设置我们在此简要介绍实验设置更多详情见附录A.3。模型。我们在各种模型家族上评估C2C包括Qwen2.5Yang et al., 2024a; Hui et al., 2024、Qwen3Yang et al., 2025a、Llama3.2Dubey et al., 2024和Gemma3Team et al., 2025。为测试泛化性我们为Sharer-Receiver模型组合选择不同配置包括不同代际的模型Qwen3和Qwen2.5、不同家族Qwen、Llama和Gemma、不同大小0.6B到14B、不同专业化通用、代码和数学模型以及不同训练阶段预训练和指令微调模型。对于消融和诊断分析缩放行为、消融研究、行为分析除非另有说明我们将Receiver和Sharer固定为Qwen3模型。这种一致性消除了模型对齐的混杂因素隔离了C2C的核心影响。基线。我们将C2C与两种LLM协作方法进行比较以定位性能1文本到文本T2T通信模型通过针对每个查询的“分析-然后-响应”交接进行协作。Sharer生成关键信息的分析文本以解决输入问题。该文本与原始问题拼接后馈送给Receiver以镜像标准协作流程。相应提示见附录A.3.6。2查询级路由Ong et al., 2024模型通过为不同查询选择合适的LLM进行协作。我们还纳入单个模型性能单独Sharer或Receiver以建立协作增益的下界。基准。我们在四个广泛使用的基准上评估涵盖推理、知识和语言领域以确保全面覆盖。OpenBookQAMihaylov et al., 2018用于基于事实的推理MMLU-ReduxGema et al., 2025用于通用领域知识ARC-ChallengeARC-CClark et al., 2018用于科学和逻辑推理C-EvalHuang et al., 2023用于中文领域的综合知识。表3MMLU-Redux上的平均token数和推理时间分解ShaperQwen2.5-0.5B-InstructReceiverQwen3-0.6B。*包括90ms的KV-Cache融合时间。指标Receiver-onlySharer-onlyText-to-TextCache-to-CacheSharerReceiver输入Token170187103332170输出Token1119801012预填充时间ms2720213220 90*解码时间ms2813261312231103总时间ms3083461596445训练数据集。为确保C2C的泛化性我们使用OpenHermes2.5数据集Teknium, 2023的前500k样本一个通用微调数据集来训练C2C融合器。为降低训练成本除非另有说明我们在缩放行为和行为分析实验中使用MMLU作为训练集。评估设置。我们使用平均准确率作为性能指标。对于C2C和基线我们使用文本生成和答案提取作为评估模式多选题基准的最大生成长度设为64。所有实验在零样本设置下进行生成温度为零以确保可复现性。我们使用平均推理时间作为效率指标在单张NVIDIA A100 GPU上以批量大小为一进行测量。4.2 主要结果性能。如表4所示C2C在不同设置和基准上持续提升Receiver模型性能。代表性示例输出见附录A.4.4。应用C2C后三个Sharer的准确率平均分别提高11.00%、9.64%和11.88%。与文本到文本通信相比C2C的平均准确率分别提高5.36%、4.15%和3.06%。查询级路由优先考虑效率但将准确率限制为两个原始模型中较好的一个。值得注意的是Qwen3-4B Base作为Sharer时经常忽略指令导致单独性能差且T2T通信时间过长。相比之下C2C绕过了这个问题突出了一个有趣的用例较弱的指令微调Receiver可以通过C2C利用更强基础模型的知识即使基础模型无法遵循指令。我们还探索了强到弱通信详见附录A.2.2使用Qwen3-4B作为Sharer表明C2C有效地使Receiver能够从更强的Sharer中受益。效率。如表4所示C2C通过消除中间文本生成比T2T实现了3.46倍、1.51倍和14.41倍的显著加速。如表3所详述T2T需要Sharer解码80个输出token产生1312ms的解码开销而C2C用90ms的并行缓存融合替代了这种顺序解码。对Llama3.2-1B异常快速推理的进一步分析见附录A.4.3。4.3 缩放行为缩放序列长度。我们评估C2C如何随序列长度缩放在LongBenchV1基准的长上下文任务上进行。所有C2C融合器在不同LongBenchV1集合上训练和测试。如表5所示C2C在所有序列长度区间上持续优于文本到文本通信。这证明了C2C在输入长度范围内的优势。更详细的设置和结果见附录A.2.2和A.3.4。缩放模型大小。我们研究C2C如何随Sharer和Receiver模型大小缩放。所有C2C融合器在MMLU的辅助训练集上训练在MMLU-Redux上评估。如图6所示x轴表示Sharer大小Qwen2.5-Instruct系列yy轴显示C2C相对于仅Receiver基线的准确率增益Δ Accuracy每条曲线代表Qwen3系列的一个Receiver。我们发现C2C的准确率提升通常比T2T增长更快。这一趋势表明当Sharer拥有更丰富的知识时C2C能够更有效地向Receiver传递有用信息。注意较大Receiver的相对增益不那么明显因为它们有更强的基线且与Sharer的知识重叠更高。不同模型组合。我们测试不同的Sharer-Receiver组合包括不同模型家族和不同任务特定模型。表7的结果显示C2C在MMLU-Redux上所有五种组合中平均比文本到文本通信高出8.59%。这支持了通过采用C2CReceiver模型可以有效利用来自不同模型的上下文理解来增强性能。值得注意的是当使用Qwen2.5-Math作为Sharer时通信文本变得相当长如附录A.4.3所分析。为进一步测试C2C的泛化性我们交换Sharer和Receiver模型。结果显示C2C稳健地带来5.05%的准确率提升而应用T2T导致6.30%的性能下降。这些实验共同支持了C2C作为一种有效且高效的新LLM通信范式的可扩展性。表4不同通信方法在四个基准上的准确率%和推理时间秒。Receiver固定为Qwen3-0.6B搭配三个不同的Sharer。Sharer任务指标ReceiverSharerRoutingText-to-TextCache-to-CacheQwen2.5-0.5BMMLU-ReduxAcc35.5338.4235.5841.0342.92Time0.290.340.271.520.40OpenBookAcc39.2045.6040.8044.0052.60Time0.270.350.290.810.30ARC-CAcc41.0442.0940.7049.4854.52Time0.290.390.291.000.36C-EvalAcc32.0440.2134.6135.8841.77Time0.260.310.261.510.34Llama3.2-1BMMLU-ReduxAcc35.5332.3033.3843.3244.42Time0.290.060.180.750.50OpenBookAcc39.2032.6036.4041.2047.80Time0.260.070.170.700.43ARC-CAcc41.0433.5737.2250.0053.39Time0.280.070.180.700.47C-EvalAcc32.0431.3131.9235.2740.77Time0.250.040.150.710.49Qwen3-4B-BaseMMLU-ReduxAcc35.531.0316.3943.8743.95Time0.292.060.287.540.45OpenBookAcc39.202.2022.2046.4053.20Time0.261.980.275.080.34ARC-CAcc41.041.4819.6553.9155.39Time0.282.060.286.560.40C-EvalAcc32.045.6515.1038.9242.79Time0.252.020.263.590.39图6MMLU-Redux基准上的准确率提升Δ Accuracy。aC2C通信。bT2T通信。x轴表示来自Qwen2.5-Instruct系列的Sharer模型曲线对应来自Qwen3系列的Receiver模型。C2C的准确率提升通常比T2T增长更快。表5LongBenchV1上随序列长度的性能缩放使用Qwen3-0.6B Receiver和Qwen2.5-0.5B Sharer。长度ReceiverSharerT2TC2C0-4k30.5224.9433.4637.314-8k26.0323.1829.7034.018k25.9916.4425.6430.72表6C2C改进来源的消融。Single仅微调Receiver无Sharer。IdenticalC2C使用同一LLM作为Sharer和Receiver。C2C使用不同LLM作为Sharer和Receiver。设置#参数OpenBookARC-CMMLUC-EvalSingle596M45.8047.6536.8135.81Identical529M50.6052.5242.1740.34C2C478M52.6054.5242.9241.77表7Receiver-only、Sharer-only、T2T和C2C在准确率和时间上的比较。这些配对分为异构设置Receiver与不同能力的Sharer配对和交换设置Receiver和Sharer角色互换。配对类型ReceiverSharer指标ReceiverSharerT2TC2C异构Qwen3-0.6BGemma3-1BAcc35.5331.7541.3545.90Time0.290.541.040.30Qwen3-0.6BQwen2.5-Math-1.5BAcc35.5339.8643.7146.13Time0.298.716.600.27交换Qwen3-0.6BQwen2.5-Coder-0.5BAcc35.5325.0939.7446.89Time0.290.261.590.27Qwen2.5-0.5BQwen3-0.6BAcc38.4235.5332.1243.47Time0.340.290.980.21Qwen3-0.6BQwen2.5-0.5BAcc35.5338.4241.0346.50Time0.290.341.520.264.4 消融研究改进来源。在表6中我们通过固定ReceiverQwen3-0.6B并变化Sharer来消融C2C性能增益的来源。Single表示对Receiver进行标准全微调无Sharer。Identical表示C2C中Sharer和Receiver均为Qwen3-0.6B。我们的默认C2C使用Qwen2.5-0.5B作为Sharer。在相同训练配置下C2C持续获得比Single和Identical更高的准确率。这证实了C2C的改进并非纯粹来自增加的训练容量或对训练集的过拟合。相反它指向了异构Sharer贡献的互补上下文理解。Identical仍然优于Single表明缓存级自通信可以提供有用的辅助理解这与潜在推理和循环Transformer中观察到的效果相呼应Saunshi et al., 2025; Fu et al., 2025b。融合器架构。在表8中我们展示了C2C设计中不同组件的效果。与丢弃Receiver缓存的纯投影相比融合两个模型的KV-Cache并通过残差连接保留Receiver的缓存准确率提高了24.18%。添加用于融合层选择的门控进一步将平均准确率提高了3.07%。4.5 行为分析有效秩分析。我们分析缓存到缓存通信前后KV-Cache的有效秩。有效秩Roy Vetterli, 2007是模型权重或激活值内在维度的常用度量更高的内在维度意味着更丰富的语义信息详见附录A.4.1。如表2所示缓存到缓存融合后K和V的有效秩分别从388增加到395从532增加到560。这表明C2C通过成功转换Sharer的表示并将知识注入Receiver模型丰富了语义空间。准确率分解。我们的分析揭示C2C准确率增益的来源取决于通信模型的相对容量并因任务子类别而异。详情见附录A.2.3。我们还发现在某些特定情况下C2C可能失败因为来自Sharer模型的上下文理解并不总是准确的可能误导Receiver生成错误答案。代表性示例见附录A.4.6。渐进行为。我们通过逐渐增加C2C更新的上下文KV-Cache百分比来分析C2C的渐进行为详情见附录A.2.4。当百分比超过50%时增加百分比持续产生更好的性能。门控行为。我们在附录A.4.2中分析不同训练模式下C2C可学习门控的行为。我们可以得出结论通用训练倾向于广泛的门控激活通过权重进行细粒度调制而任务特定训练倾向于稀疏的门控激活更强地依赖所选层。表8C2C融合器组件的消融。Project直接用投影的Sharer缓存替换Receiver的KV-Cache。Fuse融合两个缓存并通过残差将结果加回Receiver。Gate添加逐层可学习门控。5 讨论未来工作。C2C开辟了若干未来研究方向。1多智能体系统中的缓存通信C2C可能成为具有复杂多轮推理、编码和工具使用的真实世界智能体任务的更好通信原语。附录A.5.3提供了数学问题解决的初步案例研究。2跨模态协作超越纯文本模型融合视觉语言模型VLM和视觉语言动作VLA模型之间的缓存可能实现更丰富的多模态协作。3推理加速C2C可以增强投机解码并实现跨异构模型的token级路由以降低延迟和成本。4隐私感知协作LLM可以传输KV-Cache片段而无需显式文本限制内容暴露并提高隐私性。局限性。1当非常弱的Sharer向更强的Receiver提供噪声信息时多LLM系统会经历性能退化。这一局限为T2T和C2C所共有因为Sharer的语义质量直接影响Receiver性能。2虽然成对KV-Cache通信可行且有利但以O(N)训练成本扩展通信LLM数量仍是一个开放问题。针对此目标的初步努力见附录A.5.1和A.5.2。6 结论我们证明了LLM可以超越文本进行通信。我们引入了Cache-to-CacheC2C一种跨模型转换和融合键值KV缓存以实现直接语义通信的通用范式。在不同任务和模型配置中C2C持续实现比文本到文本通信更高的任务性能和更好的效率。这些结果确立了缓存到缓存作为基于token通信的实用替代方案并突出了其在可扩展、低延迟多LLM系统中的前景。
返回列表