ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

CARD: Cache-Assisted Parallel Speculative Decoding for Efficient Large Language Model Inference

CARD: Cache-Assisted Parallel Speculative Decoding for Efficient Large Language Model Inference 文章主要内容和创新点主要内容本文针对大型语言模型(LLM)推理过程中的延迟问题,提出了一种基于缓存的并行推测解码框架CARD(Cache-Assisted Parallel Speculative Decoding)。传统的推测解码(SD)采用“先草稿生成再验证”(draft-then-verify)的串行范式,存在硬件资源利用率低、草稿序列易因单个token被拒而整体丢弃等问题。CARD通过引入“查询-修正”(query-and-correct)范式,构建缓存机制实现草稿模型(draft model)与目标模型(target model)的并行推理,解决了传统方法的串行依赖和资源浪费问题,在不微调模型的情况下实现了最高4.83倍的推理加速。创新点并行执行框架:打破传统推测解码中草稿生成与验证的串行依赖,通过缓存支持让草稿模型与目标模型同时进行推理,实现“查询-修正”新范式(查询缓存、选择高置信度路径、修正草稿模型生成方向)。自适应缓存机制:动态缓存结构可自适应确定有效草稿长度,通过保留历史状态最大化token接受率。计算卸载:将目标模型的部分计算任务转移到草稿模型,在保持目标模型链状验证效率的同时,实现接近树形验证的性能。翻译部分摘要推测解码(SD)中,额外的草稿模型先生成多个草稿token,然后由原
返回列表