EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens 一、文章主要内容总结本文针对高效多模态大语言模型(Efficient MLLMs)在压缩视觉tokens以提升效率时面临的视觉信息丢失、细粒度理解能力下降问题,提出了一种名为EM-KD的知识蒸馏框架。核心思路是利用预训练充分的普通教师模型(vanilla teacher)向高效学生模型蒸馏知识,同时解决师生模型间视觉tokens数量不平衡、空间不对齐的关键挑战。具体实现包括三个核心模块:视觉token匹配(Vision Token Matching):通过LM头将师生模型的视觉tokens解码为视觉logits,计算曼哈顿距离构建成本矩阵,再利用匈牙利算法实现tokens的最优一对一匹配,解决数量不平衡与空间错位问题。视觉语义蒸馏(Vision Semantic Distillation, VSD):基于匹配后的视觉logits,采用反向KL散度衡量师生模型在词汇空间上的概率分布差异,实现语义知识迁移,无需额外投影层对齐维度。视觉-语言亲和蒸馏(Vision-Language Affinity Distillation, VLAD):计算匹配后视觉tokens与文本tokens的余弦相似度构建亲和矩阵,通过平滑L1损失最小化师生矩阵差异,强化跨模态对齐。实验在11个多模态基准数据集(涵盖通用问答、知识推理、OCR图表解析)上验证,EM-KD训练的模型在保持144个视觉tokens(远少于传统模型的576个)的高效推理能力下,平均准确率超过现有高效MLLMs和主流蒸馏方法,同时实现54