
文章主要内容和创新点总结主要内容本文针对计算机视觉中的感知任务,提出了一个名为MVP-LM(Multi-granular and Versatile Perception framework incorporating Visual Large Language Model)的统一框架。感知任务可按两个维度分为四类:预测类型(边界框/掩码)和指令类型(基于词/基于句子)。现有研究多仅覆盖部分任务组合,限制了通用性。MVP-LM通过整合多粒度解码器、Chain-of-Thought(CoT)启发的数据集统一策略和查询增强策略,实现了在单一架构中处理全景分割、目标检测、视觉定位、指代表达式分割等多类任务。实验表明,MVP-LM在词级和句子级感知任务的多个基准测试中表现优异,验证了其有效性。创新点框架设计:提出MVP-LM框架,利用视觉大语言模型(VLLM)的解码和生成能力,统一处理词级和句子级感知任务,支持边界框和掩码的多粒度预测。数据集统一:基于CoT思想设计数据集整理策略,将不同任务的数据集转换为统一的有监督微调(SFT)格式,鼓励模型采用“先思考后感知”的范式。查询增强:设计动态查询生成策略,结合LLM生成的序列特征优化视觉查询,提升解码精度。性能验证:在多个