
一、文章主要内容总结该研究针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在完整乐谱理解方面的研究空白,提出了首个大规模人工标注基准测试集MSU-Bench,用于评估模型在文本(ABC记谱法)和视觉(PDF乐谱)两种模态下的乐谱理解能力。核心背景与问题现有乐谱理解基准存在局限:聚焦孤立片段、单声部音乐或选择题型,缺乏对完整乐谱的整体性、多维度推理评估;VLMs处理乐谱时面临定位错误(无法准确识别小节位置)和幻觉(编造乐谱中不存在的内容)两大核心问题。基准设计数据构成:包含150首经典乐谱(涵盖巴赫、贝多芬、肖邦等作曲家的巴洛克、古典、浪漫主义等时期作品),对应1800个人工标注的生成式问答(QA)对。层级划分:按理解难度递进为四个层级,覆盖从基础元数据到高阶结构分析:Level 1(起始信息):作曲家、调号、拍号、速度等基础元数据;Level 2(记谱与音符):音高、临时记号、装饰音、力度标记等局部记谱特征;Level 3(和弦与和声):和弦性质、进行、终止式、转调等和声分析;Level 4(织体与曲式):动机、主题发展、织体类型、曲式结构等全局分析。双模态支持:同时支持文本模态(ABC记谱法,结构化文本编码乐谱信息)和视觉模态(PDF乐谱图像