
MME-SCI相关总结与翻译一、文章主要内容本文针对现有多模态大语言模型(MLLMs)科学领域评测基准存在的不足,提出了综合且具有挑战性的基准MME-SCI。该基准包含1019个高质量问答对,涵盖数学、物理、化学、生物4个学科,支持中文、英文、法语、西班牙语、日语5种语言,设计了文本仅输入、图像仅输入、图像-文本混合输入3种评测模式,并对每个问题标注了对应的知识点,共涉及63个细粒度概念。研究人员在16个开源模型和4个闭源模型上开展了大量实验,结果表明MME-SCI对现有MLLMs极具挑战性。例如在图像仅输入模式下,o4-mini在数学、物理、化学、生物学科的准确率分别仅为52.11%、24.73%、36.57%、29.80%,难度显著高于现有基准。同时,借助MME-SCI的多语言和细粒度知识属性,深入分析了现有模型的性能,发现了模型在特定领域的薄弱环节,如o4-mini在“磁场”相关33个问题中仅答对5个,进而强调了提升MLLMs科学推理能力的迫切需求。此外,文章还对比了MME-SCI与现有基准的差异,介绍了MME-SCI的数据构建流程,分析了实验结果(包括开源与闭源模型差距、推理能力对模型性能的影响、不同学科表现差异、图像仅输入模式下模型性能变化、Any2any模型视觉推理能力退化等),并从上下文学习设置、不同语言、细粒度知识点、错误原因等方面进行了进一步分析。二、文章创新点多语言适应性:现有MLLMs训练语料多以英语为主,MME-SCI支持5种语言,能全面评估模型在跨语言科学场景下的推理能力,且有