
文章主要内容和创新点主要内容本文介绍了SWE-MERA,这是一个动态、持续更新的基准测试集,旨在解决现有软件工程任务基准(如SWEbench)存在的数据污染、静态性等关键局限性。该基准通过自动化收集GitHub上的真实问题并进行严格的质量验证,构建了一个可靠的评估框架。核心目标:评估大型语言模型(LLMs)在真实软件工程任务(如修复GitHub问题)中的表现,避免数据泄露和基准饱和问题。技术实现:设计了七阶段任务收集 pipeline,从GitHub仓库筛选、PR-issue映射、元数据提取到LLM质量评估,确保任务质量并最小化污染风险。目前已收集约300个可用样本,潜在任务约10,000个。评估方法:使用Aider编码代理对LLM进行评估,记录Pass@1(首次尝试成功)和Pass@6(六次尝试内成功)等指标,对2024年9月至2025年6月的任务进行了测试,展示了对最新LLM的区分能力。创新点动态更新机制:通过定期刷新测试案例,解决静态基准的数据泄露(模型记忆解决方案)和基准饱和(模型分数接近完美,无法区分进步)问题,保持任务的真实世界相关性和评估公平性。高质量 pipeline:七阶段流程(仓库选择、PR-issue映射、元数据过滤、补丁验证等)确保任务质量,结合L