
文章主要内容总结本文提出了SimdBench,这是首个专门用于评估大型语言模型(LLMs)生成SIMD intrinsic代码能力的基准测试。SIMD(单指令多数据)指令通过并行处理多个数据项加速性能关键任务,而SIMD intrinsic是编译器提供的内置函数,允许程序员在高级语言中显式调用SIMD指令,平衡编码效率与高性能。现有代码生成基准主要关注标量代码,缺乏对SIMD intrinsic代码的评估。为此,作者构建了包含136个任务的SimdBench,覆盖x86、ARM、RISC-V架构的5种代表性SIMD intrinsic(SSE、AVX、Neon、SVE、RVV)。通过对18个主流LLM的系统评估(正确性与性能),发现:LLMs生成SIMD intrinsic代码的pass@k普遍低于标量代码,其中DeepSeek-R1表现最佳(平均pass@5为75.44%);有效的SIMD intrinsic代码在多数情况下比带编译器优化的标量代码性能更优;主要错误包括“未声明标识符”的编译错误(主要针对SVE和RVV)和逻辑错误(主要针对SSE、AVX和Neon)。创新点首个SIMD intrinsic代码生成基准:SimdBench是首个专门针对SIMD intrinsic代码生成的基准测试,包含136个高质量任务,覆盖多架构的主流SIMD intrinsic。系统评估LLM能力:首次对18个代表性L