ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern Gen...

Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern Gen... 文章主要内容总结本文研究了代码上下文和提示策略对大型语言模型(LLMs)自动生成单元测试的质量和充分性的影响。研究选取了6个不同家族的LLM模型(如GPT系列、Claude、Gemini等),设计了12个自定义Python方法(模拟购物车系统)作为测试对象,通过两种提示策略(简单提示S1、思维链提示S2)和三种代码上下文(仅方法签名CF1、方法签名+文档字符串CF2、完整实现+文档字符串CF3),从编译成功率(CSR)、分支覆盖率(BC)、突变分数(MS)等多维度评估生成的单元测试质量。研究结果显示:包含文档字符串(CF2)能显著提升测试充分性,而扩展到完整实现(CF3)的增益较小;思维链提示策略(S2)效果最优,分支覆盖率最高达96.3%,平均突变分数57%,编译成功率接近完美;在所有模型中,M5(Gemini 2.5 Pro)在突变分数和分支覆盖率上表现最优,且编译成功率名列前茅。创新点自定义数据集设计:使用未公开的自定义代码作为测试对象,避免了LLM训练数据泄露导致的评估偏差,提高了结果可信度。多维度交互分析:系统探究了代码上下文(CF1-CF3)与提示策略(S1-S2)的交互影响,明确了不同组合对测试质量的具体作用。提示策略新发现:证明思维链提示即使对“推理模型”仍能提升效果,挑战了“推理模型使用该策略可能降低性能”的常见观点。综合评估体系
返回列表