2026/8/25 16:52:50

Exploring the Potential and Limitations of Large Language Models for Novice Program Fault Localiz...

Exploring the Potential and Limitations of Large Language Models for Novice Program Fault Localiz... 文章主要内容与创新点总结一、主要内容该研究聚焦新手程序员代码故障定位问题,针对传统故障定位方法(如SBFL、MBFL)缺乏代码上下文理解能力的局限,系统评估了13个大语言模型(6个闭源模型、7个开源模型)在该任务中的表现。研究采用Codeflaws、Condefects两个公开数据集,并构建了无数据泄露风险的BugT新数据集,通过Top-N指标、消融实验、用户问卷等方法,从模型性能、提示工程影响、问题难度适配性、解释质量等维度展开分析。核心发现包括:闭源模型(如OpenAI o3)和专为代码任务优化的开源模型(如DeepSeekR1)整体性能优于传统方法,能提供上下文感知的故障定位结果及解释;具备强推理能力的模型(如OpenAI o3、DeepSeekR1)对提示工程依赖度低,而推理能力较弱的模型(如GPT-4)需精心设计提示;模型准确率随问题难度上升而下降,但顶级模型在BugT数据集上即使面对高难度任务仍保持稳健性能;大语言模型的故障解释对新手程序员具有显著教育价值,尤其受1年编程经验的学习者认可;大语言模型存在过度推理、部署成本高的问题,且不同方法在故障类型识别上具有互补性。二、创新点全面的模型评估:扩展了8个新增模型(4个前沿闭源模型、4个主流开源模型),覆盖不同架构类型,系统对比闭源与开源模型在新手代码故障定位中的表现;新数据集构建:创