Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study 文章主要内容与创新点总结一、主要内容该研究聚焦罗马尼亚语文本的重音符号恢复任务,系统评估了多款大型语言模型(LLMs)的性能。罗马尼亚语含丰富重音符号(如ă、î、ș、ț、â),但数字文本中常因键盘限制或录入错误导致重音丢失,影响文本处理质量。研究选取了12款主流模型,包括OpenAI的GPT-3.5、GPT-4、GPT-4o,Google的Gemini 1.0 Pro,Meta的Llama 2/3系列,以及MistralAI的Mixtral 8x7B等开源模型,基于dexonline项目的两类数据集(含2000条语句,覆盖1993年正字法改革前后的语言特征),设计了从零样本到三样本的梯度化提示模板,通过字符级/词级的准确率和错误率指标(结合编辑距离),并以仅复述去重音输入的“Echo模型”为基线,开展全面评估。核心结果显示:OpenAI的GPT-4o表现最优,总平均得分(TAS)达0.9639,相对基线的性能比(RPR)为1.190;Google Gemini 1.0 Pro、GPT-4等模型也显著优于基线;而部分开源模型(如Llama 2 7B、Mixtral 8x7B)未达基线水平,Llama 2系列因无法准确遵循提示指令表现最差。错误分析表明,â/î符号混淆、句首大写字母处理、多句文本中的专有名词是主要误差来源,三样本提示模板对多数模型的性能提升最显著。二、创新点多维度对比框架:首次整合12款不同类型(专有/开源)、不同参数规模的LLMs,覆盖从基础零样本到复杂三样本的提示策略,构建了兼顾字符/词级、大小写敏