
文章主要内容总结本文聚焦于大型语言模型(LLMs)在元分析数据提取中的实际表现评估,旨在解决从随机对照试验(RCTs)全文中自动提取数据用于元分析的挑战。研究选取了Gemini-2.0-flash、Grok-3、GPT-4o-mini三个LLM,在高血压、糖尿病、骨科三个医学领域,针对统计结果、偏倚风险评估和研究层面特征三类任务,测试了基础提示、自我反思提示、模型集成、定制提示四种提示策略,以探究如何提升提取质量。研究发现,所有模型均表现出高精度,但召回率较低(存在关键信息遗漏);其中定制提示策略效果最佳,可将召回率提升高达15%。基于此,研究提出了三级使用指南,根据任务复杂性和风险,将数据类型与适当的自动化水平匹配,为现实世界元分析中的数据提取自动化提供了实用建议,平衡了LLM效率与专家监督。文章创新点全面的可行性评估:首次跨多个临床领域(高血压、糖尿病、骨科)、信息类型(统计结果、偏倚风险、研究信息)和任务结构,对LLMs在元分析全文数据提取中的表现进行深入基准测试。模块化性能优化:证实提示专业化和模型输出聚合能带来显著且互补的提升,建立了针对异质元分析任务的模块化提取质量提升策略。稳健的评估方案:设计角色分离的评估流程,避免LLM自评输出,通过盲法、模型无关的比较确保评估的可靠性和无偏性。任务特异性自动化指南:基于实证性能模式,提出元分析信息类型的三级分类(根据自动化适用性和误差容忍度),为何时自动化、何时需审查