ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Assessing the Reliability and Validity of Large Language Models for Automated Assessment of Stude...

Assessing the Reliability and Validity of Large Language Models for Automated Assessment of Stude... 文章主要内容和创新点主要内容本文研究了5个先进大型语言模型(LLMs)——Claude 3.5、DeepSeek v2、Gemini 2.5、GPT-4和Mistral 24B在高等教育真实场景中自动评估学生论文的可靠性和有效性。研究以67篇意大利语的大学心理学课程学生论文为样本,采用包含“相关性(Pertinence)、连贯性(Coherence)、原创性(Originality)、可行性(Feasibility)”四个维度的评分标准,每个模型对每篇论文进行三次重复评分以评估模型内稳定性。结果显示:人机评分一致性极低且不显著(通过加权二次Kappa系数衡量);模型内三次重复评分的可靠性较弱(Kendall’s W中位数0.30);存在系统性评分偏差,例如模型普遍高估“连贯性”分数,且对依赖语境的维度(如相关性、可行性)处理不一致;模型间一致性分析显示,在“连贯性”和“原创性”上有中等一致性,但在“相关性”和“可行性”上几乎无一致性。研究认为,当前LLMs难以复制人类在需要学科洞察力和语境敏感性的任务中的判断,评估开放式学术作品时,人类监督仍至关重要。创新点真实教育场景验证:聚焦高等教育真实课堂的学生论文(心理学领域、意大利语),而非标准化数据集或人工设计任务,更贴近实际教学评估需求。多维度与多模型对比:采用四维度评分标准(涵盖内容、结构、
返回列表