
文章主要内容总结本文聚焦大型语言模型(LLMs)的情感认知推理能力,基于心理学中的认知评估理论(Cognitive Appraisal Theory),探究LLMs如何通过认知维度进行情感推理。研究核心是回答三个问题:模型是否更倾向于隐性依赖特定认知评估维度?哪些认知维度对表征特定情感至关重要?LLMs中不同情感类别的内部表征能否通过认知评估维度解释?为解答这些问题,作者构建了一个大规模基准CoRE(Cognitive Reasoning for Emotions),涵盖15种情感类别、16个认知评估维度及约20个场景/情感,包含4928个提示和34,000余条模型生成的评估结果。通过对7个开源及闭源模型(如GPT-o4-mini、Gemini 2.5 Flash等)的实验分析,发现不同LLMs的推理模式存在差异:虽在情感间关系上有共识,但对个体情感的评估存在分歧,且无通用的情感表征。创新点提出CoRE基准:首个大规模评估LLMs情感认知推理的基准,覆盖多情感类别和认知维度,为探究模型内部情感表征提供工具。实验框架设计:通过主成分分析(PCA)、逻辑回归、Wasserstein距离等方法,系统分析模型的隐性评估策略、维度与情感的关联性及模型间差异。发现模型认知规律:揭示LLMs的情感认知既有与人类相似的共性(如 val