ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Beyond the Surface: Probing the Ideological Depth of Large Language Models

Beyond the Surface: Probing the Ideological Depth of Large Language Models 论文核心内容与创新点总结一、主要内容本文聚焦大型语言模型(LLMs)的“意识形态深度”,即模型内部政治表征的稳健性与复杂性,通过双路径研究框架展开分析,核心内容如下:研究背景与问题提出LLMs已被证实存在明显意识形态倾向,但表面响应易受提示工程操纵,其背后是否存在连贯的意识形态结构尚不明确。研究核心问题是:模型响应的可引导性差异是否反映其内部政治结构的不同?研究方法与实验设计数据准备:使用1000条含政治倾向的提示(源自Perez等人数据集),将其分类为12个政治主题(如社会福利与贫困、堕胎权、气候与环境等),分层抽样126条用于评估,874条用于训练引导向量。意识形态引导实验:采用两种引导方法测试Llama-3.1-8B-Instruct和Gemma-2-9B-it两款模型:提示工程:设计9种提示条件(如“以自由派身份回答”“以保守派身份+保守派论据回答”),分析模型响应倾向(自由派/保守派/拒绝回答)与一致性。激活引导:通过对比激活添加(CAA)确定模型最易引导的层(Llama为14层,Gemma为20层),再用稀疏自编码器(SAE)的引导目标原子(STA)方法,量化引导对模型响应的影响。内部特征分析
返回列表