ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Internal Value Alignment in Large Language Models through Controlled Value Vector Activation

Internal Value Alignment in Large Language Models through Controlled Value Vector Activation 文章主要内容总结本文针对大型语言模型(LLMs)的价值观对齐问题,提出了一种名为Controlled Value Vector Activation (ConVA)的框架,旨在通过直接调控模型内部的价值表征,使LLMs与人类价值观(基于Schwartz的10种基本价值观理论)保持一致,同时避免牺牲模型性能和输出流畅性。具体而言,ConVA包含两个核心部分:上下文控制的价值向量识别:通过构建上下文可控的数据集(确保正负样本仅在目标价值观上对立,其他无关上下文一致),消除传统数据集的上下文偏差,准确识别模型潜在空间中编码价值观的向量。门控价值向量激活:基于识别出的价值向量,引入门控机制判断输入是否与目标价值观相关,仅对相关输入施加最小程度的激活调控,在保证价值观一致性的同时,维持模型在无关任务上的性能。实验表明,ConVA在10种基本价值观上的控制成功率(CSR)显著高于现有方法(如ICA、CAA、SFT),且输出流畅率(FR)保持在97%以上,即使面对包含相反或恶意引导的输入,仍能稳定输出符合目标价值观的结果。创新点上下文控制的价值向量识别:通过成对生成正负样本(仅价值观对立,其他上下文一致),消除数据集的上下文偏差,首次实现了对LLMs内部价值表征的无偏解读。门控价值向量激活:扩展概念激活向量(CAV),引入门控机制和约束优化,实现对模型激活
返回列表