
文章主要内容和创新点主要内容本文提出了一种名为双阶段自进化(Dual-Phase Self-Evolution, DPSE)的框架,旨在解决大型语言模型(LLMs)在预训练后难以同时优化用户偏好适应和特定领域能力的问题。现有后训练方法(如偏好优化、记忆增强)多侧重用户对齐,却忽视领域认知提升,而监督微调(SFT)依赖大规模人工标注数据,成本高昂。DPSE框架的核心包括:审查模块(Censor Module):从用户-模型交互中提取5种多维信号(显式反馈、停留时间、连贯性、相似度、情感),通过动态门控和可信度评估计算满意度分数,并进行主题分类,构建结构化记忆。双阶段数据扩展:基于满意度分数的偏好驱动扩展(偏向高满意度样本)和基于主题分布的主题感知扩展(平衡领域多样性),自动生成训练数据。两阶段微调:先通过监督微调在领域扩展数据集上强化领域认知,再通过频率感知的偏好优化(基于DPO)对齐用户偏好。实验表明,DPSE在通用NLP基准(AlpacaEval 2.0、MT-Bench)和长期对话任务(LoCoMo数据集)上,性能均优于SFT、偏好优化(如DPO、UPO)和记忆增强(如ReadAgent、MemoryBank)等基线方法,且消融实验验证了各模块的必要性。创新点联合优化用户偏好与领域能力