走出数学与代码,大模型还能自我进化吗? 受到自监督学习的启发作者提出了 RLSVRReinforcement Learning with Self-Verifiable Rewards训练框架。可验证奖励的强化学习RLVR逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中标准答案和编译器能够自动判断输出是否正确从而为大规模强化学习提供准确、低成本的奖励信号。然而创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量容易受到评估偏差和裁判模型能力的限制同时还会增加训练阶段的推理成本。如何为开放式任务构造稳定、可扩展且能够自动验证的奖励成为 RLVR 进一步扩展的关键障碍。受到自监督学习的启发作者提出了 RLSVRReinforcement Learning with Self-Verifiable Rewards训练框架。自监督学习通过掩码预测、对比学习等代理任务从数据本身生成训练标签RLSVR 将类似的任务变换思想引入强化学习通过构造带有环境隐藏变量和确定性规则的代理任务让开放式任务也能够产生可验证奖励。论文标题From RLVR to RLSVR: Task Transformation Induces SelfVerifiable Rewards for Open-Ended LLM Self-Improvement代码链接https://github.com/wangqinsi1/RLSVR/tree/SpyRL论文链接https://arxiv.org/abs/2607.23802基于这一思路作者进一步提出自博弈训练方法实例 SpyRLSelf-PlaY Reinforcement Learning。其核心是构造一个信息不对称的多智能体博弈环境不同智能体在掌握信息量存在差异的条件下完成同一目标任务并通过彼此的输出进行比较、判断和互动。环境预先记录造成信息差异的隐藏状态因此博弈结果可以被自动、精确地验证与此同时智能体能否在竞争中取得优势又取决于其完成原始任务的质量。由此开放式任务中难以直接衡量的能力被映射为可用于强化学习的规则化奖励信号。从 RLVR 到 RLSVR为开放式任务构造可验证奖励RLVR 能够有效提升数学推理和代码生成能力关键在于这些任务拥有确定性的验证机制。数学答案可以与标准答案直接比对代码则可以通过编译器和单元测试判断是否正确因此模型能够以较低成本持续获得稳定的强化学习信号。开放式任务的情况更复杂。摘要、写作和研究分析通常不存在唯一答案任务质量分散在完整性、逻辑性、相关性和创造性等多个维度中很难通过简单规则直接计算。奖励模型和 LLM Judge 虽然可以提供近似评价但训练效果会受到评估器能力、偏差和推理成本的影响。针对这一问题RLSVR 引入了任务变换Task Transformation。其基本思想是将原始开放式任务转化为一个可验证的代理环境并在环境中主动构造监督信号。环境首先从原始数据中采样任务再注入并记录一个隐藏变量例如哪个输入受到扰动、哪部分信息被删除或某个输出在什么条件下生成。模型仍然需要完成原始目标任务从而保证训练过程中使用的能力与真实应用场景保持一致随后模型通过输出之间的比较和交互对环境中的隐藏状态作出判断。由于隐藏变量由环境预先生成并保存模型的判断结果可以通过确定性规则直接核验。这样一来原本难以直接衡量的输出质量就能够通过代理环境中的交互结果转化为强化学习奖励。论文将这种奖励称为自可验证奖励Self-Verifiable Rewards它不依赖人工标注或外部裁判其验证依据来自环境自身的状态和规则标准答案在任务生成时就已经确定。从这个角度看RLSVR 可以视为将自监督学习的思想引入 RLVR。自监督学习通过代理任务从数据中自动生成标签RLSVR 则通过任务和环境变换自动生成奖励。任务变换对应代理任务环境隐藏变量对应自动构造的标签最终得到的规则化奖励可以直接用于 GRPO 等现有强化学习算法。RLSVR 由此提供了一条新的路径开放式任务的可验证性可以通过环境设计获得并进一步支持大规模、低成本的模型自我进化。SpyRL基于自博弈的 RLSVR 的实例为了验证 RLSVR 能否真正应用于开放式任务作者设计了一个基于信息不对称自博弈的具体实例——SpyRLSelf-PlaY Reinforcement Learning。SpyRL 将摘要、创意写作和数学推理等任务嵌入一个类似「谁是卧底」的多智能体环境中通过环境预先分配的隐藏身份为原本缺乏标准答案的任务构造可验证奖励。如论文图 2 所示SpyRL 的每轮训练包含 Performing 和 Detection 两个阶段。首先环境从任务数据中采样一个输入并随机指定一名玩家为 spy。其余 civilian 玩家获得完整输入spy 则只能看到经过信息降质处理的版本例如被连续遮盖部分内容的报告、写作提示或数学材料。随后所有玩家根据各自掌握的信息完成同一个目标任务生成摘要、故事或数学问题及解答。信息降质只移除影响任务完成的关键内容同时尽量保持输入的主题、风格和表面形式一致以避免模型通过长度、格式等简单特征识别身份。在 Detection 阶段所有输出会被公开玩家需要结合这些结果判断谁获得了残缺信息。由于 spy 的身份由环境提前随机指定投票是否正确能够直接与环境记录进行比较Detection 阶段也因此获得了确定性的奖励。与此同时一个玩家生成的内容越不完整、逻辑越薄弱越容易暴露其信息缺失并收到更多怀疑票。因此投票结果也可以反向用于评价 Performing 阶段收到的怀疑票越多任务执行奖励越低能够生成更完整、更连贯、更具说服力输出的玩家则更有可能避免被识别。这两个阶段共同构成了 SpyRL 的闭环自博弈机制。检测能力提升后模型能够发现输出中更细微的缺陷给执行者带来更严格的训练信号执行能力提升后不同玩家的输出会变得更难区分又会推动检测模型继续进化。作者对两个阶段进行交替优化当检测任务已经较为容易时训练重点转向执行模型当执行模型的提升导致身份识别准确率下降时再增强检测模型。这样的动态过程能够持续围绕模型当前的能力边界产生学习压力降低固定评估器逐渐失效带来的训练停滞。在奖励设计上Detection 阶段根据身份判断是否正确获得可验证奖励并通过类似 GRPO 的组内相对优势进行优化。Performing 阶段则采用零和奖励将 spy 与 civilian 之间的竞争以及 civilian 内部的相对表现结合起来。通过这样的设计SpyRL 将「输出质量」映射为「输出是否暴露了信息缺失」再将身份判断结果转化为可由环境直接核验的训练信号。整个训练过程不需要人工标注、奖励模型或外部 LLM Judge并且执行阶段始终围绕原始目标任务展开从而保证代理博弈所训练的能力能够迁移回摘要、写作和推理等真实任务。实验结果作者在 Qwen3-4B 和 Qwen3-8B 上验证了 SpyRL实验覆盖文本摘要、创意写作和数学推理三类任务并与 R-Zero、Absolute Zero 等自进化方法进行比较。评估同时采用任务专用自动指标、GPT-4o 成对 A/B 测试和人工盲测以考察模型在客观指标和人类偏好下的表现。在文本摘要任务中SpyRL 在 GovReport、Multi-News、QMSum、VCSum 和 SAMSum 五个数据集上均取得最高的 ROUGE-L。以 GovReport 为例Qwen3-4B 的 ROUGE-L 从 30.2 提升至 36.7Qwen3-8B 则从 29.0 提升至 34.1。在与未经训练的基础模型进行 A/B 测试时SpyRL 在五个数据集上的平均胜率分别达到 73.9% 和 75.4%并且在与 R-Zero、Absolute Zero 的对比中赢得了绝大多数测试。这表明基于身份识别产生的训练信号能够有效改善摘要的完整性、信息覆盖和组织质量。创意写作上的提升更加明显。作者从新颖性、情感表达、连贯性、一致性和总体质量五个维度进行评估。在 WritingPrompts 和 WritingBench 上SpyRL 相比基础模型及两种自进化基线在所有细分维度上的胜率均超过 50%。其中Qwen3-4B 相比基础模型的总体胜率分别达到 81.3% 和 75.1%Qwen3-8B 则达到 76.5% 和 78.1%。优势在新颖性和情感表达上尤其突出说明 SpyRL 带来的改善并不局限于语言流畅度和表面结构也覆盖了更具主观性的创作能力。虽然 SpyRL 主要面向缺少确定性奖励的开放式任务它在数学和通用推理任务上同样取得了稳定增益。在 GSM8K、Math500、AIME 2024、AIME 2025、Minerva、MMLU-Pro 和 GPQA-Diamond 七个基准上SpyRL 均取得了最佳结果。Qwen3-4B 的七项平均成绩相比基础模型提升 8.97 个百分点Qwen3-8B 提升 6.16 个百分点。例如Qwen3-4B 在 AIME 2025 上从 6.7 提升至 20.0在 GPQA-Diamond 上从 26.3 提升至 41.3Qwen3-8B 在 Math500 上从 74.2 提升至 81.2。这说明多玩家竞争和集体判断也能够为已有标准答案的任务提供更细粒度的学习信号。人工评估也支持这一结论。10 名博士生对 400 个创意写作样本进行了盲测SpyRL 在 WritingPrompts 上相对基础模型、R-Zero 和 Absolute Zero 的总体胜率分别达到 80.0%、78.5% 和 74.0%在 WritingBench 上则分别达到 85.0%、80.5% 和 72.0%。此外SpyRL 的效果并未局限于主实验所使用的数据分布。将训练语料从政府报告换成 PubMed 科学论文后模型在 arXiv、PubMed 和 BillSum 三个数据集上的平均 ROUGE-L 从 33.2 提升至 38.1平均 A/B 胜率达到 70.2%。跨任务实验还显示摘要和创意写作之间存在双向正迁移说明 SpyRL 学到的内容组织、完整性和长程一致性等能力能够跨开放式任务复用。启示本篇工作为自监督学习与强化学习建立了一条连接。自监督学习的核心经验是当真实标签难以获得时可以通过掩码预测、对比学习等代理任务从数据本身构造监督信号。RLSVR 将同样的思想推进到强化学习阶段面对缺少确定性奖励的开放式任务通过任务变换构造代理环境并由环境预设的隐藏变量和交互规则自动生成奖励。自监督学习通过构造任务获得标签RLSVR 通过构造环境获得奖励前者解决「没有标注如何学习」后者进一步探索「没有验证器如何做强化学习」。这也意味着RLVR 的适用范围不必完全受限于任务天然具备的标准答案。过去数学和代码之所以适合 RLVR是因为答案检查器和单元测试已经存在对于写作、摘要和研究分析RLSVR 将问题转化为如何设计一个与目标能力高度相关、同时具有确定性答案的代理任务。由此可验证性从任务的一项固定属性逐渐转变为一种可以通过环境设计获得的训练资源。SpyRL 所采用的信息不对称博弈正是这一思想的实例环境主动制造一个可记录的隐藏状态模型对该状态的判断可以被精确核验而完成判断所依赖的能力又与原始开放式任务紧密相关。这一视角也为大模型自我进化提供了新的研究方向。现有工作常将重点放在更强的奖励模型、更复杂的评价标准或更大规模的 LLM Judge 上而 RLSVR 提示我们还可以系统性地研究代理任务和训练环境本身。未来不同开放式能力可能对应不同的任务变换方式。随着这些变换逐渐丰富任务设计本身可能成为继数据、模型和优化算法之后推动模型自我提升的另一项关键变量。