ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

[论文学习]Dream-RSI:通过演化世界实现递归自我改进

[论文学习]Dream-RSI:通过演化世界实现递归自我改进 Dream-RSI: Recursive Self-Improvement through Evolving Worlds论文重点递归自我改进RSI的瓶颈不在底层编码智能体本身而在“探索策略”——决定从哪里继续搜索、哪些尝试并行、何时停止的那段代码。Dream-RSI 的切入点是一次完整的发现过程已经把所有探索决策及其代码执行结果记录成了一棵树这棵树本身就是搜索空间的一个精确回放模拟器。策略改进不再需要跑昂贵的在线实验而是让候选策略在历史树上“做梦”走一遍立即拿到反馈。在算法工程、数学优化和 GPU 内核工程三个领域Dream-RSI 做到了与固定策略相当的发现质量同时在若干设定下大幅削减了发现成本——例如在 Lasso 正则化路径任务上发现智能体调用次数比 SimpleTES 少了 162 倍。核心研究内容问题定义RSI 的典型形式是一个迭代发现循环智能体生成候选方案、评估结果、吸收反馈、进入下一轮。当自我改进的目标足够困难时这个循环会拉长到数千个“提案–评估”周期。此时决定整体效率的不是单次生成的质量而是探索策略的质量——它决定计算资源往哪个方向投。现有方案陷入两难。手工设计的固定策略在整个发现过程中不变无法从累积经验中学习会反复把算力浪费在已经证明无效的方向上。在线优化策略则要面对两个结构性障碍其一元层面的反馈延迟且昂贵因为评价一个探索策略意味着观察它如何塑造整个发现过程而不是给单个候选打分其二元策略空间极其庞大大多数候选策略都是坏的每一个坏策略都要跑完一整轮才发现不好。创新方法Dream-RSI 的核心主张可以浓缩为一句话你已经为那个反馈付过费了。一次已完成的发现过程不只是可供重读的文本而是一棵结构化的树。每个节点记录了一次“生成–评估”尝试从哪个父节点继承工作空间、用哪些观测作为上下文、产生了什么文件系统快照、评估器给了什么诊断反馈和分数。探索策略做的事情本质上只有一件——给定当前看到的树选择下一批要继续探索的叶子节点。那么一个替代策略完全不需要重新运行任何东西它只需要以不同的顺序、不同的并行分组、不同的停止点去遍历同一棵已记录的树所有需要的结果都已经在磁盘上了。这让人联想到模型强化学习中的 world model但有一个关键区别这里的世界不是学出来的近似模型而是搜索空间的精确快照。它的边界也同样精确——策略只能在与历史实际走过的路径重叠的范围内被“梦到”。正是这个限制迫使系统必须是一个循环而非一次性离线优化每部署一次新策略就产生一棵新的发现树模拟器池随之增长下一轮“做梦”的覆盖面就更广。研究成果实验覆盖三个领域八个任务控制基线是 Recursive Fixed Exploration——使用完全相同的发现智能体、评估器、初始化和每轮预算唯一区别是探索策略在递归轮次中保持不变。两种方法从同一个手工写的“并行精炼”策略出发因此第一轮表现完全相同。三个代表性数字VGG16 算法工程任务在可比性能下生成次数减少2.43 倍ConvDiv 数学优化任务在可比预算下得分提升2.09 倍Lasso 正则化路径任务发现智能体调用次数比 SimpleTES 少162 倍Lasso 任务上的 162× 差距尤其说明问题。SimpleTES 用了 51,200 次调用而 Dream-RSI 在同一系列数据集上以远低得多的调用量达到了有竞争力的解质量。这不是“稍微省一点”而是量级上的改变。实际落地应用的可能性Dream-RSI 的架构设计决定了它的落地门槛不高。它不改动底层的编码智能体只在外围加一个轻量编排层。这意味着任何已经在用 coding agentClaude Code、Gemini CLI、Cursor 等做迭代发现任务的团队理论上都可以在现有工作流上叠加这一层而不需要更换模型或重建基础设施。目前代码正在开源准备中论文 PDF 和项目页面已公开。npm 生态中已出现第三方复现包pi-dream-rsi说明社区已经在做工程化尝试。技术细节发现树的结构发现树以初始工作空间状态为根节点。每个非根节点恰好有一个主父节点——要么是根要么是之前创建的某个节点。这个父节点决定了当前尝试从哪里开始发现智能体恢复父节点保存的工作空间用累积的观测作为上下文产出新的尝试。节点记录完整的继承历史和新尝试的结果包括文件系统快照、生成产物、评估诊断和分数。探索策略的决策接口在线执行和离线回放共享同一个决策接口。策略观察当前树 T从“合格节点集合” E(T) 中选择一个批次 B其中 E(T) 由根节点和当前所有叶子节点构成。设 w 为并行工作线程数例如并发 API 调用可行批次集合为 {B ⊆ E(T) : |B| ≤ w}。每个被选中的节点指定一次尝试的起点所以批次同时决定了探索从哪里继续以及有多少尝试并行执行。回放与在线执行的区别在线 rollout中策略选出的批次触发真实的生成–评估调用新节点被添加到树上产生新的执行结果。回放中策略在同一个决策接口上做选择但过渡是“揭示”而非“执行”从已记录的树中读出对应节点的已有结果不产生新的生成–评估请求。回放结束时策略给出了一个已揭示的子树 T_traj ⊆ T。回放评估的是策略在已实现搜索空间中的轨迹质量而不是它在新空间中的表现。回放目标函数回放分数平衡三个量S max_{v∈T_traj} q(v) − λ₁·n λ₂·max{1, n/R} 公式 1第一项是回放轨迹中达到的最佳解质量。第二项惩罚尝试的生成次数n |T_traj| − 1即已揭示的非根节点数。第三项是并行度奖励用平均每轮尝试数 n/R 来度量鼓励策略把有用的延续批量化执行而非串行化。λ₁ 和 λ₂ 是固定系数。这个目标函数的设计意图很明确不只要找到好解还要用尽量少的尝试和尽量高的并行效率找到。策略改进与选择保证离线阶段中一个固定的 LLM 驱动的策略开发智能体审视当前策略在回放世界中的轨迹和分数结合之前修订的反馈识别成功的决策和反复出现的失败模式然后修订可执行的策略代码产出一个新版本。这个过程重复 M 次。改进的保证来自一个简单但有力的选择规则下一轮部署的策略从所有已评估版本包括当前版本中选择回放平均分最高的那个。由于候选集包含当前策略选出的策略在固定历史上的平均回放分数不可能低于当前策略。这是一个单调不降的保证不依赖于策略开发智能体的质量。递归循环一轮完整的循环是用当前策略 π_t 在线探索产生发现树 T_t 并追加到历史 H_t 中在 H_t 上评估和改进策略选出 π_{t1}用 π_{t1} 在线探索产生 T_{t1}历史变为 H_{t1} (T_1, …, T_{t1})。每一轮的历史都在增长策略改进所依赖的模拟器池随之扩大。研究设定实验使用 Gemini-3.1 Pro 和 Gemini-3.7-Flash 通过 Gemini CLI 执行发现。在 Recursive Fixed Exploration 基线下每个发现轮次对 Gemini-3.1 Pro 执行 10 个并行工作空间每个最多 11 步精炼10×11 110 次生成–评估调用。三个实验领域各有侧重。算法工程以 Lasso 正则化路径求解为任务对比 sklearn、glmnet 和 SimpleTES 等已有求解器。数学优化覆盖 ConvDiv 等任务GPU 内核工程包含 VGG16 等任务。所有实验使用相同的发现智能体、评估器、初始化、资源约束和起始探索策略控制变量做得比较干净。Dream-RSI 的硬件需求本质上与它使用的底层编码智能体相同——它自己不训练模型不要求 GPU 集群做策略优化。离线“做梦”阶段纯粹是 CPU 上的树遍历和打分计算开销可以忽略不计。真正的成本来自在线发现轮次中的 API 调用。综合分析Dream-RSI 的洞见在概念层面非常干净把一个已经被忽略的东西——发现历史的结构——重新解读为可计算的资产。prior work 把历史当作文本上下文来提示或者当作微调数据来训练权重但没有人把它当作一棵树、一个模拟器、一个可以被策略反复遍历而不产生新执行成本的对象。但真正让这个框架成立的是“精确而非近似”这个性质。学出来的 world model 永远有分布偏移的风险——你在模型里优化出来的策略到了真实环境可能完全不行。Dream-RSI 的回放世界是历史本身的精确重构不存在预测误差。代价是覆盖面有限策略只能被“梦到”历史实际走过的区域。这个限制看起来像是缺陷但恰恰是它把系统变成了一个自我扩展的循环——每一轮真实探索都在拓宽可回放的边界。从工程角度看策略代码可执行化这个设计选择值得注意。探索策略不是一段自然语言描述而是可以运行的代码。这让“修订策略”变成一个可自动化的过程也让回放评估有明确的输入输出接口。策略开发智能体不需要理解底层编码智能体的内部机制只需要理解回放接口和分数反馈。不过有几个问题论文目前没有充分展开。第一回放世界对历史覆盖的依赖性意味着初始策略的质量仍然重要——如果第一轮探索走得太偏后续所有 dreaming 都受限于那棵树的形状。第二回放目标函数中 λ₁ 和 λ₂ 的取值对策略选择的影响没有做敏感性分析。第三目前实验中的策略修订由 LLM 驱动但 LLM 修订策略的有效性边界在哪里——它能理解多复杂的探索逻辑——还不清楚。第四162× 这个数字来自 Lasso 任务这是一个评估相对廉价、解空间结构比较规整的领域。在评估本身就很昂贵的任务比如需要大量物理模拟或真实实验反馈的领域回放的收益是否依然显著需要更多验证。从更大的背景看RSI 正在从一个科幻概念变成有具体工程路径的研究议程。OpenAI 在 2026 年 9 月公开呼吁将 RSI 纳入前沿 AI 全球技术标准讨论Anthropic 也表达了类似的关注。Dream-RSI 的贡献不在于“让 AI 自己写自己”而在于把 RSI 中一个此前被当作黑盒的组件——探索调度——变成了可以系统性地自我改进的对象。改进的是调度逻辑不是模型权重。这个区隔让整个框架的可控性和可审计性都更好。实践应用适合采用 Dream-RSI 的场景如果你已经在用 coding agent 做迭代式的问题求解或设计优化每轮迭代需要几十到几百次 agent 调用并且当前的探索调度是手工写死的或者每次都从头再来那么把历史记录组织成发现树、加一层轻量编排来做回放评估是投入产出比很高的改造。Lasso 类的算法工程任务、内核调优、超参搜索路径规划都是自然的候选场景。不太适合的场景单次评估成本极低、总迭代轮次很少的任务回放带来的收益可能覆盖不了引入编排层的工程成本。评估本身不可自动化、需要人工判断的任务回放模拟器无法构造。历史覆盖极其稀疏的任务策略可做梦的空间太小循环的自我扩展效应难以启动。落地建议第一步不需要动现有智能体只需要把每轮迭代的决策点和结果结构化记录下来——哪个父尝试、继承了哪些观测、评估分数是多少。这个记录格式一旦统一回放接口就有了。第二步从已有的几轮历史开始做离线策略搜索不需要等策略开发智能体完全自动化手动写几个替代策略在回放世界里跑一遍就能看到哪些探索决策的差异会显著影响最终质量。第三步再考虑把策略修订环节自动化。论文里“下一轮策略不会比当前差”的选择保证让这个过程的风险很低——最坏情况就是策略不变。參考資料來源原始論文: https://github.com/zhengkid/Dream-RSI
返回列表