
ATLAS的研究基石LLaMA Monkeys、PlanSearch等6篇论文如何被翻译成一套完整的工程系统【免费下载链接】ATLASAdaptive Test-time Learning and Autonomous Specialization项目地址: https://gitcode.com/gh_mirrors/atlas112/ATLASATLASAdaptive Test-time Learning and Autonomous Specialization是一个开源的本地 AI 编码智能体它不改模型本身而是把测试时计算test-time compute拆成规划、候选生成、评分与修复等工程组件让 14B 级别的小模型在本地硬件上完成真实软件开发。这篇文章带你拆解支撑 ATLAS 的6 篇关键论文——从 LLaMA Monkeys 到 PlanSearch——以及它们分别落成了代码仓库里哪些具体模块。一张图看懂论文如何变成工程模块ATLAS 的设计哲学可以概括为一句话模型是冻结的智能长在模型外面。仓库中有一份官方的研究来源清单 docs/SOURCES.md按当前生效 / 已废弃 / 路线图三个状态桶组织每篇论文。下面这 6 篇是支撑当前 V3 流水线核心路径的基石论文核心思想落地模块Large Language Monkeys重复采样让弱模型超越强模型整个 V3 流水线的总动机PlanSearch规划 在程序空间里做搜索v3-service/stages/plan_search.pyThink Diverse (DivSampling)扰动提示制造候选多样性v3-service/stages/div_sampling.pys1 (Budget Forcing)用 token 预算控制思考深度v3-service/stages/budget_forcing.pyCodeT模型先自己写测试再写代码v3-service/stages/pr_cot.pyEWC持续学习不遗忘旧知识geometric-lens/geometric_lens/ewc.py论文一Large Language Monkeys——为什么小模型配多采样就能打Brown 等人 2024 年的Large Language Monkeys: Scaling Inference Compute with Repeated Sampling是整个项目的前提推理时算力采样次数可以替代模型规模。采样次数足够多时更弱的模型也能超过更强的模型。对 ATLAS 而言这意味着不需要追求更大的权重——把省下的显存让位给生成 k 个候选 挑选 修复的循环。ATLAS 的 V3 流水线每任务生成3 个候选用 Geometric Lens 选出最优者全挂则进入修复循环。消融研究docs/reports/V3_ABLATION_STUDY.md正是围绕候选池 选择 修复这条链路逐阶段量化收益的注意该报告的 74.6% 数字已被官方撤回重新测量进行中。论文二PlanSearch——把规划做成约束驱动的结构化搜索Wang 等人 2025 年 ICLR 2025 Spotlight 论文PlanSearch: Planning as Search over Programs的核心主张是不要一次性盲写代码先搜索出一组互相不同的解题计划再逐计划生成。工程化后的实现在 v3-service/stages/plan_search.py分三步从题目中抽取 N 组互相独立的约束集每组约束各自收窄解空间针对每组建一个解法计划此时开启思考按计划生成代码。文件头部的注释写得很直白三条各砍掉 70% 解空间的约束叠加后模型只需在剩余2.7%的空间里生成而不是盲目搜索。这正是 PlanSearch 论文中规划即搜索的工程翻译。论文三Think Diverse——用扰动逼出真正的多样性Think DiversearXiv:2502.11027指出光靠调温度制造多样候选往往只是措辞不同、思路相同。它主张基于扰动的多样性perturbation-based diversity给不同候选注入不同的角色、指令风格与代码风格提示。对应模块 v3-service/stages/div_sampling.py 内置了一个 12 类扰动库4 种专家角色 4 种思考策略改写 4 种代码风格functional / pythonic / 迭代优化 / 结构化。3 个候选各领一份不同扰动再叠加 PlanSearch 的约束差异候选池的多样性就从温度差异升级为思路差异。论文四s1——Budget Forcing给思考设定 token 预算Muennighoff 等人的s1: Simple Test-Time Scaling提出了一个极其实用的技巧用一个特殊的预算 token 序列强制模型思考指定长度从而显式控制推理深度。ATLAS 在 v3-service/stages/budget_forcing.py 中把它做成了 5 档预算阶梯档位思考 token 预算适用场景nothink0简单编辑别浪费算力light≤1024常规小改动standard≤2048中等复杂度hard≤4096较难任务extreme≤8192高难度任务档位如何选由 Geometric Lens 的归一化能量值0–1映射——能量越低说明越有把握预算越小。这让算力花在刀刃上从口号变成了可配置的数值规则。论文五CodeT——让模型自己出考卷再批改自己的答卷Chen 等人 2022 年的CodeT: Code Generation with Generated TestsICLR 2023开创了自生成测试范式模型没有外部测试可用时先针对题目描述独立生成输入/输出用例再用这些用例验证和修复自己的代码。这条思想支撑了 V3 流水线的 Phase 3 修复链路自测生成v3-service/stages/self_test_gen.py 让模型独立推导出测试用例PR-CoT 修复v3-service/stages/pr_cot.py 拿着失败输出 自测用例做链式思维定位根因并产出修复版本修复后再过一遍自测才算数沙箱验证sandbox/executor_server.py 在隔离环境里真正编译、运行而不是让模型口述结果。消融数据显示PR-CoT 修复贡献了 Phase 3 全部救回案例的85.7%是自生成测试路线价值的最直接证据。论文六EWC——评分器升级时别忘了它以前学过的东西前面五篇管怎么生成更好的代码第六篇管怎么让评分器自己进化。ATLAS 的 Geometric Lens 用两个小网络给候选打分C(x) 成本场MLP和 G(x) 质量预测XGBoost。当用户通过atlas lens retrain用自己项目的工作负载重新训练 C(x) 时经典风险是灾难性遗忘——新域学会、旧域忘光。Kirkpatrick 等人 2017 年 PNAS 论文Overcoming Catastrophic Forgetting in Neural Networks提出的EWC弹性权重巩固就是解法给对旧知识重要的权重加对角 Fisher 惩罚新数据照常学旧知识锚住。实现在 geometric-lens/geometric_lens/ewc.py配合按域分层的 replay_buffer.py从每个历史域回放代表性通过/失败样本让 Lens 可以跨领域持续进化而不推倒重来。六篇论文如何协同一次请求的完整旅程单独看每篇论文都是技巧串起来才是一个系统。当你用atlas命令提出帮我写一个贪吃蛇小游戏时后台发生的事是PlanSearch抽取约束集、产出 3 个思路互异的解法计划DivSampling为每个候选注入不同角色与风格扰动Budget Forcing按 Lens 能量值给每个候选分档思考预算Geometric Lens对候选逐个打能量分选出最低能量者全部失败时PR-CoT 沙箱用自生成测试迭代修复若 Lens 需要跟进你的代码风格EWC 回放缓冲保证它学新不忘旧。每一环节在终端侧栏都可见——这就是把论文翻译成工程的直观结果论文里的每个组件都有对应的运行日志、遥测文件和配置文件段。延伸阅读从论文清单到源码地图全部研究来源及状态分级docs/SOURCES.md分阶段消融实验方法与结果docs/reports/V3_ABLATION_STUDY.md系统整体架构Proxy / V3 Pipeline / Lens / 沙箱docs/ARCHITECTURE.md逐任务评测原始数据docs/reports/ablation/README.mdV3 各阶段实现目录v3-service/stages/小结论文是砖工程才是房子ATLAS 的价值不在于引用了多少论文而在于它把 6 篇方向各异的研究成果——重复采样、规划即搜索、扰动多样性、预算强制、自生成测试、弹性持续学习——逐一翻译成了可配置、可消融、可回滚的工程模块并且诚实标注了哪些组件已被废弃Confidence Router、PageIndex 索引器都已下线或已被撤回验证。对新用户来说这份论文 → 代码的映射就是理解整个系统最快的地图先读 docs/SOURCES.md再顺藤摸到 v3-service/stages/ 里对应的实现研究如何落地就一目了然了。【免费下载链接】ATLASAdaptive Test-time Learning and Autonomous Specialization项目地址: https://gitcode.com/gh_mirrors/atlas112/ATLAS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考