ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

WikiSkill: Compiling Agent Experience intoPersistent Knowledge for Skill Evolution将智能体经验编译为持久知识以促进技能

WikiSkill: Compiling Agent Experience intoPersistent Knowledge for Skill Evolution将智能体经验编译为持久知识以促进技能 一、研究背景与核心问题背景通用AI智能体在各领域能力日益增强但可靠完成现实任务仍需领域特定的程序性知识和工作流程。智能体技能Agent Skills提供了一种无需更新模型参数即可封装专业知识的轻量级方式。核心问题现有技能演化方法如EvoSkill、Trace2Skill、SkillOpt虽能从执行轨迹中发现和改进技能但它们没有将所学到的内容作为独立的、持续演化的知识表示来维护导致洞见分散在优化历史中限制了跨迭代的系统性复用。研究动机受Karpathy2026LLM Wiki观点启发——倡导将经验编译为持久、复利增长的知识——作者提出智能体经验能否类似地被编译为持久知识以支持长期技能演化二、核心方法WikiSkill框架1. 三层知识架构层级名称功能第一层原始层Raw Layer存储不可变的原始执行轨迹推理、工具调用、输出、答案第二层Wiki层Wiki Layer将原始轨迹编译为结构化、复利增长的知识包含模式目录、演化日志、技能影响跟踪器第三层技能层Skill Layer包含活跃的演化技能集每个技能含SKILL.md和PURPOSE.md2. 演化循环的四个组件推理智能体Inference Agent使用当前技能执行任务生成执行轨迹。训练时被限制访问Wiki层消融实验证明此限制有益。Wiki维护者Wiki Maintainer分析采样轨迹进行根因分析提取成功策略更新持久wiki中的模式页面和演化日志。技能提议者Skill Proposer以多轮ReAct方式自主运行按需读取wiki和轨迹生成原子提案创建新技能或补丁式编辑现有技能。门控与回滚机制Gating and Rollback在验证集上评估候选技能接受提升性能的修改否则回滚。关键设计无论接受与否Wiki永不回滚确保知识长期保留。3. 关键创新点持久知识积累Wiki跨迭代持续积累记录被拒绝的提案、反复出现的错误、成功策略避免重复失败尝试。知识-技能分离将发现有用程序性知识与有效执行该知识区分开来Wiki负责前者技能负责后者。审计轨迹skill-impact.md提供客观的真实审计轨迹记录提案元数据、diff、验证分数和接受结果。三、实验设计与主要发现1. 实验设置5个基准LiveMath数学推理、SealQA网络搜索、SpreadSheetBench电子表格操作、OfficeQA长上下文文档问答、ALFWorld交互式具身任务5个模型Qwen-3.5-4B/9B、Qwen-3.6-27B、Gemma-4-31B、Gemini-3.5-Flash3个基线Trace2Skill、EvoSkill、SkillOpt以及无技能基线3次独立运行取平均配对bootstrap检验p0.052. 主要发现1WikiSkill持续优于现有方法在全部5个模型上实现最高平均性能相比最强竞争方法平均提升3.3~12.0个百分点改进跨领域一致而基线方法如EvoSkill、SkillOpt在某些设置下会退化2技能演化与模型规模扩展互补Qwen家族内增益随规模增加4B12.3、9B17.5、27B23.9小模型技能可超越大模型无技能Qwen-3.5-9BWikiSkill47.4% Qwen-3.6-27B无技能39.4%3跨模型技能迁移有效迁移技能常优于无技能基线和自演化技能例Qwen-3.6-27B技能将Qwen-3.5-9B在SpreadSheet上从24.3%提升到50.5%有效迁移也可从小模型到大模型但存在负迁移模型特定变通方法可能限制更强模型4持久Wiki至关重要消融实验禁用推理智能体wiki访问、保留技能提议者访问平均性能从48.7%→63.7%15.0%允许推理智能体训练时访问wiki性能从63.7%降至60.9%说明会分散技能开发5技能精炼贯穿整个演化过程初始阶段迭代0-1占接受更新的39%-52%中后期持续有大量更新被接受Wiki保留反复错误、被拒绝提案和演化历史支持持续精炼四、案例研究以Qwen-3.6-27B在ALFWorld上的演化为例迭代0Wiki维护者识别基本循环行为提议者提出goal-directed-action被拒绝skill-impact.md保留拒绝记录迭代1受审计轨迹启发提议者创建break-repetition-loop被接受迭代4随着新循环变体出现Wiki积累新证据提议者进一步用新规则精炼技能说明持久知识从先前迭代为后续技能精炼提供信息。五、贡献与局限主要贡献提出WikiSkill框架将智能体技能与持久知识库共同演化在5个基准和5个模型上证明WikiSkill持续优于现有方法消融证实持久知识积累的重要性系统研究演化技能与模型能力的交互证明技能演化与规模扩展互补、跨模型迁移有效局限性采用全注入设置未评估技能检索/触发严格验证门控排除了中性提案缺乏自动修剪wiki的机制未覆盖超长时程任务数百动作/数小时WikiSkill通过引入持久、复利增长的Wiki层将智能体执行经验编译为结构化知识使技能演化建立在累积知识而非分散的优化历史上在多个基准和模型上持续超越现有技能演化方法并揭示技能演化与模型规模扩展互补、跨模型迁移有效等重要规律。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示智能体技能将专业知识和工作流程打包为可复用资源从而扩展AI智能体的能力。近期研究能够从智能体经验中自动发现此类技能使智能体通过交互逐步适应。然而指导技能开发的洞见通常分散在优化历史中限制了它们在迭代之间的系统性复用。我们提出WikiSkill一个将智能体技能与持久知识库wiki共同演化的框架。在高层设计上WikiSkill将原始执行经验、累积知识和可执行技能分离同时持续将经验整合到wiki中后续技能更新可在此基础上构建。在多种基准和模型上WikiSkill持续优于最先进的技能演化方法并在大多数模型-基准设置中优于无技能基线。我们发现技能演化与模型规模扩展互补更大的模型通常从演化技能中获益更多而使用技能的较小模型可以超越不使用技能的显著更大模型。我们还发现演化技能可以有效地跨模型和模型家族迁移且由其他模型演化的技能可以优于自演化技能。最后我们的消融研究证实wiki中持久的知识积累对于有效的技能演化至关重要。这些结果证明了系统性积累和精炼智能体经验以开发可复用且可迁移技能的价值。图1| WikiSkill持续优于无技能基线和现有技能演化方法。有趣的是其优势在更强的模型上更为显著。我们报告了每个模型在使用无技能或由EvoSkill、SkillOpt和WikiSkill演化的技能时在所评估基准上的平均准确率详情见表1。1. 引言通用AI智能体在各领域执行复杂任务的能力日益增强Jackson等2025Merrill等2026Patwardhan等2026Phan等2026。然而可靠地完成现实世界任务通常需要领域特定的专业知识例如程序性知识和工作流程。智能体技能Chen等2026aLi等2026Liu等2026Zhang等2025提供了一种轻量级、开放格式来捕获此类专业知识而无需更新模型参数。其核心是将指令、脚本和其他资源打包为可复用的基于文件系统的模块即有组织的目录Anthropic2026Li等2026Xia等2026bZhang等2025。这种设计使专业知识在兼容技能的智能体之间保持一致、可审计和可复用。它还支持渐进式披露Jiang等2026即智能体在任何给定时间只加载相关内容从而节省上下文空间。更广泛地说技能提供了一种独立于模型参数来积累知识的自然机制。然而开发有效的技能仍然具有挑战性。大多数智能体技能是手动编写的这需要预先设想智能体将需要的程序性知识和工作流程Li等2026Liang等2026Xu和Yan2026。这一挑战推动了近期的工作即通过在训练任务上执行智能体、分析成功和失败的轨迹并基于所得经验精炼技能来迭代地开发智能体技能Agrawal等2026Alzubi等2026Ni等2026Ouyang等2026Yang等2026Yuksekgonul等2025。一个关键的设计问题是如何在整个技能演化过程中保存和组织智能体所学到的内容。先前的工作以不同方式解决这个问题。EvoSkillAlzubi等2026维护先前提案及其评估结果的累积历史Trace2SkillNi等2026从执行轨迹中提取并整合经验教训到技能更新中SkillOptYang等2026使用被拒绝编辑的反馈和按轮次的元指导。然而这些方法没有将所学到的内容作为独立的、不断演化的知识表示来维护。受Karpathy2026关于LLM Wiki的观点——即倡导将经验编译为持久、复利增长的知识——的启发我们提出智能体经验能否类似地被编译为持久知识以支持长期技能演化我们提出WikiSkill它在原始经验和可执行程序即技能之间增加了一个结构化知识层。这一层允许技能开发在迭代之间建立在日益得到良好支持和整合的知识之上而不是建立在分散于技能演化产物中的知识之上。WikiSkill将智能体工作空间组织为三个层原始层Raw Layer存储不可变的执行轨迹Wiki层Wiki Layer维护结构化知识技能层Skill Layer包含不断演化的程序性知识图2。每次迭代涉及四个组件推理智能体Inference Agent使用当前技能执行 rolloutWiki维护者Wiki Maintainer将轨迹整合到wiki中技能提议者Skill Proposer使用wiki和轨迹提出技能更新以及门控与回滚机制Gating and Rollback保留能提升验证性能的更新。虽然技能更新可以回滚但wiki会持续存在以便未来更新可以建立在累积知识之上。在高层设计上这些组件形成一个持续循环其中经验被整合为持久知识以支持技能演化。我们在五个基准上评估WikiSkill涵盖数学推理LiveMathematicianBenchHe等2026、网络搜索SealQAPham等2026、电子表格操作SpreadSheetBenchMa等2024、长上下文文档问答OfficeQASinghvi等2025和交互式具身任务ALFWorldShridhar等2021使用来自QwenQwen Team2026a,b、GemmaGemma Team2026和GeminiGoogle DeepMind2026家族的五个模型。我们发现WikiSkill优于现有技能演化方法并在大多数设置中优于无技能基线。有趣的是技能演化与模型规模扩展互补。在Qwen家族内WikiSkill将4B、9B和27B模型的平均性能分别提升12.3%、17.5%和23.9%且增益随模型规模增加。同时演化技能可以弥补显著的模型规模差距使用WikiSkill的Qwen-3.5-9B优于不使用技能的Qwen-3.6-27B47.4% vs. 39.4%3。我们进一步发现演化技能可以有效地跨模型家族迁移并且可以优于自演化技能。例如在ALFWorld上Qwen-3.5-9B使用Qwen-3.6-27B演化的技能达到70.2%而使用自己的技能为63.4%。这些结果表明技能发现和技能执行是不同的能力。最后我们的分析表明持久wiki对这些增益至关重要支持了我们的假设跨迭代积累和精炼知识可以改善技能演化。总之我们的主要贡献是我们提出WikiSkill一个将智能体技能与持久知识库共同演化的框架该知识库持续从智能体经验中组织和精炼知识。我们在五个基准和五个模型上证明WikiSkill持续优于现有技能演化方法消融研究证实了持久知识积累的重要性。我们系统地研究了演化技能如何与模型能力交互表明技能演化与模型规模扩展互补且演化技能可以有效地跨模型迁移有时优于自演化技能。综上我们希望我们的工作能激发更多关于智能体如何从经验中积累、组织和复用知识的基础研究。2. 问题设定图2| WikiSkill框架概览。智能体工作空间被组织为三个层不可变执行轨迹原始层、在迭代间复利增长的持久知识库Wiki层和活跃程序性指令技能层。在每个演化循环中推理智能体运行rollout注入活跃技能但限制Wiki访问Wiki维护者将轨迹整合到Wiki中技能提议者使用ReAct机制建议更新同时Wiki在所有迭代中保留。3. 方法我们提出WikiSkill一个将智能体技能与持久知识库wiki共同演化的框架。围绕三层知识架构§3.1WikiSkill执行一个精心编排的演化循环其中智能体运行rolloutWiki维护者整合轨迹并更新wiki技能提议者提出技能更新门控机制过滤更改§3.2。3.1. 三层知识架构WikiSkill工作空间由三个不同的层组成如图2所示并在下面描述。原始层raw该层存储每次迭代中从训练示例收集的原始执行轨迹τi∈Ttrain,k​。这些轨迹捕获智能体完整的逐步交互包括推理、工具调用、工具调用输出和最终答案。在我们的设置中Wiki维护者和技能提议者智能体可以访问这些原始轨迹以分析智能体行为。为保留原始历史该层是不可变的。Wiki层wiki该层将原始轨迹编译为结构化的、复利增长的知识并在技能演化过程中维护。它包含一个模式目录patterns/其中填充了记录特定失败模式或成功策略以及可操作变通方法的单独markdown文件。关键的是该层通过演化日志logs.md由Wiki维护者更新和技能影响跟踪器skill-impact.md由外层循环框架在验证门控后以编程方式更新提供跨优化迭代的长期历史意识。这些记录使Wiki维护者和技能提议者能够(1) 观察完整的技能接受历史以便不再提出被拒绝的干预措施(2) 跟踪先前迭代中提出了什么以及这些提案是否成功(3) 识别跨迭代反复出现的错误。wiki不会在迭代之间重置而是在整个演化过程中持续积累和编译知识。技能层skills/该层包含活跃的演化技能集ss编码推理智能体可以读取的程序性知识。WikiSkill中的每个技能目录包含两个文件SKILL.md包含技能的完整内容以及PURPOSE.md将技能映射回激发其创建或修改的Wiki模式。技能层与Wiki层之间交互的详细示例在图3中说明并在§5.3的案例研究中解释。3.2. 演化智能体与Wiki编排WikiSkill循环由四个组件组成。在每次迭代中推理智能体§3.2.1使用skills/中的活跃技能执行任务在raw/中产生不可变的执行轨迹。在训练rollout期间推理智能体被限制访问Wiki层因为我们的消融研究§5.1表明在训练期间允许wiki访问会对技能开发产生负面影响。接下来Wiki维护者§3.2.2分析这些原始轨迹以及现有的wiki/层以诊断失败并提取成功策略更新持久模式目录和演化日志。然后技能提议者§3.2.3审查更新后的wiki并读取最新迭代的执行轨迹以在skills/中生成或修改候选技能。最后门控与回滚机制§3.2.4在验证集上评估候选技能接受成功的修改或在更改导致性能下降时回滚技能集。整个演化算法在附录A的算法1中描述。3.2.1. 推理智能体的技能提供3.2.3. Wiki-informed技能提议者3.2.4. 门控与回滚4. 实验与结果4.1. 实验设置数据集我们在五个基准上评估涵盖多样领域数学推理LiveMathematicianBench (LiveMath)He等2026、网络搜索SealQAPham等2026、电子表格操作SpreadsheetBench (SpreadSheet)Ma等2024、长上下文文档问答OfficeQASinghvi等2025和交互式具身任务ALFWorldShridhar等2021。数据集详情和统计见附录B。基线我们将WikiSkill与三个代表性技能演化基线进行比较包括Trace2SkillNi等2026、EvoSkillAlzubi等2026和SkillOptYang等2026它们都共享相同的一般循环展开智能体、分析执行轨迹、提出技能修改、通过验证门控更改。我们还评估每个模型在不使用技能时的无技能基线。这些框架的详细描述和优化器API调用复杂性分析见附录D。我们专注于专门的技能演化框架而非通用自动提示优化器例如GEPAAgrawal等2026遵循先前工作表明专门技能演化流水线始终优于通用提示优化方法Yang等2026。模型我们实验了闭源和开源权重模型来评估WikiSkill和基线。对于闭源模型我们使用Gemini-3.5-FlashGoogle DeepMind2026。对于开源权重模型我们评估Qwen-3.5-4B/9B-InstructQwen Team2026a、Qwen-3.6-27BQwen Team2026b和Gemma-4-31B-ItGemma Team2026我们使用vLLM框架Kwon等2023部署。4.2. 主要结果我们在模型和任务上评估WikiSkill并研究演化技能是否能跨模型迁移。表1展示了跨模型和任务的主要技能演化结果包括技能演化收益如何随模型规模变化而表2展示了跨模型技能迁移结果。我们下面详细分析这些结果。为了考虑变异性我们对每种方法重复完整演化过程三次独立运行所有报告的分数代表三个所得演化技能集的平均测试性能。性能差异的统计显著性使用配对bootstrap检验在p0.05下评估附录C。注意对于Gemini-3.5-Flash在ALFWorld上所有演化方法都产生与无技能基线相同的性能(85.9%)因为Gemini-3.5-Flash在技能演化之前在验证集(Dval)(Dval​)上达到100%分数。这也解释了为什么Gemini-3.5-Flash在跨模型迁移评估表2中在ALFWorld上被标记为“—”。4.2.1. 跨模型和任务的技能演化WikiSkill在模型和数据集上产生一致的改进如表1所示WikiSkill在所有五个模型上实现了最高的平均性能。与每个模型最强的竞争技能演化方法相比WikiSkill将Qwen-3.5-4B、Qwen-3.5-9B、Qwen-3.6-27B、Gemma-4-31B和Gemini-3.5-Flash的平均性能分别提升3.3、5.1、10.0、5.8和12.0个百分点。这些改进在设置中是一致的WikiSkill在大多数模型-数据集对中优于无技能基线并在所有模型的5个数据集平均性能上匹配或超过最强竞争方法。改进也跨越多样领域且可能很显著。例如WikiSkill将Gemini-3.5-Flash在LiveMath上从33.0%提升到72.6%在SpreadSheet上从50.5%提升到76.6%同时将Qwen-3.6-27B在ALFWorld上从52.8%提升到77.6%。相比之下现有技能演化方法不太一致。例如EvoSkill在LiveMath上大幅提升Qwen-9B (28.2%→58.1%)但在同一基准上降低Gemma-4-31B (33.9%→29.8%)而SkillOpt在SealQA上降低Gemini-3.5-Flash (29.4%→28.2%)。这些结果表明WikiSkill在设置中产生更强且更可靠的改进。技能演化的收益随模型能力增加并与模型规模扩展互补在Qwen家族内WikiSkill的平均改进随模型规模增加从Qwen-3.5-4B的12.3分到Qwen-3.5-9B的17.5分和Qwen-3.6-27B的23.9分。这一趋势在SpreadSheet上尤为明显WikiSkill将三个模型分别提升6.5、9.3和40.9分表明技能演化的收益可以随模型规模显著增加。同时演化技能可以弥补显著的模型规模差异使用WikiSkill的Qwen-3.5-9B达到47.4%平均准确率优于不使用技能的Qwen-3.6-27B的39.4%而使用WikiSkill的Qwen-3.5-4B达到38.5%。我们的结果表明模型能力和演化程序性知识提供了互补的性能来源更强的模型可以通过开发和执行更有效的技能从技能演化中获得更大价值而有效的技能可以使较小模型超越不使用技能的显著更大模型。技能演化的收益也因数据集而异我们的结果表明一些数据集比其他数据集更适合技能演化。对于Qwen-3.6-27BWikiSkill在OfficeQA上提升11.6分在SealQA上提升14.1分而在ALFWorld上提升24.8分LiveMath上提升28.0分SpreadSheet上提升40.9分。其他模型也出现类似差异。LiveMath始终从技能演化中受益在所有五个模型上增益范围为20.6到39.6分而ALFWorld在WikiSkill演化技能的四个模型上产生14.0到29.3分的增益由于提前停止排除Gemini-3.5-Flash。相比之下OfficeQA由于其长上下文文档检索需求而呈现独特挑战。较大的模型有效地利用演化搜索工作流程来导航长文档例如Qwen-3.6-27B为11.6分Gemini-3.5-Flash为12.1分而Qwen-3.5-4B难以在长上下文中执行这些多步搜索工作流程并退回到其默认阅读行为导致轻微退化。4.2.2. 使用WikiSkill的跨模型技能迁移演化技能有效地跨模型迁移且迁移技能可以优于自演化技能表2评估了WikiSkill演化的技能在使用不同源模型开发时如何跨推理模型迁移。迁移技能经常优于无技能基线和自演化技能。例如Qwen-3.6-27B技能将Qwen-3.5-9B在SpreadSheet上提升到50.5%而无技能为24.3%自演化技能为33.6%并将Gemma-4-31B在LiveMath上提升到73.7%而无技能为33.9%自演化技能为56.7%。值得注意的是有效的迁移也发生在从小模型到大模型Qwen-3.5-4B技能将Gemma-4-31B在LiveMath上提升到73.1%在ALFWorld上提升到66.9%。我们的结果表明更强的源模型不一定产生更好的技能且由一个模型经验开发的程序性知识可以跨模型规模和家族迁移。演化技能的可迁移性取决于它们捕获的是通用程序还是模型特定的变通方法表2中的结果表明WikiSkill可以产生跨模型迁移的通用程序性知识和可能导致负迁移的模型特定策略。LiveMath技能跨模型迁移特别好Qwen-3.5-4B和Qwen-3.6-27B技能分别将Gemini-3.5-Flash从33.0%提升到67.5%和73.9%。相比之下SpreadSheet表现出强烈的源-目标交互。Qwen-3.5-4B技能将Gemini-3.5-Flash性能从50.5%降低到18.1%而Qwen-3.6-27B技能将其提升到63.4%。我们的错误分析确定了负迁移背后的两个因素。首先Qwen-3.5-4B技能编码了低级变通方法如单行Python命令和字符串转换规则这帮助较小模型避免执行失败但限制了更强模型如Gemini-3.5-Flash使用全面的端到端脚本。其次碎片化的诊断程序引入冗余工具调用可能在任务完成前耗尽Gemini-3.5-Flash的交互预算。迁移技能的效用还取决于推理模型执行它们的能力我们现在转向不同推理模型如何使用由同一源模型开发的技能。在Qwen家族内更强的模型可以从相同的程序性知识中获得更大价值。例如Qwen-3.6-27B SpreadSheet技能将Qwen-3.5-4B、Qwen-3.5-9B和Qwen-3.6-27B相对于其无技能基线分别提升18.4%、26.2%和40.9%。OfficeQA提供了一个案例其中模型开发的技能对另一个模型比对自己更有用Qwen-3.5-4B技能将其自身性能从30.2%降低到28.5%但将Qwen-3.6-27B从42.1%提升到52.9%。我们的轨迹分析表明在长上下文设置中较小的模型可能被冗长的文档上下文分散注意力无法遵循详细的多步搜索指令而是退回到其默认文档阅读行为。相比之下更强的模型更可靠地在长上下文中执行技能指定的结构化导航程序。总之这些结果区分了自演化通常混淆的两种能力从经验中发现有用的程序性知识以及在推理时有效执行该知识。5. 分析与讨论5.1. 持久知识在技能演化中的作用为了理解持久知识在技能演化中的贡献我们对演化过程中可以使用它的两个组件消融wiki访问表3。具体而言使用Gemini-3.5-Flash我们独立改变推理智能体在训练rollout期间和技能提议者在技能开发期间的wiki访问产生四种配置。当技能提议者没有wiki访问时我们还移除Wiki维护者消除跨迭代的持久知识积累。我们的默认WikiSkill配置给技能提议者wiki访问但不给推理智能体。持久wiki知识显著改善技能演化如表3所示当推理智能体的wiki访问被禁用时为技能提议者提供对持久wiki的访问将平均基准性能从48.7%提升到63.7%(15.0%)在LiveMath (51.3%到72.6%和SpreadsheetBench (49.9%到76.6%上有显著增益。没有跨迭代积累的持久知识技能提议者难以解决复杂的失败模式。推理智能体在演化期间访问wiki会降低最终技能质量当技能提议者可以访问持久wiki时为推理智能体在训练rollout期间提供wiki访问会将平均基准性能从63.7%降低到60.9%LiveMath上大幅下降从72.6%7到64.8%。我们假设当推理智能体在训练rollout期间可以同时访问技能和wiki时一些任务解决知识可能直接从wiki获得而不是从技能获得这可能使所得轨迹对技能开发的信息量减少。5.2. 定性分析技能和Wiki动态为了更好地理解WikiSkill如何在模型和数据集上演化知识和技能我们分析演化过程中积累的wiki模式和产生的技能表4以及成功技能更新在迭代中被接受的时间附录表5。WikiSkill持续积累wiki模式同时产生简洁技能表4总结了跨模型和基准的技能和wiki模式的创建与编辑以及它们的平均长度。跨模型Qwen模型产生更长的程序性技能118.9-128.6行而Gemma-4-31B和Gemini-3.5-Flash产生更紧凑的技能分别为45.1和81.2行。Wiki模式积累也因模型而异平均创建6.3-8.9个模式编辑7.0-18.4次。跨基准SpreadSheet产生最长的技能142.5行和最多的wiki模式9.8而LiveMath产生最短的技能84.6行和最少的wiki模式4.4。总体而言这些结果表明技能结构和wiki积累因模型和数据集而异。技能精炼在整个演化过程中持续附录表5将接受的技能更新分为早期迭代0-1、中期迭代2-4和晚期迭代5-7阶段。跨模型初始阶段占接受更新的39%−52%中后期仍有相当比例。跨基准也类似39%−58%的接受更新发生在初始阶段。持续精炼在SealQA上尤为明显其中33%的接受更新发生在中期28%发生在晚期。结合§5.1的消融这些结果表明持久知识积累支持跨迭代的持续技能精炼。Wiki层保留反复出现的错误、被拒绝的提案和演化历史为技能提议者提供后续更新的累积上下文。下面我们提供一个案例研究说明这种积累的知识如何为技能演化提供信息。图3| ALFWorld上Wiki引导技能演化的案例研究Qwen-3.6-27B。持久Wiki层编译跨迭代模式、过去提案diff和接受决策的审计轨迹以及时间顺序历史。受迭代0技能提案被拒绝的启发提议者在迭代1综合出被接受的技能更新随后用新模式证据精炼它。文件内容为清晰起见已简化。5.3. 案例研究Wiki引导技能演化的剖析为了说明Wiki层和技能层在演化过程中如何交互我们追踪Qwen-3.6-27B在ALFWorld上的一个具体例子如图3所示为展示简化。在迭代0Wiki维护者识别出基本循环行为take-examine-move-loop.md而技能提议者提出goal-directed-action但未能在验证集上提升性能并被拒绝。关键的是skill-impact.md保留了提案diff和拒绝结果使后续技能更新能够考虑这一失败尝试。受此审计轨迹启发技能提议者在迭代1创建break-repetition-loop带有具体动作规则Never Return an Item to Its Origin Location并被接受。随着新的循环变体在rollout中出现multi-operation-loop.mdWiki维护者在持久wiki中积累新证据。在这些累积的wiki模式和 newly stored trajectories图中未显示的指导下技能提议者在迭代4进一步用新规则Each Operation Type ONCE Per Item精炼技能。这个例子说明了来自先前迭代的持久知识如何为后续技能精炼提供信息。6. 相关工作经验驱动的智能体技能演化智能体技能编码可复用的程序性知识使LLM智能体能够利用过去经验完成未来任务Anthropic2026Li等2026Wang等2026Xia等2026bXu和Yan2026Zhang等2025Zhou等2026。近期框架使智能体能够通过从过去执行轨迹中发现和精炼程序性知识来自我改进Agrawal等2026Lu等2026Ouyang等2026Xia等2026aYuksekgonul等2025。EvoSkillAlzubi等2026、Trace2SkillNi等2026和SkillOptYang等2026等方法使用专门的智能体流水线分析任务rollout并更新模块化技能文档Zhang等2026a。然而这些方法没有将所学到的内容作为独立的、不断演化的知识表示来维护。WikiSkill引入持久Wiki层跨迭代将经验整合为结构化知识允许后续技能更新系统地建立在累积知识之上。技能增强智能体与智能体自我改进除了构建高质量技能外技能增强智能体必须在执行期间有效选择和使用相关技能Chen等2026aLiu等2026。随着可复用技能数量的增长近期工作探索了技能检索以从库中为每个任务选择相关技能Cho等2026Shi等2026Su等2026Ye等2026Zheng等2026。WikiSkill则专注于技能质量本身与技能检索分开。另一条工作线优化更广泛的智能体框架包括提示、上下文、工具、记忆和工作流程Chen等2026bLee等2026Lin等2026Lou等2026Zhang等2026b。这些方法通过分析执行轨迹和环境反馈来搜索更好的智能体配置从而改进智能体系统。这一方向与WikiSkill互补后者专注于演化可复用程序性技能同时保持更广泛的智能体框架固定。7. 结论我们提出WikiSkill一个将智能体技能与持久、复利增长的知识库wiki共同演化的框架。通过将智能体工作空间结构化为三个不同的层WikiSkill使技能开发能够在迭代之间建立在日益得到良好支持和整合的知识之上。一个编排循环将经验整合到wiki中从累积知识中提出技能精炼并基于验证性能门控更改。在实证上WikiSkill在五个基准和五个推理模型上持续优于现有技能演化方法并在大多数模型-数据集对中优于无技能基线。除了这些总体增益外技能演化与模型规模扩展互补更大的模型通常从演化技能中获益更多而使用技能的较小模型可以超越不使用技能的显著更大模型。同时演化技能有效地跨模型和模型家族迁移并且可以优于自演化技能。最后我们的消融证实持久知识积累对于有效的技能演化至关重要。局限性WikiSkill有几个局限性推动未来工作。首先为了隔离技能质量并避免技能检索的混杂效应我们的研究遵循先前工作直接将活跃技能注入智能体提示。这种设置不评估技能检索或触发随着可用技能数量增长这些变得重要。其次我们的验证门控要求每个被接受的提案提高验证分数这排除了保持即时性能但可能在后继迭代中实现增益的中性提案。我们采用这一严格标准遵循先前技能演化框架Alzubi等2026Yang等2026以确保公平比较。探索更灵活的接受标准是未来工作的重要方向。第三Wiki层跨迭代持续积累模式页面、演化日志和提案diff但WikiSkill目前缺乏自动修剪wiki的机制。随着知识在更长的演化运行中积累这种修剪可能变得必要。最后虽然我们的基准套件包括长上下文文档推理OfficeQA和多步工具交互但它不包括跨越数百个环境动作或多个小时的非常长时程任务。开发在单个长执行rollout内精炼程序性知识的在线技能适应方法仍然是未来工作的重要方向。
返回列表