Microsoft 提出 Resource2Skill:把人类教程蒸馏成 Agent 真能执行的多模态技能库 Skill 的价值不在于给 Agent 多塞一段提示而在于把人类经验变成可检索、可验证、可执行、可复用的程序性知识。让 Agent 做一张专业幻灯片、一个多表联动的 Excel 仪表盘或一段 Blender 场景难点往往不是“知道答案”而是知道 先做什么、调用什么工具、检查什么中间状态。这些步骤藏在人的教程、演示和成品里却很难直接塞进上下文。Resource2Skill 的关键动作是把视频、代码库、文章和参考成品蒸馏为 层级多模态 Skill Wiki。Agent 不再被动检索一段相似文字而是先浏览技能树再选择带文字、视觉和代码视图的技能最后通过 MCP 接到真实软件后端执行。它把“参考资料”推进成了“可运行的程序性记忆”。 一句话总结 本文提出 Resource2Skill将人类多模态资源蒸馏为层级可执行技能使七域平均总分较无技能 Agent 提升 11.9 个百分点。11.9平均提升 / pp26/28胜过强 Harness21.6新能力在线补齐 / ppHIGHLIGHTS · 本文看点01教程如何变成可执行技能02层级、多模态与选技为何有效03强提升背后的失效边界01PROBLEMAgent 缺的不是更多资料而是可复用的“做法”想象你让 Agent 做一份十页路演。它可能知道什么叫“信息层级”也能写出标题和要点却不知道 页面节奏如何变化、图表该怎样落位、失败后应检查哪里。论文把这类可重复调用的流程性知识称为 Skill它包含任务分解、工具或 API 模式、中间状态检查和故障恢复。现有技能库通常来自专家手写、Agent 自己的交互轨迹或纯文本与代码资源。问题在于很多商业软件的隐性知识最自然地存在于 教程视频点击顺序、前后视觉变化、节奏、空间布局和参数调整都比一段说明文字更完整。只把视频压成摘要恰恰会丢掉视频最有价值的时序与感知信号。— 图 1从多模态资源到 Skill Wiki以及七类软件创作域的代表性结果。把“看教程”改造成“调用技能”Resource2Skill 不让 Agent 在任务时反复观看原始视频也不把整个代码仓库硬塞进上下文。它先离线抽取程序性信号再统一写入技能条目当任务出现时只暴露少量候选技能。这个设计同时解决 原始资源太长 和 文本摘要太薄 两个问题。「资料告诉 Agent“是什么”Skill 进一步告诉它“怎么做、何时用、如何验证”。」02METHOD一条流水线把多模态资源蒸馏成 Skill Wiki— 图 2Resource2Skill 的构建、组织、选择、执行与评测全流程。第一步按模态抽取真正可执行的证据输入来自四类资源教程视频、代码仓库、文章、参考成品。系统对视频采样关键帧对仓库定位代码区域与参数签名对文章切分段落对成品做图像预处理再由视觉语言模型生成结构化技能候选。每个候选技能被组织为路径 p、文本视图、视觉视图、代码视图和元数据 m。第二步五道确定性质量门•完整性必填字段、最小正文长度和至少一种内容模态必须存在。•可追溯性来源路径或视频链接必须能在连接器清单中解析方便审计与回查。•去重根据域、来源路径和抽取节点生成稳定技能 ID并辅以同源规范化名称检查。•模态一致性元数据声称存在的文本、视觉或代码文件都必须在磁盘上真实存在。•结构可执行性带代码的技能要在沙箱中导入、运行并产出非空结果未通过者只能作为参考技能。这里有一个容易被忽略的细节质量门不是另一个 LM-as-a-Judge而是 规则化、可复现的确定性检查。模型负责蒸馏规则负责结构与执行层面的验收。这让 Skill Wiki 更像可维护的软件资产而不是一堆未经验证的提示词。03RETRIEVALMetaBrowse先走技能树再让模型挑组合层级结构不是目录装饰而是检索先验不同软件域使用不同分类树PPT 按布局、字体、配色和动效组织Blender 按几何、材质、灯光和构图组织。给定任务 qMetaBrowse 先用 BM25 在技能名称、标签、适用性说明和 分类路径 p(s) 上取 K20 个候选再让语言模型选出最多 n5 个技能进行组合。第二阶段做的是 子集选择不是简单排序。模型可以组合互补技能也可以在候选都不合适时选择零个退回自由代码路径。这样系统把“语义相似”与“任务适配”拆开前者缩小搜索区后者判断技能是否真的能一起完成当前任务。执行层只保留一个统一接口Wiki 侧提供分类浏览、技能卡片、按模态读取与搜索软件侧则提供统一 apply 动作和域能力清单。带代码技能可直接对真实 MCP 后端执行中间不再让语言模型把代码“翻译一次”。仅作参考的技能仍能提供文字和视觉依据由 Agent 自行改写实现。论文还把上下文账算得很清楚五个核心域中单技能平均约 4,332 tokens候选筛选消耗约 4K–10K五个完整技能约 22K总技能上下文约 26K–32K tokens。由于 K 和 n 固定技能库继续扩容并不会线性撑大推理上下文。04RESULTS主结果技能带来的提升不只是 Harness 红利— 表 1四种模型后端、七个创作域上的主结果。Overall 为五个域内维度的等权平均。主比较覆盖 7 个软件创作域 × 4 个模型后端每个域使用匹配的 N80 任务。跨 28 个模型—领域单元w Skills 全部胜过同模型的 w/o Skills平均总分从 45.0% 升至 56.8%提升 11.9 个百分点。更关键的是作者没有只拿“裸 Agent”作对照还加入 ClaudeCode-H 与 Codex-H 两个现成 Agent Harness。Resource2Skill 在 28 个主聚合单元中有 26 个超过更强的 Harness 基线仅 GPT-5.5 的 Web 和 GPT-5.4 Nano 的 PPT 两格落后而且差距都不到 1 个百分点。主要增益来自被检索和组合的 Skill Wiki而不是执行外壳本身。不同域的收益并不均匀以 GPT-5.4 为例平均分从 51.9% 升至 66.9%提升 15.0 个百分点。其中 UE5 从 29.1% 升至 67.3%增加 38.2 个百分点Excel 增加 17.8Blender 增加 14.6Web 增加 13.7。Reaper 只增加 4.1说明模型本身对音频制作已有较强先验技能的边际空间更小。论文报告的配对单元中w Skills 相对 w/o Skills 的差异均达到 Wilcoxon p10⁻³。人类盲评包含 200 个独立评分排除平局后w Skills 的胜率为 85.5%。这两组证据共同说明提升不是由少量漂亮案例撑起来的。05ABLATION为什么有效规模、模态、来源和选技缺一不可— 图 3技能池规模曲线以及无技能、纯文本扁平库与完整 Wiki 的对比。技能数量从 0 增至 200 时五个核心域获得最大一段收益此后曲线趋于饱和400 到完整技能池每个域最多只再增加 0.8 个百分点。这表明前 200 个技能覆盖了常见操作和恢复路径后续条目主要补齐长尾。与此同时完整 Wiki 比扁平纯文本库高 2.5–8.2 个百分点说明层级导航、视觉预览和可执行代码不是包装层。— 表 2资源来源消融视频是不可替代的基础来源多样性负责补齐覆盖。去掉视频后只保留代码、文章与成品平均分从 68.9% 降到 59.4%反过来仅视频 的 66.8% 仍高于无视频三来源组合 7.4 个百分点。Excel 的视频移除损失为 14.2 个百分点Web 为 11.5恰好都是高度依赖操作顺序与视觉反馈的域。— 表 3固定技能 ID 与检索预算后只改变 Agent 能看到的模态。只给精心整理的文本技能平均分已经有 65.0%加入视觉到 66.9%加入代码到 67.0%三种视图全开达到 68.9%。视觉和代码的单独增益接近但两者互补。多模态并不是替代好文本而是在好文本之上补足“长什么样”和“怎样运行”。— 表 4固定库、Agent、评测器与候选预算后的选择策略消融。层级后接 LM 的 MetaBrowse 以 68.9% 排名第一超过 BM25 的 66.0%、BM25Embed 的 64.2% 和纯向量检索的 60.0%。随机从全库抽技能只有 58.0%几乎贴近无技能的 57.3%。结论很直接技能质量重要选对技能同样重要不合适的技能会增加参数绑定和组合冲突成本。06ONLINE在线学习不是常驻加速器而是能力缺口的补丁— 表 5固定 891 个离线技能最多在线增加 100 个技能时的结果。当离线库已经覆盖常见请求时加入最多 100 个在线技能标准任务集只从 65.4% 升到 66.1%即 0.7 个百分点。这个变化很小说明频繁联网蒸馏不是默认情况下的免费增益。但在专门挑选离线库缺口的 Tnovel 上在线技能把 41.2% 提升到 62.8%增加 21.6 个百分点。在线条目使用与离线相同的构建和验收流程并单独存放不回灌默认库。合理的定位不是“每次都搜索”而是先发现能力缺口再定向补齐。一套更稳妥的部署策略•离线库覆盖高频能力把常见操作、风格模板和恢复路径预先蒸馏并版本化。•运行时先做层级选择限制候选和完整技能数量控制上下文与组合复杂度。•检测缺口后再在线扩展让新技能进入隔离池通过同一组质量门后再参与当前任务。•执行后必须渲染检查无论技能是否通过结构测试最终成品仍要经过域内渲染与质量验证。07CASES成功与失败都说明Skill 的最后一公里是参数落地— 图 4Web 成功案例技能侧形成完整长页、稳定排版和丰富内容结构。在农场餐厅落地页案例中技能侧把字体、卡片、信息密度和长页节奏组织成统一系统无技能侧则停留在占位感很强的六段骨架。这里的优势不是多写几行 CSS而是多个技能共同提供了 内容结构、版式模式和视觉约束。— 图 5Web 失败案例技能侧更保守、更稀疏无技能侧反而完成度更高。但在复古未来主义桌游页中技能侧过度贴住单一模式页面稀疏无技能侧反而有更完整的章节覆盖。论文的十个边界案例反复出现两类问题一是 partial grounding技能表面模式被复用但公式、背景、曝光或相机等绑定没有真正落地二是 conservative compositionAgent 因锚定某个技能而失去必要变化。— 图 6Blender 成功案例技能侧建立了主体、材质与多光源层次。— 图 7Blender 失败案例复杂技能组合未正确绑定背景、曝光和相机参数。Blender 的一正一反更直观首饰案例中技能侧确实用上了 PBR 材质和蓝/琥珀色轮廓光香水瓶案例却被过曝与构图错误吞没。Excel 案例还出现可见的 #NAME? 公式错误PPT 案例出现未处理的占位文本。一个技能只有在参数被正确绑定、冲突被正确裁决时才会真正成为能力。08EVALUATION如何读这些数字评测设计、边界与未来方向这套实验证据强在哪里主比较在每个域使用匹配的 N80 任务消融使用固定 N40 子集同一比较中的任务 ID、Agent、评测器和随机设置保持一致。未产出、不可打开、过小或静音的成品按 0 分计入均值不会被静默剔除。非音频成品由 GPT-5.4 视觉评测器按五个域内维度打分Reaper 由音频模型评测。自动评测并非完美17 个任务—成品样本上评测器与人类中位数的总体 Spearman ρ0.71、ICC0.66评测器重复运行相关性 ρ0.83。论文又加入五人盲评方向上支持主结果。更合理的读法是证据链相互印证但不等于每个小差异都具有同等确定性。还要区分 论文评测范围 与 当前公开资源范围论文主结果覆盖 Web、Excel、Reaper、PPT、Blender、CAD、UE5 七域当前官方项目页把可发布域标为五个即 Web、PPT、Excel、Blender 和 Reaper并说明 CAD、UE5 属于论文评测抽象。若要复现完整七域结果需要额外确认对应后端与资源是否已开放。未来方向•加强参数绑定在执行前后追踪技能变量是否映射到真实对象、单元格、材质、相机和工具状态。•处理技能冲突当前一次运行只按序应用最多五个技能没有多轮重规划或冲突仲裁未来可把冲突检测放进控制回路。•补充同预算原始资源基线现有检索基线在蒸馏后的技能库上运行尚未与等 token 预算的原始视频转录、仓库片段和文章检索正面对比。•扩展到弱工具化领域论文不主张方法已泛化到缺少可编程接口或公开程序性内容的领域这决定了当前系统的适用边界。对 Agent 工程的真正启示Resource2Skill 的价值不只是“从视频生成技能”的单点能力而是一套知识工程闭环资源采集 → 多模态蒸馏 → 确定性验收 → 层级检索 → 组合执行 → 成品验证。它把人类经验从临时上下文中抽出来变成有路径、有版本、有来源、有执行接口的资产。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

本月热点