ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

MidTool:面向智能体工具使用的中间训练数据合成方案

MidTool:面向智能体工具使用的中间训练数据合成方案 MidTool:面向智能体工具使用的中间训练数据合成方案论文来源:arXiv:2608.20314v1摘要中间训练(Mid‑training)正逐渐被认为是塑造大语言模型能力的关键阶段。已有研究表明,定向中间训练可以增强数学、科学这类强推理能力,同样也可以提升软件工程领域智能体能力。本文研究尚未被充分探索的通用工具使用智能体能力,提出MidTool,一套面向智能体工具使用中间训练的开源语料构建流水线,融合大规模网页、PDF、代码数据,结合真实世界工具API、MCP技能、文档驱动工作流生成合成监督数据。MidTool旨在教会模型识别工具可用能力、从上下文解析参数、组合工具调用工作流、在信息不全时进行故障恢复。本文在Qwen3‑4B‑Base、Qwen3‑8B‑Base基座模型上使用MidTool‑Mix开展中间训练,之后分别执行有监督微调SFT与强化学习RL后置训练。对比基线方案,在BFCL、τ²‑Bench、MCP‑Universe评测集上,经过MidTool‑Mix中间训练的模型,在SFT、RL两种后置训练条件下下游性能均获得稳定提升。实验说明:和完全依赖后置训练相比,通用工具使用能力同样可以从专门的中间训练中获益。关键词:大语言模型;智能体;工具调用;中间训练;数据集构建;MCP;Agent1 引言工具使用是大模型智能体的核心能力。高性能智能体需要判断何时调用外部工具、依据工具Schema解析参数、从长噪声上下文提取实参、将多个工具组合成工作流、信息缺失时做澄清与故障恢复。该能力广泛应用于函数调用、API编排、交互式智能体评测、新兴Model Context Protocol(MCP)生态。当前工具使用能力提升大多依靠后置训练:在精选交互轨迹上做SFT、RL。但后置训练负担很重:模型需要从相对有限的监督样本中,同时学会工具识别、Schema参数构造、信息缺失下澄清、多步执行等多项原子能力。更深层的问题:工具调用所需知识不只显式存在于交互轨迹,还广泛分布在开发者文档、手册PDF、代码仓库、API规范、结构化工具定义中,而这些资料大多不会被整理成干净的智能体演示样本。由此引出核心研究问题:通用工具使用能力,能否通过专门的中间训练阶段提前塑造,而不是几乎全部交给后置训练完成?中间训练是多阶段预训练中独立阶段,处于通用预训练与后置训练之间。已有工作证明定向中间训练可以显著提升推理能力;也有面向深度研究、代码软件工程的智能体中间训练探索。但面向通用工具使用的中间训练尚未被充分研究。相比数学、软件工程任务,工具使用数据集需要覆盖更加异构的能力集合:自然语言文档、可执行代码模式、结构化Schema、多工具工作流、信息缺失带来的各类失败案例。本文提出MidTool,一套可扩展智能体中间训练数据构建流水线,产出203亿token混合数据集MidTool‑Mix。流水线有两大合成分支,分别解决工具使用两大核心短板:上下文驱动轨迹增强:处理文档、代码,解决**上下文接地(grounding)**能力,教会模型识别工具边界、推断参数、从杂乱现实素材还原工作流;原生智能体轨迹合成:基于真实API、MCP技能直接生成可执行轨迹,解决执行规划能力,学习多轮规划、缺失信息澄清、校验Schema、轮次顺序、参数与工具返回结果一致性。表1:主流预训练/中间训练语料对比| 工作 | 领域 | 数据规模 |训练阶段 |数据源 |工具多样性 |智能体轨迹 |公开可用 ||—|—|—|—|—|—|—|| FineWeb | 通用 |15T |预训练PT |网页 |无 |✗ | ✓ || Dolmino | 通用 |100B |中间训练MT |爬虫+合成 |无 |✗ | ✓ || MegaMath‑Web‑Pro |数学 |100B |中间训练MT |数学QA+合成 |无 |✗ | ✓ || AgentFounder |深度研究 |300B |中间训练MT |网页+合成 |低 |✓ |✗ || daVinci‑Dev |软件工程 |73.1B |中间训练MT |Github PR+合成 |部分 |✓ | ✓ || MidTool‑Mix(本文) |工具使用 |20.3B |中间训练MT |网页/PDF/代码/工具+合成 |高 |✓ | ✓ |本文在Qwen3‑4B‑Base、Qwen3‑8B‑Base基座模型开展实验,统一后置SFT、可选RL流程。在BFCLv3、τ²‑Bench、MCP‑Universe三套评测集上观察稳定现象:经过MidTool‑Mix中间训练,下游工具使用性能优于仅做后置训练的基线;RL训练可以进一步放大收益;提升在难度更高的多轮交互式任务上尤为显著。主要贡献提出MidTool:开源面向通用工具使用的流水线与中间训练数据集MidTool‑Mix(203亿token),融合网页、PDF、代码、工具素材,同时包含上下文增强轨迹、原生智能体轨迹。实验证明:4B、8B规模基座模型经过MidTool‑Mix中间训练,在SFT、RL后置训练后,三套评测集下游工具使用性能稳定优于基线;中间训练可以为后续后置训练提供更强、更稳定的模型初始化。揭示能力边界:MidTool‑Mix对广泛工具迁移提升明显;但深度探索类任务增益有限。说明通用工具使用先验与深度搜索探索类行为属于不同能力,为后续智能体中间训练指明方向。2 MidTool:面向智能体中间训练的可扩展数据合成流水线流水线分为3个阶段:数据源采集、数据预处理、智能体轨迹合成。2.1 阶段1:数据源采集共四类互补数据源,不只依赖显式交互轨迹,同时覆盖技术文档、可执行代码、结构化工具Schema。网页数据:基于FineWeb处理后的Common Crawl快照,采样2020‑2025多轮快照。包含API参考、开发文档、排错页面、教程、CLI指令;提供大规模工具概念、术语、工作流描述。PDF文档:取自FinePDFs英文子集。大量手册、产品文档以PDF分发;内容偏向长流程程序性描述。PDF提取噪声高,后续需要更严格过滤。代码数据:来自GH Archive的GitHub仓库,分两类筛选:Agent/MCP相关仓库,按活跃度、许可过滤;Python、Java、JS、Go、Rust等主流生态高质量仓库;过滤个人项目、fork副本、基准数据集仓库,避免数据泄露。工具结构化素材:REST API、MCP技能,提供可执行Schema、参数结构,作为原生轨迹合成的底层接口。四类数据源权衡广度与结构化程度:网页+PDF提供宽泛技术上下文;代码提供执行模式与开发者工作流;工具素材提供可直接调用的接口定义。
返回列表