ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Google 提出 Procedural Graphs:从执行轨迹中进化程序性知识图谱

Google 提出 Procedural Graphs:从执行轨迹中进化程序性知识图谱 把行动的前提、顺序和常见错误连起来Agent 才能在当前进度上找到可用的经验并从执行反馈中修正它。Agent 能调用工具并不意味着它总能把工具用在合适的时机。长任务里遗漏一次检查、过早结束或反复查询都可能让后续步骤偏离目标。来自 Google、佐治亚理工学院和北京大学的这项研究将行动之间的依赖关系存成可查询、可修改的 Procedural Graph在每一步提供贴合当前进度的建议。这张图在单次任务执行时保持固定执行结束后再结合训练轨迹与验证结果更新。模型权重无需改变改进发生在外部流程知识上。论文的主要比较覆盖四个模型、六项基准PG 在 24 种组合中的 21 种取得第一或并列第一更值得展开的是同一套反馈机制还能修复起初拖累表现的人工流程图。 一句话总结 本文提出 Procedural Graph以局部流程图生成逐步指导并通过验证筛选自演化更新在24 种模型与基准组合中的 21 种取得第一或并列第一。01BACKGROUND研究背景行动需要顺序传统 ReAct Agent 交替进行推理和工具调用把此前的动作与观察不断放进上下文。任务越长模型越需要同时判断哪些信息仍然相关、哪些步骤尚未完成、当前动作需要什么前提。行动流程的连贯性往往要由模型从越来越长的历史中临时重建。记忆摘要保留经验轨迹检索提供过去的做法条件式指南给出特定状态下的建议工作流则把若干动作组织成顺序。它们各有价值但仍留下一个组合问题怎样把步骤之间的联系、当前执行进度和后续修订放进同一套表示PG 的贡献围绕这三者展开。论文借知识图谱解释自己的设计图 1知识图谱通过“实体—关系—实体”回答事实问题PG 通过“过程—关系—过程”描述行动关系。例如搜索之后需要阅读证据形成答案后还要检查再决定是否输出。把“检查后再提交”作为一条可查询的联系保存便能让下一步建议带上必要前提。— 图 1从事实关系到过程关系把步骤及其衔接组织成可查询的图。这种外部表示允许人或模型检查具体边上的条件也允许执行反馈直接改变某条路径。要让它真正参与解题还需要解决两个问题运行时取出哪一段流程以及任务结束后如何判断一次改图是否值得保留。02METHOD方法简介局部指导与改图整体框架如图 2 所示包含固定图上的在线指导以及任务批次之间的离线自演化。求解模型负责行动指导模型把图转成当前可用的建议修订模型负责提出图编辑。三种角色使用同一种底层 LLM改进来自流程知识的组织与调用方式而无需更新模型权重。— 图 2左带属性的过程关系中定位、提取局部图并生成指导右反馈改图、验证与回退。2.1把前提、做法与错误写在边上PG 是带属性的有向图节点可以表示工具函数、技能、内部推理步骤或任务状态。每条边记录一个可衔接的过程关系并附带 condition、guidance、pitfalls 三类文本分别说明何时适用、如何执行、需要避开什么。边同时保存动作之间的连接和连接成立的条件因此比单独列出工具名包含更多执行信息。论文给出的财务模拟例子是“现金流预测 → 融资申请”当预计资金可支撑时间低于安全缓冲时应提前提出申请为到账延迟留出时间若已有申请等待处理就不要叠加第二次申请。提前融资与避免重复申请都依赖当前状态和此前动作的关系。这里描述的是模拟环境中的规则。2.2每一步只读与当前位置相连的流程运行开始时系统定位在 Start之后按最近执行的过程或工具名进行精确匹配找到当前节点再沿出边展开两跳。若匹配失败就退回完整图。指导模型接收用户问题、这段局部图和最近三步轨迹把静态边属性转写成此刻的行动目标与注意事项。求解模型仍可使用完整历史。局部图保留了连续步骤之间的联系。例如只检索到“提交”建议可能漏掉前面的答案检查连通邻域能让指导模型一起看到相关衔接。最终建议被追加到求解提示中下一步仍由求解模型生成。PG 通过提示影响行动选择保留了模型的推理自由并不保证每次行动都严格遵循图中的路线。2.3用执行反馈提出更新用验证决定去留自演化可以从人工图开始也可以只从 Start → End 的最小骨架开始。每轮先用当前保留的图运行一批训练任务记录动作、观察和任务得分修订模型对照高分与低分轨迹找出反复失败的环节或成功路径中的有效步骤。修订对象包括节点、边以及边上的条件和建议属性修改通过删除旧边、添加新版边实现。候选图先接受结构检查包括边端点是否存在、每个节点是否能到达终止节点以及任务规定的环路约束。通过后才在独立验证集上测量平均任务得分。候选分数不低于当前保留图的缓存分数时更新才被接受持平也可以接受否则恢复原图。这个门槛针对实测验证分数不能被理解为未来表现必然单调提升。被拒绝的候选和相关诊断会进入拒绝记忆供下一轮修订参考减少再次提出相似失败方案的机会。图在每次训练、验证或测试任务内部都保持固定论文构建模式中的“Online Evolution”指的是训练批次之间的增量更新。定位指导与反馈改图发生在不同时间尺度上下面的实验分别检验它们带来了什么。03EXPERIMENTS实验结果流程怎样起效3.1跨模型比较优势出现在哪里主实验统一使用相同的 ReAct 求解器、工具接口与解码配置学习型基线使用同一批训练轨迹。比较对象包括无记忆 ReAct、MemoryBank、RAP、ExpeL、AutoGuide、AWM 和 KnowAgent覆盖摘要、轨迹、洞察、条件指南、工作流和文本动作规则。对照关注的是经验如何存储和复用四个求解模型分别为 Claude Sonnet 4.6、Gemini 3.1 Pro、Gemini 3.5 Flash 和 Grok 4.1 Fast。表 1 的六列分别考查多跳问答、跨轮指令保持、专业任务产物、家庭环境行动、零售工具服务和多轮函数调用。HotpotQA 主表采用 LLM 判断的答案准确率GDPval 采用任务评分细则下的平均分其余列按各自的准确率、成功率或 Pass1 报告。不同列代表不同能力和评分口径不能直接把数值当成统一总分。相对每个模型与基准组合中最强的基线PG 获得 19 次胜出、2 次持平和 3 次落后即 21/24 次第一或并列第一。较大的优势包括 Flash 的 BFCL 准确率从最强基线的 58.00% 到 67.00%提高 9.00 个百分点Gemini 3.1 Pro 的 GDPval 从 71.37 到 78.78提高 7.41 分同模型的 τ-bench 从 73.04% 到 80.00%提高 6.96 个百分点。流程指导的收益在这些任务上更为明显。— 表 1四个模型、六项基准的完整比较方括号为 95% 置信区间。结果也有清楚的差异PG 在所有四个模型的 GDPval 和 BFCL 上都超过各项基线但 HotpotQA 相对最强基线的变化仅为 −0.90 至 1.30 个百分点。三处落后分别是 Claude 的 HotpotQA以及 Grok 的 ALFWorld 和 τ-bench。论文对排除平局后的整体胜负作符号检验报告 p4.3×10⁻⁴整体胜出趋势不代表每个单项差异都已得到显著性确认。附录 F.1 提供了一个更具体的函数调用案例用户只询问机票报价两条轨迹都获得 220 美元的结果。PG Agent 报价后结束当前回合无引导 Agent 继续认证、操作支付信息并尝试订票造成目标状态不匹配。恰当停止也是流程知识的一部分。这是一个任务实例用来解释行为差异不代表该行为在全部样本中的发生率。3.2长周期决策把检查放到行动之前短任务的正确率之外作者在 EnterpriseArena 模拟中测试长达 132 个月的决策。现金为负会导致模拟立即终止三个预设危机时点不向 Agent 披露融资需要 1—6 个月才能到账。图 3 同时给出存活曲线和现金轨迹完整周期存活率检验的是连续跨过危机的能力而非某个月的局部得分。— 图 3四个模型的存活率与现金轨迹竖线标示危机时点蓝色为 PG。在这组每配置 50 个测试回合的评测中PG 将 Claude 的完整周期存活率从 44.0% 提升到 58.0%Gemini 3.1 Pro 从 6.0% 提升到 34.0%Grok 从 26.0% 提升到 40.0%。Flash 的四种配置仍全部为 0.0%但 PG 将平均存活时间从 33.58 个月延长至 40.62 个月。这组结果支持三个模型的存活率改善和四个模型的平均存活时间改善没有显示所有模型都能走完整个周期。工具使用并非一致减少Flash 的每月信息工具调用从 18.94 次降至 12.53 次Claude 和 Gemini 3.1 Pro 却分别从 0.13、0.89 次升至 0.36、3.18 次。该指标不计记忆操作及改变状态的动作。有效调用的时机比统一压低调用次数更能解释这组现象指导会促使模型在融资前检查现金、预测可支撑时间并查看市场状态。同一实例的附录轨迹进一步说明了这一点无引导 Agent 在已有融资等待处理时再次申请被环境拒绝PG Agent 较早发起融资并在等待期间检查预测、推进月份。融资金额和存活率也不是同一个目标例如 Claude 的 PG 平均企业得分低于其无引导基线。这些指标需要结合看才不会把“更能存活”误写成所有经营指标都更好。接下来论文检验这样的流程是否必须依靠人工设计。3.3从最小骨架出发也能修复人工先验构建实验使用固定的 Gemini 3.5 Flash比较人工图、人工图单次更新、人工图迭代演化、从零单次构建、从零迭代演化五种方式。表 2 的 HotpotQA 改用严格答案匹配 EM 和词级 F1MultiChallenge 则使用 56 个样本的快速测试集区别于主表的 166 个样本。这张表用于比较构建方式不能与主表数值直接拼接成提升曲线。HotpotQA 上从零迭代演化的 Mode 5 得到 66.30% EM、78.79% F1相比无引导基线分别提高 7.50 和 7.58 个百分点。人工图在这项任务上也有效F1 为 76.61%从零一次性构建则只有 69.49%。最小骨架经过反复反馈能够形成有效流程单次生成并不自动带来同等收益。— 表 2五种流程图构建策略HotpotQA 报告 EMF1MultiChallenge 报告分项与总体成功率。在 MultiChallenge 上人工图却将总体成功率从 87.50% 拉低到 58.93%一次更新后进一步降至 53.57%带验证门槛的迭代演化最终恢复到 92.86%比人工初始化高 33.93 个百分点。从零迭代演化达到 91.07%。人工经验是否适合当前任务需要通过执行反馈检验这里的完整迭代配置表现更好但实验未单独拆出验证门槛和拒绝记忆各自的贡献。附录 F.2 记录了一次修订早期图把“分析目标问题”直接连到“结束”Agent 因而回答评估问题没有按用户约束讲笑话新图移除这条直达路径改为提取约束后作答保存的成功标记从 0 变成 1。图编辑能改变模型把什么当作当前回答目标。这也说明修订不只是增补文字有时需要删除错误的衔接。3.4十轮自演化保留哪个版本很重要为了观察更新过程作者另外用 Flash 在 EnterpriseArena 上运行十轮自演化训练、验证和测试各 20 个回合起点为最小骨架。图 4 跟踪平均存活时间与实际融资额区分训练、验证及被接受检查点的测试表现。这是独立于前述 50 回合常规评测的实验两组 Flash 结果对应不同图配置和样本设置。— 图 4十轮自演化中的平均存活时间与融资额灰色虚线为训练红色为验证绿色菱形为测试。第 1 轮形成“检查现金—预测资金可支撑时间—保存记录—检查市场—融资决策”的流程骨架验证存活率从 0.0% 跃升至 45.0%。第 2 轮补入 recall_notes使上月保存的记录能在新月份取用验证存活率升至 80.0%。早期收益对应的是补齐执行顺序和跨月信息调用而不只是延长推理文本。第 3—6 轮没有提交更新其中第 5 轮未通过结构检查根本没有运行新验证第 7 轮删去 pass_action 分支第 8 轮再把融资后的路径直接连向结束。按附录解释环境适配器已经在融资请求后推进月份继续立即结账会重复推进状态。删除不合适的动作衔接同样可以形成进步第 8 轮验证存活率达到 90.0%。第 10 轮候选因验证退步而被拒绝系统最终返回第 9 轮图测试存活率为 85.0%无引导基线为 0.0%。搜索中第 7 轮曾出现 95.0% 的测试成绩但论文明确采用最终返回图的 85.0%避免按测试结果挑最好版本。最终交付的图与搜索途中最高的测试点必须分开报告。每个分区只有 20 个回合单轮接受或拒绝可能取决于一两个回合应将这些点看作搜索轨迹。3.5效率消融局部指导为什么更合适表 3 固定底层流程图、Flash 模型和求解提示比较无图、直接注入全图、全图生成指导、局部子图生成指导。它检验两个设计选择是否让模型把图转写为建议以及生成建议时是否定位到当前邻域。该实验没有“局部子图直接注入”这一配置因此支持的是已测试组合之间的比较。— 表 3同一流程图的使用方式消融同时比较任务成绩、总 token 和求解步数。局部生成指导在三项任务中都取得最高分MultiChallenge 为 89.31GDPval 为 63.99ALFWorld 为 81.53。ALFWorld 尤其能体现图范围的影响无图为 72.58直接注入全图为 70.34全图生成指导降至 54.48局部生成指导则为 81.53。生成指导需要与当前位置相匹配看到更多流程并不保证执行更好。相对全图生成指导局部方案的总 token 在 ALFWorld、GDPval、MultiChallenge 上分别减少 70.9%、18.1%、14.8%。但相对无图基线GDPval 和 ALFWorld 的总 token 仍分别增加 33.4% 与 55.4%即使求解步数已从 28.20、21.84 降到 18.57、18.80。MultiChallenge 的步数还从 3.87 增至 4.22。额外的指导调用有成本轨迹缩短不能直接等同于更省 token。这组消融让论文的收益定位更清晰用局部指导提高流程质量并控制相对全图指导的开销。04SUMMARY总结让流程随经验改进Procedural Graph 把过程知识放到模型权重之外用带条件的边连接步骤用当前位置检索相关邻域再将执行轨迹转化为可验证的图修改。跨任务比较、构建实验与自演化轨迹共同支持了一个具体方向Agent 的经验可以沉淀为可查询、可修订的行动关系并在下一次执行中逐步调用。从这项研究得到的设计启发是把“当前走到哪里”“下一步需要哪些前提”“哪些流程修改值得留下”作为相互连接的问题来处理。最小骨架能够生长错误先验也能修正关键在于让经验持续接受任务结果的检验。流程知识的价值体现在它能否改善下一次行动以及能否根据反馈继续调整。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表