ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Agent Governance Toolkit 解耦式执行与学习架构:DoerAgent 与 ObserverAgent 实现低延迟持久自进化

Agent Governance Toolkit 解耦式执行与学习架构:DoerAgent 与 ObserverAgent 实现低延迟持久自进化 Agent Governance Toolkit 解耦式执行与学习架构DoerAgent 与 ObserverAgent 实现低延迟持久自进化【免费下载链接】agent-governance-toolkitAI Agent Governance Toolkit — Policy enforcement, zero-trust identity, execution sandboxing, and reliability engineering for autonomous AI agents. Covers 10/10 OWASP Agentic Top 10.项目地址: https://gitcode.com/GitHub_Trending/ag/agent-governance-toolkit导读本文基于 Agent Governance Toolkit 中 Self-Evolving Agent 示例的落地实现完整剖析解耦式执行与学习Decoupled Execution and Learning架构将执行者 Doer与学习者 Observer彻底分离让 Agent 在线响应仅需一次 LLM 调用即可返回而反思Reflect与进化Evolve等自改进逻辑全部下沉到离线异步处理同时保持旧版同步自进化模式的向后兼容。读完本文你将掌握该架构的组件划分、事件流与检查点机制、环境变量配置、两种使用模式以及无 API Key 的结构化验证方法并可直接在 self-evaluating 示例目录 中复现全部流程。架构背景为什么要分离执行与学习Self-Evolving Agent 的传统Legacy模式采用同步自改进循环Task → Act → Reflect → Evolve → Retry。每处理一个请求Agent 不仅要回答用户问题还要在同一请求路径上调用反思模型打分、调用进化模型重写系统指令甚至在分数不达标时循环重试。从 agent.py 的 SelfEvolvingAgent.run 实现 可以看出单次请求最多会触发 3 次重试每次重试包含 1 次执行调用、1 次反思调用累计可达 3-9 次 LLM 调用——用户需要等待执行 反思 进化的完整链路体验与成本都难以接受。解耦式架构的核心思想是低延迟不牺牲学习能力持久学习不拖累在线路径。DoerAgent 负责执行并即时返回ObserverAgent 作为影子学习者在离线侧消费执行轨迹二者通过一个追加式事件流解耦。组件全景本次实现新增与修改了什么新增组件源码佐证组件源码文件职责TelemetryEvent/EventStreamtelemetry.py执行事件的数据结构与追加式 JSONL 事件流支持批量读取与基于检查点的增量处理ObserverAgentobserver.py异步学习 Agent离线消费事件流执行反思与进化更新智慧数据库基于检查点跟踪进度DoerAgentagent.py同步执行 Agent只读访问智慧数据库执行时发射遥测不进行反思与进化立即返回example_decoupled.pyexamples/example_decoupled.py演示脚本Phase 1 用 DoerAgent 执行任务Phase 2 用 ObserverAgent 离线学习test_decoupled.pytests/test_decoupled.py测试套件覆盖 TelemetryEvent/EventStream、DoerAgent/ObserverAgent 的结构化验证无需 API 调用verify_architecture.pyexamples/verify_architecture.py手动验证脚本无 API Key 验证全部组件与解耦数据流并校验向后兼容ARCHITECTURE_DECOUPLED.mddocs/ARCHITECTURE_DECOUPLED.md详细架构文档组件描述、数据流、使用模式与设计原则修改组件agent.py新增DoerAgent类保留SelfEvolvingAgent不动向后兼容telemetry 作为可选依赖通过try/except ImportError导入README.md补充解耦模式文档与使用示例ARCHITECTURE.md增加指向ARCHITECTURE_DECOUPLED.md的引用保留旧文档.gitignore排除telemetry_events.jsonl与observer_checkpoint.json两个运行时产物。执行阶段Doer1 次 LLM 调用立即返回代码示例from agent import DoerAgent # 初始化 Doer doer DoerAgent() # 执行任务立即返回 result doer.run(What is 25 * 4 50?) # 遥测事件自动写入事件流执行流程与源码对应对照 agent.py 的 DoerAgent.run 的实现其流程为加载智慧只读self.wisdom MemorySystem(wisdom_file)Wisdom 数据库只读访问执行查询self.act(query)调用AGENT_MODEL指定的执行模型生成响应发射遥测先后通过_emit_telemetry发射task_start与task_complete两类事件事件携带query、agent_response、success、instructions_version、conversation_id、turn_number等字段立即返回不触发任何反思或进化调用run()返回包含response、instructions_version、telemetry_emitted的字典。值得注意的是DoerAgent在保留只执行核心职责的同时其构造函数还提供了一系列可插拔的可选能力详见 agent.py 构造函数enable_prioritization优先级框架、enable_intent_detection意图检测、enable_circuit_breaker熔断器 A/B 分流、enable_constraint_engine约束引擎逻辑防火墙、enable_metadataOAD 元数据清单。这些能力均采用可选导入 失败降级策略任一模块缺失时打印警告并自动禁用不影响核心执行路径。延迟特征仅 1 次 LLM 调用即AGENT_MODEL默认gpt-4o-mini的执行调用。学习阶段Observer离线批量处理不阻塞执行代码示例from observer import ObserverAgent # 初始化 Observer observer ObserverAgent() # 处理累积的遥测事件离线 results observer.process_events() # 智慧数据库已根据学到的经验更新学习流程与源码对应对照 observer.py 的 process_events 的实现读取未处理事件基于检查点中的last_processed_timestamp通过EventStream.read_unprocessed()增量读取逐条分析执行轨迹对每个task_complete事件调用analyze_trace内部执行reflect()——用REFLECTION_MODEL默认gpt-4o-mini按正确性、完整性、清晰度、工具使用四个维度打分并生成 critique分数低于阈值则进化若score SCORE_THRESHOLD默认 0.8调用evolve()用EVOLUTION_MODEL基于 critique 重写系统指令并通过MemorySystem.update_instructions()写入智慧数据库、递增version并记录改进日志更新检查点处理完毕后将最后一条事件的timestamp写入observer_checkpoint.json并累计lessons_learned。更丰富的学习信号源码层面的进阶能力ObserverAgent并非只会对task_complete做反思打分从 observer.py 的实现可以看出它还处理三类补充学习信号静默信号Silent Signalssignal_undo用户撤销动作评为 0.0 分、critical 优先级、signal_abandonment用户中途放弃评为 0.3 分、high 优先级、signal_acceptance用户接受输出评为 1.0 分、正向强化通过analyze_signal判定并学习意图驱动评估Intent-Based Evaluation通过evaluate_conversation_by_intent对多轮会话按意图分类评估——troubleshooting 场景超过 3 轮视为失败用户被困brainstorming 场景上下文过浅视为失败相关意图字段intent_type、intent_confidence由 DoerAgent 在首轮通过IntentDetector检测并写入事件智慧策展Wisdom Curator可选启用时进化产生的指令若触发策略违规检测如安全、隐私、质量模式则创建人工审批工单而非自动应用实现 human-in-the-loop 的高层策展。process_events的返回值包含events_processed、lessons_learned、analyses、signal_stats、intent_evaluations、curator_stats等统计结构便于接入监控与告警。延迟特征离线执行不阻塞在线响应可以按 cron 或后台任务批量调度。智慧数据库与事件流的数据结构Wisdom Databasesystem_instructions.json由 MemorySystem 管理每次进化递增version并追加improvements记录{ version: 2, instructions: Current system prompt text, improvements: [ { version: 2, timestamp: 2024-01-01T12:00:00, critique: What was learned from failure, query: 触发改进的原始查询可选, response: 触发改进的原始响应可选 } ] }Event Streamtelemetry_events.jsonl由 EventStream 管理的追加式 JSONL 日志每行一条事件{event_type:task_start,timestamp:2024-01-01T12:00:00,query:...,instructions_version:1} {event_type:task_complete,timestamp:2024-01-01T12:00:01,query:...,agent_response:...,success:true,instructions_version:1}TelemetryEvent数据类telemetry.py的核心字段包括event_typetask_start、task_complete、user_feedback、signal_undo、signal_abandonment、signal_acceptance、timestamp、query、agent_response、success、user_feedback、instructions_version、metadata、signal_type、signal_context以及意图评估扩展字段conversation_id、turn_number、intent_type、intent_confidence。EventStream提供emit、read_all、read_unprocessed、clear、get_last_timestamp、get_signal_events、get_conversation_events、get_conversation_turn_count等方法支持批量读取、检查点增量消费与会话维度查询。环境变量配置两种模式共享同一组环境变量默认值以源码实际实现为准环境变量作用默认值OPENAI_API_KEYOpenAI API 密钥必需通过.env文件加载无AGENT_MODEL执行模型DoerAgent 与 SelfEvolvingAgent 均使用gpt-4o-miniREFLECTION_MODEL反思打分模型gpt-4o-miniEVOLUTION_MODEL指令进化模型gpt-4o-miniSCORE_THRESHOLD学习触发阈值分数低于该值触发进化0.8MAX_RETRIESLegacy 模式最大重试次数3从 observer.py 的源码可以看出学习侧模型通过os.getenv(REFLECTION_MODEL, gpt-4o-mini)与os.getenv(EVOLUTION_MODEL, gpt-4o-mini)独立配置这正体现了执行与学习可以使用不同模型的架构灵活性——线上执行可以用低成本低延迟模型离线学习则可以用更强的模型。关键收益低运行时延迟Doer 立即返回1 次 LLM 调用对比 Legacy 模式的 3-9 次持久学习Observer 随时间在智慧数据库中持续累积经验可扩展性Observer 可以批量处理事件学习与执行解耦后可独立水平扩展灵活性执行与学习可以使用不同的模型与资源配置异步处理学习在离线侧完成不占用用户等待时间向后兼容Legacy 模式SelfEvolvingAgent原样保留example.py依旧可用。解耦模式与 Legacy 模式架构对比方面解耦模式Legacy 模式执行延迟低1 次 LLM 调用高1-3 轮迭代共 3-9 次 LLM 调用学习方式异步、离线同步、执行期间重试无从遥测中学习最多 3 次立即重试用户等待仅执行执行 反思 进化可扩展性高批量处理低按请求模型选择执行与学习可分别配置全程同一模型使用方式快速开始解耦模式# 安装依赖 pip install -r requirements.txt # 配置环境变量在 self-evaluating 目录下 cp .env.example .env # 编辑 .env填入 OPENAI_API_KEY # 运行解耦示例 python example_decoupled.py手动使用# Phase 1: 执行快速 from agent import DoerAgent doer DoerAgent() result doer.run(query) # Phase 2: 学习离线 from observer import ObserverAgent observer ObserverAgent() observer.process_events()生产推荐模式连续执行 定时学习# Web 服务或 API 侧——快速响应 doer DoerAgent() response doer.run(user_query) # 立即返回 return response # Cron 任务或后台 worker——离线学习 observer ObserverAgent() observer.process_events() # 批量处理遥测Legacy 模式仍然可用python example.py无 API Key 的验证方式解耦架构的验证不依赖真实 LLM 调用仓库提供了两条无成本验证路径结构化测试套件tests/test_decoupled.py覆盖 TelemetryEvent 的序列化/反序列化、EventStream 的发射/全量读取/增量读取/末时间戳/清空、DoerAgent 与 ObserverAgent 的初始化与检查点持久化/加载全程不发起 API 调用手动验证脚本examples/verify_architecture.py六步验证流程——遥测系统读写、DoerAgent 初始化、ObserverAgent 初始化、事件流读取、五大组件结构核对、SelfEvolvingAgent向后兼容性确认。运行方式在 self-evaluating 目录 下python tests/test_decoupled.py python examples/verify_architecture.py扩展点与设计原则从 ARCHITECTURE_DECOUPLED.md 可以归纳出系统的七大设计原则关注点分离执行与学习解耦、低延迟关键路径开销最小化、持久记忆智慧随时间累积、可扩展学习可批量与定时、灵活不同阶段可用不同模型/资源、向后兼容Legacy 模式保留、可观测遥测提供完整审计轨迹。同时系统预留了明确的扩展点文件存储可替换为数据库可为遥测添加自定义分析器可实现替代学习算法可按条件选择模型可为AgentTools增加更多工具可将用户反馈接入学习回路还可运行多个 Observer 实现分布式并行处理。安全与结论仓库的实现总结明确记录了安全验证结果未发现漏洞、全部安全检查通过、无敏感数据暴露、API 密钥通过环境变量妥善处理dotenv加载.env源码中未硬编码密钥。总而言之该实现通过执行与学习解耦的架构演进在保持SelfEvolvingAgent完整向后兼容的前提下将在线路径的 LLM 调用压缩到 1 次同时把反思、进化、静默信号、意图评估、策略策展等学习能力全部沉淀到离线侧配合追加式事件流与检查点机制形成了一套可调度、可扩展、可观测、带完整测试与验证脚本的生产级自进化 Agent 参考实现。若要接入真实 OpenAI API只需创建.env写入OPENAI_API_KEY运行python example_decoupled.py即可观察 DoerAgent 快速执行、ObserverAgent 离线学习并持续累积智慧版本的全过程。【免费下载链接】agent-governance-toolkitAI Agent Governance Toolkit — Policy enforcement, zero-trust identity, execution sandboxing, and reliability engineering for autonomous AI agents. Covers 10/10 OWASP Agentic Top 10.项目地址: https://gitcode.com/GitHub_Trending/ag/agent-governance-toolkit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表