ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OpenSRE 测试体系完整指南:如何为 AI SRE 智能体做端到端与合成测试

OpenSRE 测试体系完整指南:如何为 AI SRE 智能体做端到端与合成测试 OpenSRE 测试体系完整指南如何为 AI SRE 智能体做端到端与合成测试【免费下载链接】opensreBuild your own AI SRE agents. The open source toolkit for the AI era.项目地址: https://gitcode.com/GitHub_Trending/op/opensreOpenSRE 是一个构建自有 AI SRE 智能体AI Site Reliability Engineering Agent的开源工具包让 AI 值班工程师自动排查告警、查询监控数据并修复故障。正因为智能体的行为高度依赖 LLM 与外部服务它的测试体系格外有借鉴意义如何用真实端到端测试 合成测试语料把一个会思考的运维智能体测得又快又稳本文带你逐层拆解 OpenSRE 的测试架构。 三层测试架构一览OpenSRE 的测试代码统一放在tests/目录下按离真实环境的距离划分为三层官方布局说明见 tests/README.md层级位置特点单元 集成测试tests/domain/cli/、tools/、integrations/、core/等离线可跑、毫秒级反馈覆盖 1000 测试文件真实端到端测试tests/e2e/对接真实云服务零 mock合成基准测试tests/benchmarks/452 个合成运维场景语料量化智能体能力这种分层的核心思想是越靠近生产的行为越要用真实环境验证越靠近内部逻辑越要用高速单测兜底。 真实 E2E 测试三条零 Mock 设计原则tests/e2e/下包含install、quickstart、grafana_validation、tempo、incident_io、posthog、trello等场景。OpenSRE 智能体的核心能力是查询 Grafana 监控数据因此grafana_validation/场景直接对真实 Grafana Cloud 实例发起查询验证从告警进入到数据回传的完整链路场景设计规则写在 tests/e2e/AGENTS.md值得所有 AI Agent 项目借鉴零 Mock 原则测试必须驱动真实服务真实安装器、Grafana Cloud、Docker 构建mock 掉的服务只会让智能体对着假数据自嗨业务逻辑纯净测试驱动的工作负载代码要与测试编排代码隔离让它看起来像真实客户代码环境门控 响亮跳过每个真实场景用env_requirements.py声明所需凭据缺失时带着清晰原因跳过——没有密钥的 CI 保持绿色有密钥的运行则绝不掩盖失败。目录命名同样有纪律tests/e2e/场景名/描述系统 负载环境相关测试文件必须命名为test_local.py或test_cloud.py。️ 测试隔离AI Agent 项目最容易踩的坑LLM 智能体的测试比普通代码更脏它会写配置文件、改环境变量、连系统钥匙串。OpenSRE 在根 tests/conftest.py 中用一组autouse fixture给每个测试穿上防护服环境变量快照恢复部分代码会在运行时os.environ.pop供应商 API Key不隔离会跨测试泄漏家目录重定向把~/.opensre/下的配置与凭据文件默认重定向到tmp_path防止测试污染开发者的真实配置这是一次真实回归事故后补上的防线;观测通道复位每个测试后恢复全局 trace store 与 LLM 观测 sink避免 xdist 并行下的串扰空集合硬失败pytest_sessionfinish钩子确保0 个测试被选中时 CI 直接红掉杜绝绿了但啥也没跑。再配合 pytest.ini 中的全局600 秒超时超时自动 dump 所有线程栈死锁可诊断和integration/live_llm/e2e/live_install四级 marker测试集在本地与 CI 中都能精确裁剪。 合成测试语料不靠真实事故也能测智能体真实故障不可能天天发生OpenSRE 的答案是合成测试基准tests/benchmarks/ 内置了 452 个场景的云运维基准语料cloud-ops-bench可本地拉取后用make download-cloudopsbench-hf一键准备。运行方式极简——先用--dev冒烟 5 个场景再全量跑产物是机器可读的report.json加人类可读的 HTML 报告并附带代码 SHA、配置内容等溯源信息。合成语料的妙处在于可重复、可回归LLM 升级或提示词修改后跑一遍基准就能量化智能体的能力变化这是AI 智能体如何做回归测试的实用范式。⚡ 快速上手四条命令跑通全体系在 Makefile 中测试入口被收敛为几条清晰命令目标命令何时使用带覆盖率的默认单测套件make test-cov本地第一站xdist 并行无需真实基础设施全量回归CI 同款make test-full大范围本地回归真实集成校验make verify-integrations改动集成后必跑分支增量测试make test-scope只跑与改动文件相关的测试CI 侧还有一个精巧设计——按文件耗时快照分片tests/ci_sharding.py 读取.github/ci/pytest-file-durations.json中每个测试文件的耗时记录用最长处理时间优先 最少总耗时组的贪心策略把文件均匀分片到多个 CI 并行任务且对快照过期14 天、缺失文件占比过高都有保护阈值。仓库卫生检查命名、导入边界、架构引用则独立放在tests/github_ci/见 tests/github_ci/test_ci_sharding.py 的守护用例。✅ 小结可复制的 AI Agent 测试方法论分层单测保速度、真实 E2E 保保真、合成语料保回归零 Mock智能体能力必须用生产级真实数据验证强隔离autouse fixture 兜住环境、文件、凭据三类污染源响亮门控缺凭据就带原因跳过绝不静默绿灯量化基准合成语料 可溯源报告让 LLM 能力变化可度量。如果你想亲手体验这套 AI SRE 智能体可通过安装脚本或直接克隆仓库开始git clone https://gitcode.com/GitHub_Trending/op/opensre cd opensre make install make test-cov参考阅读tests/e2e/AGENTS.md、tests/benchmarks/README.md、tests/README.md【免费下载链接】opensreBuild your own AI SRE agents. The open source toolkit for the AI era.项目地址: https://gitcode.com/GitHub_Trending/op/opensre创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表