ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Keep 部署全解:从 5 分钟上手到生产级的开源 AIOps 告警管理平台

Keep 部署全解:从 5 分钟上手到生产级的开源 AIOps 告警管理平台 Keep 部署全解从 5 分钟上手到生产级的开源 AIOps 告警管理平台【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨两点值班手机震动。同一条数据库连接池告警已经在 Slack 里刷了 40 遍Grafana、Prometheus、CloudWatch 三个面板同时在闪你分不清哪条是根因哪条只是连带噪音。如果你也经历过在七八个监控平台之间来回切换排查一个问题那你需要的是一套开源告警管理方案Keep 就是一个开源 AIOps 告警管理平台把各工具的告警拉进同一个面板再做收敛、关联和自动化。一、5 分钟从 Docker 到第一条告警 ⏱️先把它跑起来。克隆仓库然后直接启动容器git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker compose up -d两条命令会拉起前端、后端和 WebSocket 三个服务。起来之后浏览器打开 http://localhost:3000 就能进面板。Keep 默认这份 compose 用的是 AUTH_TYPENO_AUTH不需要登录想要账号体系就换用仓库里的 docker-compose-with-auth.yml默认账号密码是 keep / keep。进入面板后接入你的第一个 Provider。最简单的是 Webhook 类型把 Keep 给的接收 URL 配到任何监控工具的告警出口上告警一进来它就会直接出现在左侧 Feed。如果你在用 Prometheus也可以直接接 Prometheus Provider它会把历史告警一次性拉进来省得等。二、它到底能帮你做什么四个高频场景拆解 2.1 告警风暴收敛一次节点故障监控系统可能一口气发出 200 条告警。Keep 用去重规则和关联规则把它们合并成少数几个事件你看到的是事件而不是刷屏。左侧面板还能按严重度、来源、状态继续过滤把无关的 noise 直接筛掉。2.2 用自然语言建自动化流程写工作流不用先背 YAML 语法。Keep 内置 AI 工作流助手你在对话框里说每分钟查一次 CloudWatch日志里出现 error 就发到 Slack它会拆成触发器、条件、动作三步直接生成工作流你确认参数后点 Test Run 就能验证。2.3 根因快速定位新告警进来时Keep 会基于你自己的历史告警数据训练模型判断它应该归入已有事件还是新建事件。执行日志里能直接看到判断结果比如NetworkLatencyHigh被归到了Application issue caused by DB load这个事件下根因一眼可见。2.4 跨服务影响面评估把服务和依赖关系接入 Keep 的 Service Topology一张拓扑图就画出组件间的调用路径以及每个节点上正在响的告警。某个组件挂了你不用逐个面板点开看图上直接显示哪些下游服务会被波及。三、从开发机到生产部署与调优路径 ️跑完第一章的 compose打开 3000 端口看到的就是这样一个主界面左侧是告警 Feed中间是列表右侧是筛选面板。生产路径按四个阶段推进。阶段一Docker Compose 验证。就是上面这套。上生产前改两处把前端的 AUTH_TYPENO_AUTH 换成 DB再给后端配一个真实的 JWT 密钥state/ 数据目录挂到持久化存储避免容器重建丢数据。阶段二Helm 上 K8s。用官方 chart 安装helm repo add keephq https://keephq.github.io/helm-charts helm install keep keephq/keep -n keep --create-namespace第二条命令顺带建命名空间并完成部署副本数和资源默认即可后续按需覆盖。阶段三高可用与资源规划。后端建议三副本values 片段如下backend: replicaCount: 3 resources: limits: memory: 2Gi cpu: 1000m只改 replicaCount 和资源上下限改多少取决于你的日告警量其余项保持默认即可。阶段四可观测性接入。把 OTLP 指向你自己的 Collectorbackend: env: - name: OTEL_EXPORTER_OTLP_ENDPOINT value: http://otel-collector:4317value 换成你集群里 Collector 的实际地址Keep 后端的 trace 和指标就会发过去仓库里还有一份带完整观测栈的 docker-compose-with-otel.yaml 可以对照参考。四、接入你的监控栈生态与扩展 Keep 目前集成 100 多个工具按类型一句话带过云监控CloudWatch、GCP Monitoring、Azure Monitor、APMDatadog、New Relic、Dynatrace、日志Splunk、Grafana Loki、Elastic、通知渠道Slack、Teams、SMTP、Telegram、AI 后端OpenAI、Anthropic、Ollama。说白了不管你用哪种监控工具基本都能把告警接进 Keep处理结果也能回写源工具。扩展性最强的是工作流。比如 Sentry 的 critical 告警来了就自动通知 Slackworkflow: id: sentry-critical-slack triggers: - type: alert filters: - key: source value: sentry - key: severity value: critical actions: - name: notify-slack provider: type: slack config: {{ providers.slack }} # 换成你配置好的 Slack Provider with: message: Critical alert: {{ alert.name }}要改的就两处filters 里的 source 换成你的监控工具名providers.slack 换成你实际配置的 Provider 名。仓库的 examples/workflows/ 目录里有一百多个现成例子建 Jira 工单、事件升级、定时巡检都有照抄一个改字段就能用。想深入的话看三个入口工作流语法文档讲全量语法examples/workflows/是示例库docs/providers/是所有 Provider 的接入说明。如果你有多个监控工具却没有统一告警入口Keep 就是干这个的。今晚就照第一章那两条命令在本地跑起来接上你的第一个监控工具。明早打开面板告警应该已经在里面了。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表