
Keep多源告警聚合与自动化响应的AIOps平台【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keepPrometheus、Zabbix、Datadog 各发各的告警值班群一天几百条消息真正的故障淹没在重复通知里。Keep 是一个开源的 AIOps 与告警管理平台把多监控源的告警汇到一处做去重、富化、关联和自动化响应。它解决的核心问题就一个把告警洪流变成可处理的工单流。 Keep 是什么定位与能力边界Keep 把来自不同监控系统的告警统一接入在同一个界面里做过滤、去重、富化与关联并能双向同步回各监控系统。本质上是一个告警总线 工作流引擎而不是又一套监控系统。核心能力多源告警聚合100 个 Provider 接入 Prometheus、Datadog、Zabbix、CloudWatch 等告警去重与富化按指纹字段识别重复告警自动补充上下文告警关联把相关告警归并成事件incident支持 AI 辅助关联YAML 工作流触发器 条件 动作自动化建单、通知、重启双向集成不仅拉取告警也能把处置状态同步回监控源能力边界不替代 Prometheus 的指标采集不做日志存储与查询。如果只需要看板展示而不做告警治理它偏重了。 从克隆到看到第一条告警Keep 用 Docker Compose 一键拉起包含前端3000 端口、后端8080 端口和 WebSocket 服务默认 SQLite 存数据无需额外准备数据库git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker-compose up -d浏览器打开 http://localhost:3000 进入界面。两个常见失败点3000/8080 端口被占用时改docker-compose.common.yml里的端口映射镜像托管在境外仓库网络慢的环境可先手动拉好镜像再启动。第一条告警怎么进 Keep设置页的 Webhook 选项卡提供接入 URL 和 API Key把各监控系统的告警转发过去即可有原生 Provider 的监控源则直接配置双向同步免去写转发脚本。️ 三个高频场景怎么解决重复告警怎么归并同一条数据库连接失败告警每 5 分钟重发一次值班看到的是 12 条消息而不是 1 个问题。Keep 的去重分两层部分去重按指纹字段如 service error_message把同类告警归成一组字段值随最新告警更新完整去重直接丢弃除忽略字段外完全相同的重复事件。每个 Provider 自带预置指纹规则开箱可用去重规则页可改字段组合。自动化响应怎么配Keep 把工作流定义为 YAML触发器告警/事件/定时/手动 步骤富化取数 动作建单/通知/执行命令。不想手写 YAMLAI 助手支持用自然语言描述需求直接生成工作流右侧画布同步显示触发器与步骤结构最小工作流片段——把告警转发到 Slackworkflow: id: critical-to-slack triggers: - type: alert actions: - provider: {type: slack}示例库里有 100 多个现成工作流建 Jira 单、发 Slack、重启 K8s 服务等改改参数就能跑见 examples/workflows/。故障影响面怎么定位告警归并之后还需要知道这次故障波及哪些服务。Keep 的服务拓扑把告警和组件依赖关系画在同一张图上红色标记落在哪个节点影响范围一眼可见排查时不必逐条翻告警⚙️ 第一次跑通后最该调的 4 件事先接 1~2 个监控源别一次全接多源同接时指纹字段冲突会放大去重噪音先把流量最大的源跑稳。按业务字段调整去重指纹默认的 service 消息字段对多数源够用但同一服务在不同环境会被合并成一条指纹里加上 environment 或 cluster 字段可以避免误合并。给工作流动作加 if 条件无条件的动作每次触发都会执行只在 severity 为 critical 或 service 匹配时才建单通知量立刻降一个数量级。时间统一用 UTC多源告警按 lastReceived 排序和去重时区混用会导致时间线错乱。新工作流建议先用列表页的 Run 按钮手动触发一次确认动作输出符合预期再交给触发器自动跑 上下游生态Provider 按用途分几类完整列表见 docs/providers/监控与日志源Prometheus、Datadog、Grafana、Zabbix、CloudWatch、Elastic、Splunk、VictoriaMetrics通知渠道Slack、Teams、Telegram、SMTP/SendGrid 邮件、ntfy、Twilio协作与工单Jira、GitHub、GitLab、ServiceNow、Linear、Trello事件管理PagerDuty、Opsgenie、Grafana OnCall、Incident.io云与容器AWS/EKS/AKS/GKE、Kubernetes、OpenShift、ArgoCD、FluxAI 后端OpenAI、Anthropic、Ollama、vLLM支持本地部署见 docs/deployment/local-llm/部署支持 Docker Compose、Kubernetes、AWS ECS生产环境前建议看 docs/deployment/含 SSO/LDAP 认证、密钥存储与压测文档。社区入口是官方 SlackREADME 内有徽章链接。 选型参考适合多监控源并存、告警量大到人工无法逐条看的团队已有工单和值班系统、需要把告警自动流转进去的场景希望在自建环境部署、数据不出内网的团队。不适合只需要监控看板而不做告警治理的团队告警量本身很小一天几条的场景接入成本大于收益指望 Keep 直接采集指标的团队它只做治理不做采集。对比PagerDuty、Opsgenie 这类商业事件管理产品开箱管值班排班但私有化部署和多源去重的灵活度不如 KeepKeep 偏告警治理与自动化值班调度可再配合 Grafana OnCall 等补齐。如果团队现在同时接了 Prometheus 和 Datadog第一步先把这两个 Provider 接上配好各自指纹字段观察一两天去重效果再决定要不要上关联规则。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考