拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Keep 告警管理平台实战:Docker 5 分钟体验与 K8s 生产部署

Keep 告警管理平台实战Docker 5 分钟体验与 K8s 生产部署【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨两点一次失败的发布让告警像多米诺骨牌一样倒下连接池报警、接口延迟飙升、同一台机器的磁盘告警重复刷了几十遍。你在 Datadog、Prometheus 看板和 Slack 事件频道之间来回切换越拼越乱。Keep 告警管理平台要解决的就是这件事——把散落在各监控工具里的告警收进同一个面板先去重、再关联然后按工作流自动处理。它是开源的 AIOps 告警管理方案支持从 Docker 单机到 Kubernetes 集群的部署。Keep 解决什么按运维的真实痛点拆Keep 把自己定位成监控工具的 GitHub Actions告警通过 provider 流进平台工作流负责自动响应。对照日常遇到的四类问题看告警风暴与重复告警同源告警按指纹去重面板上只保留一条关联规则把相互相关的告警聚合成一个事件几十条同一根因的告警不会各自占一行。根因定位困难服务拓扑视图把服务间的依赖关系画成图AI 关联功能再把一批告警读成一个带摘要的事件帮助判断问题从哪条链路开始。响应依赖人肉工作流是声明式 YAML由触发器、取数步骤和动作组成写好之后 7x24 小时自动执行不依赖值班人员的手速。工具割裂与 100 多个监控、工单、通知工具双向集成告警可以写回源系统处理结果也能带回去。Docker 5 分钟体验步骤最轻量的部署形态是 Docker Compose共 3 个容器keep-backendFastAPI 服务提供 API 并执行工作流、keep-frontendNext.js 界面、keep-websocket-serverSoketi负责告警变化的实时推送。默认docker-compose.yml使用AUTH_TYPENO_AUTH启动后无需登录即可访问需要账号体系时换用docker-compose-with-auth.yml默认账号与密码均为 keep。git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker-compose up -d验证方式浏览器打开http://localhost:3000应能看到 Keep 界面后端 API 监听 8080 端口。随后在 Providers 页接入一个监控工具Alerts 页出现同步过来的告警即说明链路已通。服务清单与环境变量说明见 Docker 部署文档。功能深潜四个值得花时间试的功能统一告警面板与告警丰富化面板是所有告警的落点按严重程度、状态、来源、服务筛选排序点开一行可以看到完整上下文。告警入库时还能配置提取规则从原始 payload 里抽出字段如 incident id、主机名挂到告警上方便后续筛选和工作流引用。受益者是值班工程师告警响起时不用再先想这事该去哪个工具里看。服务拓扑看告警落在哪条依赖链上拓扑视图把服务依赖关系画成一张图告警来源标注在图上。上游数据库告警触发时能在图上直接看到受影响哪些下游服务而不必靠记忆拼调用链。对排障来说这比翻架构文档快。AI 告警关联把几十条告警读成一个事件告警风暴时人很难逐条读完上百条告警。Keep 用 LLM 分批阅读告警识别哪些属于同一事件并聚合同时生成摘要也提供半自动模式AI 先给出关联建议人工确认后沉淀为规则。首次体验时建议先接入 Datadog 这类告警量大的工具再观察关联页的聚合效果详见 AI 关联文档。自然语言工作流描述需求直接生成 YAML手写工作流 YAML 有门槛。AI 工作流助手支持用自然语言描述需求比如收到 Sentry 的 critical 告警就建 Jira 工单并通知对应 Slack 频道它会生成完整的工作流配置可直接保存。保存前可先手动执行一次验证步骤是否正确之后再查看每次执行的历史与输入输出。走向生产分档部署路径验证与开发环境继续用 Docker Compose 即可数据存放在挂载的 state 目录SQLite 与文件形式密钥。长期运行的环境至少把DATABASE_CONNECTION_STRING指到 Postgres并替换默认的 JWT 与登录密钥完整变量说明见 部署配置文档。生产环境官方推荐用 Helm 部署到 Kubernetes由 chart 统一管理后端、前端、websocket 与数据库组件。helm repo add keep https://keephq.github.io/helm-charts helm repo update kubectl create namespace keep helm install keep keep/keep -n keep高可用关键项后端跑多副本、数据库开启持久化、通过 ingress 暴露入口ingress-nginx 与 HAProxy 均可。可观测性方面通过OTEL_EXPORTER_OTLP_ENDPOINT指向 OpenTelemetry Collector 即可接入仓库otel-shared/目录提供了现成的 collector 配置。安装细节见 K8s 安装文档性能与压测参考 监控 和 压力测试 两篇。生态扩展100 Provider 与工作流Provider 按用途分类可观测工具Datadog、Prometheus、Grafana、Elastic、Splunk、云监控AWS CloudWatch、Azure Monitor、GCP Monitoring、值班与事件PagerDuty、OpsGenie、Grafana OnCall、Incident.io、工单Jira、GitLab、Linear、通知Slack、Teams、Telegram、SMTP、ntfy以及 OpenAI、Anthropic、Ollama、DeepSeek 等 AI 后端和 MySQL、PostgreSQL、ClickHouse 等数据源。完整清单见 provider 列表。工作流是声明式 YAML由triggers告警到达、定时间隔、手动、steps取数与丰富告警和actions建工单、发消息、调 API三段组成。examples/workflows/ 目录有一百多个现成示例例如自动解决超过一小时未更新的陈旧告警、告警触发后创建 Jira 工单、查询 VictoriaMetrics 指标再转成告警。建议直接改一个现有示例的 provider 与过滤条件而不是从零写。读完去做四条可验证的行动用 Docker Compose 启动打开http://localhost:3000确认界面可访问、8080 端口有后端响应。接入一个监控工具Prometheus 或 Datadog 均可确认 Alerts 页出现告警。从示例复制一个 interval 工作流如 resolve_old_alerts.yml保存后手动执行一次在历史里确认有记录。准备上生产时用 Helm 在 K8s 部署一套检查后端副本数与数据库持久化是否生效。Keep 把告警管理里最费人力的部分——去重、关联、自动响应——收进了一个开源仓库文档与示例都相当齐整。上面四条做完你手上就有一个可验证的实验环境多租户认证、性能调优这类深度改造可以按团队节奏逐步推进。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门