拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Keep 开源 AIOps 平台实战指南:从接入监控警报到自动化处理的完整流程

Keep 开源 AIOps 平台实战指南从接入监控警报到自动化处理的完整流程【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨三点一台数据库挂掉Prometheus、Datadog、Grafana 各自往值班群里甩了十几条格式不一的警报而真正的问题只有一个。Keep 就是为这种场景设计的开源 AIOps 平台它把分散在各监控工具里的警报收进一个统一的警报管理界面做去重、关联再按你定义的规则自动执行响应动作比如发通知、开工单、调服务。一句话定位Keep 是一个警报的瑞士军刀——单点查看所有告警、双向集成监控工具、用 YAML 工作流做自动化并内置 AI 辅助能力。它填补了有 Prometheus 看指标、有 Grafana 看面板但没有开源工具统一管告警的空白且所有配置都可以作为代码管理。一条命令部署 Keep仓库提供了现成的 Docker Compose 编排三个服务FastAPI 后端、Next.js 前端、Soketi 实时推送服务全部容器化git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker compose up -d第一条命令拉取代码第二条进入目录第三条启动全部容器。起来之后浏览器打开前端地址即可进入告警列表页官方部署细节见 docs/deployment/docker.mdx生产环境还支持 Kubernetes、AWS ECS 和 OpenShift 部署。告警表格是 Keep 的主界面所有监控源的警报汇聚到这里。左侧可按来源、服务、严重级别等维度切片搜索栏支持 CEL 表达式做复杂过滤过滤条件还能保存为可复用的预设列和主题都可以自定义适合不同值班场景各存一套视图。接入第一个监控源Push 与 Pull 两种方式Keep 用 Provider提供商的概念对接外部系统已内置 100 多个Prometheus、Datadog、CloudWatch、Sentry、Zabbix 这类观测工具Slack、Telegram、SMTP 这类通知渠道以及 Jira、ServiceNow 这类工单系统完整清单见 docs/providers/overview.md。接入后警报进入 Keep 有两条路Push推荐在 Provider 设置里勾选Install WebhookKeep 会自动去对方系统里配好 webhook。比如连接 Grafana 时它会自动创建一个 Webhook contact point 和通知策略把告警实时推给 Keep。官方文档明确建议优先用 Push因为只有推送链路能完整走通工作流自动化。Pull拉取勾选Pulling Enabled后Keep 按KEEP_PULL_INTERVAL设定的间隔主动拉取历史告警默认回看 7 天。适合先快速把存量告警搬进来看看不适合当主链路。降噪去重规则把 20 条警报压成 1 条警报进表之后第一步通常是降噪。Keep 的去重分两种模式机制见 docs/overview/deduplication.mdx部分去重指定指纹字段fingerprint fields字段值相同的警报归并为一条字段差异会做更新合并。每个 Provider 都自带针对其告警格式预设好的指纹字段接入即生效。完全去重除忽略字段外所有字段完全相同的警报直接丢弃防止同一条告警反复刷进来拖垮系统。在去重之上Keep 还有一个关联引擎Correlation Engine用条件规则把多条相关警报合并成一个 incident。例如来源是 Prometheus 且严重级别为 critical的警报自动归入高优先级事件事件名还支持模板变量像Service Issue on {{alert.labels.host}}这样自动拼出受影响的主机列表。写第一个工作流让警报自己跑起来响应Keep 的工作流是声明式 YAML 文件官方把它比作监控工具的 GitHub Actions。一个最小可用的例子来自 examples/workflows/workflow: id: cloudwatch-slack-notifier triggers: - type: alert filters: - key: source value: cloudwatch actions: - name: trigger-slack provider: type: slack config: {{ providers.slack-prod }} with: message: Got alarm from aws cloudwatch! {{ alert.name }}这段配置的意思是只要有一条来源是 CloudWatch 的警报进来就往指定 Slack 频道发一条带警报名的消息。触发器支持 alert、incident、定时interval和手动四种类型动作可以用if条件分支和foreach循环控制流向还能通过enrich_alert把动作结果比如 Jira 工单号回写到警报上。仓库的 examples/workflows/ 目录里有 100 多个可直接照抄的样例语法细节在 docs/workflows/overview.mdx。如果不想手写 YAML开源版带有一个实验性的 AI 工作流助手在 Workflows 页面点 Create Workflow进入聊天界面用自然语言描述需求它生成草稿、你确认后再应用属于人在回路的模式改完可以落回标准 YAML 继续维护。进阶拓扑图、维护窗口与多团队管控跑顺之后值得关注的几个方向服务拓扑基于 Datadog、PagerDuty、Cilium、Grafana 等数据源画出服务依赖图故障发生时能快速看出一个节点挂了会波及哪些下游辅助定位根因。维护窗口窗口期内来自指定源的警报自动静默避免发布窗口被误报吵醒。告警富化Enrichment用 HTTP、Bash、Python、OpenAI 等 Provider 给警报补充上下文比如查一次 CMDB、让大模型摘要一下故障背景。企业能力SSOSAML/OIDC/LDAP、RBAC 权限、审计以及面向水平扩展的压力测试文档小团队用单机 Compose大团队走 K8s 部署同一套代码库。接下来看哪里文档站以docs/目录为主建议按这个顺序读项目介绍与理念 → 使用场景合集 → Provider 总览再按自己接的第一个监控工具找到对应 provider 文档docs/providers/documentation/ 下每个工具一篇含配置截图。需要写复杂工作流时examples/workflows/ 里的真实样例比语法文档更直观对告警评估、事件管理等专项概念docs/overview/ 下也有对应的专题页面。Keep 的源码结构同样清晰keep/providers/ 放全部 Provider 实现keep/api/ 是后端路由keep-ui/ 是前端想给某个 Provider 提补丁时可以直接从对应目录入手。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门