监控该看什么:服务器、应用与业务三层指标清单
监控面板上一堆数字,到底该盯哪些?本文把指标分成三层:服务器层(CPU/内存/磁盘/带宽)、应用层(请求量/错误率/延迟)、业务层(转化/注册/订单),逐项给出含义与典型告警阈值,并附一张可直接落地用的指标清单表。
建立覆盖外部可用性、基础资源、应用日志和业务指标的网站监控体系,并用 SLO、告警与复盘闭环持续改进。
监控面板上一堆数字,到底该盯哪些?本文把指标分成三层:服务器层(CPU/内存/磁盘/带宽)、应用层(请求量/错误率/延迟)、业务层(转化/注册/订单),逐项给出含义与典型告警阈值,并附一张可直接落地用的指标清单表。
告警太多,值班的人被"狼来了"磨到麻木,真出事反而没人理;告警太少,故障藏到用户投诉才发现。好的告警设计要同时做到"不吵"和"不漏"。本文讲清阈值怎么定、P1-P4 怎么分级、怎么避免告警疲劳,并给出可直接照抄的告警规则示例。
合成监控通过全球探针主动模拟用户请求与关键业务流程,是真实用户监控之外的第一道防线。本文讲解可用性检查、浏览器事务脚本与多地点告警的落地方法。
SLO 不是指标墙上的数字,而是产品与工程的"共同契约"。本文结合 Google SRE 方法论,讲解 SLI 选择、SLO 目标设定、错误预算与燃烧率告警的落地步骤。
好的告警规则是"先抑制噪音、再精准通知"。本文基于 Prometheus 官方文档,讲解 PromQL 规则表达式、Alertmanager 分组路由与抑制静默的设计方法。
集中式日志查询是故障定位的加速器。本文对比 ELK 与 Grafana Loki 两种日志聚合方案,讲解标签设计、LogQL 查询与从日志生成指标的实践方法。
真实用户监控(RUM)把前端体验变成可观测数据。本文基于 Datadog RUM 与 web.dev 官方文档,讲解 Core Web Vitals 采集、会话分析与前端告警的落地方法。
AWS、Azure、Google Cloud 各有一套原生监控体系。本文对比 CloudWatch、Azure Monitor 与 Google Cloud Monitoring 的能力差异,帮你按云环境选对监控方案。
当请求穿越多个服务,只有分布式追踪能看到完整路径。本文基于 OpenTelemetry 官方文档,讲解 Span、链路上下文、上下文传播与采样策略的落地方法。
告警疲劳会让人在真正的事故中反应迟钝。本文结合 Google SRE 的 On-call 理念,讲解告警分级、通知降噪与值班机制的设计方法。
Grafana Cloud 成本归因扩展到合成监控与 k6 性能测试:通过标签把指标、日志、链路、监控检查与压测费用按团队/环境/服务拆分,支撑 chargeback 与 showback。
2026 年 6 月 Grafana 13.1 发布:Git Sync 支持根目录同步与 GPG 签名提交、Grafana Assistant 覆盖更多数据源、区块级变量 GA、查询编辑器重构进入公开预览。