Observability Alerts
Every page should map to user pain or imminent pain and a runbook. Symptom-based beats cause-based flapping.
Workflow
- User journeys and SLOs to protect.
- Alert on symptoms (error rate, latency, freshness) first.
- Thresholds, windows, and multi-window burn if SLO-based.
- Severity → route (page vs ticket vs slack).
- Runbook link mandatory for paging alerts.
- Dedup, group, inhibit flapping.
- Review noise weekly; delete or tune.
Output format
## Alert: <name>
**Symptom:** …
**Condition:** …
**Severity / route:** …
**Runbook:** …
**Owners:** …
**Noise risks:** …
Rules
- No pages without owners and runbooks.
- Avoid CPU-only alerts as primary for apps.
- Test alerts (fire drill) occasionally.
- Night pages need higher bar.
- Document dependencies to reduce stampede pages.
Edge cases
- Batch jobs: freshness not uptime.
- Multi-tenant: avoid one-tenant storms paging everyone without scope.
- Synthetic checks: complement, not sole signal.