Руководство по настройке алертов в Prometheus и Alertmanager опубликовано
RukInDaHouse опубликовал руководство по настройке алертов в Prometheus, Alertmanager и nxs-anomaly. Материал разбирает типичную ситуацию: критичный сервис упал, система мониторинга сработала, но никто не начал исправление, потому что инженеры не поняли, кто отвечает.
В руководстве показан полный путь ошибки HTTP 500 — от счётчика приложения через PromQL до webhook в систему реагирования. Автор разбирает ошибки маршрутизации алертов, объясняет, почему повторная отправка не заменяет эскалацию, и использует открытый проект nxs-anomaly для настройки дежурств.
Источник: Хабр — всё
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.