fix(observability): healthcheck Alertmanager стучится по правильному пути — контейнер был вечно unhealthy #3134
No reviewers
Labels
No labels
Fable 5 ревью
GG-форсайт
admin
analytics
auth
automation
bug
business
chore
ci
compliance
data
data-moat
docs
duplicate
dx
enhancement
feedback/max
generative
needs-discussion
needs-human
observability
pause-bots
performance
priority/p0
priority/p1
priority/p2
priority/p3
scope/backend
scope/db
scope/devops
scope/frontend
scope/qa
scrapers
security
site-finder
stage/1
stage/2
status/blocked
status/done
status/needs-analysis
status/needs-fix
status/qa
status/ready
status/review
status/wip
tech-debt
tradein
ux
week ревью 1
wontfix
ИРД
вторичка
No milestone
No project
No assignees
1 participant
Notifications
Due date
No due date set.
Dependencies
No dependencies set.
Reference: lekss361/gendesign#3134
Loading…
Add table
Reference in a new issue
No description provided.
Delete branch "fix/3078-alertmanager-healthcheck-prefix"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
Найдено при сквозной проверке прода после включения алертов.
Замер
--web.external-url=https://metrics.gendsgn.ru/alertmanagerзаставляет Alertmanager обслуживать всё под этим префиксом, включая служебные ручки. Проверено внутри контейнера:Контейнер при этом работал и рассылал алерты — 45 минут аптайма, конфиг загружен, кластер собрался. Но docker держал его
unhealthyбессрочно.Почему это стоит чинить, а не игнорировать
Само по себе безобидно — и ровно поэтому вредно. Статус, который всегда красный, приучают не смотреть; когда он покраснеет по делу, разницы никто не заметит.
Плюс прямой риск: любая автоматика вида «перезапусти нездоровый контейнер» — а такие правила заводят рано или поздно — устроила бы из этого вечный перезапуск канала оповещений. То есть выбивала бы именно то, что обязано работать в аварию.
Refs #3078
--web.external-url=…/alertmanager заставляет Alertmanager обслуживать ВСЁ под этим префиксом, включая служебные ручки. Проверено на проде: /-/healthy → 404 Not Found /alertmanager/-/healthy → OK Контейнер при этом работал и рассылал алерты, но docker держал его unhealthy бессрочно. Само по себе безобидно — и ровно поэтому вредно: статус, который всегда красный, приучают не смотреть. А любая автоматика вида «перезапусти нездоровое» устроила бы из этого вечный перезапуск канала оповещений — то есть выбивала бы именно то, что должно работать в аварию.