fix(ops): убрать Watchdog из человеческой ленты + эскалация по длительности #3589

Merged
bot-backend merged 3 commits from fix/alert-noise-and-escalation into main 2026-09-17 13:54:03 +00:00

3 commits

Author SHA1 Message Date
bot-backend
e48909dda2 style(tests): разбить длинный литерал в тесте watchdog-приёмника
All checks were successful
CI Trade-In / changes (pull_request) Successful in 16s
CI / changes (pull_request) Successful in 18s
CI Trade-In / backend-tests (pull_request) Has been skipped
CI Trade-In / browser-tests (pull_request) Has been skipped
CI Trade-In / frontend-checks (pull_request) Has been skipped
CI / frontend-tests (pull_request) Has been skipped
CI / openapi-codegen-check (pull_request) Successful in 2m40s
CI / backend-tests (pull_request) Successful in 7m7s
E501 в CI: 106 символов при лимите 100.
2026-09-17 16:44:53 +03:00
bot-backend
b8d2e74951 fix(ops): не ронять деплой метрик пустым/непереданным watchdog-секретом
Some checks failed
CI Trade-In / changes (pull_request) Successful in 15s
CI Trade-In / backend-tests (pull_request) Has been skipped
CI Trade-In / browser-tests (pull_request) Has been skipped
CI Trade-In / frontend-checks (pull_request) Has been skipped
CI / changes (pull_request) Successful in 30s
CI / frontend-tests (pull_request) Has been skipped
CI / backend-tests (pull_request) Failing after 1m59s
CI / openapi-codegen-check (pull_request) Successful in 3m4s
amtool check-config падал на "unsupported scheme \"\" for URL": шаблон
заводил url: "${METRICS_WATCHDOG_PING_URL}" напрямую, а envsubst в
deploy-metrics.yml вызывается с явным allow-list переменных, в который
эту новую переменную не добавили — литерал плейсхолдера (или пустая
строка, если бы добавили без блока) доезжал до amtool и валил проверку
целиком, то есть ронял ВЕСЬ Alertmanager, а не только Watchdog.

Тот же приём, что уже применён для темы форума: подставляется ЦЕЛЫЙ
БЛОК (webhook_configs целиком), а не голое значение url. Собирается в
deploy-metrics.yml через METRICS_WATCHDOG_PING_BLOCK — если секрет задан,
блок с url и send_resolved; если пуст, пустая строка и ::warning в лог.
Пустой блок оставляет receiver watchdog-ping без единого *_configs — это
валидный конфиг Alertmanager (приёмник молча ничего не шлёт), а не
деградация всего алертинга. METRICS_WATCHDOG_PING_URL добавлен в env/envs
appleboy/ssh-action и в allow-list envsubst.

_render() в test_3078_alert_topic.py переписан так, чтобы подставлять
РОВНО тот набор переменных, что реально в allow-list деплоя (вытащен
регексом из самого воркфлоу), а не свой отдельный список — так и
воспроизвёлся бы этот регресс автоматически. Добавлен явный тест
test_every_template_placeholder_is_in_envsubst_allowlist на этот инвариант
и два теста на обе ветки watchdog-секрета (пуст / задан), проверенные
amtool check-config на prom/alertmanager:v0.28.0 вручную для обоих
рендеров.
2026-09-17 16:24:59 +03:00
bot-backend
dc9a93c048 fix(ops): убрать Watchdog из человеческой ленты и добавить эскалацию по длительности
All checks were successful
CI Trade-In / changes (pull_request) Successful in 18s
CI / changes (pull_request) Successful in 22s
CI Trade-In / backend-tests (pull_request) Has been skipped
CI Trade-In / browser-tests (pull_request) Has been skipped
CI Trade-In / frontend-checks (pull_request) Has been skipped
CI / frontend-tests (pull_request) Has been skipped
CI / openapi-codegen-check (pull_request) Successful in 2m54s
CI / backend-tests (pull_request) Successful in 7m37s
Watchdog горел всегда по построению (10080/10080 интервалов за 7 суток) и
раньше слался в Telegram раз в 12ч — 14 сообщений в неделю ни о чём. Это
приучило пролистывать инфра-тему, и 17.09 настоящий DiskWillFillIn24h утонул
между Watchdog и вечно горящим NoActiveCeleryWorkers: диск дошёл до 84%
незамеченным.

Watchdog переведён на внешний deadman-приёмник (webhook на
METRICS_WATCHDOG_PING_URL, healthchecks.io-подобный сервис) вместо Telegram:
человек не получает ни одного штатного сообщения, а живость канала
по-прежнему подтверждается регулярным HTTP-пингом. Секрет на хосте пока не
заведён — деплой не трогаем, добавление аккаунта и значения переменной на
проде остаётся ручным шагом.

Новое правило Prometheus AlertFiringTooLong эскалирует любую тревогу,
непрерывно firing дольше 6 часов (кроме Watchdog и себя самой — оба
исключения обязательны, иначе получаем второй вечный сигнал). Маршрутизирована
в клиентскую тему (алертменеджер матчит по alertname, не по host — исходная
тревога может быть про любой хост).

Затронуты также два backend-теста ops/ (test_3078_alert_topic.py,
test_3078_oncall_route.py), проверявших структуру шаблона Alertmanager —
обновлены под новую форму (один прямой Telegram-получатель вместо двух,
маркер watchdog-ping вместо telegram-heartbeat).
2026-09-17 16:05:07 +03:00