Prometheus не видел ни одной серии celery_*/redis_* — переполнение
очереди Site Finder и залипший воркер снаружи выглядели одинаково,
тишиной (issue #3471).
Добавлено (только на продуктовом хосте, профиль apps):
- redis-exporter (oliver006/redis_exporter) — здоровье общего Redis
(db0 celery-брокер Site Finder, db1 SearchCache trade-in, db2
glitchtip), адрес через alias gendesign-redis на сети shared, без
нового сетевого доступа.
- celery-exporter (danihodovic/celery-exporter) — глубина очереди,
число живых воркеров, счётчик неуспешных задач. Выбран вместо
redis-exporter --check-keys, потому что дефолтная очередь "celery"
дала бы только глубину, но не воркеров и не failures.
- Скрейп обоих в alloy-apps.alloy.
- Алерты в infra.yml: RedisDown, NoActiveCeleryWorkers,
CeleryQueueGrowing (порог 150 предварительный — реальных данных по
глубине очереди ещё нет, пересмотр через неделю наблюдений).
Имена метрик celery-exporter (celery_queue_length, celery_worker_up,
celery_task_failed_total) — по документации проекта, без прогона на
реальном брокере; сверить после первого деплоя, см. комментарий у
сервиса. promtool check rules — 23 правила, SUCCESS.
Refs #3471