gendesign/ops/metrics/prometheus
bot-backend a8d3499bdc
All checks were successful
CI Trade-In / changes (pull_request) Successful in 16s
CI / changes (pull_request) Successful in 19s
CI Trade-In / backend-tests (pull_request) Has been skipped
CI Trade-In / browser-tests (pull_request) Has been skipped
CI Trade-In / frontend-checks (pull_request) Has been skipped
CI / frontend-tests (pull_request) Has been skipped
CI / openapi-codegen-check (pull_request) Successful in 2m34s
CI / backend-tests (pull_request) Successful in 6m40s
fix(metrics): дисковые тревоги в абсолютных ГБ + алерт на скорость утечки
Инцидент 16.09: кэш архивов Forgejo ел 2 ГБ/ч, а проценты на диске 145 ГБ
(host=infra) давали слишком короткое окно реакции (85% = 21 ГБ запаса,
93% = 10 ГБ). На диске host=apps (~910 ГБ) те же проценты значат совсем
другой запас в ГБ — переведено на абсолютные пороги (30/15 ГБ свободного
места), одинаково осмысленные независимо от размера диска. Сужено до
mountpoint="/" — на /boot и /boot/efi (меньше 1 ГБ целиком) абсолютный
порог горел бы постоянно.

Добавлен DiskSpaceDepletingFast: deriv() по 15-минутному окну, >1 ГБ/ч
устойчиво 30 минут — ловит именно быструю течь независимо от текущего
уровня заполнения, пока DiskSpaceLow/Critical ещё молчат (места много,
но утечка есть). DiskWillFillIn24h остаётся отдельным сигналом для более
медленных, но устойчивых трендов (предупреждает позже за счёт 6h окна
сглаживания шума) — роли не дублируют друг друга, разделение описано
комментариями в файле.

Проверено promtool check rules (24 rules found) и живыми запросами к
Prometheus на Beget — ни одно из трёх правил сейчас не горит.
2026-09-16 22:23:58 +03:00
..
rules fix(metrics): дисковые тревоги в абсолютных ГБ + алерт на скорость утечки 2026-09-16 22:23:58 +03:00
prometheus.yml fix(ops/metrics): Prometheus не видел ни одного Alertmanager — цель file_sd осталась пустой 2026-08-27 21:10:25 +03:00