Хвосты #3467, не попавшие в main вместе с #3476:
- prometheus.yml смонтирован одним файлом: после git reset --hard reload
перечитывал СТАРЫЙ инод с rc=0 и новым lastConfigTime (стенд
prom/prometheus:v3.1.0, 17.09). Комментарий в деплое утверждал обратное.
Теперь promtool проверяет файлы С ДИСКА одноразовым контейнером, а при
расхождении инода контейнер пересоздаётся до reload.
- loki-config.yml — тот же пофайловый маунт, перезагрузки у Loki нет:
пересоздание при расхождении инода.
- Датасорсы Grafana применяются только при старте: POST
/api/admin/provisioning/datasources/reload, отказ роняет деплой.
Общий шаг — ops/metrics/recreate-stale-mount.sh: пересоздаёт только при
расхождении инода и перепроверяет после; тесты исполняют его с подставным
docker. Гейт берёт пофайловые маунты из docker-compose.metrics.yml.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
lastConfigTime у gendesign-prometheus совпадал со startTime контейнера 16
суток: docker compose up -d не пересоздаёт контейнер из-за изменения
содержимого бинд-маунта (сравнивается только описание сервиса), а
--web.enable-lifecycle был включён, но /-/reload никто не вызывал. Любая
правка ops/metrics/prometheus/** доезжала до диска и молча не вступала в
силу до случайного рестарта, при зелёном деплое.
Добавлен шаг по образцу уже работающей проверки Caddyfile в этом же
workflow: promtool check config + promtool check rules внутри контейнера,
reload только при успешной проверке, приёмка через сравнение
lastConfigTime до/после (обновляется на каждый успешный reload, поэтому
надёжно ловит и несостоявшийся вызов). Провал promtool теперь роняет шаг
и не трогает работающий Prometheus.
Alertmanager уже чинился отдельно (--force-recreate, #3078/#3136) — reload
для него намеренно не помогает из-за переиспользуемого инода, это не
regressed. Loki (/etc/loki/loki-config.yml), Grafana (provisioning) и Alloy
(config.alloy) в том же деплое лежат на дисковых бинд-маунтах без reload —
чинить их этим PR не стал, см. summary задачи.
Refs #3467, #3471