All checks were successful
CI Trade-In / changes (pull_request) Successful in 8s
CI / changes (pull_request) Successful in 9s
CI / backend-tests (pull_request) Has been skipped
CI / frontend-tests (pull_request) Has been skipped
CI Trade-In / backend-tests (pull_request) Has been skipped
CI Trade-In / browser-tests (pull_request) Has been skipped
CI Trade-In / frontend-checks (pull_request) Has been skipped
CI / openapi-codegen-check (pull_request) Has been skipped
Метрик в проекте не было ни одной: ни экспортеров, ни /metrics в бэкендах, единственный канал наблюдения — journald, единственный сигнал об аварии — исключение в GlitchTip. Из-за этого целый класс отказов невидим в принципе: задача рапортует done, строк ноль, исключения нет. Так протухли данные на семь месяцев (#2998), 34 дня был мёртв house_imv_backfill (#2698), 8 суток писал ноль newbuilding_enrich (#2767), 91 день копилось раздутие listings (#2992). Grafana не заменяет GlitchTip: ошибки остаются там. Grafana OSS не принимает Sentry DSN ни одним компонентом, а скрубберы в before_send — требование 152-ФЗ. Здесь появляется другой класс данных: ряды и алерты по трендам. Наблюдатель поставлен у ДРУГОГО провайдера, чем наблюдаемое: серверная сторона на Beget, рядом с GlitchTip. Если ляжет Poincare, мониторинг должен об этом сказать, а не лечь вместе с ним. Транспорт push, а не pull: агент на Poincare шлёт remote_write и логи исходящим HTTPS, поэтому там не открывается ни одного входящего порта сверх 22/80/443. При обрыве канала Alloy копит в WAL и досылает — pull-скрейп в той же ситуации терял бы точки именно в аварии, ради которой мониторинг и нужен. Два контура доступа с разными учётками. Пароль приёмника по построению лежит открытым на продуктовом хосте, значит его компрометация неизбежна вместе с хостом; будь это учётка витрины, утёк бы и доступ к дашбордам. GlitchTip читается прямым SQL, а не Sentry-плагином: у плагина на 6.1.6 stats_v2 отдаёт 500 (баг GlitchTip #381), Events/Discover — 404 (#416), а в grafana/sentry-datasource слово glitchtip не встречается ни разу. Схема сверена на живой базе: колонка времени называется timestamp, а не received, и отдельной таблицы IssueIndex не существует — агрегаты лежат на самой issue_events_issue. Алерты за профилем alerts: канал доставки — открытый вопрос #3078, и стек не должен на нём стоять. Деплой предупреждает, что уведомлять пока некому. Каждая настройка, способная отказать молча, закрыта явно: ретенция Prometheus задана и по времени и по размеру, retention_enabled у компактора Loki (без него retention_period не работает вовсе), путь к журналу и запуск Alloy от root (иначе агент читает ноль записей без ошибки), проверка Caddy до перезагрузки (на этом хосте тот же Caddy держит git, errors и obsidian). Refs #3078
172 lines
6.8 KiB
Text
172 lines
6.8 KiB
Text
// Alloy — агент на ПРОДУКТОВОМ хосте (Poincare). Приёмник стоит у другого провайдера,
|
||
// поэтому доставка идёт исходящим HTTPS через metrics.gendsgn.ru под basic_auth.
|
||
//
|
||
// ПОЧЕМУ PUSH. Альтернатива — открыть на Poincare входящие порты под скрейп из центра.
|
||
// ufw там держит только 22/80/443, и расширять периметр ради мониторинга — плохой
|
||
// размен. Исходящий HTTPS уже разрешён, ничего открывать не нужно.
|
||
//
|
||
// ПРИ ОБРЫВЕ КАНАЛА агент копит в WAL и досылает. Pull-скрейп в этой ситуации просто
|
||
// потерял бы точки — а обрыв между площадками это ровно тот случай, ради которого
|
||
// мониторинг и заводится.
|
||
|
||
logging {
|
||
level = "warn"
|
||
format = "logfmt"
|
||
}
|
||
|
||
// ═══ КУДА ОТПРАВЛЯЕМ ═══════════════════════════════════════════════════════════
|
||
|
||
prometheus.remote_write "central" {
|
||
endpoint {
|
||
url = "https://metrics.gendsgn.ru/ingest/prometheus/api/v1/write"
|
||
|
||
basic_auth {
|
||
username = sys.env("METRICS_INGEST_USER")
|
||
password = sys.env("METRICS_INGEST_PASSWORD")
|
||
}
|
||
|
||
// Очередь на случай недоступности приёмника. Дефолты рассчитаны на облако с
|
||
// быстрым каналом; здесь между площадками 17 мс и приёмник может уехать в
|
||
// рестарт при деплое — даём запас, чтобы не терять точки на ровном месте.
|
||
queue_config {
|
||
capacity = 10000
|
||
max_shards = 5
|
||
min_shards = 1
|
||
max_samples_per_send = 2000
|
||
batch_send_deadline = "10s"
|
||
retry_on_http_429 = true
|
||
}
|
||
}
|
||
|
||
// Досыл после обрыва. Держим сутки: суточного окна хватает и на ночной рестарт
|
||
// приёмника, и на разбор утром.
|
||
wal {
|
||
truncate_frequency = "2h"
|
||
max_keepalive_time = "24h"
|
||
}
|
||
|
||
external_labels = {
|
||
host = sys.env("METRICS_HOST_LABEL"),
|
||
}
|
||
}
|
||
|
||
loki.write "central" {
|
||
endpoint {
|
||
url = "https://metrics.gendsgn.ru/ingest/loki/loki/api/v1/push"
|
||
|
||
basic_auth {
|
||
username = sys.env("METRICS_INGEST_USER")
|
||
password = sys.env("METRICS_INGEST_PASSWORD")
|
||
}
|
||
}
|
||
|
||
external_labels = {
|
||
host = sys.env("METRICS_HOST_LABEL"),
|
||
}
|
||
}
|
||
|
||
// ═══ МЕТРИКИ ХОСТА И КОНТЕЙНЕРОВ ═══════════════════════════════════════════════
|
||
|
||
prometheus.scrape "node" {
|
||
targets = [
|
||
{ __address__ = "node-exporter:9100", job = "node" },
|
||
]
|
||
forward_to = [prometheus.remote_write.central.receiver]
|
||
scrape_interval = "30s"
|
||
}
|
||
|
||
prometheus.scrape "cadvisor" {
|
||
targets = [
|
||
{ __address__ = "cadvisor:8080", job = "cadvisor" },
|
||
]
|
||
forward_to = [prometheus.relabel.cadvisor_trim.receiver]
|
||
scrape_interval = "30s"
|
||
}
|
||
|
||
prometheus.relabel "cadvisor_trim" {
|
||
forward_to = [prometheus.remote_write.central.receiver]
|
||
|
||
rule {
|
||
source_labels = ["__name__"]
|
||
regex = "container_(memory_(usage_bytes|working_set_bytes|rss)|cpu_(usage_seconds_total|cfs_throttled_seconds_total)|network_(receive|transmit)_bytes_total|fs_(usage|limit)_bytes|last_seen|spec_memory_limit_bytes|start_time_seconds|processes)"
|
||
action = "keep"
|
||
}
|
||
|
||
rule {
|
||
source_labels = ["name"]
|
||
regex = ""
|
||
action = "drop"
|
||
}
|
||
}
|
||
|
||
// ═══ МЕТРИКИ ОБЕИХ БОЕВЫХ БД ═══════════════════════════════════════════════════
|
||
// Именно здесь живут ряды, из-за отсутствия которых раздутие `listings` копилось
|
||
// 91 день незамеченным: WAL в сутки, n_tup_upd против n_tup_hot_upd, рост TOAST.
|
||
|
||
prometheus.scrape "postgres" {
|
||
targets = [
|
||
{ __address__ = "gendesign-pg-exporter-gendesign:9187", job = "postgres", db = "gendesign" },
|
||
{ __address__ = "gendesign-pg-exporter-tradein:9187", job = "postgres", db = "tradein" },
|
||
]
|
||
forward_to = [prometheus.remote_write.central.receiver]
|
||
scrape_interval = "60s"
|
||
}
|
||
|
||
// ═══ МЕТРИКИ ПРИЛОЖЕНИЙ ════════════════════════════════════════════════════════
|
||
// Эндпоинты появляются в части 3. До этого скрейп просто отдаёт `up 0` — и это
|
||
// правильно: цель видна как недоступная, а не отсутствует молча.
|
||
|
||
prometheus.scrape "apps" {
|
||
targets = [
|
||
{ __address__ = "gendesign-backend-1:8000", job = "app", app = "sitefinder" },
|
||
{ __address__ = "tradein-backend:8000", job = "app", app = "mera" },
|
||
]
|
||
metrics_path = "/metrics"
|
||
forward_to = [prometheus.remote_write.central.receiver]
|
||
scrape_interval = "30s"
|
||
scrape_timeout = "20s"
|
||
}
|
||
|
||
// ═══ ЛОГИ ══════════════════════════════════════════════════════════════════════
|
||
|
||
loki.source.journal "host" {
|
||
path = "/var/log/journal"
|
||
max_age = "12h"
|
||
format_as_json = false
|
||
labels = {
|
||
job = "journal",
|
||
}
|
||
relabel_rules = loki.relabel.journal.rules
|
||
forward_to = [loki.write.central.receiver]
|
||
}
|
||
|
||
loki.relabel "journal" {
|
||
forward_to = []
|
||
|
||
rule {
|
||
source_labels = ["__journal__systemd_unit"]
|
||
target_label = "unit"
|
||
}
|
||
rule {
|
||
source_labels = ["__journal__hostname"]
|
||
target_label = "node"
|
||
}
|
||
rule {
|
||
source_labels = ["__journal_container_name"]
|
||
target_label = "container"
|
||
}
|
||
rule {
|
||
source_labels = ["__journal_priority_keyword"]
|
||
target_label = "level"
|
||
}
|
||
}
|
||
|
||
// ═══ САМОКОНТРОЛЬ ══════════════════════════════════════════════════════════════
|
||
|
||
prometheus.exporter.self "alloy" {}
|
||
|
||
prometheus.scrape "alloy_self" {
|
||
targets = prometheus.exporter.self.alloy.targets
|
||
forward_to = [prometheus.remote_write.central.receiver]
|
||
scrape_interval = "60s"
|
||
}
|