fix(observability): cadvisor перестаёт сканировать overlay-слои — упирался в лимит памяти #3135

Merged
lekss361 merged 1 commit from fix/3078-cadvisor-disk-metrics into main 2026-08-27 10:53:32 +00:00

View file

@ -131,7 +131,21 @@ services:
# раздувает TSDB на порядок ради данных, которые никто не смотрит.
- "--docker_only=true"
- "--housekeeping_interval=30s"
- "--disable_metrics=percpu,sched,tcp,udp,advtcp,process,hugetlb,referenced_memory,cpu_topology,resctrl"
# disk/diskIO добавлены 27.08 по замеру. Именно они держат fsHandler,
# который в логе честно отчитывается: «disk usage and inodes count on
# following dirs took 1.31.8s» — обход overlay-слоёв на каждом цикле.
# Память растёт вместе с числом слоёв, а слои копятся от сборок.
#
# Прод: на продуктовом хосте cadvisor доходил до 359 МиБ из 384 (93 %
# лимита), на инфраструктурном за два часа поднялся со 105 до 291 МиБ.
# До OOM не дошло, но запас был 25 МиБ — то есть вопрос времени.
#
# Теряем метрики использования диска ПО КОНТЕЙНЕРАМ. Проверено, что их
# никто не использует: ни правила Prometheus, ни дашборды. Алерты по
# диску построены на node_exporter (`node_filesystem_*`), то есть на
# уровне файловой системы хоста — а это как раз то измерение, которое
# и нужно, чтобы вовремя увидеть кончающееся место.
- "--disable_metrics=disk,diskIO,percpu,sched,tcp,udp,advtcp,process,hugetlb,referenced_memory,cpu_topology,resctrl"
- "--store_container_labels=false"
volumes:
- /:/rootfs:ro