diff --git a/.forgejo/workflows/perimeter-smoke.yml b/.forgejo/workflows/perimeter-smoke.yml index 17ac34bf..fe3f5c4c 100644 --- a/.forgejo/workflows/perimeter-smoke.yml +++ b/.forgejo/workflows/perimeter-smoke.yml @@ -39,10 +39,31 @@ jobs: # проверками (2 c) и повтор запроса, если ответа не пришло вовсе: обычный # прогон вырос с ~89 c до ~175 c, а ХУДШИЙ случай — гораздо больше, потому # что каждая неотвечающая проверка стоит до 3×15 c таймаута плюс паузы - # (~53 c против обычных ~2 c). Трёх таких хватило бы, чтобы упереться в - # 5 минут и job был бы убит ДО того, как напечатает строки FAIL и итог — - # то есть ровно в тот момент, когда лог нужнее всего. - timeout-minutes: 10 + # (~53 c против обычных ~2 c). + # + # 12.09.2026: 10 минут — тоже мало, и мало ровно в том сценарии, ради + # которого повтор писался. АРИФМЕТИКА ХУДШЕГО СЛУЧАЯ. Одна неотвечающая + # проверка сетевого класса = 3×15 c таймаута + 2 c и 4 c пауз ретрая + 2 c + # паузы между проверками = 53 c. Прод не отвечает целиком (DNS не + # резолвится, вход лежит) — мертвы ВСЕ проверки: 43 × 53 = 2279 c ≈ 38 мин. + # Откуда 43 (замер 12.09, зелёный прогон против прода — 43 PASS за 167 c): + # 42 обычные проверки + отдельная загрузка HTML лэндинга; 43-я, производный + # layout-чанк, при мёртвом ответе не запрашивается вовсе — запросов ровно + # столько же. + # В 10 минут помещалось ~8 мёртвых проверок из 43, дальше job убивали ДО + # печати FAIL-строк и итога — то есть лог терялся при полном отказе прода. + # + # Правка «повторяем только сетевой класс» (12.09) худший случай НЕ + # уменьшает: 15-секундный таймаут как раз сетевой (rc=28) и повторяется + # по-прежнему. Она удешевляет ДРУГОЙ сценарий — протухший/чужой сертификат + # (rc=60): отказ приходит сразу и без повторов. Замер 12.09 на + # expired.badssl.com, одна проверка при SMOKE_PAUSE=0 — 23 c на прежней + # голове (3 попытки + 6 c пауз) против <1 c теперь. + # + # 40 минут = 38 мин худшего случая + запас на чекаут и разброс сети. + # Цена промаха несимметрична: занятый раннер стоит дёшево (прогон daily + + # on-push), потерянный лог при полном отказе прода — дорого. + timeout-minutes: 40 steps: - name: Checkout repo diff --git a/scripts/smoke-mera-perimeter.sh b/scripts/smoke-mera-perimeter.sh index 7a32bcaa..4b449ed7 100644 --- a/scripts/smoke-mera-perimeter.sh +++ b/scripts/smoke-mera-perimeter.sh @@ -69,8 +69,11 @@ noresp=0 # взять их означало бы выдумать число. Цена ИЗМЕРЕНА, а не оценена: прогон # целиком занимал 89 c и стал занимать 160 c (оба замера 11.09 с локальной # машины, 43 проверки, все зелёные). Под это в воркфлоу периметра поднят -# timeout-minutes — у неотвечающей проверки цена совсем другая (до 3×15 c -# таймаута плюс паузы), и прежних 5 минут на худший случай не хватало. +# timeout-minutes: неотвечающая проверка сетевого класса стоит 3×15 c таймаута +# + 2 c и 4 c пауз ретрая + 2 c паузы между проверками = 53 c, а худший случай +# (прод не отвечает вовсе — мертвы все 43) = 43 × 53 ≈ 2279 c ≈ 38 мин. +# Ни 5, ни 10 минут на него не хватало: job убивали ДО печати FAIL-строк и +# итога, то есть ровно там, где лог нужнее всего. # Обе величины переопределяются из окружения — для отладки локально # (`SMOKE_PAUSE=0 bash scripts/smoke-mera-perimeter.sh` даёт прежний темп). SMOKE_PAUSE="${SMOKE_PAUSE:-2}" @@ -78,14 +81,35 @@ SMOKE_ATTEMPTS="${SMOKE_ATTEMPTS:-3}" # curl_try: запрос с повтором, если ответа не пришло ВООБЩЕ, и с паузой после. # -# Признак «ответа не было» берём у самого curl — ненулевой код возврата (28 -# таймаут, 35/52/56 обрыв соединения и TLS, 6 DNS). Он строго эквивалентен +# Признак «ответа не было» берём у самого curl — код возврата из СЕТЕВОГО +# класса (перечислен в константе NETWORK_RC ниже). Он строго эквивалентен # `%{http_code}` = 000, но доступен ВСЕМ проверкам, включая те, которые # http_code вообще не запрашивают: до этой правки обрыв в # check_redirect_location читался как «Location не тот», а обрыв при загрузке # лэндинга — как «сам лэндинг сломан». Один сторож в общей обёртке чинит все # места сразу, а не только те две проверки, что покраснели. # +# СЕТЕВОЙ КЛАСС — И ТОЛЬКО ОН. Коды живут в константе, а не в тексте +# комментария, чтобы описание и поведение не разъехались: +# 6 — DNS не разрешился +# 7 — соединение отвергнуто (вход лежит; REJECT у fail2ban выглядит так же) +# 28 — таймаут +# 35 — обрыв на TLS-хендшейке +# 52 — сервер закрыл соединение, не ответив +# 56 — обрыв при приёме ответа +# Общее у них ровно одно: ответа не получено, и повтор имеет шанс помочь — +# тот самый эффект входа, ради которого повтор и заведён. +# +# ОСТАЛЬНЫЕ КОДЫ НЕ ПОВТОРЯЕМ И НЕ ЗОВЁМ «ответа нет». Протухший, чужой или +# самоподписанный сертификат даёт rc=60 (замер 12.09: expired.badssl.com, +# self-signed.badssl.com, wrong.host.badssl.com — все три). Это ИЗМЕРЕННЫЙ +# отказ периметра, а не потерянный запрос: см. проверку 5b в шапке — без +# site-блока Caddy не выпускает сертификат, и клиент видит обрыв TLS вместо +# редиректа, ради этого проверка и написана. Отказ детерминирован: три попытки +# дадут тот же rc, потратив 6 c пауз, а результат уехал бы в колонку «не +# измеряли» — то есть регресс спрятался бы ровно там, где его надо показать. +NETWORK_RC=" 6 7 28 35 52 56 " + # Ответ, пришедший с «неправильным» кодом, для curl — успех (rc=0), повтора не # будет; проверка отработает ровно так же, как до правки. curl_try() { @@ -94,6 +118,8 @@ curl_try() { out=$(curl "$@" 2>/dev/null) rc=$? { [ "$rc" -eq 0 ] || [ "$attempt" -ge "$SMOKE_ATTEMPTS" ]; } && break + # Код вне сетевого класса — повторять нечего, отдаём rc наверх (см. NETWORK_RC). + case "$NETWORK_RC" in *" $rc "*) ;; *) break ;; esac # Пауза растёт: 2 c, затем 4 c — ниже 2 c смысла нет (см. замер выше). echo " RETRY: ответа нет (curl rc=$rc), попытка $((attempt + 1)) из $SMOKE_ATTEMPTS через $((attempt * 2)) c: $*" >&2 sleep "$((attempt * 2))" @@ -104,17 +130,35 @@ curl_try() { return "$rc" } -# no_response: отдельная формулировка для «ответа не было». +# curl_failed: красная строка, когда ответа не удалось получить у самого curl. # -# Это FAIL (прогон обязан покраснеть — мы действительно не знаем, цел ли -# периметр), но формулировка другая специально: читатель красного лога не -# должен искать регресс периметра там, где измерения не было вовсе. -no_response() { - local desc="$1" url="$2" - echo "FAIL (ответа нет): $desc ($url — вход не отдал ответ после $SMOKE_ATTEMPTS попыток;" \ - "это НЕ измеренный код ответа, периметр этой проверкой НЕ проверен — повторите URL вручную)" +# За одним «rc != 0» прячутся ДВА разных диагноза, и путать их нельзя: +# - сетевой класс → «ответа нет»: цел ли периметр, мы не знаем, проверка НЕ +# измерилась (плюс счётчик noresp и отдельная строка в итоге); +# - всё остальное, прежде всего cert-класс (rc=60) → обычный FAIL: отказ +# ИЗМЕРЕН, это регресс периметра, искать надо конфиг, а не флап входа. +# +# rc печатается в ОБЕИХ ветках: строка RETRY при SMOKE_ATTEMPTS=1 не выводится +# вовсе, и без rc читатель красного лога не отличит «домена нет» (6) от +# «сертификат протух» (60) — а это диагнозы из разных отделов. +curl_failed() { + local desc="$1" url="$2" rc="$3" reason fail=1 - noresp=$((noresp + 1)) + case "$NETWORK_RC" in + *" $rc "*) + echo "FAIL (ответа нет): $desc ($url — вход не отдал ответ после $SMOKE_ATTEMPTS попыток, curl rc=$rc;" \ + "это НЕ измеренный код ответа, периметр этой проверкой НЕ проверен — повторите URL вручную)" + noresp=$((noresp + 1)) + return + ;; + esac + case "$rc" in + 60|51|83) reason="TLS-сертификат отвергнут" ;; + 58|77) reason="проблема с клиентским сертификатом/CA" ;; + *) reason="curl не выполнил запрос" ;; + esac + echo "FAIL: $desc ($url -> $reason (curl rc=$rc); ответ измерен как отказ, это не потерянный" \ + "запрос — повтора не было, код вне сетевого класса «ответа нет»)" } check() { @@ -123,7 +167,7 @@ check() { code=$(curl_try -s -o /dev/null -w '%{http_code}' --max-time 15 "$url") rc=$? if [ "$rc" -ne 0 ]; then - no_response "$desc" "$url" + curl_failed "$desc" "$url" "$rc" elif [ "$code" = "$expected" ]; then echo "PASS: $desc ($url -> $code)" else @@ -148,7 +192,7 @@ check_any() { code=$(curl_try -s -o /dev/null -w '%{http_code}' --max-time 15 "$url") rc=$? if [ "$rc" -ne 0 ]; then - no_response "$desc" "$url" + curl_failed "$desc" "$url" "$rc" return fi for want in "$@"; do @@ -170,7 +214,7 @@ check_post() { -X POST -H 'Content-Type: application/json' -d "$body" "$url") rc=$? if [ "$rc" -ne 0 ]; then - no_response "$desc" "$url" + curl_failed "$desc" "$url" "$rc" return fi code=${out##*$'\n'} @@ -209,7 +253,7 @@ check_redirect_location() { headers=$(curl_try -s -o /dev/null -D - --max-time 15 "$url") rc=$? if [ "$rc" -ne 0 ]; then - no_response "$desc" "$url" + curl_failed "$desc" "$url" "$rc" return fi location=$(printf '%s' "$headers" \ @@ -237,7 +281,7 @@ check_content_type() { out=$(curl_try -s -o /dev/null -D - -w '%{http_code}' --max-time 15 "$url") rc=$? if [ "$rc" -ne 0 ]; then - no_response "$desc" "$url" + curl_failed "$desc" "$url" "$rc" return fi code=${out##*$' @@ -349,7 +393,7 @@ check_caddy_404() { out=$(curl_try -s -o /dev/null -w '%{http_code} %{size_download}' --max-time 15 "$url") rc=$? if [ "$rc" -ne 0 ]; then - no_response "$desc" "$url" + curl_failed "$desc" "$url" "$rc" return fi code=${out%% *} @@ -377,7 +421,7 @@ layout_rc=$? if [ "$layout_rc" -ne 0 ]; then # Обрыв на загрузке лэндинга раньше попадал в ветку «не нашёл чанк» и читался # как «сам лэндинг сломан» — диагноз, которого никто не измерял. - no_response "HTML лэндинга (ищем в нём layout-чанк)" "$BASE_MERA/" + curl_failed "HTML лэндинга (ищем в нём layout-чанк)" "$BASE_MERA/" "$layout_rc" else layout_chunk=$(printf '%s' "$layout_html" \ | grep -o '/trade-in/_next/static/chunks/app/layout-[^"]*\.js' | head -1)