fix(vodokanal): column-aligned парсинг DOCX — реальные резервы вместо № п/п (#2119/#2126) #2238

Merged
bot-backend merged 2 commits from fix/vodokanal-column-parse into main 2026-07-02 22:03:16 +00:00
Showing only changes of commit eddbe9eaa5 - Show all commits

View file

@ -84,7 +84,9 @@ _REQUESTED_LABEL = "количество поданных и зарегистр
_REFUSED_LABEL_PREFIX = "количество заявок на подключение, по которым принято решение об отказе"
# Ед.изм. резерва: «тыс. м3/сут» / «тыс.м3/сут» (пробелы схлопнуты) — защита от того,
# чтобы «Резерв…» из чужой формы с иной размерностью не попал в тыс.м³/сут.
_RESERVE_UNIT_MARKER = "тыс"
# Оба токена обязательны: одного «тыс» мало — «тыс. м3/час» прошёл бы с чужой
# временной базой (ревью 2026-07-03).
_RESERVE_UNIT_MARKERS = ("тыс", "сут")
# Шапки таблицы и служебные строки — не данные.
_HEADER_MARKERS = frozenset({"№ п/п", "№ цсв", "наименование показателя", "название цсв"})
_TOTAL_MARKER = "итого"
@ -344,7 +346,7 @@ def extract_water_rows(matrix: list[list[str]]) -> list[dict]:
if _is_reserve_metric(metric):
# Защита размерности: у резерва ед.изм. — «тыс…м3/сут» (col label+1).
unit = _norm(_cell(row, label_col + 1))
if _RESERVE_UNIT_MARKER in unit:
if all(m in unit for m in _RESERVE_UNIT_MARKERS):
cur_reserve = value
cur_note = _cell(row, value_col + 1) # Примечание строки резерва
elif _is_requested_metric(metric):