gendesign/backend/tests/services/scrapers
bot-backend 9a4acb67d1
All checks were successful
CI Trade-In / changes (pull_request) Successful in 7s
CI / changes (pull_request) Successful in 9s
CI Trade-In / backend-tests (pull_request) Has been skipped
CI Trade-In / browser-tests (pull_request) Has been skipped
CI Trade-In / frontend-checks (pull_request) Has been skipped
CI / frontend-tests (pull_request) Has been skipped
CI / openapi-codegen-check (pull_request) Successful in 2m0s
CI / backend-tests (pull_request) Successful in 17m13s
fix(ptica): act_date — дата акта об изъятии, а не первой попавшейся ссылки (#2464)
`_extract_act_date` брал ПЕРВОЕ «от DD.MM.YYYY» во всём OCR-тексте.
«Сообщение о планируемом изъятии» открывается списком оснований, и первой
строкой там стоит

    «Решение Екатеринбургской городской Думы от 06.07.2004 № 60/1
     «Об утверждении Генерального плана города»»

— Генплан, а не акт об изъятии. На проде это дало 11 строк из 27 с датой
2004-07-06 при проектах 2020 и 2022 годов, причём одну и ту же дату
получили ДВА разных документа (развязка на Сибирском тракте и улица
Энергостроителей). Совпадение даты у несвязанных актов и было первым
признаком, что дата не своя.

Дата принимается, только если в 120 символах перед ней стоит слово
«постановлени». Ссылки-помехи в этих документах — «Решение … Думы» и
«Приказ Министерства» — его не содержат. Окно шире самой фразы, потому
что OCR перемешивает колонки таблицы и вклинивает в неё чужой текст
(«…Администрации города документами) Екатеринбурга от 19.04.2019…»).

Если подходящей даты нет — None. Дата чужого документа хуже пустоты: по
ней нельзя ни отфильтровать актуальные изъятия, ни сверить срок, и она
неотличима от настоящей.

Калибровка не на одном образце: все пять исходных PDF загружены и
распознаны тем же трактом, что использует загрузчик (ocr_pdf_text в
прод-контейнере). Окна 80/120/160 дают одинаковые 5 из 5. Более узкое
правило (плюс «администраци») давало те же 5 из 5, но ломало законный
случай «Постановление № 509-ПП» — областной акт без слова «администрация»,
уже закреплённый тестом test_act_date_extracted_from_text; взято широкое.

Сквозная проверка: патченный код прогнан по всем пяти распознанным
текстам целиком — 27 записей, ровно столько же, сколько строк в
land_reservation; 11 меняют 2004-07-06 на настоящую дату, 16 не двигаются.

Двусторонне: против origin/main три теста красные с реальным неверным
значением ('2004-07-06'), ни одного TypeError — тесты идут через
extract_izyatie_records, чья сигнатура одинакова на обеих сторонах.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-20 21:24:32 +05:00
..
__init__.py feat(22d): domrf_catalog_object scraper — fill ~25 NULL kn_objects cols from SSR __NEXT_DATA__ (#335) 2026-05-17 21:26:22 +00:00
test_2464_act_date_citation.py fix(ptica): act_date — дата акта об изъятии, а не первой попавшейся ссылки (#2464) 2026-08-20 21:24:32 +05:00
test_2464_catalog_batch_commits.py fix(ptica): успехи батча каталога фиксируются по ходу, а не одним commit'ом в конце (#2464) (#2960) 2026-08-20 08:54:26 +00:00
test_2464_catalog_skipped_counter.py fix(ptica): «объекта нет в БД» считается пропуском, а не сбоем (#2464) (#2974) 2026-08-20 11:59:39 +00:00
test_2464_catalog_waf_breaker.py fix(ptica): серия WAF-блоков прерывает батч каталога, а не гонит его до конца (#2464) (#2971) 2026-08-20 10:54:11 +00:00
test_domrf_catalog_browsersession_throttle.py fix(scrapers): WAF-guard эндпоинтов + throttled catalog BrowserSession (#2445-D1/D2) (#2459) 2026-07-05 20:09:06 +00:00
test_domrf_catalog_object.py feat(22d): domrf_catalog_object scraper — fill ~25 NULL kn_objects cols from SSR __NEXT_DATA__ (#335) 2026-05-17 21:26:22 +00:00
test_domrf_catalog_object_browsersession_throttle.py fix(scrapers): WAF-guard эндпоинтов + throttled catalog BrowserSession (#2445-D1/D2) (#2459) 2026-07-05 20:09:06 +00:00
test_domrf_catalog_parse.py fix(scrapers): narrow domrf Level-1 status badge-class regex (#1609 follow-up) 2026-06-17 21:21:56 +03:00
test_domrf_flat_plan_url.py feat(scrapers): extract + download DOM.РФ flat plan images (#2440) (#2441) 2026-07-05 16:23:29 +00:00
test_domrf_kn_isolation.py fix(scrapers): разблокировать domrf_kn flats — изоляция flats от poison-extras + throttle (#1945) (#2050) 2026-06-28 13:03:43 +00:00
test_domrf_kn_normalize.py feat(scrapers): wire per-flat DOM.РФ catalog scraper + propagate catalog_url_hash (#2442) (#2444) 2026-07-05 17:00:58 +00:00
test_domrf_kn_upsert_sql.py fix(analytics): de-inflate domrf_kn snapshot counts (8.49×) + backfill UPSERT columns (#2464) (#2470) 2026-07-08 07:30:12 +00:00
test_ekb_krt_registry.py test(scrapers/krt): вернуть в прогон проверку многоблочной страницы (#2778) (#2781) 2026-08-07 09:48:52 +00:00
test_ekb_ppt_tep_parser.py fix(tests): починить и вычистить проверки, которые не исполнялись ни разу (#2744) 2026-08-06 16:57:28 +00:00
test_flat_plan_download.py feat(scrapers): extract + download DOM.РФ flat plan images (#2440) (#2441) 2026-07-05 16:23:29 +00:00
test_gisogd_so_client.py feat(sf): ingest функц.зон генплана ЕКБ-2045 из ГИСОГД-СО WFS → ekb_genplan_functional_zone (#1137) 2026-06-07 12:03:39 +00:00
test_izyatie_ocr.py fix(workers): izyatie per-doc isolation + newbuilding-crossload breadcrumb (#2445-D5/D6) (#2460) 2026-07-05 20:09:12 +00:00
test_okn_egrkn_client.py fix(scrapers): rate-limit/backoff/circuit-breaker для ОКН EGRKN-скрапера (#2445-D3) (#2461) 2026-07-05 20:09:18 +00:00
test_page_reservation_parser.py feat(sf): ПАГЕ-парсер изъятия/резервирования → land_reservation (#1118) 2026-06-07 10:15:03 +00:00
test_stealth_throttle_proxy.py fix(scrapers): разблокировать domrf_kn flats — изоляция flats от poison-extras + throttle (#1945) (#2050) 2026-06-28 13:03:43 +00:00