Commit graph

2 commits

Author SHA1 Message Date
77c4af9751 fix(tradein): yandex_realty captures house number + parse_rub strips NBSP
Two critical bugs в yandex_realty scraper, обнаружены при investigating
issue #582 (217+ houses без номера дома в address):

1. **Address скрейпился только до street name** (yandex_realty.py:162-163).
   Прежний код брал text() только anchor tag `a[href*="/kupit/kvartira/st-..."]`
   что = только «улица Малышева». House number жил sibling text node parent'а
   `.AddressWithGeoLinks__addressContainer--<hash>`.

   Fix: читаем text() parent контейнера + normalise whitespace → получаем
   «улица Малышева, 125». Fallback на legacy street-only link если container
   отсутствует — не регрессим в NULL.

   Tests cover: letter suffix («2В»), slash («14/3»), district prefix
   («Берёзовский, …»), fallback.

2. **parse_rub() не стрипает NBSP** (yandex_helpers.py:289-294).
   Yandex SERP форматирует «9\xa0800\xa0000» через non-breaking space
   (U+00A0). Прежний `.replace(" ", "")` стрипал только regular space →
   `int("9\xa0800\xa0000")` raise ValueError → возвращали None → scraper
   skipping все listings c ценой.

   На production main парсилось **0/23 cards** из live HTML by-this-reason.
   Это объясняет почему `yandex_realty_nb` накопил мало houses (305) и
   почему `_card_to_lot` silently failed.

   Fix: `re.sub(r"\s", "", ...)` covers `\xa0`, тонкие пробелы, табы и т.д.
   То же для RE_RUB_MLN branch для consistency.

   Tests cover NBSP в obычной цене и в «4,4\xa0млн\xa0₽» форме.

После merge → deploy → следующий yandex sweep должен parse ~23/23 cards
с full addresses включая house number. Existing 217 houses с street-only
remain — пусть починятся через `backfill_house_coords.py` (precision
filter теперь сможет matchнуть exact).

Tests: 52/52 pass (yandex_realty_serp + yandex_helpers).
Ruff clean.
2026-05-27 12:23:11 +05:00
lekss361
ead2ac16c5 feat(tradein): yandex_realty.py — DOM SERP refactor (vtorichka, 23 cards/page)
Replace dead JSON-state extraction (Yandex moved to chunked/ephemeral state
post-hydration) with selectolax DOM parsing using helpers from PR #456.

Changes:
- New URL: /{city}/kupit/kvartira/vtorichniy-rynok/?page=N (path-based, no geo)
- Selector: [data-test="OffersSerpItem"] x ~23 per page
- Per-card extraction: offer_id (URL regex), title (rooms/area/floor regex),
  price/ppm2 (regex + parse_rub), bargain flag, publish_date (parse_ru_date),
  street address, photos (avatars.mds.yandex domain filter + size upgrade),
  newbuilding linkage (house_source='yandex_realty_nb' + house_ext_id)
- ScrapedLot mapping: lat/lon=None (no coords on SERP — geocode-missing
  fills later), listing_segment="vtorichka"
- Pagination: fetch_around_multi_room -> up to MAX_PAGES=3 pages, dedup by
  source_id. **kwargs swallow keeps old rooms/sort/pages callers compat.
- Preserved: BaseScraper interface, name="yandex" (matches existing rows +
  avoids breaking dedup_hash; Wave 5 conflict resolution can alias if needed),
  request_delay_sec=5.0, sleep_between_requests, tenacity retry.

Tests: 10 unit tests against hand-crafted fixture HTML (single card / studio /
no-price / empty page / multi-card / URL builder / city override) — all pass.
Ruff clean.
2026-05-23 16:21:47 +03:00