57 lines
1.9 KiB
Python
57 lines
1.9 KiB
Python
"""子站解析器的公共契约与工具
|
|
|
|
乐天部分官方旗舰店的商品页会跳出市场域名,落到各自独立的站点上。这些站点
|
|
技术栈各不相同(微数据 / Vue SSR state / Nuxt state),但对外要收敛成同一个
|
|
ItemDetailData,因此这里定义统一的输入结构与注册契约。
|
|
"""
|
|
from __future__ import annotations
|
|
|
|
import re
|
|
from collections.abc import Callable
|
|
from dataclasses import dataclass
|
|
|
|
from app.models.scrape import ItemDetailData
|
|
|
|
# 售罄判定关键词:日文页面上表示不可购买的常见措辞
|
|
SOLD_OUT_MARKERS = ("在庫なし", "在庫切れ", "品切れ", "入荷未定", "販売終了", "取扱終了")
|
|
|
|
_DIGITS_RE = re.compile(r"\d+")
|
|
|
|
|
|
@dataclass(slots=True)
|
|
class SubsitePage:
|
|
"""一个待解析的子站页面及其上下文"""
|
|
|
|
html: str
|
|
requested_url: str # 请求时的 item.rakuten.co.jp 地址
|
|
final_url: str # 跳转后的实际地址
|
|
shop_code: str # 市场侧店铺代码,如 book / stylife / biccamera
|
|
item_code: str # 市场侧商品编号
|
|
include_sku_variants: bool
|
|
|
|
|
|
@dataclass(frozen=True, slots=True)
|
|
class SubsiteParser:
|
|
"""一个子站的解析能力"""
|
|
|
|
host: str # 落地域名
|
|
source: str # 写入 ItemDetailData.source 的标识
|
|
shop_name: str
|
|
validate: Callable[[str], str | None] # 返回 None 表示页面正常
|
|
parse: Callable[[SubsitePage], ItemDetailData]
|
|
|
|
|
|
def parse_price(text: str | int | float | None) -> int:
|
|
"""从 "3,091円" / "1760" / 1760 这类值里取出整数日元金额"""
|
|
if isinstance(text, bool) or text is None:
|
|
return 0
|
|
if isinstance(text, (int, float)):
|
|
return int(text)
|
|
digits = _DIGITS_RE.findall(text.replace(",", ""))
|
|
return int(digits[0]) if digits else 0
|
|
|
|
|
|
def looks_sold_out(status_text: str) -> bool:
|
|
"""按页面上的库存措辞判断是否不可购买"""
|
|
return any(marker in status_text for marker in SOLD_OUT_MARKERS)
|