"""从页面 HTML 中抽取服务端渲染的 `window.__INITIAL_STATE__` 搜索页与(手机版)商品详情页都会把整页数据以 JSON 形式内联到这个全局变量里, 因此不需要解析 DOM——直接把 JSON 取出来即可拿到结构化数据。 该赋值语句后面紧跟着其他脚本代码,不能按行或按分号切分,只能用增量 JSON 解码器从 `=` 之后开始解析,读到一个完整对象为止。 """ from __future__ import annotations import json import re from collections.abc import Callable from typing import Any from app.shared.errors import ScrapeParseError # 页面必须包含的服务端渲染数据标记;缺失说明拿到的不是正常页面 STATE_MARKER = "window.__INITIAL_STATE__" # 页面校验器:接收 (页面 HTML, 最终落地 URL),返回 None 表示通过,返回字符串表示 # 失败原因(会触发抓取层换 cookie / 浏览器兜底重试)。遇到重试也无济于事的情况 # (例如落到了不支持的站点),校验器可直接抛 AppError 快速失败。 PageValidator = Callable[[str, str], str | None] _ASSIGNMENT_RE = re.compile(r"window\.__INITIAL_STATE__\s*=\s*") _DECODER = json.JSONDecoder() def require_state_marker(html: str, _final_url: str) -> str | None: """默认页面校验:必须含服务端渲染数据""" if STATE_MARKER in html: return None return f"missing {STATE_MARKER} (body {len(html)} bytes)" def extract_initial_state(html: str) -> dict[str, Any]: """抽取并解析 `window.__INITIAL_STATE__` Raises: ScrapeParseError: 页面中没有该变量,或其内容不是合法 JSON 对象 """ match = _ASSIGNMENT_RE.search(html) if match is None: raise ScrapeParseError("页面中未找到 window.__INITIAL_STATE__") try: state, _ = _DECODER.raw_decode(html, match.end()) except ValueError as exc: raise ScrapeParseError(f"window.__INITIAL_STATE__ 解析失败:{exc}") from exc if not isinstance(state, dict): raise ScrapeParseError("window.__INITIAL_STATE__ 不是 JSON 对象") return state