Files
q792602257andClaude Opus 5 104d7fef6b 拆分抓取与交易服务
把需要账号登录态的链路从抓取服务里拆出成独立进程。分界线不是「要不要登录」,
而是抓取无状态、幂等、可多开实例,而交易的写操作不可逆、登录态全局唯一、
订单监控是常驻轮询——同进程时抓取一扩容就会复制出 N 份登录态与 N 个轮询,
同一账号会被并发操作。

- app/shared:配置、错误码、日志、ApiResponse 信封 + Bearer 鉴权 + 异常处理器、
  导航请求头构造器
- app/scraping:站点常量、会话、解析器与 10 个抓取接口,:31107,可多开
- app/trading:登录态查询/重载与健康检查,:31108,只能单实例
- 依赖方向锁为 scraping→shared、trading→shared,两侧互不 import;
  tests/test_architecture.py 用 AST 检查 import 并校验两个 app 的路径不串
- 登录态 UA 在 trading 独立持有:与抓取 UA 值相同但变更理由不同,抓取 UA 为绕
  反爬可随时调整,登录 UA 一改可能触发设备校验使已落盘 cookie 失效
- scripts/login.py 与 AuthSession 共用 auth_site.PROFILES 与 is_logged_in,判据只写一遍
- 同一镜像两个启动命令,交易容器覆盖 command 并设 RAKUTEN_HEALTH_PORT

同时带上此前未提交的 ラクマ 分类接口与登录态基础设施。

验证:239 个离线用例全绿;两个入口真实启动,/health 与鉴权正常。
未验证:真实探测登录态(当前开发机无外网,对站点的连接全部超时)。

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-07-27 15:05:01 +08:00

56 lines
2.1 KiB
Python

"""从页面 HTML 中抽取服务端渲染的 `window.__INITIAL_STATE__`
搜索页与(手机版)商品详情页都会把整页数据以 JSON 形式内联到这个全局变量里,
因此不需要解析 DOM——直接把 JSON 取出来即可拿到结构化数据。
该赋值语句后面紧跟着其他脚本代码,不能按行或按分号切分,只能用增量 JSON
解码器从 `=` 之后开始解析,读到一个完整对象为止。
"""
from __future__ import annotations
import json
import re
from collections.abc import Callable
from typing import Any
from app.shared.errors import ScrapeParseError
# 页面必须包含的服务端渲染数据标记;缺失说明拿到的不是正常页面
STATE_MARKER = "window.__INITIAL_STATE__"
# 页面校验器:接收 (页面 HTML, 最终落地 URL),返回 None 表示通过,返回字符串表示
# 失败原因(会触发抓取层换 cookie / 浏览器兜底重试)。遇到重试也无济于事的情况
# (例如落到了不支持的站点),校验器可直接抛 AppError 快速失败。
PageValidator = Callable[[str, str], str | None]
_ASSIGNMENT_RE = re.compile(r"window\.__INITIAL_STATE__\s*=\s*")
_DECODER = json.JSONDecoder()
def require_state_marker(html: str, _final_url: str) -> str | None:
"""默认页面校验:必须含服务端渲染数据"""
if STATE_MARKER in html:
return None
return f"missing {STATE_MARKER} (body {len(html)} bytes)"
def extract_initial_state(html: str) -> dict[str, Any]:
"""抽取并解析 `window.__INITIAL_STATE__`
Raises:
ScrapeParseError: 页面中没有该变量,或其内容不是合法 JSON 对象
"""
match = _ASSIGNMENT_RE.search(html)
if match is None:
raise ScrapeParseError("页面中未找到 window.__INITIAL_STATE__")
try:
state, _ = _DECODER.raw_decode(html, match.end())
except ValueError as exc:
raise ScrapeParseError(f"window.__INITIAL_STATE__ 解析失败:{exc}") from exc
if not isinstance(state, dict):
raise ScrapeParseError("window.__INITIAL_STATE__ 不是 JSON 对象")
return state