把需要账号登录态的链路从抓取服务里拆出成独立进程。分界线不是「要不要登录」, 而是抓取无状态、幂等、可多开实例,而交易的写操作不可逆、登录态全局唯一、 订单监控是常驻轮询——同进程时抓取一扩容就会复制出 N 份登录态与 N 个轮询, 同一账号会被并发操作。 - app/shared:配置、错误码、日志、ApiResponse 信封 + Bearer 鉴权 + 异常处理器、 导航请求头构造器 - app/scraping:站点常量、会话、解析器与 10 个抓取接口,:31107,可多开 - app/trading:登录态查询/重载与健康检查,:31108,只能单实例 - 依赖方向锁为 scraping→shared、trading→shared,两侧互不 import; tests/test_architecture.py 用 AST 检查 import 并校验两个 app 的路径不串 - 登录态 UA 在 trading 独立持有:与抓取 UA 值相同但变更理由不同,抓取 UA 为绕 反爬可随时调整,登录 UA 一改可能触发设备校验使已落盘 cookie 失效 - scripts/login.py 与 AuthSession 共用 auth_site.PROFILES 与 is_logged_in,判据只写一遍 - 同一镜像两个启动命令,交易容器覆盖 command 并设 RAKUTEN_HEALTH_PORT 同时带上此前未提交的 ラクマ 分类接口与登录态基础设施。 验证:239 个离线用例全绿;两个入口真实启动,/health 与鉴权正常。 未验证:真实探测登录态(当前开发机无外网,对站点的连接全部超时)。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
58 lines
2.1 KiB
Python
58 lines
2.1 KiB
Python
"""子站解析器注册表与商品页分派
|
|
|
|
乐天部分官方旗舰店的商品页会 302 跳出 item.rakuten.co.jp,落到各自独立的站点。
|
|
这里按落地域名把页面分派给对应解析器;落到未登记的站点时抛 OffIchibaRedirectError,
|
|
让上游能明确区分「站点不支持」与「被反爬拦截」,而不是白白重试。
|
|
"""
|
|
from __future__ import annotations
|
|
|
|
from urllib.parse import urlsplit
|
|
|
|
from app.scraping.core import site
|
|
from app.shared.errors import OffIchibaRedirectError, ScrapeParseError
|
|
from app.scraping.models.scrape import ItemDetailData
|
|
from app.scraping.parsers.state import PageValidator, require_state_marker
|
|
from app.scraping.parsers.subsites import biccamera, books, brandavenue
|
|
from app.scraping.parsers.subsites.base import SubsitePage, SubsiteParser
|
|
|
|
SUBSITE_PARSERS: dict[str, SubsiteParser] = {
|
|
module.HOST: SubsiteParser(
|
|
host=module.HOST,
|
|
source=module.SOURCE,
|
|
shop_name=module.SHOP_NAME,
|
|
validate=module.validate,
|
|
parse=module.parse,
|
|
)
|
|
for module in (books, brandavenue, biccamera)
|
|
}
|
|
|
|
|
|
def host_of(url: str) -> str:
|
|
return urlsplit(url).hostname or ""
|
|
|
|
|
|
def build_item_page_validator(requested_url: str) -> PageValidator:
|
|
"""构造商品页校验器:按落地域名选用对应的页面校验规则
|
|
|
|
落到未登记的站点时直接抛错——换 cookie 或上浏览器都改变不了页面归属。
|
|
"""
|
|
|
|
def validate(html: str, final_url: str) -> str | None:
|
|
host = host_of(final_url)
|
|
if host == site.ITEM_HOST:
|
|
return require_state_marker(html, final_url)
|
|
parser = SUBSITE_PARSERS.get(host)
|
|
if parser is None:
|
|
raise OffIchibaRedirectError(requested_url, final_url)
|
|
return parser.validate(html)
|
|
|
|
return validate
|
|
|
|
|
|
def parse_subsite_item(page: SubsitePage) -> ItemDetailData:
|
|
"""把子站页面交给对应解析器"""
|
|
parser = SUBSITE_PARSERS.get(host_of(page.final_url))
|
|
if parser is None:
|
|
raise ScrapeParseError(f"没有匹配的子站解析器:{page.final_url}")
|
|
return parser.parse(page)
|