Files
rakuten-api/app/scraping/parsers/shop.py
T
q792602257andClaude Opus 5 104d7fef6b 拆分抓取与交易服务
把需要账号登录态的链路从抓取服务里拆出成独立进程。分界线不是「要不要登录」,
而是抓取无状态、幂等、可多开实例,而交易的写操作不可逆、登录态全局唯一、
订单监控是常驻轮询——同进程时抓取一扩容就会复制出 N 份登录态与 N 个轮询,
同一账号会被并发操作。

- app/shared:配置、错误码、日志、ApiResponse 信封 + Bearer 鉴权 + 异常处理器、
  导航请求头构造器
- app/scraping:站点常量、会话、解析器与 10 个抓取接口,:31107,可多开
- app/trading:登录态查询/重载与健康检查,:31108,只能单实例
- 依赖方向锁为 scraping→shared、trading→shared,两侧互不 import;
  tests/test_architecture.py 用 AST 检查 import 并校验两个 app 的路径不串
- 登录态 UA 在 trading 独立持有:与抓取 UA 值相同但变更理由不同,抓取 UA 为绕
  反爬可随时调整,登录 UA 一改可能触发设备校验使已落盘 cookie 失效
- scripts/login.py 与 AuthSession 共用 auth_site.PROFILES 与 is_logged_in,判据只写一遍
- 同一镜像两个启动命令,交易容器覆盖 command 并设 RAKUTEN_HEALTH_PORT

同时带上此前未提交的 ラクマ 分类接口与登录态基础设施。

验证:239 个离线用例全绿;两个入口真实启动,/health 与鉴权正常。
未验证:真实探测登录态(当前开发机无外网,对站点的连接全部超时)。

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-07-27 15:05:01 +08:00

80 lines
2.9 KiB
Python

"""乐天店铺页 __INITIAL_STATE__ → ShopDetailData
店铺首页(www.rakuten.co.jp/{店铺代码}/)与搜索页一样把状态内联在
`window.__INITIAL_STATE__` 里,店铺信息在顶层的 `shop` 节点下,结构比商品
详情页里的 shop.information 更完整(多出招牌图、39ショップ标记、休息日)。
店铺 logo 不在 state 里,只出现在页面的 ld+json AggregateRating 微数据中。
"""
from __future__ import annotations
import json
import re
from typing import Any
from app.scraping.core import site
from app.shared.errors import ScrapeParseError
from app.scraping.models.scrape import ShopDetailData
from app.scraping.utils.coerce import as_dict, as_float, as_int, as_list, as_str
_LD_JSON_RE = re.compile(
r'<script[^>]*type="application/ld\+json"[^>]*>(.*?)</script>', re.S
)
def _parse_logo_url(html: str) -> str:
"""从 ld+json 的 AggregateRating.itemReviewed 里取店铺 logo"""
for match in _LD_JSON_RE.finditer(html):
try:
data = json.loads(match.group(1))
except ValueError:
continue
if not isinstance(data, dict) or data.get("@type") != "AggregateRating":
continue
reviewed = data.get("itemReviewed")
if isinstance(reviewed, dict):
return as_str(reviewed.get("logo"))
return ""
def parse_shop_detail(
state: dict[str, Any], *, shop_code: str, html: str = ""
) -> ShopDetailData:
"""把店铺页状态解析为商家详情
Raises:
ScrapeParseError: 状态中不存在 shop 节点
"""
shop = state.get("shop")
if not isinstance(shop, dict) or not shop:
raise ScrapeParseError("店铺页缺少 shop 节点")
review = as_dict(shop.get("shopReview"))
resolved_code = as_str(shop.get("shopCode")) or shop_code
# state 里的 shopUrl 是 http 的且不带尾斜杠,统一按规范形式给出
shop_url = f"{site.WWW_BASE_URL}{resolved_code}/" if resolved_code else ""
holidays = [
as_str(day)
for day in as_list(as_dict(as_dict(shop.get("shopCalendar")).get("eventDates")).get("holiday"))
if as_str(day)
]
return ShopDetailData(
shop_id=as_int(shop.get("shopId")) or None,
shop_code=resolved_code,
shop_name=as_str(shop.get("shopName")),
shop_url=shop_url,
introduction=as_str(shop.get("shopIntroduction")),
signboard_url=as_str(shop.get("signboardUrl")),
logo_url=_parse_logo_url(html),
review_score=as_float(review.get("average")),
review_count=as_int(review.get("total")),
# 评价数过少时站点不展示评分,此时 average 不可信
review_displayed=bool(review.get("didMeetDisplayRequirements")),
is_39_shop=bool(shop.get("is39Shop")),
age_verification_required=bool(shop.get("ageVerificationFlag")),
status=as_int(shop.get("status")) if shop.get("status") is not None else None,
holidays=holidays,
)