拆分抓取与交易服务
把需要账号登录态的链路从抓取服务里拆出成独立进程。分界线不是「要不要登录」, 而是抓取无状态、幂等、可多开实例,而交易的写操作不可逆、登录态全局唯一、 订单监控是常驻轮询——同进程时抓取一扩容就会复制出 N 份登录态与 N 个轮询, 同一账号会被并发操作。 - app/shared:配置、错误码、日志、ApiResponse 信封 + Bearer 鉴权 + 异常处理器、 导航请求头构造器 - app/scraping:站点常量、会话、解析器与 10 个抓取接口,:31107,可多开 - app/trading:登录态查询/重载与健康检查,:31108,只能单实例 - 依赖方向锁为 scraping→shared、trading→shared,两侧互不 import; tests/test_architecture.py 用 AST 检查 import 并校验两个 app 的路径不串 - 登录态 UA 在 trading 独立持有:与抓取 UA 值相同但变更理由不同,抓取 UA 为绕 反爬可随时调整,登录 UA 一改可能触发设备校验使已落盘 cookie 失效 - scripts/login.py 与 AuthSession 共用 auth_site.PROFILES 与 is_logged_in,判据只写一遍 - 同一镜像两个启动命令,交易容器覆盖 command 并设 RAKUTEN_HEALTH_PORT 同时带上此前未提交的 ラクマ 分类接口与登录态基础设施。 验证:239 个离线用例全绿;两个入口真实启动,/health 与鉴权正常。 未验证:真实探测登录态(当前开发机无外网,对站点的连接全部超时)。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,102 @@
|
||||
"""ラクマ(fril.jp)站点常量
|
||||
|
||||
集中维护站点入口 URL、浏览器指纹参数,以及搜索页 URL 的排序码 / 筛选码映射。
|
||||
|
||||
排序与筛选参数并非猜测,而是从站点前端 bundle
|
||||
(asset.fril.jp/assets/v2/application-*.js)中 SearchPanel 组件的 `_url()`
|
||||
方法里提取的——那段代码逐条拼出搜索 URL,因此参数名与取值与站点行为一一对应。
|
||||
|
||||
与乐天市场(app/core/site.py)的关键差异:
|
||||
- 页面是服务端渲染的 HTML,**没有** `window.__INITIAL_STATE__`,只能解析 DOM
|
||||
- 前置的不是 Akamai Bot Manager,无限速行为,冷请求即 ~0.6-1.1s,不需要 cookie 预热
|
||||
- 商品详情页用 PC UA 即可,不需要像乐天那样切手机 UA
|
||||
"""
|
||||
from __future__ import annotations
|
||||
|
||||
from typing import Final
|
||||
|
||||
from app.shared import headers
|
||||
|
||||
# ---- 站点入口 ----
|
||||
HOME_URL: Final = "https://fril.jp/"
|
||||
SEARCH_BASE_URL: Final = "https://fril.jp/s"
|
||||
ITEM_BASE_URL: Final = "https://item.fril.jp/"
|
||||
SHOP_BASE_URL: Final = "https://fril.jp/shop/"
|
||||
CATEGORY_BASE_URL: Final = "https://fril.jp/category/"
|
||||
BRAND_BASE_URL: Final = "https://fril.jp/brand/"
|
||||
|
||||
# 分类一览页。它是 Next.js App Router 页面,服务端把整棵分类树写进 RSC flight
|
||||
# payload(`self.__next_f.push`)。实测这份数据与 `?category_id=` 无关:传任意
|
||||
# 合法分类、或完全不传,返回的 categoryList 都是同一份全量树(1686 条),
|
||||
# 因此取分类只需一次请求,不像乐天 genre 那样必须逐层下钻。
|
||||
CATEGORY_LIST_URL: Final = "https://fril.jp/category"
|
||||
|
||||
SEARCH_HOST: Final = "fril.jp"
|
||||
ITEM_HOST: Final = "item.fril.jp"
|
||||
|
||||
# 站点每页固定返回 40 条(实测第 1 页与深翻页均为 40)
|
||||
PAGE_SIZE: Final = 40
|
||||
|
||||
# 站点侧翻页上限:page=100 正常返回,page=101 起直接 404。
|
||||
MAX_PAGE: Final = 100
|
||||
|
||||
# ---- 浏览器指纹 ----
|
||||
# 两类页面都用 PC UA:详情页 PC 版即为完整模板,无需像乐天那样切手机 UA。
|
||||
USER_AGENT: Final = (
|
||||
"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 "
|
||||
"(KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36"
|
||||
)
|
||||
|
||||
ACCEPT_LANGUAGE: Final = headers.ACCEPT_LANGUAGE
|
||||
|
||||
|
||||
def default_headers() -> dict[str, str]:
|
||||
"""构造一套完整的浏览器导航请求头"""
|
||||
return headers.navigation_headers(USER_AGENT, mobile=False)
|
||||
|
||||
|
||||
# ---- 排序(搜索页 `sort=` + `order=` 两个参数)----
|
||||
# 键为对外暴露的语义化排序名,值为 (sort, order)。
|
||||
# 站点把排序字段与升降序拆成两个参数,因此这里成对给出。
|
||||
SORT_CODES: Final[dict[str, tuple[str, str]]] = {
|
||||
"standard": ("relevance", "desc"), # 站点默认的おすすめ順
|
||||
"newest": ("created_at", "desc"),
|
||||
"price_asc": ("sell_price", "asc"),
|
||||
"price_desc": ("sell_price", "desc"),
|
||||
"like_count": ("like_count", "desc"), # いいね数順
|
||||
}
|
||||
|
||||
# ---- 商品状态(搜索页 `statuses=`,逗号分隔可多选)----
|
||||
# 取值来自 SearchPanel 组件的 statusOptions 定义。
|
||||
CONDITION_CODES: Final[dict[str, str]] = {
|
||||
"new": "5", # 新品、未使用
|
||||
"almost_new": "4", # 未使用に近い
|
||||
"no_damage": "6", # 目立った傷や汚れなし
|
||||
"slight_damage": "3", # やや傷や汚れあり
|
||||
"damaged": "2", # 傷や汚れあり
|
||||
"poor": "1", # 全体的に状態が悪い
|
||||
}
|
||||
|
||||
# ---- 售卖状态(搜索页 `transaction=`)----
|
||||
# 站点默认 all(不带该参数),仅在筛选时下发。
|
||||
TRANSACTION_CODES: Final[dict[str, str]] = {
|
||||
"on_sale": "selling", # 販売中のみ
|
||||
"sold_out": "soldout", # 売切れのみ
|
||||
}
|
||||
|
||||
# ---- 鉴定服务(搜索页 `authenticity_types=`)----
|
||||
AUTHENTICITY_CODES: Final[dict[str, str]] = {
|
||||
"before_delivery": "pre", # お届け前鑑定
|
||||
"after_delivery": "post", # 後から鑑定
|
||||
}
|
||||
|
||||
# 运费负担:站点用 carriage=1 表示「送料込みのみ」(卖家承担),0 表示不限
|
||||
CARRIAGE_INCLUDED: Final = "1"
|
||||
|
||||
# 商品详情页上表示已售出的标记文案
|
||||
SOLD_OUT_MARKERS: Final = ("SOLD OUT", "SOLDOUT", "売り切れました")
|
||||
|
||||
# 页面校验用的结构标记:这几类页面各自必须出现的 DOM 特征
|
||||
SEARCH_PAGE_MARKER: Final = "page-count"
|
||||
ITEM_PAGE_MARKER: Final = "item-info"
|
||||
SHOP_PAGE_MARKER: Final = "profile-area__shop-name"
|
||||
@@ -0,0 +1,93 @@
|
||||
"""乐天市场(rakuten.co.jp)站点常量
|
||||
|
||||
集中维护站点入口 URL、浏览器指纹参数,以及搜索页 URL 的排序码 / 筛选码映射。
|
||||
|
||||
排序码(`s=`)与筛选码(`f=`)并非猜测所得,而是从搜索页前端 bundle
|
||||
(r.r10s.jp/com/assets/app/pages/search/javascript/pc-*.bundle.js)中的
|
||||
URL→UiQuestion 转换逻辑里提取的枚举,与站点行为一一对应。
|
||||
"""
|
||||
from __future__ import annotations
|
||||
|
||||
from typing import Final
|
||||
|
||||
from app.shared import headers
|
||||
|
||||
# ---- 站点入口 ----
|
||||
HOME_URL: Final = "https://www.rakuten.co.jp/"
|
||||
SEARCH_BASE_URL: Final = "https://search.rakuten.co.jp/search/mall/"
|
||||
ITEM_BASE_URL: Final = "https://item.rakuten.co.jp/"
|
||||
|
||||
CATEGORY_BASE_URL: Final = "https://www.rakuten.co.jp/category/"
|
||||
|
||||
# 店铺首页形如 https://www.rakuten.co.jp/edion/
|
||||
WWW_BASE_URL: Final = "https://www.rakuten.co.jp/"
|
||||
|
||||
SEARCH_HOST: Final = "search.rakuten.co.jp"
|
||||
ITEM_HOST: Final = "item.rakuten.co.jp"
|
||||
WWW_HOST: Final = "www.rakuten.co.jp"
|
||||
|
||||
# 取顶层分类列表用的哨兵关键词。
|
||||
# 站点的分类分面(genreTree)与查询内容无关,任何关键词都会返回同一套 39 个顶层
|
||||
# 分类;刻意用一个搜不到东西的词,可以拿到 count 全为 null 的干净列表,避免把
|
||||
# 「某个关键词下的命中数」误当成分类的商品总数返回。
|
||||
# 注意不能用单字母(如 a),站点对过短的拉丁关键词直接返回 503。
|
||||
GENRE_FACET_PROBE_KEYWORD: Final = "zzzqqqxyz123"
|
||||
|
||||
# 站点侧限制:搜索结果最多只能翻到 pagination.subset 条(实测 6750),
|
||||
# 再往后翻页返回空列表。用于计算 has_more,避免上游无意义地深翻。
|
||||
DEFAULT_SUBSET_LIMIT: Final = 6750
|
||||
|
||||
# ---- 浏览器指纹 ----
|
||||
# 搜索页用 PC UA;商品详情页必须用手机 UA,否则返回的是各店铺自定义的
|
||||
# EUC-JP 老模板(无 __INITIAL_STATE__,只有面包屑 JSON-LD,无法结构化解析)。
|
||||
PC_USER_AGENT: Final = (
|
||||
"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 "
|
||||
"(KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36"
|
||||
)
|
||||
SP_USER_AGENT: Final = (
|
||||
"Mozilla/5.0 (iPhone; CPU iPhone OS 17_5 like Mac OS X) AppleWebKit/605.1.15 "
|
||||
"(KHTML, like Gecko) Version/17.5 Mobile/15E148 Safari/604.1"
|
||||
)
|
||||
|
||||
ACCEPT_LANGUAGE: Final = headers.ACCEPT_LANGUAGE
|
||||
|
||||
|
||||
def default_headers(*, mobile: bool) -> dict[str, str]:
|
||||
"""构造一套完整的浏览器导航请求头。"""
|
||||
return headers.navigation_headers(
|
||||
SP_USER_AGENT if mobile else PC_USER_AGENT, mobile=mobile
|
||||
)
|
||||
|
||||
|
||||
# Akamai Bot Manager 下发的 cookie:判断会话是否已预热完成的依据
|
||||
AKAMAI_COOKIE_NAMES: Final = ("ak_bmsc", "bm_sv", "bm_mi", "_abck")
|
||||
|
||||
# ---- 排序(搜索页 `s=` 参数)----
|
||||
# 键为对外暴露的语义化排序名,值为站点侧排序码;standard 不带 s 参数。
|
||||
SORT_CODES: Final[dict[str, str | None]] = {
|
||||
"standard": None, # 站点默认的相关度排序(relevancy)
|
||||
"price_asc": "2",
|
||||
"price_desc": "3",
|
||||
"newest": "4",
|
||||
"review_count": "5",
|
||||
"review_score": "6",
|
||||
"price_with_shipping_asc": "11",
|
||||
"price_with_shipping_desc": "12",
|
||||
}
|
||||
|
||||
# ---- 成色(搜索页 `f=` 参数中的 condition 段)----
|
||||
CONDITION_CODES: Final[dict[str, str]] = {
|
||||
"new": "101",
|
||||
"used": "100",
|
||||
"rental": "102",
|
||||
}
|
||||
|
||||
# ---- 布尔筛选(搜索页 `f=` 参数,可重复出现)----
|
||||
# 字段名 -> 筛选码
|
||||
BOOL_FILTER_CODES: Final[dict[str, str]] = {
|
||||
"include_sold_out": "0",
|
||||
"free_shipping": "2",
|
||||
"has_review": "4",
|
||||
"next_day_delivery": "12",
|
||||
"super_deal": "13",
|
||||
}
|
||||
Reference in New Issue
Block a user