把需要账号登录态的链路从抓取服务里拆出成独立进程。分界线不是「要不要登录」, 而是抓取无状态、幂等、可多开实例,而交易的写操作不可逆、登录态全局唯一、 订单监控是常驻轮询——同进程时抓取一扩容就会复制出 N 份登录态与 N 个轮询, 同一账号会被并发操作。 - app/shared:配置、错误码、日志、ApiResponse 信封 + Bearer 鉴权 + 异常处理器、 导航请求头构造器 - app/scraping:站点常量、会话、解析器与 10 个抓取接口,:31107,可多开 - app/trading:登录态查询/重载与健康检查,:31108,只能单实例 - 依赖方向锁为 scraping→shared、trading→shared,两侧互不 import; tests/test_architecture.py 用 AST 检查 import 并校验两个 app 的路径不串 - 登录态 UA 在 trading 独立持有:与抓取 UA 值相同但变更理由不同,抓取 UA 为绕 反爬可随时调整,登录 UA 一改可能触发设备校验使已落盘 cookie 失效 - scripts/login.py 与 AuthSession 共用 auth_site.PROFILES 与 is_logged_in,判据只写一遍 - 同一镜像两个启动命令,交易容器覆盖 command 并设 RAKUTEN_HEALTH_PORT 同时带上此前未提交的 ラクマ 分类接口与登录态基础设施。 验证:239 个离线用例全绿;两个入口真实启动,/health 与鉴权正常。 未验证:真实探测登录态(当前开发机无外网,对站点的连接全部超时)。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
147 lines
4.6 KiB
Python
147 lines
4.6 KiB
Python
"""抓取路由:乐天市场的搜索、分类、商品详情与商家"""
|
|
from fastapi import APIRouter, Depends
|
|
|
|
from app.shared.api import ApiResponse, get_container, require_bearer_token
|
|
from app.scraping.container import ScrapingContainer
|
|
from app.scraping.models.scrape import (
|
|
GenreData,
|
|
GenreRequest,
|
|
ItemDetailData,
|
|
ItemDetailRequest,
|
|
SearchRequest,
|
|
SearchResultData,
|
|
ShopDetailData,
|
|
ShopDetailRequest,
|
|
ShopItemsRequest,
|
|
)
|
|
|
|
router = APIRouter(prefix="/api", tags=["scrape"])
|
|
|
|
|
|
@router.post(
|
|
"/search",
|
|
response_model=ApiResponse[SearchResultData],
|
|
dependencies=[Depends(require_bearer_token)],
|
|
)
|
|
async def search(
|
|
payload: SearchRequest,
|
|
container: ScrapingContainer = Depends(get_container),
|
|
) -> ApiResponse[SearchResultData]:
|
|
"""搜索商品列表
|
|
|
|
支持关键词、分类、排序、价格区间、店铺、成色、免运费等筛选;也可以直接传
|
|
search_url 透传一条乐天搜索页地址。返回结果默认已剔除混入的 CPC 广告位
|
|
(剔除数量见 ad_count)。
|
|
|
|
翻页上限受站点限制:最多只能取到 reachable_count 条(通常 6750)。
|
|
"""
|
|
data = await container.rakuten_client.search(payload)
|
|
return ApiResponse[SearchResultData](
|
|
success=True,
|
|
msg="success",
|
|
data=data,
|
|
code=0,
|
|
)
|
|
|
|
|
|
@router.post(
|
|
"/genres",
|
|
response_model=ApiResponse[GenreData],
|
|
dependencies=[Depends(require_bearer_token)],
|
|
)
|
|
async def genres(
|
|
payload: GenreRequest,
|
|
container: ScrapingContainer = Depends(get_container),
|
|
) -> ApiResponse[GenreData]:
|
|
"""获取乐天分类(genre)树,用于取得 /api/search 需要的 genre_id
|
|
|
|
不传 genre_id 返回 39 个顶层分类;传入后返回该分类的名称、描述、祖先路径
|
|
与直接子分类,逐层下钻即可定位到叶子分类。
|
|
|
|
子分类的 item_count 是该分类下的商品数;顶层列表不返回该值,因为站点给出的
|
|
是「当前查询在该分类下的命中数」,并非分类自身的商品总量。
|
|
"""
|
|
data = await container.rakuten_client.genres(payload)
|
|
return ApiResponse[GenreData](
|
|
success=True,
|
|
msg="success",
|
|
data=data,
|
|
code=0,
|
|
)
|
|
|
|
|
|
@router.post(
|
|
"/item_detail",
|
|
response_model=ApiResponse[ItemDetailData],
|
|
dependencies=[Depends(require_bearer_token)],
|
|
)
|
|
async def item_detail(
|
|
payload: ItemDetailRequest,
|
|
container: ScrapingContainer = Depends(get_container),
|
|
) -> ApiResponse[ItemDetailData]:
|
|
"""获取商品详情
|
|
|
|
传 shop_code + item_code(即商品 URL 的两段路径),或直接传 item_url。
|
|
返回名称、价格、图片、店铺、评价、配送与全部 SKU 组合;SKU 组合可能多达
|
|
数百条,不需要时可将 include_sku_variants 置为 false。
|
|
"""
|
|
data = await container.rakuten_client.item_detail(payload)
|
|
return ApiResponse[ItemDetailData](
|
|
success=True,
|
|
msg="success",
|
|
data=data,
|
|
code=0,
|
|
)
|
|
|
|
|
|
@router.post(
|
|
"/shop_detail",
|
|
response_model=ApiResponse[ShopDetailData],
|
|
dependencies=[Depends(require_bearer_token)],
|
|
)
|
|
async def shop_detail(
|
|
payload: ShopDetailRequest,
|
|
container: ScrapingContainer = Depends(get_container),
|
|
) -> ApiResponse[ShopDetailData]:
|
|
"""获取乐天商家(店铺)详情
|
|
|
|
传 shop_code(店铺首页 URL 的路径段,如 edion),或直接传 shop_url。
|
|
返回店铺名称、简介、评分与评价数、招牌图、是否 39ショップ 与休息日。
|
|
|
|
评价数过少时站点不展示评分,此时 review_displayed 为 false,
|
|
review_score 不可信。
|
|
"""
|
|
data = await container.rakuten_client.shop_detail(payload)
|
|
return ApiResponse[ShopDetailData](
|
|
success=True,
|
|
msg="success",
|
|
data=data,
|
|
code=0,
|
|
)
|
|
|
|
|
|
@router.post(
|
|
"/shop_items",
|
|
response_model=ApiResponse[SearchResultData],
|
|
dependencies=[Depends(require_bearer_token)],
|
|
)
|
|
async def shop_items(
|
|
payload: ShopItemsRequest,
|
|
container: ScrapingContainer = Depends(get_container),
|
|
) -> ApiResponse[SearchResultData]:
|
|
"""获取乐天商家名下的商品列表
|
|
|
|
传 shop_id(取自搜索结果或 /api/shop_detail)或 shop_code;只给 shop_code
|
|
时服务端会先取一次店铺详情换出 shop_id,多花一次请求。
|
|
|
|
支持在店铺内按关键词、分类、价格、成色等继续筛选,翻页与返回结构同
|
|
/api/search。
|
|
"""
|
|
data = await container.rakuten_client.shop_items(payload)
|
|
return ApiResponse[SearchResultData](
|
|
success=True,
|
|
msg="success",
|
|
data=data,
|
|
code=0,
|
|
)
|