拆分抓取与交易服务
把需要账号登录态的链路从抓取服务里拆出成独立进程。分界线不是「要不要登录」, 而是抓取无状态、幂等、可多开实例,而交易的写操作不可逆、登录态全局唯一、 订单监控是常驻轮询——同进程时抓取一扩容就会复制出 N 份登录态与 N 个轮询, 同一账号会被并发操作。 - app/shared:配置、错误码、日志、ApiResponse 信封 + Bearer 鉴权 + 异常处理器、 导航请求头构造器 - app/scraping:站点常量、会话、解析器与 10 个抓取接口,:31107,可多开 - app/trading:登录态查询/重载与健康检查,:31108,只能单实例 - 依赖方向锁为 scraping→shared、trading→shared,两侧互不 import; tests/test_architecture.py 用 AST 检查 import 并校验两个 app 的路径不串 - 登录态 UA 在 trading 独立持有:与抓取 UA 值相同但变更理由不同,抓取 UA 为绕 反爬可随时调整,登录 UA 一改可能触发设备校验使已落盘 cookie 失效 - scripts/login.py 与 AuthSession 共用 auth_site.PROFILES 与 is_logged_in,判据只写一遍 - 同一镜像两个启动命令,交易容器覆盖 command 并设 RAKUTEN_HEALTH_PORT 同时带上此前未提交的 ラクマ 分类接口与登录态基础设施。 验证:239 个离线用例全绿;两个入口真实启动,/health 与鉴权正常。 未验证:真实探测登录态(当前开发机无外网,对站点的连接全部超时)。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,36 @@
|
||||
"""抓取服务健康检查路由"""
|
||||
from fastapi import APIRouter, Depends
|
||||
|
||||
from app.scraping.container import ScrapingContainer
|
||||
from app.scraping.models.scrape import HealthData
|
||||
from app.shared.api import ApiResponse, get_container
|
||||
|
||||
router = APIRouter(tags=["health"])
|
||||
|
||||
|
||||
@router.get("/health", response_model=ApiResponse[HealthData])
|
||||
async def health(container: ScrapingContainer = Depends(get_container)) -> ApiResponse[HealthData]:
|
||||
"""抓取服务健康状态
|
||||
|
||||
sessions 里给出乐天的 PC / 手机两条抓取通道的 cookie 预热情况,以及
|
||||
ラクマ 通道的就绪状态(ラクマ 无需预热,只报是否已初始化);
|
||||
browser_fallback_* 反映浏览器兜底当前是否可用(未安装 playwright 时为不可用,
|
||||
属于预期降级,不影响主链路)。
|
||||
|
||||
账号登录态不在这里——它属于交易服务,查它请打交易服务的 /health。
|
||||
"""
|
||||
return ApiResponse[HealthData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=HealthData(
|
||||
status="ok",
|
||||
browser_fallback_enabled=container.browser_fallback.enabled,
|
||||
browser_fallback_ready=container.browser_fallback.ready,
|
||||
browser_fallback_error=container.browser_fallback.unavailable_reason,
|
||||
sessions={
|
||||
**container.site_session.profile_status(),
|
||||
"rakuma": container.rakuma_session.status(),
|
||||
},
|
||||
),
|
||||
code=0,
|
||||
)
|
||||
@@ -0,0 +1,157 @@
|
||||
"""抓取路由:ラクマ(fril.jp)的搜索、分类、商品详情与卖家
|
||||
|
||||
单独挂在 /api/rakuma 前缀下,不与乐天市场的接口合并:两站的筛选参数体系
|
||||
差异很大(乐天有 genre_id / 成色 / SuperDEAL,ラクマ 有 category_id /
|
||||
brand_id / 匿名配送 / 鉴定服务),合并会让大半字段对另一站无效。
|
||||
"""
|
||||
from fastapi import APIRouter, Depends
|
||||
|
||||
from app.shared.api import ApiResponse, get_container, require_bearer_token
|
||||
from app.scraping.container import ScrapingContainer
|
||||
from app.scraping.models.scrape import (
|
||||
RakumaCategoryData,
|
||||
RakumaCategoryRequest,
|
||||
RakumaItemDetailData,
|
||||
RakumaItemDetailRequest,
|
||||
RakumaSearchRequest,
|
||||
RakumaSearchResultData,
|
||||
RakumaShopDetailData,
|
||||
RakumaShopDetailRequest,
|
||||
RakumaShopItemsData,
|
||||
RakumaShopItemsRequest,
|
||||
)
|
||||
|
||||
router = APIRouter(prefix="/api/rakuma", tags=["rakuma"])
|
||||
|
||||
|
||||
@router.post(
|
||||
"/search",
|
||||
response_model=ApiResponse[RakumaSearchResultData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def search(
|
||||
payload: RakumaSearchRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[RakumaSearchResultData]:
|
||||
"""搜索 ラクマ 商品列表
|
||||
|
||||
支持关键词、分类、品牌、价格区间、商品状态(6 档成色,可多选)、
|
||||
在售/售罄、免运费、匿名配送等筛选;也可以直接传 search_url 透传一条
|
||||
fril.jp 搜索页地址。
|
||||
|
||||
每页固定 40 条,站点侧最多翻到第 100 页(page > 100 直接 404)。
|
||||
"""
|
||||
data = await container.rakuma_client.search(payload)
|
||||
return ApiResponse[RakumaSearchResultData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
|
||||
|
||||
@router.post(
|
||||
"/categories",
|
||||
response_model=ApiResponse[RakumaCategoryData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def categories(
|
||||
payload: RakumaCategoryRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[RakumaCategoryData]:
|
||||
"""获取 ラクマ 分类树,用于取得 /api/rakuma/search 需要的 category_id
|
||||
|
||||
不传 category_id 返回 14 个顶层分类;传入后返回该分类的名称、祖先路径与
|
||||
直接子分类。分类共三层,逐层下钻即可定位到叶子分类。
|
||||
|
||||
站点一次请求就返回整棵树,所以把 include_descendants 置为 true 可以直接
|
||||
拿到该分类下的完整子树,不会多花请求。
|
||||
|
||||
站点分类数据里没有商品数(要逐个分类另抓一次页面才有),因此本接口不返回。
|
||||
"""
|
||||
data = await container.rakuma_client.categories(payload)
|
||||
return ApiResponse[RakumaCategoryData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
|
||||
|
||||
@router.post(
|
||||
"/item_detail",
|
||||
response_model=ApiResponse[RakumaItemDetailData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def item_detail(
|
||||
payload: RakumaItemDetailRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[RakumaItemDetailData]:
|
||||
"""获取 ラクマ 商品详情
|
||||
|
||||
传 item_id(商品页 URL 的最后一段 hash),或直接传 item_url。
|
||||
返回名称、价格、描述、图片、成色、配送信息与出品者摘要。
|
||||
|
||||
ラクマ 是 C2C 集市,每件商品都是单件的:没有 SKU 组合,也没有库存数量。
|
||||
响应里的 seller.shop_id 可直接用于 /api/rakuma/shop_detail。
|
||||
"""
|
||||
data = await container.rakuma_client.item_detail(payload)
|
||||
return ApiResponse[RakumaItemDetailData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
|
||||
|
||||
@router.post(
|
||||
"/shop_detail",
|
||||
response_model=ApiResponse[RakumaShopDetailData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def shop_detail(
|
||||
payload: RakumaShopDetailRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[RakumaShopDetailData]:
|
||||
"""获取 ラクマ 卖家(出品者)详情
|
||||
|
||||
传 shop_id(店铺页 URL 的最后一段 hash),或直接传 shop_url。
|
||||
返回店铺名、昵称、头像与封面、简介、评分与评价数、本人确认状态、
|
||||
以及该卖家的商品总数。
|
||||
|
||||
评价明细(最新 100 条)与好评/普通/差评分档计数在站点的单独子页上,
|
||||
需要多打一次请求,把 include_reviews 置为 true 才会返回。
|
||||
"""
|
||||
data = await container.rakuma_client.shop_detail(payload)
|
||||
return ApiResponse[RakumaShopDetailData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
|
||||
|
||||
@router.post(
|
||||
"/shop_items",
|
||||
response_model=ApiResponse[RakumaShopItemsData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def shop_items(
|
||||
payload: RakumaShopItemsRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[RakumaShopItemsData]:
|
||||
"""获取 ラクマ 卖家名下的商品列表
|
||||
|
||||
传 shop_id 或 shop_url,按页取该卖家的全部商品(含已售出,
|
||||
用每条的 is_sold_out 区分)。
|
||||
|
||||
站点在店铺页不提供排序与筛选参数,因此这里只有页码;需要筛选请改用
|
||||
/api/rakuma/search。
|
||||
"""
|
||||
data = await container.rakuma_client.shop_items(payload)
|
||||
return ApiResponse[RakumaShopItemsData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
@@ -0,0 +1,146 @@
|
||||
"""抓取路由:乐天市场的搜索、分类、商品详情与商家"""
|
||||
from fastapi import APIRouter, Depends
|
||||
|
||||
from app.shared.api import ApiResponse, get_container, require_bearer_token
|
||||
from app.scraping.container import ScrapingContainer
|
||||
from app.scraping.models.scrape import (
|
||||
GenreData,
|
||||
GenreRequest,
|
||||
ItemDetailData,
|
||||
ItemDetailRequest,
|
||||
SearchRequest,
|
||||
SearchResultData,
|
||||
ShopDetailData,
|
||||
ShopDetailRequest,
|
||||
ShopItemsRequest,
|
||||
)
|
||||
|
||||
router = APIRouter(prefix="/api", tags=["scrape"])
|
||||
|
||||
|
||||
@router.post(
|
||||
"/search",
|
||||
response_model=ApiResponse[SearchResultData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def search(
|
||||
payload: SearchRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[SearchResultData]:
|
||||
"""搜索商品列表
|
||||
|
||||
支持关键词、分类、排序、价格区间、店铺、成色、免运费等筛选;也可以直接传
|
||||
search_url 透传一条乐天搜索页地址。返回结果默认已剔除混入的 CPC 广告位
|
||||
(剔除数量见 ad_count)。
|
||||
|
||||
翻页上限受站点限制:最多只能取到 reachable_count 条(通常 6750)。
|
||||
"""
|
||||
data = await container.rakuten_client.search(payload)
|
||||
return ApiResponse[SearchResultData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
|
||||
|
||||
@router.post(
|
||||
"/genres",
|
||||
response_model=ApiResponse[GenreData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def genres(
|
||||
payload: GenreRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[GenreData]:
|
||||
"""获取乐天分类(genre)树,用于取得 /api/search 需要的 genre_id
|
||||
|
||||
不传 genre_id 返回 39 个顶层分类;传入后返回该分类的名称、描述、祖先路径
|
||||
与直接子分类,逐层下钻即可定位到叶子分类。
|
||||
|
||||
子分类的 item_count 是该分类下的商品数;顶层列表不返回该值,因为站点给出的
|
||||
是「当前查询在该分类下的命中数」,并非分类自身的商品总量。
|
||||
"""
|
||||
data = await container.rakuten_client.genres(payload)
|
||||
return ApiResponse[GenreData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
|
||||
|
||||
@router.post(
|
||||
"/item_detail",
|
||||
response_model=ApiResponse[ItemDetailData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def item_detail(
|
||||
payload: ItemDetailRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[ItemDetailData]:
|
||||
"""获取商品详情
|
||||
|
||||
传 shop_code + item_code(即商品 URL 的两段路径),或直接传 item_url。
|
||||
返回名称、价格、图片、店铺、评价、配送与全部 SKU 组合;SKU 组合可能多达
|
||||
数百条,不需要时可将 include_sku_variants 置为 false。
|
||||
"""
|
||||
data = await container.rakuten_client.item_detail(payload)
|
||||
return ApiResponse[ItemDetailData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
|
||||
|
||||
@router.post(
|
||||
"/shop_detail",
|
||||
response_model=ApiResponse[ShopDetailData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def shop_detail(
|
||||
payload: ShopDetailRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[ShopDetailData]:
|
||||
"""获取乐天商家(店铺)详情
|
||||
|
||||
传 shop_code(店铺首页 URL 的路径段,如 edion),或直接传 shop_url。
|
||||
返回店铺名称、简介、评分与评价数、招牌图、是否 39ショップ 与休息日。
|
||||
|
||||
评价数过少时站点不展示评分,此时 review_displayed 为 false,
|
||||
review_score 不可信。
|
||||
"""
|
||||
data = await container.rakuten_client.shop_detail(payload)
|
||||
return ApiResponse[ShopDetailData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
|
||||
|
||||
@router.post(
|
||||
"/shop_items",
|
||||
response_model=ApiResponse[SearchResultData],
|
||||
dependencies=[Depends(require_bearer_token)],
|
||||
)
|
||||
async def shop_items(
|
||||
payload: ShopItemsRequest,
|
||||
container: ScrapingContainer = Depends(get_container),
|
||||
) -> ApiResponse[SearchResultData]:
|
||||
"""获取乐天商家名下的商品列表
|
||||
|
||||
传 shop_id(取自搜索结果或 /api/shop_detail)或 shop_code;只给 shop_code
|
||||
时服务端会先取一次店铺详情换出 shop_id,多花一次请求。
|
||||
|
||||
支持在店铺内按关键词、分类、价格、成色等继续筛选,翻页与返回结构同
|
||||
/api/search。
|
||||
"""
|
||||
data = await container.rakuten_client.shop_items(payload)
|
||||
return ApiResponse[SearchResultData](
|
||||
success=True,
|
||||
msg="success",
|
||||
data=data,
|
||||
code=0,
|
||||
)
|
||||
Reference in New Issue
Block a user