拆分抓取与交易服务

把需要账号登录态的链路从抓取服务里拆出成独立进程。分界线不是「要不要登录」,
而是抓取无状态、幂等、可多开实例,而交易的写操作不可逆、登录态全局唯一、
订单监控是常驻轮询——同进程时抓取一扩容就会复制出 N 份登录态与 N 个轮询,
同一账号会被并发操作。

- app/shared:配置、错误码、日志、ApiResponse 信封 + Bearer 鉴权 + 异常处理器、
  导航请求头构造器
- app/scraping:站点常量、会话、解析器与 10 个抓取接口,:31107,可多开
- app/trading:登录态查询/重载与健康检查,:31108,只能单实例
- 依赖方向锁为 scraping→shared、trading→shared,两侧互不 import;
  tests/test_architecture.py 用 AST 检查 import 并校验两个 app 的路径不串
- 登录态 UA 在 trading 独立持有:与抓取 UA 值相同但变更理由不同,抓取 UA 为绕
  反爬可随时调整,登录 UA 一改可能触发设备校验使已落盘 cookie 失效
- scripts/login.py 与 AuthSession 共用 auth_site.PROFILES 与 is_logged_in,判据只写一遍
- 同一镜像两个启动命令,交易容器覆盖 command 并设 RAKUTEN_HEALTH_PORT

同时带上此前未提交的 ラクマ 分类接口与登录态基础设施。

验证:239 个离线用例全绿;两个入口真实启动,/health 与鉴权正常。
未验证:真实探测登录态(当前开发机无外网,对站点的连接全部超时)。

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-07-27 15:05:01 +08:00
co-authored by Claude Opus 5
parent 4250388762
commit 104d7fef6b
80 changed files with 2330 additions and 402 deletions
+32
View File
@@ -0,0 +1,32 @@
"""抓取服务容器:集中管理抓取侧服务实例,用于依赖注入"""
from dataclasses import dataclass
from app.scraping.services.browser_fallback import BrowserFallback
from app.scraping.services.rakuma_client import RakumaClient
from app.scraping.services.rakuma_session import RakumaSession
from app.scraping.services.rakuten_client import RakutenClient
from app.scraping.services.site_session import SiteSession
from app.shared.config import Settings
@dataclass(slots=True)
class ScrapingContainer:
"""抓取服务容器,持有抓取链路的全部服务实例
通过 FastAPI 的 app.state.container 在请求间共享,
各路由通过依赖注入获取容器中的服务。
两个站点各自持有独立的会话与客户端:乐天需要 Akamai cookie 预热与双指纹
通道,ラクマ 不需要,抓取前提不同不便合并。
这里**没有登录态**:抓取全程匿名,账号相关的一切在交易服务
(app/trading/)里。这也是抓取服务可以随意多开实例的前提——一旦把
登录态放回来,多实例就会出现同一账号被多个进程并发操作的问题。
"""
settings: Settings
browser_fallback: BrowserFallback
site_session: SiteSession
rakuten_client: RakutenClient
rakuma_session: RakumaSession
rakuma_client: RakumaClient