README.md 2.9 KB

药品数据采集系统

多平台药品/商品数据采集系统,覆盖淘宝、京东、小红书、饿了么闪购、药房网。

子项目

project/
├── xhs/           # 小红书商品采集(Android + OCR + AI)
├── tbsg/          # 饿了么闪购店铺采集(OCR + 滑块验证码)
└── spides/        # 淘宝 / 京东 / 药房网爬虫

1. xhs — 小红书商品采集

Android 自动化采集,uiautomator2 操控手机 + OCR 识别 + AI 分析页面,支持多设备多线程派单。

启动:

cd xhs
python start_run_xhs.py

核心流程:

  • 从数据库/手动配置拉取任务(药品关键词)
  • ADB 检测空闲设备,状态锁防冲突
  • 每个设备独立线程:打开小红书 → 搜索 → 滚动商品列表 → OCR 截图 → AI 提取价格/标题 → 写入数据库
  • 飞书通知 + 调度中心 API 上报

依赖: xhs/requirements.txt(主要:uiautomator2, opencv-python, easyocr, DBUtils)


2. tbsg — 饿了么闪购店铺采集

步骤驱动,OCR + AI 实现端到端自动化:打开 App → 搜索商品 → 滚动店铺列表 → 进入店铺 → 解析二维码获取商品链接。

启动:

cd tbsg
python main.py

核心模块: | 文件 | 作用 | |------|------| | main.py | 步骤编排(step1~step4) | | steps/ocr.py | OCR 识别封装 | | steps/executor.py | uiautomator2 安全执行器 | | ai_helper.py | DeepSeek AI 页面分类/坐标解析 | | yzm/ | 滑块验证码/九宫格自动破解 |

验证码处理: 模板匹配 + OCR 检测 → 自动调用滑块/九宫格破解,最多重试5次,失败等人工介入。


3. spides — 淘宝 / 京东 / 药房网爬虫

启动:

# 淘宝
cd spides
python start_run_taobao.py

# 京东
python start_run_jd.py

# 药房网
python start_run_yaofangwang.py

共用基础设施(spides/commons/): | 模块 | 作用 | |------|------| | collect_schedule_runner.py | 通用调度循环 | | scheduler.py | 任务拉取 + 心跳 + 上报 | | conn_mysql.py | MySQL 连接池 | | feishu_webhook.py | 飞书通知 | | config.py | 设备 ID、账号配置 |

淘宝: DrissionPage 浏览器自动化,搜索 → 翻页 → 提取商品列表 京东: 浏览器自动化,API 拉取任务 药房网: 固定任务列表循环


服务端依赖

  • MySQL 数据库 drug_retrieve120.24.26.308:3307
  • 调度中心 API(scheduleapi.findit.ltd
  • 阿里云 OSS(oss-cn-shenzhen
  • DeepSeek AI API(ai-api.dfwy.tech
  • 飞书 Webhook

注意事项

  • 需要 Android 真机连接 ADB(小红书、饿了么)
  • 需要 Chrome 浏览器(淘宝 DrissionPage)
  • spides/commons/config.pyxhs/spiders/xhs/xhs_config.py 含敏感凭证,不要提交公开仓库
  • xhs/spiders/xhs/main.py 第78行数据库密码硬编码,建议改为环境变量