多平台药品/商品数据采集系统,覆盖淘宝、京东、小红书、饿了么闪购、药房网。
project/
├── xhs/ # 小红书商品采集(Android + OCR + AI)
├── tbsg/ # 饿了么闪购店铺采集(OCR + 滑块验证码)
└── spides/ # 淘宝 / 京东 / 药房网爬虫
Android 自动化采集,uiautomator2 操控手机 + OCR 识别 + AI 分析页面,支持多设备多线程派单。
启动:
cd xhs
python start_run_xhs.py
核心流程:
依赖: xhs/requirements.txt(主要:uiautomator2, opencv-python, easyocr, DBUtils)
步骤驱动,OCR + AI 实现端到端自动化:打开 App → 搜索商品 → 滚动店铺列表 → 进入店铺 → 解析二维码获取商品链接。
启动:
cd tbsg
python main.py
核心模块:
| 文件 | 作用 |
|------|------|
| main.py | 步骤编排(step1~step4) |
| steps/ocr.py | OCR 识别封装 |
| steps/executor.py | uiautomator2 安全执行器 |
| ai_helper.py | DeepSeek AI 页面分类/坐标解析 |
| yzm/ | 滑块验证码/九宫格自动破解 |
验证码处理: 模板匹配 + OCR 检测 → 自动调用滑块/九宫格破解,最多重试5次,失败等人工介入。
启动:
# 淘宝
cd spides
python start_run_taobao.py
# 京东
python start_run_jd.py
# 药房网
python start_run_yaofangwang.py
共用基础设施(spides/commons/):
| 模块 | 作用 |
|------|------|
| collect_schedule_runner.py | 通用调度循环 |
| scheduler.py | 任务拉取 + 心跳 + 上报 |
| conn_mysql.py | MySQL 连接池 |
| feishu_webhook.py | 飞书通知 |
| config.py | 设备 ID、账号配置 |
淘宝: DrissionPage 浏览器自动化,搜索 → 翻页 → 提取商品列表 京东: 浏览器自动化,API 拉取任务 药房网: 固定任务列表循环
drug_retrieve(120.24.26.308:3307)scheduleapi.findit.ltd)oss-cn-shenzhen)ai-api.dfwy.tech)spides/commons/config.py 和 xhs/spiders/xhs/xhs_config.py 含敏感凭证,不要提交公开仓库xhs/spiders/xhs/main.py 第78行数据库密码硬编码,建议改为环境变量