# 药品数据采集系统 多平台药品/商品数据采集系统,覆盖美团、拼多多、淘宝、京东、小红书、饿了么闪购、药房网。 ## 子项目 ``` project/ ├── mt_V2/ # 美团商品采集 V2(Android + 百度 OCR,3978行) ├── pdd/ # 拼多多商品采集(Android + OCR + AI) ├── xhs/ # 小红书商品采集(Android + OCR + AI) ├── tbsg/ # 饿了么闪购店铺采集(OCR + 滑块验证码) └── spides/ # 淘宝 / 京东 / 药房网爬虫 ``` --- ### 1. mt_V2 — 美团商品采集 V2 Android 自动化采集,uiautomator2 + 百度 OCR 识别,主文件 3978 行,体量最大。 **启动:** ```bash cd mt_V2 python main.py ``` **核心模块:** | 文件 | 作用 | |------|------| | `main.py` | 采集主逻辑(3978行,181KB) | | `config.py` | 数据库 / 美团 App 配置 | | `db.py` | MySQL 连接池(自研,非 DBUtils) | | `yzm.py` | 滑块验证码破解 | | `area.py` | 城市区域服务 | | `logger.py` | 日志初始化 | **依赖:** uiautomator2, opencv-python, aip (百度OCR), oss2 --- ### 2. pdd — 拼多多商品采集 Android 自动化采集,uiautomator2 操控手机 + 百度 OCR + AI 分析,支持多设备多线程派单。架构与小红书一致。 **启动:** ```bash cd pdd python start_run_pdd.py ``` **核心流程:** - 从调度 API 或手动配置拉取任务(药品关键词+规格) - ADB 检测空闲设备,状态锁防冲突 - 每个设备独立线程:打开拼多多 → 搜索 → 翻页 → OCR 截图 → 提取价格/标题/盒数 → 去重 → 写入数据库 - 飞书通知 + 调度中心 API 上报 **核心模块:** | 文件 | 作用 | |------|------| | `start_run_pdd.py` | 调度入口,多线程派单(3559行) | | `spiders/pdd/main.py` | 采集主逻辑(3585行) | | `spiders/pdd/box_script.py` | 药品盒数/规格提取 | | `spiders/pdd/test_captcha.py` | 滑块验证码破解 | | `spiders/pdd/pdd_config.py` | OSS / DB / 百度OCR 配置 | | `area_info/city_name_to_id.py` | 城市映射 | **依赖:** uiautomator2, opencv-python, aip (百度OCR), oss2, DBUtils --- ### 3. xhs — 小红书商品采集 Android 自动化采集,uiautomator2 操控手机 + OCR 识别 + AI 分析页面,支持多设备多线程派单。 **启动:** ```bash cd xhs python start_run_xhs.py ``` **核心流程:** - 从数据库/手动配置拉取任务(药品关键词) - ADB 检测空闲设备,状态锁防冲突 - 每个设备独立线程:打开小红书 → 搜索 → 滚动商品列表 → OCR 截图 → AI 提取价格/标题 → 写入数据库 - 飞书通知 + 调度中心 API 上报 **依赖:** `xhs/requirements.txt`(主要:uiautomator2, opencv-python, easyocr, DBUtils) --- ### 4. tbsg — 饿了么闪购店铺采集 步骤驱动,OCR + AI 实现端到端自动化:打开 App → 搜索商品 → 滚动店铺列表 → 进入店铺 → 解析二维码获取商品链接。 **启动:** ```bash cd tbsg python main.py ``` **核心模块:** | 文件 | 作用 | |------|------| | `main.py` | 步骤编排(step1~step4) | | `steps/ocr.py` | OCR 识别封装 | | `steps/executor.py` | uiautomator2 安全执行器 | | `ai_helper.py` | DeepSeek AI 页面分类/坐标解析 | | `yzm/` | 滑块验证码/九宫格自动破解 | **验证码处理:** 模板匹配 + OCR 检测 → 自动调用滑块/九宫格破解,最多重试5次,失败等人工介入。 --- ### 5. spides — 淘宝 / 京东 / 药房网爬虫 **启动:** ```bash # 淘宝 cd spides python start_run_taobao.py # 京东 python start_run_jd.py # 药房网 python start_run_yaofangwang.py ``` **共用基础设施(`spides/commons/`):** | 模块 | 作用 | |------|------| | `collect_schedule_runner.py` | 通用调度循环 | | `scheduler.py` | 任务拉取 + 心跳 + 上报 | | `conn_mysql.py` | MySQL 连接池 | | `feishu_webhook.py` | 飞书通知 | | `config.py` | 设备 ID、账号配置 | **淘宝:** DrissionPage 浏览器自动化,搜索 → 翻页 → 提取商品列表 **京东:** 浏览器自动化,API 拉取任务 **药房网:** 固定任务列表循环 --- ## 服务端依赖 - MySQL 数据库 `drug_retrieve`(`120.24.26.108:3307`) - 调度中心 API(`scheduleapi.findit.ltd`) - 阿里云 OSS(`oss-cn-shenzhen`) - 百度 OCR API - DeepSeek AI API(`ai-api.dfwy.tech`) - 飞书 Webhook --- ## 注意事项 - 美团、拼多多、小红书、饿了么需要 Android 真机连接 ADB - 淘宝/京东需要 Chrome 浏览器(DrissionPage) - 以下文件含敏感凭证,不要提交公开仓库: - `mt_V2/main.py`(百度OCR AK/SK) - `mt_V2/db.py`(数据库密码) - `mt_V2/config.py`(数据库密码) - `pdd/start_run_pdd.py`(数据库密码、百度OCR AK/SK) - `pdd/spiders/pdd/pdd_config.py`(OSS AK/SK) - `xhs/spiders/xhs/main.py`(数据库密码) - `xhs/spiders/xhs/xhs_config.py`(OSS AK/SK) - `spides/commons/config.py`(药师帮/壹药城密码) - `tbsg/ai_helper.py`(内网 API 地址)