|
|
1 month ago | |
|---|---|---|
| .idea | 1 month ago | |
| commons | 1 month ago | |
| spiders | 1 month ago | |
| README.md | 1 month ago | |
| detail.py | 1 month ago |
淘宝药品/商品数据采集系统,支持列表搜索和详情页 SKU 级抓取。
MySQL
pip install DrissionPage curl_cffi lxml pymysql
需要本地安装 Chrome 浏览器,路径默认 C:\Program Files\Google\Chrome\Application\chrome.exe。
从 retrieve_scrape_data 表读取带 + 的商品(一条链接含多个 SKU),打开详情页逐个点击规格,拆解出每条 SKU 的独立记录写入数据库。
流程:
platform_item_id 含 + 的记录,按 pre_id 去重运行:
python detail.py
detail.py 删写操作在事务内执行,失败自动回滚。