CRAWLER_ASSESSMENT.md 3.3 KB

爬虫开发能力评估(实测版)

2026-07-11 实际探测 10 个数据源后的结论


实测结果

数据源 状态 含药品数据 说明
NMPA 公告页面 ❌ 412 - WAF 拦截,Header/Cookie 校验
NMPA 药品查询 API ❌ DNS - 子域名不可解析,可能内部/GeoIP限制
NMPA 开放数据平台 ❌ DNS - 同上
药智网 ❌ 404 - URL结构已变更
药品标准查询 (nifdc) ❌ DNS - 域名不可达
百度百科 ⚠️ 反爬 200但标记反爬,需JS渲染
丁香园用药助手 ✅ 200 SPA应用,公开API不可用,需浏览器渲染
药典在线 (drugfuture) ✅ 200 搜索表单POST无返回,实际药品数据不可通过程序获取
药物在线搜索 ✅ 200 仅搜索界面,不返回药品内容
1药网 ❌ 404 - -

结论:通过纯 HTTP 请求自动化采集中国药典/药品数据的公开 API 不存在。


推荐数据获取方案

方案一:PDF 辅助录入工具(立即可做,2天开发)

我写一个半自动化工具,操作流程:

PDF文本 → 粘贴到工具 → AI自动识别栏目 → 生成JSON → 一键入库

工具界面示例:

请输入药品信息(从PDF复制粘贴全文):

阿莫西林 Amoxicillin
Amoxilin
本品为白色或类白色结晶性粉末...
鉴别 (1) 取本品约10mg...
...
贮藏 遮光,密封保存。
来源: 2020年版 二部 P567-569

→ [解析] → 生成JSON → [入库]

这个工具用 LLM 自动将非结构化 PDF 文本解析为我们定好的 JSON Schema。我 2 天内能交付。

方案二:购买第三方数据库 API(1-2周接洽)

平台 模式 覆盖 预估费用
药智网 会员 + API 完整药典 + NMPA数据 ~5,000-20,000/年
药渡数据 API 药品注册 + 说明书 报价需联系
丁香园 Insight API 说明书 + 临床数据 企业版报价
国家药品编码中心 公开接口 批准文号基础信息 免费但有限

方案三:团队手动录入(并行推进)

分发 DATA_GUIDE.md 给团队成员,每人每天录入 20-50 个药品条目(熟练后每条约 3-5 分钟)。

人力 速度 每天产出
1 人全时 20-30条/天 周一至五约 100-150 条
2 人全时 40-60条/天 一周约 200-300 条
核心药典(2000条) - 约 1-2 个月

我已经做好和可以立即做的

事项 状态 说明
JSON Schema data-pipeline/schemas/drug_schema.json
入库脚本 data-pipeline/ingest.py(向量化 + PG写入已验证)
操作指南 DATA_GUIDE.md
PDF 解析器框架 data-pipeline/crawlers/pharmacopoeia.py
Scrapy 爬虫框架 data-pipeline/crawlers/spider.py
半自动录入工具 🔜 可做 2天内交付,用 LLM 解析 PDF 文本成 JSON

建议执行顺序

本周  → 方案一:开发 PDF 辅助录入工具
      → 方案三:分发 DATA_GUIDE.md 开始手动录入
本月  → 方案二:联系药智网/药渡获取 API 报价
      → 累计录入 500+ 核心药品
月底  → 小程序联调上线(500 条药品可覆盖日常需求)