# 爬虫开发能力评估(实测版) > 2026-07-11 实际探测 10 个数据源后的结论 --- ## 实测结果 | 数据源 | 状态 | 含药品数据 | 说明 | |--------|:---:|:---:|------| | NMPA 公告页面 | ❌ 412 | - | WAF 拦截,Header/Cookie 校验 | | NMPA 药品查询 API | ❌ DNS | - | 子域名不可解析,可能内部/GeoIP限制 | | NMPA 开放数据平台 | ❌ DNS | - | 同上 | | 药智网 | ❌ 404 | - | URL结构已变更 | | 药品标准查询 (nifdc) | ❌ DNS | - | 域名不可达 | | 百度百科 | ⚠️ 反爬 | ✅ | 200但标记反爬,需JS渲染 | | 丁香园用药助手 | ✅ 200 | 是 | SPA应用,公开API不可用,需浏览器渲染 | | 药典在线 (drugfuture) | ✅ 200 | 是 | 搜索表单POST无返回,实际药品数据不可通过程序获取 | | 药物在线搜索 | ✅ 200 | 否 | 仅搜索界面,不返回药品内容 | | 1药网 | ❌ 404 | - | - | **结论:通过纯 HTTP 请求自动化采集中国药典/药品数据的公开 API 不存在。** --- ## 推荐数据获取方案 ### 方案一:PDF 辅助录入工具(立即可做,2天开发) 我写一个半自动化工具,操作流程: ``` PDF文本 → 粘贴到工具 → AI自动识别栏目 → 生成JSON → 一键入库 ``` 工具界面示例: ``` 请输入药品信息(从PDF复制粘贴全文): 阿莫西林 Amoxicillin Amoxilin 本品为白色或类白色结晶性粉末... 鉴别 (1) 取本品约10mg... ... 贮藏 遮光,密封保存。 来源: 2020年版 二部 P567-569 → [解析] → 生成JSON → [入库] ``` 这个工具用 LLM 自动将非结构化 PDF 文本解析为我们定好的 JSON Schema。我 2 天内能交付。 ### 方案二:购买第三方数据库 API(1-2周接洽) | 平台 | 模式 | 覆盖 | 预估费用 | |------|------|------|---------| | 药智网 | 会员 + API | 完整药典 + NMPA数据 | ~5,000-20,000/年 | | 药渡数据 | API | 药品注册 + 说明书 | 报价需联系 | | 丁香园 Insight | API | 说明书 + 临床数据 | 企业版报价 | | 国家药品编码中心 | 公开接口 | 批准文号基础信息 | 免费但有限 | ### 方案三:团队手动录入(并行推进) 分发 `DATA_GUIDE.md` 给团队成员,每人每天录入 20-50 个药品条目(熟练后每条约 3-5 分钟)。 | 人力 | 速度 | 每天产出 | |------|------|---------| | 1 人全时 | 20-30条/天 | 周一至五约 100-150 条 | | 2 人全时 | 40-60条/天 | 一周约 200-300 条 | | 核心药典(2000条) | - | 约 1-2 个月 | --- ## 我已经做好和可以立即做的 | 事项 | 状态 | 说明 | |------|:---:|------| | JSON Schema | ✅ | `data-pipeline/schemas/drug_schema.json` | | 入库脚本 | ✅ | `data-pipeline/ingest.py`(向量化 + PG写入已验证) | | 操作指南 | ✅ | `DATA_GUIDE.md` | | PDF 解析器框架 | ✅ | `data-pipeline/crawlers/pharmacopoeia.py` | | Scrapy 爬虫框架 | ✅ | `data-pipeline/crawlers/spider.py` | | 半自动录入工具 | 🔜 可做 | 2天内交付,用 LLM 解析 PDF 文本成 JSON | --- ## 建议执行顺序 ``` 本周 → 方案一:开发 PDF 辅助录入工具 → 方案三:分发 DATA_GUIDE.md 开始手动录入 本月 → 方案二:联系药智网/药渡获取 API 报价 → 累计录入 500+ 核心药品 月底 → 小程序联调上线(500 条药品可覆盖日常需求) ```