2026-07-11 实际探测 10 个数据源后的结论
| 数据源 | 状态 | 含药品数据 | 说明 |
|---|---|---|---|
| NMPA 公告页面 | ❌ 412 | - | WAF 拦截,Header/Cookie 校验 |
| NMPA 药品查询 API | ❌ DNS | - | 子域名不可解析,可能内部/GeoIP限制 |
| NMPA 开放数据平台 | ❌ DNS | - | 同上 |
| 药智网 | ❌ 404 | - | URL结构已变更 |
| 药品标准查询 (nifdc) | ❌ DNS | - | 域名不可达 |
| 百度百科 | ⚠️ 反爬 | ✅ | 200但标记反爬,需JS渲染 |
| 丁香园用药助手 | ✅ 200 | 是 | SPA应用,公开API不可用,需浏览器渲染 |
| 药典在线 (drugfuture) | ✅ 200 | 是 | 搜索表单POST无返回,实际药品数据不可通过程序获取 |
| 药物在线搜索 | ✅ 200 | 否 | 仅搜索界面,不返回药品内容 |
| 1药网 | ❌ 404 | - | - |
结论:通过纯 HTTP 请求自动化采集中国药典/药品数据的公开 API 不存在。
我写一个半自动化工具,操作流程:
PDF文本 → 粘贴到工具 → AI自动识别栏目 → 生成JSON → 一键入库
工具界面示例:
请输入药品信息(从PDF复制粘贴全文):
阿莫西林 Amoxicillin
Amoxilin
本品为白色或类白色结晶性粉末...
鉴别 (1) 取本品约10mg...
...
贮藏 遮光,密封保存。
来源: 2020年版 二部 P567-569
→ [解析] → 生成JSON → [入库]
这个工具用 LLM 自动将非结构化 PDF 文本解析为我们定好的 JSON Schema。我 2 天内能交付。
| 平台 | 模式 | 覆盖 | 预估费用 |
|---|---|---|---|
| 药智网 | 会员 + API | 完整药典 + NMPA数据 | ~5,000-20,000/年 |
| 药渡数据 | API | 药品注册 + 说明书 | 报价需联系 |
| 丁香园 Insight | API | 说明书 + 临床数据 | 企业版报价 |
| 国家药品编码中心 | 公开接口 | 批准文号基础信息 | 免费但有限 |
分发 DATA_GUIDE.md 给团队成员,每人每天录入 20-50 个药品条目(熟练后每条约 3-5 分钟)。
| 人力 | 速度 | 每天产出 |
|---|---|---|
| 1 人全时 | 20-30条/天 | 周一至五约 100-150 条 |
| 2 人全时 | 40-60条/天 | 一周约 200-300 条 |
| 核心药典(2000条) | - | 约 1-2 个月 |
| 事项 | 状态 | 说明 |
|---|---|---|
| JSON Schema | ✅ | data-pipeline/schemas/drug_schema.json |
| 入库脚本 | ✅ | data-pipeline/ingest.py(向量化 + PG写入已验证) |
| 操作指南 | ✅ | DATA_GUIDE.md |
| PDF 解析器框架 | ✅ | data-pipeline/crawlers/pharmacopoeia.py |
| Scrapy 爬虫框架 | ✅ | data-pipeline/crawlers/spider.py |
| 半自动录入工具 | 🔜 可做 | 2天内交付,用 LLM 解析 PDF 文本成 JSON |
本周 → 方案一:开发 PDF 辅助录入工具
→ 方案三:分发 DATA_GUIDE.md 开始手动录入
本月 → 方案二:联系药智网/药渡获取 API 报价
→ 累计录入 500+ 核心药品
月底 → 小程序联调上线(500 条药品可覆盖日常需求)