~/public-data/clinical-trials-scraper

ClinicalTrials.gov Scraper——临床研究、入组标准与结果数据

按病症、干预措施、申办方、地点、状态或 NCT ID 检索官方 ClinicalTrials.gov v2 API。导出包含入组标准、结果元数据的规范化研究记录,并支持增量更新——无需 API 密钥。

医疗健康 TypeScriptREST API 全球
proooxy/clinical-trials-scraper — 规格
分类public-data / 医疗健康
语言TypeScript
技术栈TypeScript, REST API
市场全球
输出干净、RAG 就绪的 JSON

核心特性

官方 ClinicalTrials.gov v2 API——无需 API 密钥

多字段检索——病症、干预措施、申办方、地点与自由文本查询

按招募状态(9 种取值,OR 组合)与研究阶段(Early Phase 1 → Phase 4)筛选

支持通过 NCT ID 直接查询一项或多项指定研究

通过 updatedSince 实现增量监控——只返回指定日期当天及之后发生变更的研究

summary 或 full 两种输出模式——full 模式会附加原始的 protocol、derived 与 results 部分

对标题、摘要、入组标准与结果进行 RAG 就绪的段落分块

结果信号——hasResults,以及受试者流程、结局指标、不良事件相关标志位

推导得到的 MeSH 术语,以及规范化的申办方、合作方与地点数据

应用场景

  • 按申办方或病症监控制药/生物科技管线
  • CRO 与研究机构可行性调研——按地点、阶段与病症筛选招募中的试验
  • 针对新发布或新更新研究的竞争情报
  • 面向正在招募患者的试验开展受试者招募调研
  • 系统性综述——大规模获取入组标准、结局指标与结果元数据
  • 基于分块试验文本构建医疗 AI / RAG 知识库

输入参数

参数类型必填说明
conditionstring可选要检索的病症或疾病,例如 diabetes。
statusarray可选招募状态筛选,OR 组合,例如 RECRUITING、COMPLETED。
phasearray可选研究阶段——Not Applicable、Early Phase 1、Phase 1–4。
nctIdsarray可选按 ClinicalTrials.gov 的 NCT ID 获取指定研究。
updatedSincestring可选YYYY-MM-DD——返回 LastUpdatePostDate 在该日期当天及之后的研究。
outputFieldsstring可选summary(默认,规范化输出)或 full(附加原始 protocol/derived/results 部分)。
chunkingstring可选RAG 文本分块方式:paragraph(默认)或 none。
maxItemsnumber可选最多保存的研究数量;每条计为一次计费事件(默认:10)。

输出示例

 1{
 2  "itemType": "study",
 3  "nctId": "NCT01884792",
 4  "title": "Example Diabetes Study",
 5  "officialTitle": "A Study of Example Diabetes Study",
 6  "status": "COMPLETED",
 7  "phase": ["PHASE2"],
 8  "studyType": "INTERVENTIONAL",
 9  "conditions": ["Diabetes Mellitus"],
10  "sponsors": { "lead": "Example Sponsor Inc.", "collaborators": [] },
11  "locations": [
12    { "facility": "Example Medical Center", "city": "Boston", "state": "MA", "country": "United States", "status": "COMPLETED" }
13  ],
14  "hasResults": true,
15  "resultsSummary": { "hasParticipantFlow": true, "hasOutcomeMeasures": true, "hasAdverseEvents": true },
16  "lastUpdate": "2026-06-01",
17  "url": "https://clinicaltrials.gov/study/NCT01884792"
18}

价格

按事件计费:每保存一项研究收费 $0.002,无论是 summary 还是 full 输出模式。导出 1,000 项研究约为 $2.00,maxItems 可同时限制导出量与费用上限。

使用建议

  • updatedSince 做变更监控。 每天用昨天的日期定时运行,只捕获新发布或修改过的试验——这是追踪竞争对手管线最省钱的方式。
  • 组合使用 condition + status: [RECRUITING] + phase,无需拉取整个注册库即可构建有针对性的可行性名单。
  • 只在需要原始数据部分时才设置 outputFields: full——规范化的 summary 输出已经包含入组标准、申办方、地点与结果标志位。

常见问题

我需要 API 密钥吗?
不需要。ClinicalTrials.gov 的 v2 API 完全公开——该 Actor 仅发送一个描述性的 User-Agent,无需任何身份验证。
我能获取原始研究数据,而不仅仅是规范化字段吗?
可以。将 outputFields 设为“full”,即可在规范化的 summary 字段之外,附带原始的 protocolSection、derivedSection 与 resultsSection。
如何监控近期发生变更的研究?
将 updatedSince 设为一个 YYYY-MM-DD 格式的日期。该 Actor 会基于 ClinicalTrials.gov 的 LastUpdatePostDate 进行筛选,只返回当天及之后更新的研究——非常适合按日监控管线。
数据覆盖范围是全球性的,还是仅限美国?
覆盖全球。ClinicalTrials.gov 登记的是全球范围内的试验,每项研究的 locations 数组在提供相关信息时会包含国家、州/省、城市与机构。

~/public-data 下的相关工具

运行 ClinicalTrials.gov Scraper——临床研究、入组标准与结果数据,或定制专属方案

几分钟内即可在 Apify 上开始提取数据,或聘请我为你的目标源和 schema 定制专属爬虫与 RAG 管道。

在 Apify 上运行 获取定制数据