~/public-data/courtlistener-scraper
CourtListener Scraper——判决书、案卷与全文数据
查询 CourtListener 的美国法院判决、RECAP 案卷、口头辩论、法官与判例引注——附带完整判决全文与 RAG 就绪分块。支持按法院、日期或关键词筛选。
法律
TypeScriptCheerio
美国
分类public-data / 法律
语言TypeScript
技术栈TypeScript, Cheerio
市场美国
输出干净、RAG 就绪的 JSON
核心特性
一个 Actor 内置六种检索类型——opinions(判决书)、dockets(RECAP 案卷)、RECAP documents(RECAP 文档)、oral arguments(口头辩论)、judges(法官)与 citation lookup(引注查询)
完整判决全文——从搜索命中结果深入数据库获取完整判决书,而非 300 字符的片段摘要
RAG 就绪分块——约 2000 字符的段落分块,每块附带顺序索引
引注解析——最多可将 250 条引注字符串(例如 576 U.S. 644)解析为对应的判例
支持布尔全文检索,以及法院 ID、立案日期区间与排序方式筛选
感知速率限制的请求节流,针对 CourtListener 各类响应格式精确处理 429 退避
游标分页流式获取,直到达到你设置的条目上限
支持自带令牌,或使用内置的轮换令牌池
应用场景
- 法律研究——按法院、日期区间或关键词拉取判例法全文
- 诉讼情报——按主题与日期追踪某法院的案卷动态
- 法律 AI / RAG——构建已分块、可直接生成向量嵌入的判例法语料库
- 引注分析——将法律文书中的引注解析为关联判例记录与被引次数
- 实证法学研究——法官信息、口头辩论元数据与判决趋势
- 法律新闻报道——监控特定法院新立案的判决或案卷
输入参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
searchType | string | 可选 | 要获取的内容:opinions、dockets、recap_docs、oral_arguments、judges 或 citation(默认:opinions)。 |
query | string | 可选 | 带布尔运算符的全文查询——除非使用法院筛选或引注查询,否则为必填。 |
citations | array | 可选 | 待解析的引注字符串(最多 250 条)——citation 模式下为必填。 |
court | string | 可选 | CourtListener 的法院 ID,例如 scotus、ca9、nyed。 |
dateFrom | string | 可选 | 立案起始日期(YYYY-MM-DD)。 |
includeFullText | boolean | 可选 | 获取判决书的完整全文与 RAG 分块(默认:false)。 |
apiToken | string | 可选 | 你的 CourtListener API 令牌;若不填写,将回退使用内置轮换令牌池。 |
maxItems | number | 可选 | 最多保存的条目数;每条计为一次计费事件(默认:5)。 |
输出示例
1{
2 "itemType": "legal",
3 "searchType": "opinions",
4 "id": "10380001",
5 "title": "Climate United Fund v. Citibank, N.A.",
6 "court": "Court of Appeals for the D.C. Circuit",
7 "date": "2025-04-16",
8 "url": "https://www.courtlistener.com/opinion/10380001/...",
9 "citations": [],
10 "citeCount": 0,
11 "docketNumber": "23-5138",
12 "fullText": "...",
13 "chunks": [{ "text": "...", "order": 0 }],
14 "meta": { "courtId": "cadc", "clusterId": 10380001 }
15}
价格
按事件计费——只对实际保存的条目计费:
| 事件 | 价格 | 说明 |
|---|---|---|
| 带全文的判决书 | $0.005 | 保存一份判决书,含完整全文 + RAG 分块 |
| 元数据条目 | $0.002 | 一条案卷、口头辩论、法官、引注或纯元数据记录 |
1,000 份判决全文语料约为 $5.00;maxItems 可同时限制导出量与费用上限。
使用建议
- 只为真正需要生成向量嵌入的判决书开启
includeFullText。 它会为每份判决书带来额外请求开销,且默认关闭——建议先按法院和日期做精细筛选。 - 用
citation模式为法律文书补全引注信息。 粘贴引注字符串,一次运行即可获得关联的判例记录与被引次数。 - 大规模任务请使用你自己的 CourtListener 令牌——免费层级过低的速率限制是主要的吞吐瓶颈。
常见问题
我需要 CourtListener 的 API 令牌吗?
CourtListener 要求提供令牌。你可以通过 apiToken 提供自己的免费令牌,也可以依赖该 Actor 内置的轮换备用令牌池。自带令牌可以让你在付费/会员套餐下获得更高的吞吐量。
所有检索类型都能获取判决全文吗?
不能。全文与分块功能(includeFullText)仅适用于 opinions,且默认关闭以保证运行速度。dockets、RECAP 文档、oral arguments、judges 与 citation 结果只返回元数据。
覆盖哪些法院?
凡是 CourtListener 收录的法院均可覆盖——包括美国联邦法院(最高法院 SCOTUS、上诉法院,以及通过 RECAP 收录的地区法院),还有大量州法院,均以 CourtListener 自有的法院 ID(如 scotus、ca9、nyed)标识。
运行速度能有多快?
吞吐量受限于你令牌的速率限制(CourtListener 免费层级每分钟仅有几次请求),并会自动进行 429 退避;会员令牌可以提高这一上限。