CourtListener Scraper — Décisions, dockets et texte intégral
Interrogez CourtListener pour les décisions de justice US, les dockets RECAP, les plaidoiries orales, les juges et les citations — texte intégral et chunks prêts pour le RAG. Filtrez par tribunal, date ou mot-clé.
fonctionnalités clés
Six types de recherche dans un seul acteur — opinions, dockets (RECAP), documents RECAP, plaidoiries orales, juges, et recherche de citations
Texte intégral des décisions — l’acteur suit les résultats de recherche jusque dans la base pour obtenir des décisions complètes, pas de simples extraits de 300 caractères
Découpage en chunks prêt pour le RAG — des chunks de paragraphes d’environ 2000 caractères, chacun avec un index d’ordre
Résolution de citations — résolvez jusqu’à 250 chaînes de citation (ex. 576 U.S. 644) vers les affaires correspondantes
Recherche booléenne en texte intégral, plus des filtres par ID de tribunal, plage de dates de dépôt, et ordre de tri
Un rythme conscient des limites de débit, avec un backoff précis sur 429 à travers tous les formats de réponse de CourtListener
Streaming par pagination à curseur jusqu’à votre plafond d’éléments configuré
Utilisez votre propre token, ou le pool de tokens rotatifs intégré
cas d’usage
- Recherche juridique — extrayez la jurisprudence en texte intégral par tribunal, plage de dates ou mot-clé
- Veille contentieuse — suivez l’activité des dockets d’un tribunal par sujet et par date
- IA juridique / RAG — construisez un corpus de jurisprudence découpé en chunks, prêt pour les embeddings
- Analyse de citations — résolvez les citations d’un mémoire vers les décisions liées et leur nombre de citations
- Études juridiques empiriques — juges, métadonnées de plaidoiries orales, et tendances des décisions
- Journalisme judiciaire — surveillez les décisions ou dockets nouvellement déposés dans des tribunaux spécifiques
paramètres d’entrée
| Paramètre | Type | Requis | Description |
|---|---|---|---|
searchType | string | optionnel | Ce qu’il faut récupérer : opinions, dockets, recap_docs, oral_arguments, judges, ou citation (par défaut : opinions). |
query | string | optionnel | Requête en texte intégral avec opérateurs booléens — requis sauf en cas d’utilisation d’un filtre de tribunal ou d’une recherche de citation. |
citations | array | optionnel | Chaînes de citation à résoudre (jusqu’à 250) — requis pour le mode citation. |
court | string | optionnel | ID de tribunal CourtListener, ex. scotus, ca9, nyed. |
dateFrom | string | optionnel | Date de dépôt après laquelle filtrer (YYYY-MM-DD). |
includeFullText | boolean | optionnel | Récupère le texte intégral des décisions et les chunks RAG pour les opinions (par défaut : false). |
apiToken | string | optionnel | Votre token API CourtListener ; utilise le pool rotatif intégré si omis. |
maxItems | number | optionnel | Nombre maximal d’éléments sauvegardés ; chacun correspond à un événement facturé (par défaut : 5). |
Exemple de sortie
1{
2 "itemType": "legal",
3 "searchType": "opinions",
4 "id": "10380001",
5 "title": "Climate United Fund v. Citibank, N.A.",
6 "court": "Court of Appeals for the D.C. Circuit",
7 "date": "2025-04-16",
8 "url": "https://www.courtlistener.com/opinion/10380001/...",
9 "citations": [],
10 "citeCount": 0,
11 "docketNumber": "23-5138",
12 "fullText": "...",
13 "chunks": [{ "text": "...", "order": 0 }],
14 "meta": { "courtId": "cadc", "clusterId": 10380001 }
15}
Tarification
Facturation à l’événement — vous n’êtes facturé que pour les éléments sauvegardés :
| Événement | Prix | Ce qui est couvert |
|---|---|---|
| Opinion avec texte intégral | $0.005 | Une opinion sauvegardée avec texte complet + chunks RAG |
| Élément de métadonnées | $0.002 | Un docket, une plaidoirie orale, un juge, une citation, ou un enregistrement de métadonnées uniquement |
Un corpus en texte intégral de 1 000 opinions coûte environ $5.00 ; maxItems plafonne à la fois le volume et le coût.
Astuces
- N’activez
includeFullTextque pour les opinions que vous allez réellement embedder. Cela coûte des requêtes supplémentaires par opinion et c’est désactivé par défaut — filtrez d’abord précisément par tribunal et par date. - Utilisez le mode
citationpour enrichir un mémoire. Collez les chaînes de citation et récupérez en un seul run les décisions liées et leur nombre de citations. - Utilisez votre propre token CourtListener pour les gros volumes — le faible taux du palier gratuit est le principal goulot d’étranglement en débit.
faq
Ai-je besoin d’un token API CourtListener ?
Le texte intégral des décisions est-il disponible pour tous les types de recherche ?
Quels tribunaux sont couverts ?
Quelle est la vitesse d’exécution possible ?
similaires dans ~/public-data
ClinicalTrials.gov Scraper — Études, éligibilité et résultats
Recherchez études, éligibilité et résultats sur ClinicalTrials.gov.
ouvrirSEC EDGAR Scraper — Dépôts, texte intégral et données financières XBRL
Dépôts SEC, texte des 10-K/10-Q et données financières XBRL — prêts pour le RAG.
ouvrirUSAspending.gov Scraper — Financements fédéraux, bénéficiaires et agrégats
Financements fédéraux, bénéficiaires et agrégats de dépenses depuis USAspending.gov.
ouvrir