~/public-data/courtlistener-scraper

CourtListener Scraper — Décisions, dockets et texte intégral

Interrogez CourtListener pour les décisions de justice US, les dockets RECAP, les plaidoiries orales, les juges et les citations — texte intégral et chunks prêts pour le RAG. Filtrez par tribunal, date ou mot-clé.

juridique TypeScriptCheerio États-Unis
proooxy/courtlistener-scraper — specs
catégoriepublic-data / juridique
langageTypeScript
stackTypeScript, Cheerio
marchésÉtats-Unis
sortieJSON propre, prêt pour le RAG

fonctionnalités clés

Six types de recherche dans un seul acteur — opinions, dockets (RECAP), documents RECAP, plaidoiries orales, juges, et recherche de citations

Texte intégral des décisions — l’acteur suit les résultats de recherche jusque dans la base pour obtenir des décisions complètes, pas de simples extraits de 300 caractères

Découpage en chunks prêt pour le RAG — des chunks de paragraphes d’environ 2000 caractères, chacun avec un index d’ordre

Résolution de citations — résolvez jusqu’à 250 chaînes de citation (ex. 576 U.S. 644) vers les affaires correspondantes

Recherche booléenne en texte intégral, plus des filtres par ID de tribunal, plage de dates de dépôt, et ordre de tri

Un rythme conscient des limites de débit, avec un backoff précis sur 429 à travers tous les formats de réponse de CourtListener

Streaming par pagination à curseur jusqu’à votre plafond d’éléments configuré

Utilisez votre propre token, ou le pool de tokens rotatifs intégré

cas d’usage

  • Recherche juridique — extrayez la jurisprudence en texte intégral par tribunal, plage de dates ou mot-clé
  • Veille contentieuse — suivez l’activité des dockets d’un tribunal par sujet et par date
  • IA juridique / RAG — construisez un corpus de jurisprudence découpé en chunks, prêt pour les embeddings
  • Analyse de citations — résolvez les citations d’un mémoire vers les décisions liées et leur nombre de citations
  • Études juridiques empiriques — juges, métadonnées de plaidoiries orales, et tendances des décisions
  • Journalisme judiciaire — surveillez les décisions ou dockets nouvellement déposés dans des tribunaux spécifiques

paramètres d’entrée

ParamètreTypeRequisDescription
searchTypestringoptionnelCe qu’il faut récupérer : opinions, dockets, recap_docs, oral_arguments, judges, ou citation (par défaut : opinions).
querystringoptionnelRequête en texte intégral avec opérateurs booléens — requis sauf en cas d’utilisation d’un filtre de tribunal ou d’une recherche de citation.
citationsarrayoptionnelChaînes de citation à résoudre (jusqu’à 250) — requis pour le mode citation.
courtstringoptionnelID de tribunal CourtListener, ex. scotus, ca9, nyed.
dateFromstringoptionnelDate de dépôt après laquelle filtrer (YYYY-MM-DD).
includeFullTextbooleanoptionnelRécupère le texte intégral des décisions et les chunks RAG pour les opinions (par défaut : false).
apiTokenstringoptionnelVotre token API CourtListener ; utilise le pool rotatif intégré si omis.
maxItemsnumberoptionnelNombre maximal d’éléments sauvegardés ; chacun correspond à un événement facturé (par défaut : 5).

Exemple de sortie

 1{
 2  "itemType": "legal",
 3  "searchType": "opinions",
 4  "id": "10380001",
 5  "title": "Climate United Fund v. Citibank, N.A.",
 6  "court": "Court of Appeals for the D.C. Circuit",
 7  "date": "2025-04-16",
 8  "url": "https://www.courtlistener.com/opinion/10380001/...",
 9  "citations": [],
10  "citeCount": 0,
11  "docketNumber": "23-5138",
12  "fullText": "...",
13  "chunks": [{ "text": "...", "order": 0 }],
14  "meta": { "courtId": "cadc", "clusterId": 10380001 }
15}

Tarification

Facturation à l’événement — vous n’êtes facturé que pour les éléments sauvegardés :

ÉvénementPrixCe qui est couvert
Opinion avec texte intégral$0.005Une opinion sauvegardée avec texte complet + chunks RAG
Élément de métadonnées$0.002Un docket, une plaidoirie orale, un juge, une citation, ou un enregistrement de métadonnées uniquement

Un corpus en texte intégral de 1 000 opinions coûte environ $5.00 ; maxItems plafonne à la fois le volume et le coût.

Astuces

  • N’activez includeFullText que pour les opinions que vous allez réellement embedder. Cela coûte des requêtes supplémentaires par opinion et c’est désactivé par défaut — filtrez d’abord précisément par tribunal et par date.
  • Utilisez le mode citation pour enrichir un mémoire. Collez les chaînes de citation et récupérez en un seul run les décisions liées et leur nombre de citations.
  • Utilisez votre propre token CourtListener pour les gros volumes — le faible taux du palier gratuit est le principal goulot d’étranglement en débit.

faq

Ai-je besoin d’un token API CourtListener ?
CourtListener en exige un. Fournissez votre propre token gratuit via apiToken, ou reposez-vous sur le pool de repli rotatif intégré à l’acteur. Utiliser votre propre token permet d’augmenter le débit sur un palier payant/membership.
Le texte intégral des décisions est-il disponible pour tous les types de recherche ?
Non. Le texte intégral et le chunking (includeFullText) s’appliquent uniquement aux opinions, et sont désactivés par défaut pour garder des runs rapides. Les dockets, documents RECAP, plaidoiries orales, juges et résultats de citation ne renvoient que des métadonnées.
Quels tribunaux sont couverts ?
Tout ce que CourtListener indexe — les tribunaux fédéraux américains (SCOTUS, cours d’appel, et tribunaux de district via RECAP), ainsi que de nombreux tribunaux d’État, désignés par les ID de tribunal propres à CourtListener comme scotus, ca9, ou nyed.
Quelle est la vitesse d’exécution possible ?
Le débit est limité par le taux de votre token (le palier gratuit de CourtListener autorise quelques requêtes par minute), avec un backoff automatique sur 429 ; un token membership relève ce plafond.

similaires dans ~/public-data

Exécutez CourtListener Scraper — Décisions, dockets et texte intégral, ou obtenez un projet sur mesure

Commencez à extraire sur Apify en quelques minutes, ou engagez-moi pour construire un scraper sur mesure et un pipeline RAG adaptés exactement à votre source et à votre schéma.

exécuter sur Apify obtenir des données sur mesure