~/public-data/courtlistener-scraper

CourtListener Scraper — Putusan, Berkas Perkara & Teks Lengkap

Query CourtListener untuk putusan pengadilan AS, RECAP docket, oral argument, hakim, dan sitasi — lengkap dengan teks putusan penuh dan chunk siap-RAG. Filter berdasarkan pengadilan, tanggal, atau keyword.

hukum TypeScriptCheerio Amerika Serikat
proooxy/courtlistener-scraper — spec
kategoripublic-data / hukum
bahasaTypeScript
stackTypeScript, Cheerio
pasarAmerika Serikat
outputJSON bersih, siap-RAG

fitur utama

Enam search type dalam satu actor — opinions, dockets (RECAP), RECAP document, oral argument, judges, dan citation lookup

Teks putusan lengkap — mengikuti hasil search ke dalam database untuk mendapatkan putusan lengkap, bukan snippet 300 karakter

Chunking siap-RAG — chunk paragraph ~2000 karakter, masing-masing dengan order index

Resolusi sitasi — me-resolve hingga 250 string sitasi (contoh: 576 U.S. 644) ke case yang cocok

Boolean full-text search plus filter court ID, rentang filed-date, dan sort-order

Pacing yang sadar rate-limit dengan back-off 429 yang presisi di seluruh format respons CourtListener

Streaming cursor-pagination hingga item cap yang Anda konfigurasi

Bawa token Anda sendiri, atau gunakan rotating token pool bawaan

use case

  • Riset hukum — menarik case law full-text berdasarkan pengadilan, rentang tanggal, atau keyword
  • Litigation intelligence — melacak aktivitas docket pengadilan berdasarkan subjek dan tanggal
  • Legal AI / RAG — membangun corpus case-law yang sudah di-chunk dan siap-embedding
  • Analisis sitasi — me-resolve sitasi dari sebuah brief ke case record terkait dan cite count
  • Studi hukum empiris — hakim, metadata oral-argument, dan tren putusan
  • Jurnalisme hukum — memonitor putusan atau docket yang baru diajukan di pengadilan tertentu

parameter input

ParameterTipeWajibDeskripsi
searchTypestringopsionalYang mau diambil: opinions, dockets, recap_docs, oral_arguments, judges, atau citation (default: opinions).
querystringopsionalQuery full-text dengan boolean operator — wajib diisi kecuali memakai filter court atau citation lookup.
citationsarrayopsionalString sitasi yang akan di-resolve (hingga 250) — wajib untuk mode citation.
courtstringopsionalCourt ID CourtListener, contoh: scotus, ca9, nyed.
dateFromstringopsionalTanggal filed-after (YYYY-MM-DD).
includeFullTextbooleanopsionalAmbil teks putusan lengkap dan chunk RAG untuk opinions (default: false).
apiTokenstringopsionalAPI token CourtListener Anda; jika tidak diisi, akan memakai rotating pool bawaan.
maxItemsnumberopsionalJumlah maksimum item yang disimpan; masing-masing dihitung sebagai satu billed event (default: 5).

Contoh Output

 1{
 2  "itemType": "legal",
 3  "searchType": "opinions",
 4  "id": "10380001",
 5  "title": "Climate United Fund v. Citibank, N.A.",
 6  "court": "Court of Appeals for the D.C. Circuit",
 7  "date": "2025-04-16",
 8  "url": "https://www.courtlistener.com/opinion/10380001/...",
 9  "citations": [],
10  "citeCount": 0,
11  "docketNumber": "23-5138",
12  "fullText": "...",
13  "chunks": [{ "text": "...", "order": 0 }],
14  "meta": { "courtId": "cadc", "clusterId": 10380001 }
15}

Harga

Pay-per-event — Anda hanya dikenakan biaya untuk item yang tersimpan:

EventHargaYang dicakup
Opinion dengan teks lengkap$0.005Satu opinion tersimpan dengan teks lengkap + chunk RAG
Item metadata$0.002Satu docket, oral argument, judge, citation, atau record metadata-only

Corpus full-text 1,000-opinion berharga sekitar ~$5.00; maxItems membatasi volume sekaligus biaya.

Tips

  • Aktifkan includeFullText hanya untuk opinion yang benar-benar akan Anda embed. Fitur ini menambah request per opinion dan defaultnya mati — filter dulu secara ketat berdasarkan court dan tanggal.
  • Gunakan mode citation untuk memperkaya sebuah brief. Tempel string sitasinya dan dapatkan case record terkait beserta cite count dalam satu run.
  • Bawa token CourtListener Anda sendiri untuk pekerjaan yang lebih besar — rate limit rendah di tier gratis adalah bottleneck utama throughput.

faq

Apakah saya perlu API token CourtListener?
CourtListener mewajibkannya. Berikan token gratis Anda sendiri via apiToken, atau andalkan rotating fallback pool bawaan actor. Membawa token sendiri memungkinkan Anda menaikkan throughput di tier berbayar/membership.
Apakah teks putusan lengkap tersedia untuk semua search type?
Tidak. Teks lengkap plus chunking (includeFullText) hanya berlaku untuk opinions, dan defaultnya mati (off) agar run tetap cepat. Docket, RECAP document, oral argument, judges, dan hasil citation hanya mengembalikan metadata.
Pengadilan mana saja yang dicakup?
Apa pun yang diindeks CourtListener — pengadilan federal AS (SCOTUS, Courts of Appeals, dan District court via RECAP) plus banyak pengadilan negara bagian, dialamatkan dengan court ID milik CourtListener sendiri seperti scotus, ca9, atau nyed.
Seberapa cepat actor ini bisa berjalan?
Throughput dibatasi oleh rate limit token Anda (tier gratis CourtListener hanya beberapa request per menit) dengan 429 back-off otomatis; token membership menaikkan batasnya.

terkait di ~/public-data

Jalankan CourtListener Scraper — Putusan, Berkas Perkara & Teks Lengkap, atau dapatkan build custom

Mulai ekstraksi di Apify dalam hitungan menit, atau sewa saya untuk membangun scraper custom dan pipeline RAG untuk source dan skema spesifik Anda.

run di Apify dapatkan data custom