~/public-data/courtlistener-scraper

CourtListener Scraper — Opinions, Dockets और पूरा टेक्स्ट

U.S. अदालती फैसलों, RECAP dockets, oral arguments, judges, और citations के लिए CourtListener को क्वेरी करें — पूरे opinion टेक्स्ट और RAG-तैयार chunks के साथ। court, date, या keyword से फ़िल्टर करें।

कानूनी TypeScriptCheerio संयुक्त राज्य अमेरिका
proooxy/courtlistener-scraper — स्पेक
कैटेगरीpublic-data / कानूनी
भाषाTypeScript
स्टैकTypeScript, Cheerio
मार्केट्ससंयुक्त राज्य अमेरिका
आउटपुटसाफ, RAG-तैयार JSON

मुख्य विशेषताएं

एक ही एक्टर में छह सर्च टाइप — opinions, dockets (RECAP), RECAP documents, oral arguments, judges, और citation lookup

पूरा opinion टेक्स्ट — सिर्फ़ 300-कैरेक्टर स्निपेट नहीं, पूरे फ़ैसलों के लिए सर्च हिट्स को डेटाबेस में फॉलो करता है

RAG-तैयार chunking — ~2000-कैरेक्टर के paragraph chunks, हर एक के साथ एक order index

Citation रिज़ॉल्यूशन — 250 तक citation स्ट्रिंग (जैसे 576 U.S. 644) को मैच किए गए केस से रिज़ॉल्व करें

Boolean फुल-टेक्स्ट सर्च के साथ court ID, filed-date रेंज, और sort-order फ़िल्टर

CourtListener के रिस्पॉन्स फ़ॉर्मेट्स में सटीक 429 back-off के साथ rate-limit-aware पेसिंग

आपके कॉन्फ़िगर किए गए item cap तक cursor-pagination स्ट्रीमिंग

अपना खुद का token लाएं, या बिल्ट-इन rotating token pool इस्तेमाल करें

यूज़ केस

  • लीगल रिसर्च — court, date रेंज, या keyword के हिसाब से फुल-टेक्स्ट केस लॉ खींचें
  • लिटिगेशन इंटेलिजेंस — subject और date के हिसाब से किसी court की docket एक्टिविटी ट्रैक करें
  • लीगल AI / RAG — chunked, embeddings-तैयार case-law corpus बनाएं
  • Citation एनालिसिस — किसी brief की citations को लिंक्ड केस रिकॉर्ड और cite counts से रिज़ॉल्व करें
  • एम्पिरिकल लीगल स्टडीज़ — judges, oral-argument मेटाडेटा, और opinion ट्रेंड
  • लीगल जर्नलिज़्म — खास courts में नए फ़ाइल हुए opinions या dockets मॉनिटर करें

इनपुट पैरामीटर

पैरामीटरटाइपआवश्यकविवरण
searchTypestringवैकल्पिकक्या रिट्रीव करना है: opinions, dockets, recap_docs, oral_arguments, judges, या citation (डिफ़ॉल्ट: opinions)।
querystringवैकल्पिकboolean ऑपरेटर के साथ फुल-टेक्स्ट क्वेरी — court फ़िल्टर या citation lookup इस्तेमाल न करने पर ज़रूरी।
citationsarrayवैकल्पिकरिज़ॉल्व करने के लिए citation स्ट्रिंग (250 तक) — citation मोड के लिए ज़रूरी।
courtstringवैकल्पिकCourtListener court ID, जैसे scotus, ca9, nyed।
dateFromstringवैकल्पिकFiled-after तारीख (YYYY-MM-DD)।
includeFullTextbooleanवैकल्पिकopinions के लिए पूरा opinion टेक्स्ट और RAG chunks फ़ेच करें (डिफ़ॉल्ट: false)।
apiTokenstringवैकल्पिकआपका CourtListener API token; न देने पर बिल्ट-इन rotating pool पर फ़ॉलबैक करता है।
maxItemsnumberवैकल्पिकसेव किए जाने वाले अधिकतम आइटम; हर एक एक बिल किया जाने वाला इवेंट है (डिफ़ॉल्ट: 5)।

आउटपुट का उदाहरण

 1{
 2  "itemType": "legal",
 3  "searchType": "opinions",
 4  "id": "10380001",
 5  "title": "Climate United Fund v. Citibank, N.A.",
 6  "court": "Court of Appeals for the D.C. Circuit",
 7  "date": "2025-04-16",
 8  "url": "https://www.courtlistener.com/opinion/10380001/...",
 9  "citations": [],
10  "citeCount": 0,
11  "docketNumber": "23-5138",
12  "fullText": "...",
13  "chunks": [{ "text": "...", "order": 0 }],
14  "meta": { "courtId": "cadc", "clusterId": 10380001 }
15}

प्राइसिंग

Pay-per-event — आपसे सिर्फ़ सेव किए गए आइटम के लिए बिल लिया जाता है:

इवेंटप्राइसइसमें क्या शामिल है
पूरा टेक्स्ट वाला Opinion$0.005पूरे टेक्स्ट + RAG chunks के साथ सेव किया गया एक opinion
Metadata आइटम$0.002एक docket, oral argument, judge, citation, या सिर्फ़-मेटाडेटा रिकॉर्ड

1,000-opinion फुल-टेक्स्ट corpus की कीमत ~$5.00 है; maxItems वॉल्यूम व कॉस्ट दोनों पर कैप लगाता है।

टिप्स

  • includeFullText सिर्फ़ उन opinions के लिए ऑन करें जिन्हें आप असल में embed करेंगे। इसमें हर opinion पर एक्स्ट्रा रिक्वेस्ट लगते हैं और यह डिफ़ॉल्ट रूप से बंद रहता है — पहले court और date से कसकर फ़िल्टर करें।
  • किसी brief को समृद्ध करने के लिए citation मोड इस्तेमाल करें। citation स्ट्रिंग पेस्ट करें और एक ही रन में लिंक्ड केस रिकॉर्ड और cite counts वापस पाएं।
  • बड़े jobs के लिए अपना खुद का CourtListener token लाएं — free tier की कम rate limit ही मुख्य थ्रूपुट बॉटलनेक है।

सामान्य प्रश्न

क्या मुझे CourtListener API token चाहिए?
CourtListener को इसकी ज़रूरत होती है। apiToken के ज़रिए अपना मुफ़्त token दें, या एक्टर के बिल्ट-इन rotating fallback pool पर भरोसा करें। अपना token लाने पर आप paid/membership टियर पर थ्रूपुट बढ़ा सकते हैं।
क्या हर सर्च टाइप के लिए पूरा opinion टेक्स्ट उपलब्ध है?
नहीं। पूरा टेक्स्ट और chunking (includeFullText) सिर्फ़ opinions पर लागू होता है, और रन तेज़ रखने के लिए डिफ़ॉल्ट रूप से बंद रहता है। Dockets, RECAP documents, oral arguments, judges, और citation रिज़ल्ट सिर्फ़ मेटाडेटा रिटर्न करते हैं।
कौन-कौन से courts कवर होते हैं?
जो भी CourtListener इंडेक्स करता है — U.S. फ़ेडरल courts (SCOTUS, Courts of Appeals, और RECAP के ज़रिए District courts) साथ ही कई state courts, जिन्हें CourtListener अपने court IDs जैसे scotus, ca9, या nyed से एड्रेस करता है।
यह कितनी तेज़ी से चल सकता है?
थ्रूपुट आपके token की rate limit से बंधा होता है (CourtListener के free tier में प्रति मिनट कुछ ही रिक्वेस्ट मिलते हैं) साथ में ऑटोमैटिक 429 back-off; एक membership token यह सीमा बढ़ा देता है।

~/public-data में संबंधित

CourtListener Scraper — Opinions, Dockets और पूरा टेक्स्ट रन करें, या कस्टम बिल्ड पाएं

मिनटों में Apify पर एक्सट्रैक्शन शुरू करें, या अपने सोर्स और स्कीमा के लिए कस्टम स्क्रैपर और RAG पाइपलाइन बनवाने के लिए मुझे हायर करें।

Apify पर रन करें कस्टम डेटा पाएं