~/public-data/courtlistener-scraper

CourtListener Scraper — Decisões, Processos e Texto Completo

Consulte o CourtListener em busca de decisões judiciais dos EUA, processos RECAP, sustentações orais, juízes e citações — com texto completo das decisões e chunks prontos para RAG. Filtre por tribunal, data ou palavra-chave.

jurídico TypeScriptCheerio Estados Unidos
proooxy/courtlistener-scraper — especificações
categoriapublic-data / jurídico
linguagemTypeScript
stackTypeScript, Cheerio
mercadosEstados Unidos
saídaJSON limpo e pronto para RAG

principais recursos

Seis tipos de busca em um único ator — decisões, processos (RECAP), documentos RECAP, sustentações orais, juízes e busca por citação

Texto completo das decisões — segue os resultados da busca até o banco de dados para obter decisões completas, não apenas trechos de 300 caracteres

Chunking pronto para RAG — chunks de parágrafos de ~2000 caracteres, cada um com um índice de ordem

Resolução de citações — resolve até 250 strings de citação (ex.: 576 U.S. 644) para os casos correspondentes

Busca booleana em texto completo, além de filtros por ID do tribunal, intervalo de data de protocolo e ordenação

Pacing consciente de rate limit, com backoff preciso em respostas 429, em todos os formatos de resposta do CourtListener

Streaming com paginação por cursor até o limite de itens configurado

Use seu próprio token ou o pool rotativo de tokens integrado

casos de uso

  • Pesquisa jurídica — obtenha jurisprudência em texto completo por tribunal, intervalo de data ou palavra-chave
  • Inteligência de litígios — acompanhe a atividade processual de um tribunal por assunto e data
  • IA jurídica / RAG — construa um corpus de jurisprudência em chunks, pronto para embeddings
  • Análise de citações — resolva as citações de uma petição para registros de casos vinculados e contagens de citação
  • Estudos jurídicos empíricos — juízes, metadados de sustentações orais e tendências de decisões
  • Jornalismo jurídico — monitore decisões ou processos recém-protocolados em tribunais específicos

parâmetros de entrada

ParâmetroTipoObrigatórioDescrição
searchTypestringopcionalO que buscar: opinions, dockets, recap_docs, oral_arguments, judges ou citation (padrão: opinions).
querystringopcionalConsulta em texto completo com operadores booleanos — obrigatória, a menos que use um filtro de tribunal ou busca por citação.
citationsarrayopcionalStrings de citação a resolver (até 250) — obrigatório no modo citation.
courtstringopcionalID do tribunal no CourtListener, ex.: scotus, ca9, nyed.
dateFromstringopcionalData a partir da qual o processo foi protocolado (AAAA-MM-DD).
includeFullTextbooleanopcionalBusca o texto completo da decisão e chunks para RAG no modo opinions (padrão: false).
apiTokenstringopcionalSeu token de API do CourtListener; se omitido, usa o pool rotativo integrado.
maxItemsnumberopcionalMáximo de itens salvos; cada um é um evento cobrado (padrão: 5).

Exemplo de Saída

 1{
 2  "itemType": "legal",
 3  "searchType": "opinions",
 4  "id": "10380001",
 5  "title": "Climate United Fund v. Citibank, N.A.",
 6  "court": "Court of Appeals for the D.C. Circuit",
 7  "date": "2025-04-16",
 8  "url": "https://www.courtlistener.com/opinion/10380001/...",
 9  "citations": [],
10  "citeCount": 0,
11  "docketNumber": "23-5138",
12  "fullText": "...",
13  "chunks": [{ "text": "...", "order": 0 }],
14  "meta": { "courtId": "cadc", "clusterId": 10380001 }
15}

Preços

Pagamento por evento — você paga apenas pelos itens salvos:

EventoPreçoO que cobre
Decisão com texto completo$0.005Uma decisão salva com texto completo + chunks para RAG
Item de metadados$0.002Um processo, sustentação oral, juiz, citação ou registro somente de metadados

Um corpus de texto completo com 1,000 decisões é ~$5.00; maxItems limita tanto o volume quanto o custo.

Dicas

  • Ative includeFullText somente para decisões que você realmente vai usar em embeddings. Isso custa requisições extras por decisão e vem desativado por padrão — filtre bem por tribunal e data antes.
  • Use o modo citation para enriquecer uma petição. Cole as strings de citação e receba de volta registros de casos vinculados e contagens de citação em uma única execução.
  • Use seu próprio token do CourtListener para jobs maiores — o rate limit baixo do plano gratuito é o principal gargalo de throughput.

faq

Preciso de um token de API do CourtListener?
O CourtListener exige um. Forneça seu próprio token gratuito via apiToken, ou conte com o pool rotativo de fallback integrado ao ator. Usar seu próprio token permite aumentar o throughput em um plano pago/de membro.
O texto completo das decisões está disponível para todos os tipos de busca?
Não. O texto completo e o chunking (includeFullText) se aplicam somente ao modo opinions, e vêm desativados por padrão para manter as execuções rápidas. Dockets, documentos RECAP, sustentações orais, juízes e resultados de citação retornam apenas metadados.
Quais tribunais são cobertos?
Tudo o que o CourtListener indexa — tribunais federais dos EUA (SCOTUS, Courts of Appeals e District Courts via RECAP), além de diversos tribunais estaduais, identificados pelos próprios IDs de tribunal do CourtListener, como scotus, ca9 ou nyed.
Qual a velocidade máxima de execução?
O throughput é limitado pelo rate limit do seu token (o plano gratuito do CourtListener permite poucas requisições por minuto), com backoff automático em 429; um token de membro eleva esse limite.

relacionados em ~/public-data

Execute CourtListener Scraper — Decisões, Processos e Texto Completo ou solicite um projeto personalizado

Comece a extrair dados no Apify em minutos, ou me contrate para desenvolver um scraper sob medida e um pipeline de RAG para sua fonte e esquema exatos.

executar no Apify obter dados personalizados