~/public-data/courtlistener-scraper

Scraper de CourtListener — Sentencias, expedientes y texto completo

Consulta CourtListener para obtener sentencias judiciales de EE. UU., expedientes RECAP, argumentos orales, jueces y citas — con el texto completo de las sentencias y fragmentos listos para RAG. Filtra por tribunal, fecha o palabra clave.

legal TypeScriptCheerio Estados Unidos
proooxy/courtlistener-scraper — spec
categoríapublic-data / legal
lenguajeTypeScript
stackTypeScript, Cheerio
mercadosEstados Unidos
salidaJSON limpio y listo para RAG

características clave

Seis tipos de búsqueda en un solo actor — opinions, dockets (RECAP), documentos RECAP, argumentos orales, jueces y búsqueda de citas

Texto completo de la sentencia — sigue los resultados de búsqueda hasta la base de datos para obtener las resoluciones completas, no fragmentos de 300 caracteres

Fragmentación lista para RAG — fragmentos de párrafo de ~2000 caracteres, cada uno con un índice de orden

Resolución de citas — resuelve hasta 250 cadenas de cita (por ejemplo, 576 U.S. 644) a los casos correspondientes

Búsqueda booleana de texto completo, más filtros de ID de tribunal, rango de fecha de presentación y orden de clasificación

Ritmo de solicitudes consciente de los límites de tasa, con backoff preciso ante 429 en todos los formatos de respuesta de CourtListener

Transmisión con paginación por cursor hasta tu límite de elementos configurado

Usa tu propio token o el grupo rotativo de tokens integrado

casos de uso

  • Investigación jurídica — obtén jurisprudencia de texto completo por tribunal, rango de fechas o palabra clave
  • Inteligencia de litigios — sigue la actividad de expedientes de un tribunal por materia y fecha
  • IA legal / RAG — construye un corpus de jurisprudencia fragmentado y listo para embeddings
  • Análisis de citas — resuelve las citas de un escrito legal a los registros de casos vinculados y sus recuentos de citas
  • Estudios jurídicos empíricos — jueces, metadatos de argumentos orales y tendencias en las sentencias
  • Periodismo jurídico — monitoriza sentencias o expedientes recién presentados en tribunales concretos

parámetros de entrada

ParámetroTipoObligatorioDescripción
searchTypestringopcionalQué obtener: opinions, dockets, recap_docs, oral_arguments, judges o citation (por defecto: opinions).
querystringopcionalConsulta de texto completo con operadores booleanos — obligatoria salvo que uses un filtro de tribunal o una búsqueda de citas.
citationsarrayopcionalCadenas de cita a resolver (hasta 250) — obligatorio para el modo citation.
courtstringopcionalID de tribunal de CourtListener, por ejemplo scotus, ca9, nyed.
dateFromstringopcionalFecha de presentación posterior a (AAAA-MM-DD).
includeFullTextbooleanopcionalObtén el texto completo de la sentencia y fragmentos RAG para el tipo opinions (por defecto: false).
apiTokenstringopcionalTu token de API de CourtListener; si se omite, se usa el grupo rotativo integrado.
maxItemsnumberopcionalMáximo de elementos guardados; cada uno equivale a un evento facturable (por defecto: 5).

Ejemplo de salida

 1{
 2  "itemType": "legal",
 3  "searchType": "opinions",
 4  "id": "10380001",
 5  "title": "Climate United Fund v. Citibank, N.A.",
 6  "court": "Court of Appeals for the D.C. Circuit",
 7  "date": "2025-04-16",
 8  "url": "https://www.courtlistener.com/opinion/10380001/...",
 9  "citations": [],
10  "citeCount": 0,
11  "docketNumber": "23-5138",
12  "fullText": "...",
13  "chunks": [{ "text": "...", "order": 0 }],
14  "meta": { "courtId": "cadc", "clusterId": 10380001 }
15}

Precios

Pago por evento — solo se te factura por los elementos guardados:

EventoPrecioQué incluye
Sentencia con texto completo$0.005Una sentencia guardada con el texto completo + fragmentos RAG
Elemento de metadatos$0.002Un expediente, argumento oral, juez, cita o registro solo de metadatos

Un corpus de texto completo de 1,000 sentencias cuesta ~$5.00; maxItems limita tanto el volumen como el coste.

Consejos

  • Activa includeFullText solo para las sentencias que realmente vayas a usar en embeddings. Cuesta solicitudes adicionales por sentencia y está desactivado por defecto — filtra primero de forma precisa por tribunal y fecha.
  • Usa el modo citation para enriquecer un escrito legal. Pega las cadenas de cita y obtén de vuelta los registros de casos vinculados y sus recuentos de citas en una sola ejecución.
  • Usa tu propio token de CourtListener para trabajos más grandes — el límite de tasa bajo del nivel gratuito es el principal cuello de botella de rendimiento.

faq

¿Necesito un token de API de CourtListener?
CourtListener lo requiere. Proporciona tu propio token gratuito mediante apiToken, o confía en el grupo rotativo de reserva integrado en el actor. Usar tu propio token te permite aumentar el rendimiento en un nivel de pago/membresía.
¿El texto completo de la sentencia está disponible para todos los tipos de búsqueda?
No. El texto completo y la fragmentación (includeFullText) se aplican solo a opinions, y están desactivados por defecto para mantener las ejecuciones rápidas. Los resultados de dockets, documentos RECAP, argumentos orales, jueces y citation devuelven solo metadatos.
¿Qué tribunales están cubiertos?
Todo lo que indexa CourtListener — tribunales federales de EE. UU. (el Tribunal Supremo (SCOTUS), los Tribunales de Apelación y los tribunales de distrito vía RECAP), además de muchos tribunales estatales, identificados con los propios ID de tribunal de CourtListener como scotus, ca9 o nyed.
¿A qué velocidad puede funcionar?
El rendimiento está limitado por el límite de tasa de tu token (el nivel gratuito de CourtListener permite unas pocas solicitudes por minuto) con backoff automático ante 429; un token de membresía eleva ese límite.

relacionado en ~/public-data

Ejecuta Scraper de CourtListener — Sentencias, expedientes y texto completo, o consigue un desarrollo a medida

Empieza a extraer datos en Apify en minutos, o contrátame para construir un scraper a medida y un pipeline de datos RAG para tu fuente y esquema exactos.

ejecutar en Apify obtener datos a medida