Scraper de SEC EDGAR — Informes, texto completo y datos financieros XBRL
Extrae metadatos de informes de SEC EDGAR, secciones de texto completo de 10-K/10-Q, resultados de búsqueda de texto completo de EDGAR y datos financieros XBRL como JSON limpio y listo para RAG. No requiere clave API.
características clave
Cuatro modos en un solo actor — metadatos de informes, texto completo del documento, búsqueda de texto completo de EDGAR y datos financieros XBRL
Fragmentación lista para RAG — section, paragraph (~2000 caracteres) o none; cada fragmento etiquetado con su Item de origen y su orden
Parseo automático de secciones 'Item N' para 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A, y más)
Datos XBRL con taxonomy, tag, label, unit, value, año/periodo fiscal, formulario y número de accession
La deduplicación de datos colapsa las reformulaciones de XBRL a una fila por periodo, conservando la divulgación más temprana
Resolución de empresa por ticker, CIK o nombre contra el archivo oficial de tickers de la SEC, con resolución de respaldo por coincidencia aproximada (fuzzy)
Búsqueda de texto completo de EDGAR con frases entrecomilladas, filtros de tipo de formulario y rango de fechas (2001 → actualidad)
Limitación de tasa y User-Agent conformes con la SEC — no requiere clave API ni login
casos de uso
- Pipelines financieros de RAG / LLM que necesitan texto de 10-K y 10-Q fragmentado por sección y listo para embeddings
- Investigación de inversión — obtén series temporales de ingresos, beneficio neto y BPA diluido como filas XBRL limpias
- Monitorización de cumplimiento y propiedad — Form 4, SC 13D/13G y lenguaje de factores de riesgo entre empresas
- Productos fintech que necesitan datos estructurados de EDGAR sin construir un crawler a medida
- Investigación de mercado y de industria mediante búsqueda de texto completo — quién divulga una frase, y desde cuándo
- Flujos de trabajo de BI y hojas de cálculo que consumen filas de datos financieros XBRL limpias
parámetros de entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
mode | string | obligatorio | Modo de extracción: filings, fulltext, search o facts (por defecto: filings). |
ticker | string | opcional | Ticker bursátil, por ejemplo AAPL. Es obligatorio indicar uno de ticker/cik/companyName en tiempo de ejecución. |
cik | string | opcional | Central Index Key (CIK) de la SEC, por ejemplo 320193 — tiene prioridad sobre ticker y companyName. |
companyName | string | opcional | Nombre de la entidad registrada ante la SEC, con coincidencia exacta o aproximada contra el archivo oficial de tickers. |
query | string | opcional | Expresión de búsqueda de texto completo de EDGAR, por ejemplo "supply chain disruption" — obligatorio para el modo search. |
formTypes | array | opcional | Tipos de formulario a incluir, por ejemplo 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Vacío = todos los formularios. |
chunking | string | opcional | Estrategia de fragmentación para RAG en fulltext: section, paragraph (~2000 caracteres) o none (por defecto: section). |
maxItems | number | opcional | Máximo de elementos guardados; cada elemento guardado equivale a un evento facturable (por defecto: 100). |
Ejemplo de salida
1{
2 "itemType": "filing-fulltext",
3 "title": "Apple Inc. — 10-K 2025-10-31",
4 "company": "Apple Inc.",
5 "ticker": "AAPL",
6 "cik": "0000320193",
7 "formType": "10-K",
8 "filedAt": "2025-10-31",
9 "accessionNo": "0000320193-25-000123",
10 "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11 "sections": [
12 { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13 { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14 ],
15 "chunks": [
16 { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17 ],
18 "textLength": 220151
19}
Precios
Pago por evento — solo se te factura por los elementos realmente guardados:
| Evento | Precio | Qué incluye |
|---|---|---|
| Metadatos de informe / resultado de búsqueda | $0.001 | Un registro de metadatos de informe o un resultado de búsqueda de texto completo |
| Informe de texto completo | $0.005 | Un informe extraído, analizado por secciones y fragmentado para RAG |
| Dato XBRL | $0.0002 | Una fila de dato financiero XBRL |
Una extracción de metadatos de 1,000 informes cuesta ~$1.00; 1,000 datos XBRL cuestan ~$0.20. maxItems limita tanto el volumen como el coste.
Consejos
- Empieza con el modo
factspara datos financieros. Obtener filas XBRL (ingresos, beneficio neto, BPA) es mucho más barato y limpio que analizar informes completos cuando solo necesitas las cifras. - Usa
chunking: sectionpara RAG. Mantiene cada Item (Risk Factors, MD&A) intacto, de modo que la recuperación devuelve pasajes coherentes y citables. - La búsqueda de texto completo cubre desde 2001 en adelante. Para divulgaciones más antiguas, resuelve la empresa por CIK y obtén los metadatos de informe directamente.
faq
¿Necesito una clave API de la SEC?
¿Hasta cuándo se remontan los datos?
¿La salida está lista para LLMs y RAG?
¿Por qué se omiten algunos informes en el modo fulltext?
relacionado en ~/public-data
Scraper de ClinicalTrials.gov — Estudios, elegibilidad y resultados
Busca estudios, elegibilidad y resultados en ClinicalTrials.gov.
abrirScraper de CourtListener — Sentencias, expedientes y texto completo
Jurisprudencia de EE. UU., expedientes y texto completo de sentencias para IA legal.
abrirScraper de USAspending.gov — Adjudicaciones federales, beneficiarios y agregados
Adjudicaciones federales, beneficiarios y agregados de gasto de USAspending.gov.
abrir