~/public-data/sec-edgar-scraper

Scraper de SEC EDGAR — Informes, texto completo y datos financieros XBRL

Extrae metadatos de informes de SEC EDGAR, secciones de texto completo de 10-K/10-Q, resultados de búsqueda de texto completo de EDGAR y datos financieros XBRL como JSON limpio y listo para RAG. No requiere clave API.

financiero TypeScriptCheerio Estados Unidos
proooxy/sec-edgar-scraper — spec
categoríapublic-data / financiero
lenguajeTypeScript
stackTypeScript, Cheerio
mercadosEstados Unidos
salidaJSON limpio y listo para RAG

características clave

Cuatro modos en un solo actor — metadatos de informes, texto completo del documento, búsqueda de texto completo de EDGAR y datos financieros XBRL

Fragmentación lista para RAG — section, paragraph (~2000 caracteres) o none; cada fragmento etiquetado con su Item de origen y su orden

Parseo automático de secciones 'Item N' para 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A, y más)

Datos XBRL con taxonomy, tag, label, unit, value, año/periodo fiscal, formulario y número de accession

La deduplicación de datos colapsa las reformulaciones de XBRL a una fila por periodo, conservando la divulgación más temprana

Resolución de empresa por ticker, CIK o nombre contra el archivo oficial de tickers de la SEC, con resolución de respaldo por coincidencia aproximada (fuzzy)

Búsqueda de texto completo de EDGAR con frases entrecomilladas, filtros de tipo de formulario y rango de fechas (2001 → actualidad)

Limitación de tasa y User-Agent conformes con la SEC — no requiere clave API ni login

casos de uso

  • Pipelines financieros de RAG / LLM que necesitan texto de 10-K y 10-Q fragmentado por sección y listo para embeddings
  • Investigación de inversión — obtén series temporales de ingresos, beneficio neto y BPA diluido como filas XBRL limpias
  • Monitorización de cumplimiento y propiedad — Form 4, SC 13D/13G y lenguaje de factores de riesgo entre empresas
  • Productos fintech que necesitan datos estructurados de EDGAR sin construir un crawler a medida
  • Investigación de mercado y de industria mediante búsqueda de texto completo — quién divulga una frase, y desde cuándo
  • Flujos de trabajo de BI y hojas de cálculo que consumen filas de datos financieros XBRL limpias

parámetros de entrada

ParámetroTipoObligatorioDescripción
modestringobligatorioModo de extracción: filings, fulltext, search o facts (por defecto: filings).
tickerstringopcionalTicker bursátil, por ejemplo AAPL. Es obligatorio indicar uno de ticker/cik/companyName en tiempo de ejecución.
cikstringopcionalCentral Index Key (CIK) de la SEC, por ejemplo 320193 — tiene prioridad sobre ticker y companyName.
companyNamestringopcionalNombre de la entidad registrada ante la SEC, con coincidencia exacta o aproximada contra el archivo oficial de tickers.
querystringopcionalExpresión de búsqueda de texto completo de EDGAR, por ejemplo "supply chain disruption" — obligatorio para el modo search.
formTypesarrayopcionalTipos de formulario a incluir, por ejemplo 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Vacío = todos los formularios.
chunkingstringopcionalEstrategia de fragmentación para RAG en fulltext: section, paragraph (~2000 caracteres) o none (por defecto: section).
maxItemsnumberopcionalMáximo de elementos guardados; cada elemento guardado equivale a un evento facturable (por defecto: 100).

Ejemplo de salida

 1{
 2  "itemType": "filing-fulltext",
 3  "title": "Apple Inc. — 10-K 2025-10-31",
 4  "company": "Apple Inc.",
 5  "ticker": "AAPL",
 6  "cik": "0000320193",
 7  "formType": "10-K",
 8  "filedAt": "2025-10-31",
 9  "accessionNo": "0000320193-25-000123",
10  "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11  "sections": [
12    { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13    { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14  ],
15  "chunks": [
16    { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17  ],
18  "textLength": 220151
19}

Precios

Pago por evento — solo se te factura por los elementos realmente guardados:

EventoPrecioQué incluye
Metadatos de informe / resultado de búsqueda$0.001Un registro de metadatos de informe o un resultado de búsqueda de texto completo
Informe de texto completo$0.005Un informe extraído, analizado por secciones y fragmentado para RAG
Dato XBRL$0.0002Una fila de dato financiero XBRL

Una extracción de metadatos de 1,000 informes cuesta ~$1.00; 1,000 datos XBRL cuestan ~$0.20. maxItems limita tanto el volumen como el coste.

Consejos

  • Empieza con el modo facts para datos financieros. Obtener filas XBRL (ingresos, beneficio neto, BPA) es mucho más barato y limpio que analizar informes completos cuando solo necesitas las cifras.
  • Usa chunking: section para RAG. Mantiene cada Item (Risk Factors, MD&A) intacto, de modo que la recuperación devuelve pasajes coherentes y citables.
  • La búsqueda de texto completo cubre desde 2001 en adelante. Para divulgaciones más antiguas, resuelve la empresa por CIK y obtén los metadatos de informe directamente.

faq

¿Necesito una clave API de la SEC?
No. SEC EDGAR son datos públicos gratuitos. El actor se identifica con un User-Agent conforme a la normativa y se autolimita automáticamente por debajo del límite de tasa de la SEC — sin clave ni login.
¿Hasta cuándo se remontan los datos?
La búsqueda de texto completo de EDGAR (EFTS) cubre informes desde el 2001-05-04 en adelante y está limitada a 10,000 resultados por consulta. Los metadatos de informes se remontan a 1994, y los datos financieros XBRL cubren todo lo que la empresa haya declarado en XBRL.
¿La salida está lista para LLMs y RAG?
Sí. En el modo fulltext, el actor analiza los 10-K/10-Q en secciones 'Item N' y genera fragmentos listos para embeddings (section o párrafos de ~2000 caracteres), cada uno etiquetado con su Item de origen y su índice de orden.
¿Por qué se omiten algunos informes en el modo fulltext?
Los informes cuyo documento principal no es HTML ni TXT (por ejemplo, el XML de Form 4 que es solo XBRL) no se pueden analizar por secciones, así que se omiten — y no se cobran.

relacionado en ~/public-data

Ejecuta Scraper de SEC EDGAR — Informes, texto completo y datos financieros XBRL, o consigue un desarrollo a medida

Empieza a extraer datos en Apify en minutos, o contrátame para construir un scraper a medida y un pipeline de datos RAG para tu fuente y esquema exactos.

ejecutar en Apify obtener datos a medida