SEC EDGAR Scraper — Arquivos, Texto Completo e Dados Financeiros XBRL
Extraia metadados de arquivos do SEC EDGAR, seções em texto completo de 10-K/10-Q, resultados de busca em texto completo do EDGAR e fatos financeiros XBRL como JSON limpo e pronto para RAG. Sem necessidade de chave de API.
principais recursos
Quatro modos em um único ator — metadados de arquivos, texto completo de documentos, busca em texto completo do EDGAR e fatos financeiros XBRL
Chunking pronto para RAG — section, paragraph (~2000 caracteres) ou none; cada chunk marcado com seu Item de origem e ordem
Parsing automático de seções 'Item N' para 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A e mais)
Fatos XBRL com taxonomia, tag, label, unidade, valor, ano fiscal/período, formulário e número de accession
A deduplicação de fatos condensa reformulações XBRL em uma linha por período, mantendo a divulgação mais antiga
Resolução de empresa por ticker, CIK ou nome contra o arquivo oficial de tickers da SEC, com fallback fuzzy
Busca em texto completo do EDGAR com frases entre aspas, filtros de tipo de formulário e intervalo de data (2001 → presente)
Rate limiting e User-Agent compatíveis com as normas da SEC — sem chave de API e sem necessidade de login
casos de uso
- Pipelines de RAG/LLM financeiros que precisam de texto de 10-K e 10-Q em chunks por seção, pronto para embeddings
- Pesquisa de investimento — obtenha séries temporais de receita, lucro líquido e EPS diluído como linhas XBRL limpas
- Monitoramento de compliance e propriedade — Form 4, SC 13D/13G e linguagem de fatores de risco entre empresas
- Produtos fintech que precisam de dados estruturados do EDGAR sem construir um crawler personalizado
- Pesquisa de mercado e setor via busca em texto completo — quem divulga uma frase, e desde quando
- Fluxos de trabalho de BI e planilhas consumindo linhas de fatos financeiros XBRL limpas
parâmetros de entrada
| Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
mode | string | obrigatório | Modo de extração: filings, fulltext, search ou facts (padrão: filings). |
ticker | string | opcional | Ticker da ação, ex.: AAPL. Um entre ticker/cik/companyName é obrigatório em tempo de execução. |
cik | string | opcional | Central Index Key da SEC, ex.: 320193 — tem precedência sobre ticker e companyName. |
companyName | string | opcional | Nome do registrante na SEC, com correspondência exata ou fuzzy contra o arquivo oficial de tickers. |
query | string | opcional | Expressão de busca em texto completo do EDGAR, ex.: "supply chain disruption" — obrigatória no modo search. |
formTypes | array | opcional | Tipos de formulário a incluir, ex.: 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Vazio = todos os formulários. |
chunking | string | opcional | Estratégia de RAG para fulltext: section, paragraph (~2000 caracteres) ou none (padrão: section). |
maxItems | number | opcional | Máximo de itens salvos; cada item salvo é um evento cobrado (padrão: 100). |
Exemplo de Saída
1{
2 "itemType": "filing-fulltext",
3 "title": "Apple Inc. — 10-K 2025-10-31",
4 "company": "Apple Inc.",
5 "ticker": "AAPL",
6 "cik": "0000320193",
7 "formType": "10-K",
8 "filedAt": "2025-10-31",
9 "accessionNo": "0000320193-25-000123",
10 "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11 "sections": [
12 { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13 { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14 ],
15 "chunks": [
16 { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17 ],
18 "textLength": 220151
19}
Preços
Pagamento por evento — você paga apenas pelos itens realmente salvos:
| Evento | Preço | O que cobre |
|---|---|---|
| Metadados de arquivo / resultado de busca | $0.001 | Um registro de metadados de arquivo ou resultado de busca em texto completo |
| Arquivo em texto completo | $0.005 | Um arquivo extraído, com seções parseadas e dividido em chunks para RAG |
| Fato XBRL | $0.0002 | Uma linha de fato financeiro XBRL |
Uma extração de metadados de 1,000 arquivos é ~$1.00; 1,000 fatos XBRL é ~$0.20. maxItems limita tanto o volume quanto o custo.
Dicas
- Comece pelo modo
factspara dados financeiros. Extrair linhas XBRL (receita, lucro líquido, EPS) é muito mais barato e limpo do que fazer parsing de arquivos completos quando você só precisa dos números. - Use
chunking: sectionpara RAG. Isso mantém cada Item (Risk Factors, MD&A) intacto, para que a recuperação retorne passagens coerentes e citáveis. - A busca em texto completo cobre a partir de 2001. Para divulgações mais antigas, resolva a empresa pelo CIK e extraia os metadados de arquivos diretamente.
faq
Preciso de uma chave de API da SEC?
Até quando os dados retroagem?
A saída está pronta para LLMs e RAG?
Por que alguns arquivos são ignorados no modo fulltext?
relacionados em ~/public-data
ClinicalTrials.gov Scraper — Estudos, Elegibilidade e Resultados
Pesquise estudos, elegibilidade e resultados no ClinicalTrials.gov.
abrirCourtListener Scraper — Decisões, Processos e Texto Completo
Jurisprudência dos EUA, processos e texto completo de decisões para IA jurídica.
abrirUSAspending.gov Scraper — Concessões Federais, Beneficiários e Agregados
Concessões federais, beneficiários e agregados de gastos do USAspending.gov.
abrir