~/public-data/sec-edgar-scraper

SEC EDGAR Scraper — Dépôts, texte intégral et données financières XBRL

Extrayez métadonnées de dépôts SEC EDGAR, sections en texte intégral des 10-K/10-Q, résultats de recherche EDGAR, et faits financiers XBRL, en JSON propre et prêt pour le RAG. Aucune clé API requise.

finance TypeScriptCheerio États-Unis
proooxy/sec-edgar-scraper — specs
catégoriepublic-data / finance
langageTypeScript
stackTypeScript, Cheerio
marchésÉtats-Unis
sortieJSON propre, prêt pour le RAG

fonctionnalités clés

Quatre modes dans un seul acteur — métadonnées de dépôt, texte intégral du document, recherche en texte intégral EDGAR, et faits financiers XBRL

Découpage en chunks prêt pour le RAG — section, paragraph (~2000 caractères), ou none ; chaque chunk est associé à son Item source et à son ordre

Analyse automatique des sections « Item N » pour les 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A, et plus)

Faits XBRL avec taxonomie, tag, label, unité, valeur, année/période fiscale, formulaire, et numéro d’accession

La déduplication des faits regroupe les retraitements XBRL en une seule ligne par période, en conservant la première divulgation

Résolution d’entreprise par ticker, CIK, ou nom, à partir du fichier officiel des tickers de la SEC, avec repli approximatif (fuzzy)

Recherche en texte intégral EDGAR avec expressions entre guillemets, filtres de type de formulaire et de plage de dates (2001 → aujourd’hui)

Limitation de débit et User-Agent conformes SEC — aucune clé API ni connexion requise

cas d’usage

  • Pipelines RAG / LLM financiers nécessitant du texte 10-K et 10-Q découpé par section, prêt pour les embeddings
  • Recherche en investissement — extrayez le chiffre d’affaires, le résultat net et les séries temporelles de BPA dilué sous forme de lignes XBRL propres
  • Veille conformité et actionnariat — Form 4, SC 13D/13G, et formulations de facteurs de risque à travers les entreprises
  • Produits fintech nécessitant des données EDGAR structurées sans avoir à construire un crawler sur mesure
  • Recherche de marché et sectorielle via la recherche en texte intégral — qui divulgue une expression, et depuis quand
  • Workflows BI et tableurs consommant des lignes de faits financiers XBRL propres

paramètres d’entrée

ParamètreTypeRequisDescription
modestringrequisMode d’extraction : filings, fulltext, search, ou facts (par défaut : filings).
tickerstringoptionnelTicker boursier, ex. AAPL. L’un des trois — ticker/cik/companyName — est requis à l’exécution.
cikstringoptionnelCentral Index Key de la SEC, ex. 320193 — prend le pas sur ticker et companyName.
companyNamestringoptionnelNom de l’entité enregistrée auprès de la SEC, mis en correspondance exacte ou approximative avec le fichier officiel des tickers.
querystringoptionnelExpression de recherche en texte intégral EDGAR, ex. "supply chain disruption" — requis pour le mode search.
formTypesarrayoptionnelTypes de formulaires à inclure, ex. 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Vide = tous les formulaires.
chunkingstringoptionnelStratégie RAG en texte intégral : section, paragraph (~2000 caractères), ou none (par défaut : section).
maxItemsnumberoptionnelNombre maximal d’éléments sauvegardés ; chaque élément sauvegardé correspond à un événement facturé (par défaut : 100).

Exemple de sortie

 1{
 2  "itemType": "filing-fulltext",
 3  "title": "Apple Inc. — 10-K 2025-10-31",
 4  "company": "Apple Inc.",
 5  "ticker": "AAPL",
 6  "cik": "0000320193",
 7  "formType": "10-K",
 8  "filedAt": "2025-10-31",
 9  "accessionNo": "0000320193-25-000123",
10  "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11  "sections": [
12    { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13    { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14  ],
15  "chunks": [
16    { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17  ],
18  "textLength": 220151
19}

Tarification

Facturation à l’événement — vous n’êtes facturé que pour les éléments réellement sauvegardés :

ÉvénementPrixCe qui est couvert
Métadonnées de dépôt / résultat de recherche$0.001Un enregistrement de métadonnées de dépôt ou un résultat de recherche en texte intégral
Dépôt en texte intégral$0.005Un dépôt extrait, découpé par section, et chunké pour le RAG
Fait XBRL$0.0002Une ligne de fait financier XBRL

Une extraction de métadonnées de 1 000 dépôts coûte environ $1.00 ; 1 000 faits XBRL coûtent environ $0.20. maxItems plafonne à la fois le volume et le coût.

Astuces

  • Commencez par le mode facts pour les données financières. Extraire des lignes XBRL (chiffre d’affaires, résultat net, BPA) est bien moins coûteux et plus propre que de parser des dépôts complets quand vous n’avez besoin que des chiffres.
  • Utilisez chunking: section pour le RAG. Cela garde chaque Item (Risk Factors, MD&A) intact, afin que la récupération renvoie des passages cohérents et citables.
  • La recherche en texte intégral couvre la période à partir de 2001. Pour des divulgations plus anciennes, résolvez l’entreprise par CIK et extrayez directement les métadonnées de dépôt.

faq

Ai-je besoin d’une clé API SEC ?
Non. SEC EDGAR est une donnée publique gratuite. L’acteur s’identifie avec un User-Agent conforme et s’autolimite automatiquement sous le taux de la SEC — aucune clé, aucune connexion.
Jusqu’à quand les données remontent-elles ?
La recherche en texte intégral EDGAR (EFTS) couvre les dépôts à partir du 2001-05-04, et plafonne à 10 000 résultats par requête. Les métadonnées de dépôt remontent à 1994, et les faits financiers XBRL couvrent tout ce que l’entreprise a déclaré en XBRL.
La sortie est-elle prête pour les LLM et le RAG ?
Oui. En mode fulltext, l’acteur découpe les 10-K/10-Q en sections « Item N » et produit des chunks prêts pour les embeddings (section ou paragraphe d’environ 2000 caractères), chacun associé à son Item source et à son index d’ordre.
Pourquoi certains dépôts sont-ils ignorés en mode fulltext ?
Les dépôts dont le document principal n’est ni HTML ni TXT (par exemple, un Form 4 XML uniquement XBRL) ne peuvent pas être découpés par section, ils sont donc ignorés — et non facturés.

similaires dans ~/public-data

Exécutez SEC EDGAR Scraper — Dépôts, texte intégral et données financières XBRL, ou obtenez un projet sur mesure

Commencez à extraire sur Apify en quelques minutes, ou engagez-moi pour construire un scraper sur mesure et un pipeline RAG adaptés exactement à votre source et à votre schéma.

exécuter sur Apify obtenir des données sur mesure