~/public-data/sec-edgar-scraper

SEC EDGAR Scraper — Filings, Volltext & XBRL-Finanzdaten

SEC-EDGAR-Filing-Metadaten, Volltext-Abschnitte aus 10-K/10-Q, EDGAR-Volltextsuche-Ergebnisse und XBRL-Finanzdaten als sauberes, RAG-fertiges JSON extrahieren. Kein API-Key erforderlich.

Finanzen TypeScriptCheerio USA
proooxy/sec-edgar-scraper — Steckbrief
Kategoriepublic-data / Finanzen
SpracheTypeScript
StackTypeScript, Cheerio
MärkteUSA
Outputsauberes, RAG-fertiges JSON

Hauptfunktionen

Vier Modi in einem Actor — Filing-Metadaten, vollständiger Dokumenttext, EDGAR-Volltextsuche und XBRL-Finanzdaten

RAG-fertiges Chunking — section, paragraph (~2000 Zeichen) oder none; jeder Chunk ist mit Quell-Item und Reihenfolge getaggt

Automatisches Parsing der „Item N”-Abschnitte für 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A und mehr)

XBRL-Facts mit Taxonomie, Tag, Label, Einheit, Wert, Geschäftsjahr/-periode, Formular und Accession Number

Fact-Deduplizierung reduziert XBRL-Neufassungen auf eine Zeile pro Periode und behält die früheste Offenlegung

Unternehmens-Auflösung per Ticker, CIK oder Name gegen die offizielle Ticker-Datei der SEC, mit Fuzzy-Fallback

EDGAR-Volltextsuche mit zitierten Phrasen, Formulartyp- und Datumsbereich-Filtern (2001 → heute)

SEC-konformes Rate-Limiting und User-Agent — kein API-Key und kein Login erforderlich

Anwendungsfälle

  • Finanz-RAG-/LLM-Pipelines, die abschnittsweise gechunkten, embedding-fertigen 10-K- und 10-Q-Text brauchen
  • Investment-Research — Umsatz-, Nettogewinn- und Diluted-EPS-Zeitreihen als saubere XBRL-Zeilen abrufen
  • Compliance- & Beteiligungs-Monitoring — Form 4, SC 13D/13G und Risk-Factor-Formulierungen über Unternehmen hinweg
  • Fintech-Produkte, die strukturierte EDGAR-Daten brauchen, ohne einen eigenen Crawler zu bauen
  • Markt- und Branchenrecherche über Volltextsuche — wer eine bestimmte Formulierung offenlegt, und seit wann
  • BI- und Spreadsheet-Workflows, die saubere XBRL-Finanzdatenzeilen verarbeiten

Eingabeparameter

ParameterTypErforderlichBeschreibung
modestringerforderlichExtraktionsmodus: filings, fulltext, search oder facts (Standard: filings).
tickerstringoptionalBörsenticker, z. B. AAPL. Eines von ticker/cik/companyName ist zur Laufzeit erforderlich.
cikstringoptionalSEC Central Index Key, z. B. 320193 — hat Vorrang vor ticker und companyName.
companyNamestringoptionalSEC-Registrant-Name, exakt oder per Fuzzy-Matching gegen die offizielle Ticker-Datei abgeglichen.
querystringoptionalEDGAR-Volltextsuchausdruck, z. B. "supply chain disruption" — erforderlich im Modus search.
formTypesarrayoptionalEinzuschließende Formulartypen, z. B. 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Leer = alle Formulare.
chunkingstringoptionalRAG-Strategie für Fulltext: section, paragraph (~2000 Zeichen) oder none (Standard: section).
maxItemsnumberoptionalMaximal gespeicherte Items; jedes gespeicherte Item ist ein abgerechnetes Event (Standard: 100).

Beispiel-Output

 1{
 2  "itemType": "filing-fulltext",
 3  "title": "Apple Inc. — 10-K 2025-10-31",
 4  "company": "Apple Inc.",
 5  "ticker": "AAPL",
 6  "cik": "0000320193",
 7  "formType": "10-K",
 8  "filedAt": "2025-10-31",
 9  "accessionNo": "0000320193-25-000123",
10  "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11  "sections": [
12    { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13    { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14  ],
15  "chunks": [
16    { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17  ],
18  "textLength": 220151
19}

Preise

Pay-per-Event — abgerechnet wird nur für tatsächlich gespeicherte Items:

EventPreisWas abgedeckt ist
Filing-Metadaten / Suchtreffer$0.001Ein Filing-Metadaten-Datensatz oder ein Volltextsuche-Ergebnis
Volltext-Filing$0.005Ein Filing extrahiert, in Abschnitte geparst und für RAG gechunkt
XBRL-Fact$0.0002Eine XBRL-Finanzdatenzeile

Ein Abruf von 1.000 Filing-Metadaten kostet ~$1.00; 1.000 XBRL-Facts kosten ~$0.20. maxItems begrenzt sowohl Menge als auch Kosten.

Tipps

  • Für Finanzdaten mit dem Modus facts starten. Das Abrufen von XBRL-Zeilen (Umsatz, Nettogewinn, EPS) ist deutlich günstiger und sauberer als das Parsen ganzer Filings, wenn nur die Zahlen gebraucht werden.
  • chunking: section für RAG nutzen. Das hält jedes Item (Risk Factors, MD&A) intakt, sodass Retrieval kohärente, zitierfähige Passagen liefert.
  • Die Volltextsuche deckt die Zeit ab 2001 ab. Für ältere Offenlegungen das Unternehmen per CIK auflösen und Filing-Metadaten direkt abrufen.

FAQ

Brauche ich einen SEC-API-Key?
Nein. SEC EDGAR sind frei zugängliche öffentliche Daten. Der Actor identifiziert sich mit einem konformen User-Agent und drosselt sich automatisch unterhalb des Rate-Limits der SEC — kein Key, kein Login.
Wie weit reichen die Daten zurück?
Die EDGAR-Volltextsuche (EFTS) deckt Filings ab dem 2001-05-04 ab und ist auf 10.000 Treffer pro Abfrage begrenzt. Filing-Metadaten reichen bis 1994 zurück, und XBRL-Finanzdaten decken alles ab, was das Unternehmen in XBRL gemeldet hat.
Ist der Output bereit für LLMs und RAG?
Ja. Im Modus fulltext parst der Actor 10-K/10-Q in „Item N”-Abschnitte und erzeugt embedding-fertige Chunks (section oder ~2000-Zeichen-paragraph), jeweils getaggt mit Quell-Item und Reihenfolge-Index.
Warum werden manche Filings im Modus fulltext übersprungen?
Filings, deren Hauptdokument weder HTML noch TXT ist (zum Beispiel reines XBRL-Form-4-XML), lassen sich nicht in Abschnitte parsen und werden daher übersprungen — und nicht berechnet.

verwandt in ~/public-data

SEC EDGAR Scraper — Filings, Volltext & XBRL-Finanzdaten ausführen oder ein individuelles Projekt anfragen

In wenigen Minuten mit der Extraktion auf Apify starten, oder mich für einen maßgeschneiderten Scraper und eine RAG-Pipeline exakt nach Quelle und Schema beauftragen.

auf Apify ausführen individuelle Daten anfragen