SEC EDGAR Scraper — Filings, Volltext & XBRL-Finanzdaten
SEC-EDGAR-Filing-Metadaten, Volltext-Abschnitte aus 10-K/10-Q, EDGAR-Volltextsuche-Ergebnisse und XBRL-Finanzdaten als sauberes, RAG-fertiges JSON extrahieren. Kein API-Key erforderlich.
Hauptfunktionen
Vier Modi in einem Actor — Filing-Metadaten, vollständiger Dokumenttext, EDGAR-Volltextsuche und XBRL-Finanzdaten
RAG-fertiges Chunking — section, paragraph (~2000 Zeichen) oder none; jeder Chunk ist mit Quell-Item und Reihenfolge getaggt
Automatisches Parsing der „Item N”-Abschnitte für 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A und mehr)
XBRL-Facts mit Taxonomie, Tag, Label, Einheit, Wert, Geschäftsjahr/-periode, Formular und Accession Number
Fact-Deduplizierung reduziert XBRL-Neufassungen auf eine Zeile pro Periode und behält die früheste Offenlegung
Unternehmens-Auflösung per Ticker, CIK oder Name gegen die offizielle Ticker-Datei der SEC, mit Fuzzy-Fallback
EDGAR-Volltextsuche mit zitierten Phrasen, Formulartyp- und Datumsbereich-Filtern (2001 → heute)
SEC-konformes Rate-Limiting und User-Agent — kein API-Key und kein Login erforderlich
Anwendungsfälle
- Finanz-RAG-/LLM-Pipelines, die abschnittsweise gechunkten, embedding-fertigen 10-K- und 10-Q-Text brauchen
- Investment-Research — Umsatz-, Nettogewinn- und Diluted-EPS-Zeitreihen als saubere XBRL-Zeilen abrufen
- Compliance- & Beteiligungs-Monitoring — Form 4, SC 13D/13G und Risk-Factor-Formulierungen über Unternehmen hinweg
- Fintech-Produkte, die strukturierte EDGAR-Daten brauchen, ohne einen eigenen Crawler zu bauen
- Markt- und Branchenrecherche über Volltextsuche — wer eine bestimmte Formulierung offenlegt, und seit wann
- BI- und Spreadsheet-Workflows, die saubere XBRL-Finanzdatenzeilen verarbeiten
Eingabeparameter
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
mode | string | erforderlich | Extraktionsmodus: filings, fulltext, search oder facts (Standard: filings). |
ticker | string | optional | Börsenticker, z. B. AAPL. Eines von ticker/cik/companyName ist zur Laufzeit erforderlich. |
cik | string | optional | SEC Central Index Key, z. B. 320193 — hat Vorrang vor ticker und companyName. |
companyName | string | optional | SEC-Registrant-Name, exakt oder per Fuzzy-Matching gegen die offizielle Ticker-Datei abgeglichen. |
query | string | optional | EDGAR-Volltextsuchausdruck, z. B. "supply chain disruption" — erforderlich im Modus search. |
formTypes | array | optional | Einzuschließende Formulartypen, z. B. 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Leer = alle Formulare. |
chunking | string | optional | RAG-Strategie für Fulltext: section, paragraph (~2000 Zeichen) oder none (Standard: section). |
maxItems | number | optional | Maximal gespeicherte Items; jedes gespeicherte Item ist ein abgerechnetes Event (Standard: 100). |
Beispiel-Output
1{
2 "itemType": "filing-fulltext",
3 "title": "Apple Inc. — 10-K 2025-10-31",
4 "company": "Apple Inc.",
5 "ticker": "AAPL",
6 "cik": "0000320193",
7 "formType": "10-K",
8 "filedAt": "2025-10-31",
9 "accessionNo": "0000320193-25-000123",
10 "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11 "sections": [
12 { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13 { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14 ],
15 "chunks": [
16 { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17 ],
18 "textLength": 220151
19}
Preise
Pay-per-Event — abgerechnet wird nur für tatsächlich gespeicherte Items:
| Event | Preis | Was abgedeckt ist |
|---|---|---|
| Filing-Metadaten / Suchtreffer | $0.001 | Ein Filing-Metadaten-Datensatz oder ein Volltextsuche-Ergebnis |
| Volltext-Filing | $0.005 | Ein Filing extrahiert, in Abschnitte geparst und für RAG gechunkt |
| XBRL-Fact | $0.0002 | Eine XBRL-Finanzdatenzeile |
Ein Abruf von 1.000 Filing-Metadaten kostet ~$1.00; 1.000 XBRL-Facts kosten ~$0.20. maxItems begrenzt sowohl Menge als auch Kosten.
Tipps
- Für Finanzdaten mit dem Modus
factsstarten. Das Abrufen von XBRL-Zeilen (Umsatz, Nettogewinn, EPS) ist deutlich günstiger und sauberer als das Parsen ganzer Filings, wenn nur die Zahlen gebraucht werden. chunking: sectionfür RAG nutzen. Das hält jedes Item (Risk Factors, MD&A) intakt, sodass Retrieval kohärente, zitierfähige Passagen liefert.- Die Volltextsuche deckt die Zeit ab 2001 ab. Für ältere Offenlegungen das Unternehmen per CIK auflösen und Filing-Metadaten direkt abrufen.
FAQ
Brauche ich einen SEC-API-Key?
Wie weit reichen die Daten zurück?
Ist der Output bereit für LLMs und RAG?
Warum werden manche Filings im Modus fulltext übersprungen?
verwandt in ~/public-data
ClinicalTrials.gov Scraper — Studien, Eignungskriterien & Ergebnisse
ClinicalTrials.gov-Studien, Eignungskriterien und Ergebnisse durchsuchen.
öffnenCourtListener Scraper — Gerichtsentscheidungen, Dockets & Volltext
US-Rechtsprechung, Dockets und vollständige Urteilstexte für Rechts-KI.
öffnenUSAspending.gov Scraper — Bundesvergaben, Empfänger & Aggregate
Bundesvergaben, Empfänger und Ausgaben-Aggregate von USAspending.gov.
öffnen