~/public-data/sec-edgar-scraper

SEC EDGAR Scraper — फाइलिंग, फुल-टेक्स्ट और XBRL फाइनेंशियल्स

SEC EDGAR फाइलिंग मेटाडेटा, फुल-टेक्स्ट 10-K/10-Q सेक्शन, EDGAR फुल-टेक्स्ट सर्च रिज़ल्ट, और XBRL फाइनेंशियल फ़ैक्ट्स को साफ़, RAG-तैयार JSON के रूप में एक्सट्रैक्ट करें। किसी API key की ज़रूरत नहीं।

वित्तीय TypeScriptCheerio संयुक्त राज्य अमेरिका
proooxy/sec-edgar-scraper — स्पेक
कैटेगरीpublic-data / वित्तीय
भाषाTypeScript
स्टैकTypeScript, Cheerio
मार्केट्ससंयुक्त राज्य अमेरिका
आउटपुटसाफ, RAG-तैयार JSON

मुख्य विशेषताएं

एक ही एक्टर में चार मोड — filing मेटाडेटा, फुल डॉक्यूमेंट टेक्स्ट, EDGAR फुल-टेक्स्ट सर्च, और XBRL फाइनेंशियल फ़ैक्ट्स

RAG-तैयार chunking — section, paragraph (~2000 chars), या none; हर chunk अपने सोर्स Item और order के साथ टैग किया गया

10-K/10-Q के लिए ऑटोमैटिक 'Item N' सेक्शन पार्सिंग (Item 1A Risk Factors, Item 7 MD&A, और भी बहुत कुछ)

taxonomy, tag, label, unit, value, fiscal year/period, form, और accession number के साथ XBRL फ़ैक्ट्स

Fact deduplication XBRL restatements को प्रति period एक row में collapse करता है, सबसे पहले वाला disclosure रखते हुए

SEC की आधिकारिक ticker फ़ाइल के आधार पर ticker, CIK, या नाम से Company रिज़ॉल्यूशन, fuzzy फ़ॉलबैक के साथ

quoted phrases, form-type, और date-range फ़िल्टर (2001 → अभी तक) के साथ EDGAR फुल-टेक्स्ट सर्च

SEC-कम्प्लायंट rate limiting और User-Agent — कोई API key और कोई login ज़रूरी नहीं

यूज़ केस

  • section-chunked, embedding-तैयार 10-K और 10-Q टेक्स्ट चाहने वाली फाइनेंशियल RAG / LLM पाइपलाइन
  • इन्वेस्टमेंट रिसर्च — revenue, net income, और diluted EPS की टाइम सीरीज़ साफ़ XBRL rows के रूप में खींचें
  • कंप्लायंस व ownership मॉनिटरिंग — कंपनियों में Form 4, SC 13D/13G, और risk-factor भाषा
  • फिनटेक प्रोडक्ट जिन्हें कस्टम क्रॉलर बनाए बिना संरचित EDGAR डेटा चाहिए
  • फुल-टेक्स्ट सर्च के ज़रिए मार्केट और इंडस्ट्री रिसर्च — कौन कोई phrase डिस्क्लोज़ करता है, और कब से
  • साफ़ XBRL फाइनेंशियल fact rows इस्तेमाल करने वाले BI और स्प्रेडशीट वर्कफ़्लो

इनपुट पैरामीटर

पैरामीटरटाइपआवश्यकविवरण
modestringआवश्यकएक्सट्रैक्शन मोड: filings, fulltext, search, या facts (डिफ़ॉल्ट: filings)।
tickerstringवैकल्पिकस्टॉक ticker, जैसे AAPL। runtime पर ticker/cik/companyName में से एक ज़रूरी है।
cikstringवैकल्पिकSEC Central Index Key, जैसे 320193 — ticker और companyName से ऊपर प्राथमिकता रखता है।
companyNamestringवैकल्पिकSEC registrant नाम, आधिकारिक ticker फ़ाइल के आधार पर exact या fuzzy-matched।
querystringवैकल्पिकEDGAR फुल-टेक्स्ट सर्च expression, जैसे "supply chain disruption" — search मोड के लिए ज़रूरी।
formTypesarrayवैकल्पिकशामिल करने के लिए Form types, जैसे 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4। खाली = सभी forms।
chunkingstringवैकल्पिकFulltext RAG स्ट्रैटेजी: section, paragraph (~2000 chars), या none (डिफ़ॉल्ट: section)।
maxItemsnumberवैकल्पिकसेव किए जाने वाले अधिकतम आइटम; हर सेव किया गया आइटम एक बिल किया जाने वाला इवेंट है (डिफ़ॉल्ट: 100)।

आउटपुट का उदाहरण

 1{
 2  "itemType": "filing-fulltext",
 3  "title": "Apple Inc. — 10-K 2025-10-31",
 4  "company": "Apple Inc.",
 5  "ticker": "AAPL",
 6  "cik": "0000320193",
 7  "formType": "10-K",
 8  "filedAt": "2025-10-31",
 9  "accessionNo": "0000320193-25-000123",
10  "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11  "sections": [
12    { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13    { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14  ],
15  "chunks": [
16    { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17  ],
18  "textLength": 220151
19}

प्राइसिंग

Pay-per-event — आपसे सिर्फ़ असल में सेव किए गए आइटम के लिए बिल लिया जाता है:

इवेंटप्राइसइसमें क्या शामिल है
Filing मेटाडेटा / सर्च हिट$0.001एक filing मेटाडेटा रिकॉर्ड या फुल-टेक्स्ट सर्च रिज़ल्ट
फुल-टेक्स्ट Filing$0.005एक filing एक्सट्रैक्ट, section-parsed, और RAG के लिए chunked
XBRL फ़ैक्ट$0.0002एक XBRL फाइनेंशियल fact row

1,000-filing मेटाडेटा पुल की कीमत ~$1.00 है; 1,000 XBRL facts की ~$0.20। maxItems वॉल्यूम व कॉस्ट दोनों पर कैप लगाता है।

टिप्स

  • फाइनेंशियल्स के लिए facts मोड से शुरू करें। जब आपको सिर्फ़ नंबर चाहिए हों, तो पूरी filings पार्स करने से XBRL rows (revenue, net income, EPS) खींचना कहीं ज़्यादा सस्ता और साफ़ है।
  • RAG के लिए chunking: section इस्तेमाल करें। यह हर Item (Risk Factors, MD&A) को इंटैक्ट रखता है ताकि रिट्रीवल कोहेरेंट, citable passages लौटाए।
  • फुल-टेक्स्ट सर्च 2001 से आगे को कवर करता है। पुराने disclosures के लिए, कंपनी को CIK से रिज़ॉल्व करें और filing मेटाडेटा सीधे खींचें।

सामान्य प्रश्न

क्या मुझे SEC API key चाहिए?
नहीं। SEC EDGAR मुफ़्त सार्वजनिक डेटा है। एक्टर एक कम्प्लायंट User-Agent के साथ खुद को पहचान देता है और SEC की rate limit के अंदर खुद को ऑटोमैटिकली throttle करता है — कोई key नहीं, कोई login नहीं।
डेटा कितने पीछे तक जाता है?
EDGAR फुल-टेक्स्ट सर्च (EFTS) 2001-05-04 से आगे की filings कवर करता है और प्रति क्वेरी 10,000 hits पर कैप्ड है। Filing मेटाडेटा 1994 तक जाता है, और XBRL फाइनेंशियल फ़ैक्ट्स वह सब कवर करते हैं जो कंपनी ने XBRL में रिपोर्ट किया है।
क्या आउटपुट LLM और RAG के लिए तैयार है?
हां। fulltext मोड में एक्टर 10-K/10-Q को 'Item N' सेक्शन में पार्स करता है और embedding-तैयार chunks (section या ~2000-कैरेक्टर paragraph) देता है, जिनमें से हर एक अपने सोर्स Item और order index के साथ टैग होता है।
fulltext मोड में कुछ filings क्यों स्किप हो जाती हैं?
जिन filings का primary document HTML या TXT नहीं होता (जैसे, XBRL-only Form 4 XML), उन्हें section-parse नहीं किया जा सकता, इसलिए वे स्किप हो जाती हैं — और उनके लिए चार्ज नहीं लिया जाता।

~/public-data में संबंधित

SEC EDGAR Scraper — फाइलिंग, फुल-टेक्स्ट और XBRL फाइनेंशियल्स रन करें, या कस्टम बिल्ड पाएं

मिनटों में Apify पर एक्सट्रैक्शन शुरू करें, या अपने सोर्स और स्कीमा के लिए कस्टम स्क्रैपर और RAG पाइपलाइन बनवाने के लिए मुझे हायर करें।

Apify पर रन करें कस्टम डेटा पाएं