SEC EDGAR Scraper — फाइलिंग, फुल-टेक्स्ट और XBRL फाइनेंशियल्स
SEC EDGAR फाइलिंग मेटाडेटा, फुल-टेक्स्ट 10-K/10-Q सेक्शन, EDGAR फुल-टेक्स्ट सर्च रिज़ल्ट, और XBRL फाइनेंशियल फ़ैक्ट्स को साफ़, RAG-तैयार JSON के रूप में एक्सट्रैक्ट करें। किसी API key की ज़रूरत नहीं।
मुख्य विशेषताएं
एक ही एक्टर में चार मोड — filing मेटाडेटा, फुल डॉक्यूमेंट टेक्स्ट, EDGAR फुल-टेक्स्ट सर्च, और XBRL फाइनेंशियल फ़ैक्ट्स
RAG-तैयार chunking — section, paragraph (~2000 chars), या none; हर chunk अपने सोर्स Item और order के साथ टैग किया गया
10-K/10-Q के लिए ऑटोमैटिक 'Item N' सेक्शन पार्सिंग (Item 1A Risk Factors, Item 7 MD&A, और भी बहुत कुछ)
taxonomy, tag, label, unit, value, fiscal year/period, form, और accession number के साथ XBRL फ़ैक्ट्स
Fact deduplication XBRL restatements को प्रति period एक row में collapse करता है, सबसे पहले वाला disclosure रखते हुए
SEC की आधिकारिक ticker फ़ाइल के आधार पर ticker, CIK, या नाम से Company रिज़ॉल्यूशन, fuzzy फ़ॉलबैक के साथ
quoted phrases, form-type, और date-range फ़िल्टर (2001 → अभी तक) के साथ EDGAR फुल-टेक्स्ट सर्च
SEC-कम्प्लायंट rate limiting और User-Agent — कोई API key और कोई login ज़रूरी नहीं
यूज़ केस
- section-chunked, embedding-तैयार 10-K और 10-Q टेक्स्ट चाहने वाली फाइनेंशियल RAG / LLM पाइपलाइन
- इन्वेस्टमेंट रिसर्च — revenue, net income, और diluted EPS की टाइम सीरीज़ साफ़ XBRL rows के रूप में खींचें
- कंप्लायंस व ownership मॉनिटरिंग — कंपनियों में Form 4, SC 13D/13G, और risk-factor भाषा
- फिनटेक प्रोडक्ट जिन्हें कस्टम क्रॉलर बनाए बिना संरचित EDGAR डेटा चाहिए
- फुल-टेक्स्ट सर्च के ज़रिए मार्केट और इंडस्ट्री रिसर्च — कौन कोई phrase डिस्क्लोज़ करता है, और कब से
- साफ़ XBRL फाइनेंशियल fact rows इस्तेमाल करने वाले BI और स्प्रेडशीट वर्कफ़्लो
इनपुट पैरामीटर
| पैरामीटर | टाइप | आवश्यक | विवरण |
|---|---|---|---|
mode | string | आवश्यक | एक्सट्रैक्शन मोड: filings, fulltext, search, या facts (डिफ़ॉल्ट: filings)। |
ticker | string | वैकल्पिक | स्टॉक ticker, जैसे AAPL। runtime पर ticker/cik/companyName में से एक ज़रूरी है। |
cik | string | वैकल्पिक | SEC Central Index Key, जैसे 320193 — ticker और companyName से ऊपर प्राथमिकता रखता है। |
companyName | string | वैकल्पिक | SEC registrant नाम, आधिकारिक ticker फ़ाइल के आधार पर exact या fuzzy-matched। |
query | string | वैकल्पिक | EDGAR फुल-टेक्स्ट सर्च expression, जैसे "supply chain disruption" — search मोड के लिए ज़रूरी। |
formTypes | array | वैकल्पिक | शामिल करने के लिए Form types, जैसे 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4। खाली = सभी forms। |
chunking | string | वैकल्पिक | Fulltext RAG स्ट्रैटेजी: section, paragraph (~2000 chars), या none (डिफ़ॉल्ट: section)। |
maxItems | number | वैकल्पिक | सेव किए जाने वाले अधिकतम आइटम; हर सेव किया गया आइटम एक बिल किया जाने वाला इवेंट है (डिफ़ॉल्ट: 100)। |
आउटपुट का उदाहरण
1{
2 "itemType": "filing-fulltext",
3 "title": "Apple Inc. — 10-K 2025-10-31",
4 "company": "Apple Inc.",
5 "ticker": "AAPL",
6 "cik": "0000320193",
7 "formType": "10-K",
8 "filedAt": "2025-10-31",
9 "accessionNo": "0000320193-25-000123",
10 "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11 "sections": [
12 { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13 { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14 ],
15 "chunks": [
16 { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17 ],
18 "textLength": 220151
19}
प्राइसिंग
Pay-per-event — आपसे सिर्फ़ असल में सेव किए गए आइटम के लिए बिल लिया जाता है:
| इवेंट | प्राइस | इसमें क्या शामिल है |
|---|---|---|
| Filing मेटाडेटा / सर्च हिट | $0.001 | एक filing मेटाडेटा रिकॉर्ड या फुल-टेक्स्ट सर्च रिज़ल्ट |
| फुल-टेक्स्ट Filing | $0.005 | एक filing एक्सट्रैक्ट, section-parsed, और RAG के लिए chunked |
| XBRL फ़ैक्ट | $0.0002 | एक XBRL फाइनेंशियल fact row |
1,000-filing मेटाडेटा पुल की कीमत ~$1.00 है; 1,000 XBRL facts की ~$0.20। maxItems वॉल्यूम व कॉस्ट दोनों पर कैप लगाता है।
टिप्स
- फाइनेंशियल्स के लिए
factsमोड से शुरू करें। जब आपको सिर्फ़ नंबर चाहिए हों, तो पूरी filings पार्स करने से XBRL rows (revenue, net income, EPS) खींचना कहीं ज़्यादा सस्ता और साफ़ है। - RAG के लिए
chunking: sectionइस्तेमाल करें। यह हर Item (Risk Factors, MD&A) को इंटैक्ट रखता है ताकि रिट्रीवल कोहेरेंट, citable passages लौटाए। - फुल-टेक्स्ट सर्च 2001 से आगे को कवर करता है। पुराने disclosures के लिए, कंपनी को CIK से रिज़ॉल्व करें और filing मेटाडेटा सीधे खींचें।
सामान्य प्रश्न
क्या मुझे SEC API key चाहिए?
डेटा कितने पीछे तक जाता है?
क्या आउटपुट LLM और RAG के लिए तैयार है?
fulltext मोड में कुछ filings क्यों स्किप हो जाती हैं?
~/public-data में संबंधित
ClinicalTrials.gov Scraper — स्टडीज़, एलिजिबिलिटी और रिज़ल्ट
ClinicalTrials.gov स्टडीज़, एलिजिबिलिटी, और रिज़ल्ट सर्च करें।
खोलेंCourtListener Scraper — Opinions, Dockets और पूरा टेक्स्ट
लीगल AI के लिए US केस लॉ, dockets, और पूरा opinion टेक्स्ट।
खोलेंUSAspending.gov Scraper — फ़ेडरल अवार्ड्स, प्राप्तकर्ता और एग्रीगेट्स
USAspending.gov से फ़ेडरल अवार्ड्स, प्राप्तकर्ता, और स्पेंडिंग aggregates।
खोलें