~/public-data/sec-edgar-scraper

SEC EDGAR Scraper — Laporan, Teks Lengkap & Data Keuangan XBRL

Ekstrak metadata laporan SEC EDGAR, section full-text 10-K/10-Q, hasil EDGAR full-text search, dan XBRL financial facts sebagai JSON bersih dan siap-RAG. Tanpa API key.

keuangan TypeScriptCheerio Amerika Serikat
proooxy/sec-edgar-scraper — spec
kategoripublic-data / keuangan
bahasaTypeScript
stackTypeScript, Cheerio
pasarAmerika Serikat
outputJSON bersih, siap-RAG

fitur utama

Empat mode dalam satu actor — metadata filing, teks dokumen lengkap, EDGAR full-text search, dan XBRL financial facts

Chunking siap-RAG — section, paragraph (~2000 karakter), atau none; setiap chunk ditandai dengan Item sumber dan urutannya

Parsing section 'Item N' otomatis untuk 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A, dan lainnya)

XBRL facts lengkap dengan taxonomy, tag, label, unit, value, fiscal year/period, form, dan accession number

Deduplikasi fact menggabungkan restatement XBRL menjadi satu baris per periode, mempertahankan disclosure paling awal

Resolusi perusahaan berdasarkan ticker, CIK, atau nama terhadap ticker file resmi SEC, dengan fuzzy fallback

EDGAR full-text search dengan quoted phrase, filter form-type, dan rentang tanggal (2001 → sekarang)

Rate limiting dan User-Agent yang sesuai ketentuan SEC — tanpa API key dan tanpa login

use case

  • Pipeline RAG/LLM finansial yang butuh teks 10-K dan 10-Q ter-chunk per section dan siap-embedding
  • Riset investasi — menarik time series revenue, net income, dan diluted EPS sebagai baris XBRL yang bersih
  • Monitoring compliance & kepemilikan — Form 4, SC 13D/13G, dan bahasa risk-factor di berbagai perusahaan
  • Produk fintech yang butuh data EDGAR terstruktur tanpa perlu membangun crawler custom
  • Riset pasar dan industri via full-text search — siapa yang mengungkap sebuah frasa, dan sejak kapan
  • Workflow BI dan spreadsheet yang mengonsumsi baris XBRL financial fact yang bersih

parameter input

ParameterTipeWajibDeskripsi
modestringwajibMode ekstraksi: filings, fulltext, search, atau facts (default: filings).
tickerstringopsionalTicker saham, contoh: AAPL. Salah satu dari ticker/cik/companyName wajib diisi saat runtime.
cikstringopsionalSEC Central Index Key, contoh: 320193 — lebih diutamakan dibanding ticker dan companyName.
companyNamestringopsionalNama registrant SEC, dicocokkan secara exact atau fuzzy terhadap ticker file resmi.
querystringopsionalEkspresi EDGAR full-text search, contoh: "supply chain disruption" — wajib untuk mode search.
formTypesarrayopsionalForm type yang disertakan, contoh: 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Kosong = semua form.
chunkingstringopsionalStrategi RAG fulltext: section, paragraph (~2000 karakter), atau none (default: section).
maxItemsnumberopsionalJumlah maksimum item yang disimpan; setiap item tersimpan dihitung sebagai satu billed event (default: 100).

Contoh Output

 1{
 2  "itemType": "filing-fulltext",
 3  "title": "Apple Inc. — 10-K 2025-10-31",
 4  "company": "Apple Inc.",
 5  "ticker": "AAPL",
 6  "cik": "0000320193",
 7  "formType": "10-K",
 8  "filedAt": "2025-10-31",
 9  "accessionNo": "0000320193-25-000123",
10  "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11  "sections": [
12    { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13    { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14  ],
15  "chunks": [
16    { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17  ],
18  "textLength": 220151
19}

Harga

Pay-per-event — Anda hanya dikenakan biaya untuk item yang benar-benar tersimpan:

EventHargaYang dicakup
Metadata filing / hasil search$0.001Satu record metadata filing atau satu hasil full-text search
Filing full-text$0.005Satu filing yang diekstrak, di-section-parsing, dan di-chunk untuk RAG
XBRL fact$0.0002Satu baris XBRL financial fact

Menarik metadata 1,000-filing berharga ~$1.00; 1,000 XBRL facts berharga ~$0.20. maxItems membatasi volume sekaligus biaya.

Tips

  • Mulai dengan mode facts untuk data finansial. Menarik baris XBRL (revenue, net income, EPS) jauh lebih murah dan lebih bersih dibanding mem-parsing filing lengkap saat Anda hanya butuh angkanya.
  • Gunakan chunking: section untuk RAG. Ini menjaga setiap Item (Risk Factors, MD&A) tetap utuh sehingga retrieval mengembalikan passage yang koheren dan bisa disitasi.
  • Full-text search mencakup 2001 dan seterusnya. Untuk disclosure yang lebih lama, resolve perusahaan berdasarkan CIK dan tarik metadata filing secara langsung.

faq

Apakah saya perlu API key SEC?
Tidak. SEC EDGAR adalah data publik gratis. Actor ini mengidentifikasi dirinya dengan User-Agent yang sesuai ketentuan dan mengatur throttle sendiri di bawah rate limit SEC secara otomatis — tanpa key dan tanpa login.
Sejauh apa data ini mundur ke belakang?
EDGAR full-text search (EFTS) mencakup filing sejak 2001-05-04 dan dibatasi hingga 10,000 hit per query. Metadata filing mundur hingga 1994, dan XBRL financial facts mencakup semua yang pernah dilaporkan perusahaan dalam XBRL.
Apakah outputnya siap untuk LLM dan RAG?
Ya. Di mode fulltext, actor ini mem-parsing 10-K/10-Q menjadi section 'Item N' dan menghasilkan chunk siap-embedding (section atau paragraph ~2000 karakter), masing-masing ditandai dengan Item sumber dan order index-nya.
Mengapa sebagian filing dilewati di mode fulltext?
Filing yang dokumen utamanya bukan HTML atau TXT (misalnya, Form 4 XML yang hanya berisi XBRL) tidak bisa di-section-parsing, sehingga dilewati — dan tidak dikenai biaya.

terkait di ~/public-data

Jalankan SEC EDGAR Scraper — Laporan, Teks Lengkap & Data Keuangan XBRL, atau dapatkan build custom

Mulai ekstraksi di Apify dalam hitungan menit, atau sewa saya untuk membangun scraper custom dan pipeline RAG untuk source dan skema spesifik Anda.

run di Apify dapatkan data custom