~/public-data/sec-edgar-scraper

SEC EDGAR Scraper — 공시, 전문 검색 및 XBRL 재무 데이터

SEC EDGAR 공시 메타데이터, 10-K/10-Q 전문 섹션, EDGAR 전문 검색 결과, XBRL 재무 데이터를 클린한 RAG-레디 JSON으로 추출합니다. API 키 불필요.

금융 TypeScriptCheerio 미국
proooxy/sec-edgar-scraper — 사양
카테고리public-data / 금융
언어TypeScript
스택TypeScript, Cheerio
마켓미국
출력클린한 RAG-레디 JSON

주요 기능

하나의 액터에 4가지 모드 — 공시 메타데이터, 문서 전문, EDGAR 전문 검색, XBRL 재무 데이터

RAG-레디 청킹 — section, paragraph(약 2000자), none 중 선택 가능하며, 모든 청크에 원본 Item과 순서가 태그됨

10-K/10-Q의 'Item N' 섹션 자동 파싱(Item 1A 위험 요인, Item 7 MD&A 등)

택소노미, 태그, 레이블, 단위, 값, 회계연도/기간, 서식, accession number를 포함한 XBRL 데이터

팩트 중복 제거로 XBRL 재작성 데이터를 기간당 한 행으로 축약하며 최초 공시 내용을 유지

SEC 공식 ticker 파일 기준으로 ticker, CIK, 회사명을 매칭하며 유사 매칭 폴백 지원

따옴표 구문, 서식 유형, 기간 필터를 지원하는 EDGAR 전문 검색(2001년 → 현재)

SEC 규정을 준수하는 레이트 리밋과 User-Agent — API 키와 로그인 모두 불필요

활용 사례

  • 섹션 단위로 청킹되어 임베딩 준비가 된 10-K, 10-Q 텍스트가 필요한 금융 RAG/LLM 파이프라인
  • 투자 리서치 — 매출, 순이익, 희석 EPS 시계열을 클린한 XBRL 행으로 수집
  • 컴플라이언스 및 지분 모니터링 — 기업 전반의 Form 4, SC 13D/13G, 위험 요인 문구
  • 커스텀 크롤러를 직접 구축하지 않고 구조화된 EDGAR 데이터가 필요한 핀테크 제품
  • 전문 검색을 통한 시장·산업 리서치 — 어떤 기업이 특정 문구를 언제부터 공시했는지 파악
  • 클린한 XBRL 재무 데이터 행을 활용하는 BI 및 스프레드시트 워크플로우

입력 파라미터

파라미터타입필수설명
modestring필수추출 모드: filings, fulltext, search, facts 중 선택(기본값: filings).
tickerstring선택주식 티커, 예: AAPL. 실행 시 ticker/cik/companyName 중 하나가 필수.
cikstring선택SEC Central Index Key, 예: 320193 — ticker와 companyName보다 우선 적용.
companyNamestring선택SEC 등록 회사명. 공식 ticker 파일과 정확히 또는 유사하게 매칭됩니다.
querystring선택EDGAR 전문 검색 표현식, 예: "supply chain disruption" — search 모드에서 필수.
formTypesarray선택포함할 서식 유형, 예: 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. 비워두면 전체 서식.
chunkingstring선택전문 RAG 청킹 전략: section, paragraph(약 2000자), none 중 선택(기본값: section).
maxItemsnumber선택저장할 최대 항목 수. 저장된 각 항목이 하나의 과금 이벤트입니다(기본값: 100).

출력 예시

 1{
 2  "itemType": "filing-fulltext",
 3  "title": "Apple Inc. — 10-K 2025-10-31",
 4  "company": "Apple Inc.",
 5  "ticker": "AAPL",
 6  "cik": "0000320193",
 7  "formType": "10-K",
 8  "filedAt": "2025-10-31",
 9  "accessionNo": "0000320193-25-000123",
10  "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11  "sections": [
12    { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13    { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14  ],
15  "chunks": [
16    { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17  ],
18  "textLength": 220151
19}

요금

이벤트당 과금 — 실제로 저장된 항목에 대해서만 비용이 청구됩니다:

이벤트가격포함 내용
공시 메타데이터 / 검색 결과$0.001공시 메타데이터 레코드 또는 전문 검색 결과 1건
전문 공시$0.005추출, 섹션 파싱, RAG용 청킹까지 완료된 공시 1건
XBRL 데이터$0.0002XBRL 재무 데이터 행 1건

1,000건의 공시 메타데이터 수집은 약 $1.00, XBRL 데이터 1,000건은 약 $0.20입니다. maxItems로 처리량과 비용을 모두 제한할 수 있습니다.

  • 재무 데이터에는 facts 모드로 시작하세요. 숫자만 필요하다면 전체 공시를 파싱하는 것보다 XBRL 행(매출, 순이익, EPS)을 가져오는 편이 훨씬 저렴하고 깔끔합니다.
  • RAG에는 chunking: section을 사용하세요. 각 Item(위험 요인, MD&A)이 온전하게 유지되어, 리트리벌 시 일관되고 인용 가능한 구절을 반환합니다.
  • 전문 검색은 2001년 이후를 커버합니다. 더 오래된 공시가 필요하다면 CIK로 회사를 특정한 뒤 공시 메타데이터를 직접 가져오세요.

자주 묻는 질문

SEC API 키가 필요한가요?
아니요. SEC EDGAR는 무료 공개 데이터입니다. 액터는 규정을 준수하는 User-Agent로 자신을 식별하고 SEC의 레이트 리밋 아래에서 자동으로 스로틀링합니다 — 키도 로그인도 필요 없습니다.
데이터는 얼마나 과거까지 거슬러 올라가나요?
EDGAR 전문 검색(EFTS)은 2001년 5월 4일 이후 공시를 커버하며 쿼리당 최대 10,000건으로 제한됩니다. 공시 메타데이터는 1994년까지 거슬러 올라가며, XBRL 재무 데이터는 기업이 XBRL로 보고한 모든 내용을 포함합니다.
출력이 LLM과 RAG에 바로 사용 가능한가요?
네. fulltext 모드에서 액터는 10-K/10-Q를 'Item N' 섹션으로 파싱하고, 원본 Item과 순서 인덱스가 태그된 임베딩 준비 완료 청크(section 또는 약 2000자 paragraph)를 생성합니다.
fulltext 모드에서 일부 공시가 건너뛰어지는 이유는 무엇인가요?
주요 문서가 HTML이나 TXT가 아닌 공시(예: XBRL 전용 Form 4 XML)는 섹션 파싱이 불가능하므로 건너뛰며, 이 경우 과금되지 않습니다.

~/public-data 관련 도구

SEC EDGAR Scraper — 공시, 전문 검색 및 XBRL 재무 데이터 실행하기, 또는 맞춤 제작 요청

몇 분 안에 Apify에서 추출을 시작하거나, 원하는 소스와 스키마에 딱 맞는 맞춤 스크래퍼와 RAG 파이프라인 제작을 의뢰하세요.

Apify에서 실행 맞춤 데이터 요청