~/public-data/sec-edgar-scraper
SEC EDGAR Scraper——财报文件、全文与 XBRL 财务数据
提取 SEC EDGAR 的财报文件元数据、10-K/10-Q 全文章节、EDGAR 全文检索结果,以及 XBRL 财务数据,输出干净、RAG 就绪的 JSON。无需 API 密钥。
金融
TypeScriptCheerio
美国
分类public-data / 金融
语言TypeScript
技术栈TypeScript, Cheerio
市场美国
输出干净、RAG 就绪的 JSON
核心特性
一个 Actor 内置四种模式——财报文件元数据、文档全文、EDGAR 全文检索与 XBRL 财务数据
RAG 就绪分块——section(章节)、paragraph(约 2000 字符的段落)或 none;每个分块都标注了来源 Item 与顺序
自动解析 10-K/10-Q 的“Item N”章节结构(Item 1A 风险因素、Item 7 管理层讨论与分析等)
XBRL 数据点包含分类标准(taxonomy)、标签、名称、单位、数值、财年/报告期、表格类型与登记编号
数据点去重会将 XBRL 重述数据合并为每个报告期一行,保留最早披露版本
支持按股票代码、CIK 或公司名称对照 SEC 官方 ticker 文件进行公司匹配,并提供模糊匹配兜底
支持带引号短语、表格类型与日期区间筛选的 EDGAR 全文检索(覆盖 2001 年至今)
符合 SEC 规范的速率限制与 User-Agent——无需 API 密钥,无需登录
应用场景
- 需要按章节分块、可直接生成向量嵌入的 10-K 与 10-Q 文本的金融 RAG / LLM 管道
- 投资研究——以干净的 XBRL 行记录形式拉取营收、净利润与稀释每股收益的时间序列
- 合规与股权监控——跨公司追踪 Form 4、SC 13D/13G 与风险因素表述
- 无需自建爬虫即可获取结构化 EDGAR 数据的金融科技产品
- 通过全文检索开展市场与行业研究——谁披露过某个表述,以及从何时开始
- 消费干净 XBRL 财务数据行的 BI 与电子表格工作流
输入参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
mode | string | 必填 | 提取模式:filings、fulltext、search 或 facts(默认:filings)。 |
ticker | string | 可选 | 股票代码,例如 AAPL。运行时 ticker/cik/companyName 三者需至少提供一个。 |
cik | string | 可选 | SEC 中央索引码(CIK),例如 320193——优先级高于 ticker 与 companyName。 |
companyName | string | 可选 | SEC 注册名称,会与官方 ticker 文件进行精确或模糊匹配。 |
query | string | 可选 | EDGAR 全文检索表达式,例如 "supply chain disruption"——search 模式下为必填。 |
formTypes | array | 可选 | 要包含的表格类型,例如 10-K、10-Q、8-K、S-1、DEF 14A、Form 4。留空表示包含所有类型。 |
chunking | string | 可选 | 全文 RAG 分块策略:section、paragraph(约 2000 字符)或 none(默认:section)。 |
maxItems | number | 可选 | 最多保存的条目数;每条保存的条目计为一次计费事件(默认:100)。 |
输出示例
1{
2 "itemType": "filing-fulltext",
3 "title": "Apple Inc. — 10-K 2025-10-31",
4 "company": "Apple Inc.",
5 "ticker": "AAPL",
6 "cik": "0000320193",
7 "formType": "10-K",
8 "filedAt": "2025-10-31",
9 "accessionNo": "0000320193-25-000123",
10 "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...",
11 "sections": [
12 { "name": "Item 1A — Risk Factors", "charCount": 38241 },
13 { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 }
14 ],
15 "chunks": [
16 { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 }
17 ],
18 "textLength": 220151
19}
价格
按事件计费——只对实际保存的条目计费:
| 事件 | 价格 | 说明 |
|---|---|---|
| 财报文件元数据 / 检索命中 | $0.001 | 一条财报文件元数据记录,或一条全文检索结果 |
| 全文财报文件 | $0.005 | 一份财报文件的提取、章节解析与 RAG 分块 |
| XBRL 数据点 | $0.0002 | 一条 XBRL 财务数据行 |
拉取 1,000 条财报文件元数据约为 $1.00;1,000 条 XBRL 数据约为 $0.20。maxItems 可同时限制拉取量与费用上限。
使用建议
- 需要财务数据时,优先使用
facts模式。 如果你只需要具体数字,拉取 XBRL 行数据(营收、净利润、EPS)比解析完整财报文件要便宜、干净得多。 - RAG 场景请使用
chunking: section。 它会保持每个 Item(风险因素、MD&A 等)的完整性,让检索结果返回连贯、可引用的段落。 - 全文检索仅覆盖 2001 年以后的数据。 若需要更早的披露记录,请通过 CIK 定位公司,直接拉取财报文件元数据。
常见问题
我需要 SEC 的 API 密钥吗?
不需要。SEC EDGAR 是免费公开数据。该 Actor 会使用合规的 User-Agent 表明身份,并自动按 SEC 的速率限制自我节流——无需密钥,也无需登录。
数据最早可以追溯到什么时候?
EDGAR 全文检索(EFTS)覆盖 2001-05-04 之后的财报文件,且每次查询最多返回 10,000 条命中结果。财报文件元数据可追溯至 1994 年,XBRL 财务数据则覆盖公司在 XBRL 中披露过的全部内容。
输出结果是否适合直接用于 LLM 与 RAG?
是的。在 fulltext 模式下,该 Actor 会将 10-K/10-Q 解析为“Item N”章节,并生成可直接用于向量嵌入的分块(按 section 或约 2000 字符的段落),每个分块都标注了来源 Item 与顺序索引。
为什么 fulltext 模式下部分财报文件会被跳过?
主文档格式不是 HTML 或 TXT 的财报文件(例如仅有 XBRL 的 Form 4 XML)无法进行章节解析,因此会被跳过——且不会产生费用。