~/utility/schema-markup-scraper
Schema Markup Scraper——结构化数据抓取与 SEO 审计工具
从任意 URL 提取 JSON-LD、Microdata、RDFa、Open Graph 与 Twitter Cards,并提供完整的 SEO 审计评分系统。
SEO
成功率 >99%
TypeScriptCrawlee
全球
分类utility / SEO
语言TypeScript
技术栈TypeScript, Crawlee
市场全球
成功率>99%
输出干净、RAG 就绪的 JSON
核心特性
结构化数据提取——JSON-LD、Microdata 与 RDFa
社交元标签——Open Graph、Twitter Cards、Dublin Core
SEO 分析,采用 0-100 分制评分
规范网址与 hreflang 校验
提取作者信息,用于 EEAT 信号评估
LocalBusiness 检测,覆盖 80+ 种子类型
图片 alt 文本审计
面包屑 schema 校验
提取地理标签与 NAP 信息
应用场景
- 大规模技术性 SEO 审计
- 网站结构化数据校验
- 竞品 SEO 分析——对比各竞争对手的 schema 标记
- 面向内容网站的 EEAT 信号评估
- 面向本地商家的本地 SEO 审计
- 上线前的 SEO 检查清单校验
输入参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
startUrls | array | 必填 | 待分析的 URL |
proxy | object | 可选 | 代理配置 |
maxRequestsPerCrawl | number | 可选 | 限制待审计的 URL 总数 |
maxConcurrency | number | 可选 | 并行请求数 |
extractMetaTags | boolean | 可选 | 是否提取 meta 标签(默认:true) |
extractSeoAnalysis | boolean | 可选 | 是否运行 SEO 分析(默认:true) |
computeSeoScore | boolean | 可选 | 是否计算 0-100 的 SEO 评分(默认:true) |
extractGeoData | boolean | 可选 | 是否提取地理标签与 NAP 数据 |
输出示例
1{
2 "url": "https://example.com/product/...",
3 "title": "Example Product Page",
4 "linkedData": [
5 { "@type": "Product", "name": "..." }
6 ],
7 "openGraph": {
8 "og:title": "Example Product",
9 "og:type": "product"
10 },
11 "twitterCard": {
12 "card": "summary_large_image"
13 },
14 "seoAudit": {
15 "score": 78,
16 "issues": [
17 "Missing alt text on 3 images",
18 "No hreflang tags detected"
19 ]
20 },
21 "headings": {
22 "h1": ["Example Product"],
23 "h2": ["Description", "Reviews"]
24 }
25}
常见问题
支持哪些结构化数据格式?
JSON-LD、Microdata 与 RDFa。此外,爬虫还会提取 Open Graph、Twitter Cards 与 Dublin Core 元数据。
SEO 评分是如何计算的?
这个 0-100 的评分会综合评估标题标签、meta 描述、标题层级结构、图片 alt 文本、规范网址、移动端 viewport、结构化数据是否存在等多项因素。
可以一次审计多个页面吗?
可以,在 startUrls 中提供多个 URL 即可。爬虫会并行处理,实现快速批量审计。