~/utility/schema-markup-scraper

Schema Markup Scraper——结构化数据抓取与 SEO 审计工具

从任意 URL 提取 JSON-LD、Microdata、RDFa、Open Graph 与 Twitter Cards,并提供完整的 SEO 审计评分系统。

SEO 成功率 >99% TypeScriptCrawlee 全球
proooxy/schema-markup-scraper — 规格
分类utility / SEO
语言TypeScript
技术栈TypeScript, Crawlee
市场全球
成功率>99%
输出干净、RAG 就绪的 JSON

核心特性

结构化数据提取——JSON-LD、Microdata 与 RDFa

社交元标签——Open Graph、Twitter Cards、Dublin Core

SEO 分析,采用 0-100 分制评分

规范网址与 hreflang 校验

提取作者信息,用于 EEAT 信号评估

LocalBusiness 检测,覆盖 80+ 种子类型

图片 alt 文本审计

面包屑 schema 校验

提取地理标签与 NAP 信息

应用场景

  • 大规模技术性 SEO 审计
  • 网站结构化数据校验
  • 竞品 SEO 分析——对比各竞争对手的 schema 标记
  • 面向内容网站的 EEAT 信号评估
  • 面向本地商家的本地 SEO 审计
  • 上线前的 SEO 检查清单校验

输入参数

参数类型必填说明
startUrlsarray必填待分析的 URL
proxyobject可选代理配置
maxRequestsPerCrawlnumber可选限制待审计的 URL 总数
maxConcurrencynumber可选并行请求数
extractMetaTagsboolean可选是否提取 meta 标签(默认:true)
extractSeoAnalysisboolean可选是否运行 SEO 分析(默认:true)
computeSeoScoreboolean可选是否计算 0-100 的 SEO 评分(默认:true)
extractGeoDataboolean可选是否提取地理标签与 NAP 数据

输出示例

 1{
 2  "url": "https://example.com/product/...",
 3  "title": "Example Product Page",
 4  "linkedData": [
 5    { "@type": "Product", "name": "..." }
 6  ],
 7  "openGraph": {
 8    "og:title": "Example Product",
 9    "og:type": "product"
10  },
11  "twitterCard": {
12    "card": "summary_large_image"
13  },
14  "seoAudit": {
15    "score": 78,
16    "issues": [
17      "Missing alt text on 3 images",
18      "No hreflang tags detected"
19    ]
20  },
21  "headings": {
22    "h1": ["Example Product"],
23    "h2": ["Description", "Reviews"]
24  }
25}

常见问题

支持哪些结构化数据格式?
JSON-LD、Microdata 与 RDFa。此外,爬虫还会提取 Open Graph、Twitter Cards 与 Dublin Core 元数据。
SEO 评分是如何计算的?
这个 0-100 的评分会综合评估标题标签、meta 描述、标题层级结构、图片 alt 文本、规范网址、移动端 viewport、结构化数据是否存在等多项因素。
可以一次审计多个页面吗?
可以,在 startUrls 中提供多个 URL 即可。爬虫会并行处理,实现快速批量审计。

~/utility 下的相关工具

运行 Schema Markup Scraper——结构化数据抓取与 SEO 审计工具,或定制专属方案

几分钟内即可在 Apify 上开始提取数据,或聘请我为你的目标源和 schema 定制专属爬虫与 RAG 管道。

在 Apify 上运行 获取定制数据