~/utility/schema-markup-scraper

Schema Markup Scraper——结构化数据抓取与 SEO 审计工具

从任意 URL 提取 JSON-LD、Microdata、RDFa、Open Graph 与 Twitter Cards,并提供完整的 SEO 审计评分系统。

SEO TypeScriptCrawlee 全球
proooxy/schema-markup-scraper — 规格
分类utility / SEO
语言TypeScript
技术栈TypeScript, Crawlee
市场全球
输出干净、RAG 就绪的 JSON

核心特性

结构化数据提取——JSON-LD、Microdata 与 RDFa

社交元标签——Open Graph、Twitter Cards、Dublin Core

SEO 分析,采用 0-100 分制评分

规范网址与 hreflang 校验

提取作者信息,用于 EEAT 信号评估

LocalBusiness 检测,覆盖 80+ 种子类型

图片 alt 文本审计

面包屑 schema 校验

提取地理标签与 NAP 信息

应用场景

  • 大规模技术性 SEO 审计
  • 网站结构化数据校验
  • 竞品 SEO 分析——对比各竞争对手的 schema 标记
  • 面向内容网站的 EEAT 信号评估
  • 面向本地商家的本地 SEO 审计
  • 上线前的 SEO 检查清单校验

输入参数

参数类型必填说明
startUrlsarray必填待分析的 URL
proxyobject可选代理配置
maxRequestsPerCrawlnumber可选限制待审计的 URL 总数
maxConcurrencynumber可选并行请求数
extractMetaTagsboolean可选是否提取 meta 标签(默认:true)
extractSeoAnalysisboolean可选是否运行 SEO 分析(默认:true)
computeSeoScoreboolean可选是否计算 0-100 的 SEO 评分(默认:true)
extractGeoDataboolean可选是否提取地理标签与 NAP 数据

输出示例

 1{
 2  "url": "https://developers.google.com/search/docs/appearance/structured-data/product",
 3  "title": "Intro to Product Structured Data on Google | Google Search Central",
 4  "linkedData": [
 5    {
 6      "@context": "https://schema.org",
 7      "@type": "BreadcrumbList",
 8      "itemListElement": [
 9        { "@type": "ListItem", "position": 1, "name": "Search Central", "item": "https://developers.google.com/search" }
10      ]
11    }
12  ],
13  "openGraph": {
14    "site_name": "Google for Developers",
15    "type": "website"
16  },
17  "twitterCard": {
18    "card": "summary_large_image",
19    "has_large_image": "true"
20  },
21  "seoAudit": {
22    "score": 95,
23    "issues": [
24      { "severity": "warning", "code": "TITLE_TOO_LONG", "message": "Title is 122 chars (recommended: max 60)" }
25    ]
26  },
27  "headings": {
28    "headings": [
29      { "level": 1, "text": "Introduction to Product structured data" },
30      { "level": 2, "text": "Deciding which markup to use" }
31    ],
32    "h1Count": 1,
33    "issues": []
34  }
35}

常见问题

支持哪些结构化数据格式?
JSON-LD、Microdata 与 RDFa。此外,爬虫还会提取 Open Graph、Twitter Cards 与 Dublin Core 元数据。
SEO 评分是如何计算的?
这个 0-100 的评分会综合评估标题标签、meta 描述、标题层级结构、图片 alt 文本、规范网址、移动端 viewport、结构化数据是否存在等多项因素。
可以一次审计多个页面吗?
可以,在 startUrls 中提供多个 URL 即可。爬虫会并行处理,实现快速批量审计。

~/utility 下的相关工具

运行 Schema Markup Scraper——结构化数据抓取与 SEO 审计工具,或定制专属方案

几分钟内即可在 Apify 上开始提取数据,或聘请我为你的目标源和 schema 定制专属爬虫与 RAG 管道。

在 Apify 上运行 获取定制数据