~/utility/schema-markup-scraper
Schema Markup Scraper——结构化数据抓取与 SEO 审计工具
从任意 URL 提取 JSON-LD、Microdata、RDFa、Open Graph 与 Twitter Cards,并提供完整的 SEO 审计评分系统。
SEO
TypeScriptCrawlee
全球
分类utility / SEO
语言TypeScript
技术栈TypeScript, Crawlee
市场全球
输出干净、RAG 就绪的 JSON
核心特性
结构化数据提取——JSON-LD、Microdata 与 RDFa
社交元标签——Open Graph、Twitter Cards、Dublin Core
SEO 分析,采用 0-100 分制评分
规范网址与 hreflang 校验
提取作者信息,用于 EEAT 信号评估
LocalBusiness 检测,覆盖 80+ 种子类型
图片 alt 文本审计
面包屑 schema 校验
提取地理标签与 NAP 信息
应用场景
- 大规模技术性 SEO 审计
- 网站结构化数据校验
- 竞品 SEO 分析——对比各竞争对手的 schema 标记
- 面向内容网站的 EEAT 信号评估
- 面向本地商家的本地 SEO 审计
- 上线前的 SEO 检查清单校验
输入参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
startUrls | array | 必填 | 待分析的 URL |
proxy | object | 可选 | 代理配置 |
maxRequestsPerCrawl | number | 可选 | 限制待审计的 URL 总数 |
maxConcurrency | number | 可选 | 并行请求数 |
extractMetaTags | boolean | 可选 | 是否提取 meta 标签(默认:true) |
extractSeoAnalysis | boolean | 可选 | 是否运行 SEO 分析(默认:true) |
computeSeoScore | boolean | 可选 | 是否计算 0-100 的 SEO 评分(默认:true) |
extractGeoData | boolean | 可选 | 是否提取地理标签与 NAP 数据 |
输出示例
1{
2 "url": "https://developers.google.com/search/docs/appearance/structured-data/product",
3 "title": "Intro to Product Structured Data on Google | Google Search Central",
4 "linkedData": [
5 {
6 "@context": "https://schema.org",
7 "@type": "BreadcrumbList",
8 "itemListElement": [
9 { "@type": "ListItem", "position": 1, "name": "Search Central", "item": "https://developers.google.com/search" }
10 ]
11 }
12 ],
13 "openGraph": {
14 "site_name": "Google for Developers",
15 "type": "website"
16 },
17 "twitterCard": {
18 "card": "summary_large_image",
19 "has_large_image": "true"
20 },
21 "seoAudit": {
22 "score": 95,
23 "issues": [
24 { "severity": "warning", "code": "TITLE_TOO_LONG", "message": "Title is 122 chars (recommended: max 60)" }
25 ]
26 },
27 "headings": {
28 "headings": [
29 { "level": 1, "text": "Introduction to Product structured data" },
30 { "level": 2, "text": "Deciding which markup to use" }
31 ],
32 "h1Count": 1,
33 "issues": []
34 }
35}
常见问题
支持哪些结构化数据格式?
JSON-LD、Microdata 与 RDFa。此外,爬虫还会提取 Open Graph、Twitter Cards 与 Dublin Core 元数据。
SEO 评分是如何计算的?
这个 0-100 的评分会综合评估标题标签、meta 描述、标题层级结构、图片 alt 文本、规范网址、移动端 viewport、结构化数据是否存在等多项因素。
可以一次审计多个页面吗?
可以,在 startUrls 中提供多个 URL 即可。爬虫会并行处理,实现快速批量审计。