~/utility/schema-markup-scraper

Scraper de Schema Markup y auditor SEO

Extrae JSON-LD, Microdata, RDFa, Open Graph y Twitter Cards de cualquier URL, con un sistema de puntuación de auditoría SEO integral.

SEO TypeScriptCrawlee Global
proooxy/schema-markup-scraper — spec
categoríautility / SEO
lenguajeTypeScript
stackTypeScript, Crawlee
mercadosGlobal
salidaJSON limpio y listo para RAG

características clave

Extracción de datos estructurados — JSON-LD, Microdata y RDFa

Metaetiquetas sociales — Open Graph, Twitter Cards, Dublin Core

Análisis SEO con puntuación de 0 a 100

Validación de URL canónica y hreflang

Extracción de autor para señales EEAT

Detección de LocalBusiness con más de 80 subtipos

Auditoría de texto alternativo de imágenes

Validación de schema de breadcrumbs

Extracción de etiquetas geo y NAP

casos de uso

  • Auditoría técnica de SEO a gran escala
  • Validación de datos estructurados para sitios web
  • Análisis SEO competitivo — compara el schema markup entre competidores
  • Evaluación de señales EEAT para sitios de contenido
  • Auditoría de SEO local para negocios
  • Validación de checklist SEO previo al lanzamiento

parámetros de entrada

ParámetroTipoObligatorioDescripción
startUrlsarrayobligatorioURLs a analizar
proxyobjectopcionalConfiguración de proxy
maxRequestsPerCrawlnumberopcionalLimita el total de URLs a auditar
maxConcurrencynumberopcionalSolicitudes en paralelo
extractMetaTagsbooleanopcionalExtrae metaetiquetas (por defecto: true)
extractSeoAnalysisbooleanopcionalEjecuta el análisis SEO (por defecto: true)
computeSeoScorebooleanopcionalCalcula la puntuación SEO de 0 a 100 (por defecto: true)
extractGeoDatabooleanopcionalExtrae etiquetas geo y datos NAP

Ejemplo de salida

 1{
 2  "url": "https://developers.google.com/search/docs/appearance/structured-data/product",
 3  "title": "Intro to Product Structured Data on Google | Google Search Central",
 4  "linkedData": [
 5    {
 6      "@context": "https://schema.org",
 7      "@type": "BreadcrumbList",
 8      "itemListElement": [
 9        { "@type": "ListItem", "position": 1, "name": "Search Central", "item": "https://developers.google.com/search" }
10      ]
11    }
12  ],
13  "openGraph": {
14    "site_name": "Google for Developers",
15    "type": "website"
16  },
17  "twitterCard": {
18    "card": "summary_large_image",
19    "has_large_image": "true"
20  },
21  "seoAudit": {
22    "score": 95,
23    "issues": [
24      { "severity": "warning", "code": "TITLE_TOO_LONG", "message": "Title is 122 chars (recommended: max 60)" }
25    ]
26  },
27  "headings": {
28    "headings": [
29      { "level": 1, "text": "Introduction to Product structured data" },
30      { "level": 2, "text": "Deciding which markup to use" }
31    ],
32    "h1Count": 1,
33    "issues": []
34  }
35}

faq

¿Qué formatos de datos estructurados son compatibles?
JSON-LD, Microdata y RDFa. El scraper también extrae metadatos de Open Graph, Twitter Cards y Dublin Core.
¿Cómo se calcula la puntuación SEO?
La puntuación de 0 a 100 evalúa las etiquetas title, las meta descriptions, la jerarquía de encabezados, el texto alternativo de imágenes, las URLs canónicas, el viewport móvil, la presencia de datos estructurados y más.
¿Puedo auditar varias páginas a la vez?
Sí, proporciona varias URLs en startUrls. El scraper las procesa en paralelo para una auditoría masiva rápida.

relacionado en ~/utility

Ejecuta Scraper de Schema Markup y auditor SEO, o consigue un desarrollo a medida

Empieza a extraer datos en Apify en minutos, o contrátame para construir un scraper a medida y un pipeline de datos RAG para tu fuente y esquema exactos.

ejecutar en Apify obtener datos a medida