~/utility/web-printer

Universal Web Printer — URL et HTML vers PDF, image

Convertissez URL ou HTML en PDF, PNG, JPEG ou WebP : assemblage de défilement intelligent, extraction d’éléments, chiffrement PDF et filigrane.

médias >99% de réussite TypeScriptPlaywrightPDF-libSharp Mondial
proooxy/web-printer — specs
catégorieutility / médias
langageTypeScript
stackTypeScript, Playwright, PDF-lib, Sharp
marchésMondial
réussite>99%
sortieJSON propre, prêt pour le RAG

fonctionnalités clés

Sortie multi-formats — PDF, PNG, JPEG, WebP

Plusieurs modes d’affichage — viewport, pleine page, sélecteur CSS, readability

Assemblage de défilement intelligent pour des captures pleine page précises

Extraction au niveau élément via sélecteurs CSS

Manipulation de page — suppression d’éléments, clic sur des boutons, injection de CSS, masquage des en-têtes fixes

Chiffrement PDF (RC4 128 bits) et filigrane

Fusion de PDF pour documents multi-pages

Configuration personnalisée du viewport et du facteur d’échelle

cas d’usage

  • Génération automatisée de rapports depuis des tableaux de bord web
  • Archivage et documentation de sites web
  • Captures pour tests de non-régression visuelle
  • Captures d’écran de pages produit e-commerce pour catalogues
  • Conformité légale — capture de contenu web comme preuve
  • Génération de PDF depuis des applications web

paramètres d’entrée

ParamètreTypeRequisDescription
startUrlsarrayoptionnelURLs à rendre
htmlContentstringoptionnelHTML brut à rendre
outputFormatstringoptionnelpdf, png, jpeg, ou webp (par défaut : pdf)
viewModestringoptionnelviewport, fullPage, selector, ou readability
targetSelectorstringoptionnelSélecteur CSS pour la capture au niveau élément
viewportWidthnumberoptionnelLargeur du viewport navigateur (par défaut : 1280)
viewportHeightnumberoptionnelHauteur du viewport navigateur (par défaut : 720)
removeSelectorsarrayoptionnelSélecteurs CSS des éléments à supprimer avant la capture
pdfPasswordstringoptionnelChiffre le PDF avec un chiffrement RC4 128 bits

Exemple de sortie

L’outil génère des fichiers dans le format choisi (PDF, PNG, JPEG, ou WebP) et les stocke dans le dataset Apify. Chaque sortie inclut des métadonnées :

1{
2  "url": "https://example.com",
3  "format": "pdf",
4  "fileName": "example-com.pdf",
5  "fileSize": 245832,
6  "viewMode": "fullPage",
7  "viewport": { "width": 1280, "height": 720 },
8  "encrypted": false
9}

faq

Puis-je capturer uniquement un élément spécifique de la page ?
Oui, utilisez le paramètre targetSelector avec un sélecteur CSS pour ne capturer qu’un élément spécifique. Par exemple, utilisez '#main-content' pour ne capturer que la zone de contenu principale.
Comment fonctionne l’assemblage de défilement intelligent ?
Pour les captures pleine page, l’outil fait défiler la page par incréments, capture chaque tranche de viewport, puis les assemble. Cela garantit que le contenu à chargement différé et les animations sont correctement capturés.
Puis-je supprimer les bannières de cookies ou les publicités avant la capture ?
Oui, utilisez removeSelectors pour spécifier les sélecteurs CSS des éléments à supprimer. Vous pouvez aussi utiliser hideFixedElements pour masquer les en-têtes collants et les éléments flottants.

similaires dans ~/utility

Exécutez Universal Web Printer — URL et HTML vers PDF, image, ou obtenez un projet sur mesure

Commencez à extraire sur Apify en quelques minutes, ou engagez-moi pour construire un scraper sur mesure et un pipeline RAG adaptés exactement à votre source et à votre schéma.

exécuter sur Apify obtenir des données sur mesure