# Proooxy — Données web prêtes pour le RAG, pour agents IA et LLM > Données web structurées et prêtes pour le RAG, destinées aux agents IA, aux pipelines de récupération et aux LLM. Richard Feng conçoit des acteurs Apify de qualité production pour l'e-commerce, les dépôts SEC/EDGAR, les dépenses fédérales, les décisions de justice, les essais cliniques et les données sociales et vidéo — contournement anti-bot, JSON propre au schéma cohérent, aucune clé API pour les données publiques. Richard Feng est un ingénieur web scraping indépendant qui transforme le web ouvert en données structurées propres et prêtes pour le RAG, pour les agents IA, les pipelines de récupération et les LLM. Il développe des acteurs Apify de qualité production dans quatre domaines : e-commerce et retail, données publiques et financières (dépôts SEC EDGAR et XBRL, financements fédéraux USAspending.gov, décisions de justice CourtListener, essais cliniques ClinicalTrials.gov), réseaux sociaux et médias (Bluesky, sous-titres/transcriptions YouTube), et outils développeur/SEO. Chaque acteur produit du JSON cohérent avec son schéma, conçu pour le grounding et la récupération — la plupart des acteurs de données publiques ne nécessitent aucune clé API — avec contournement anti-bot (Cloudflare, DataDome, Akamai), support des proxies résidentiels si nécessaire, tarification à l’événement, et des taux de réussite des exécutions >99% en production. **Idéal pour:** ancrer des agents IA et des systèmes RAG avec des données web fraîches, construire des datasets d’entraînement/évaluation pour LLM, l’intelligence de marché et concurrentielle, et les pipelines de données alternatives. ## En bref - **Site:** https://proooxy.com/fr/ - **Auteur:** Richard Feng (p8p9cmk96@mozmail.com) - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **Nombre d’outils:** 17 - **Stack:** Python (Crawlee, curl_cffi, Parsel) et TypeScript (Apify SDK, Crawlee, Cheerio) - **Hébergement:** Cloud Apify — tarification à l’événement, palier gratuit disponible ## Outils ### [Macy's Scraper — Produits, prix, SKUs et actualités](https://proooxy.com/fr/tools/macys-scraper/) Extrayez les données produits Macy's — prix, variantes, SKU/UPC, images, notes et avis — plus les actualités Macy's Inc., via URLs de recherche, catégorie, tendances ou produit. Sans navigateur, résistant à Akamai. - Marchés: États-Unis - Stack: TypeScript, Crawlee, Cheerio - Apify: https://apify.com/autofacts/macy-s-scraper ### [Bluesky Scraper — Posts, profils, feeds et interactions](https://proooxy.com/fr/tools/bluesky-scraper/) Extrayez posts, profils, abonnés, feeds et threads Bluesky, plus les comptes ayant liké ou reposté, via l’AT Protocol — avec recherche authentifiée et résultats de hashtags par mot de passe d’application. JSON propre et normalisé. - Marchés: Mondial - Stack: TypeScript, AT Protocol - Apify: https://apify.com/autofacts/bluesky-scraper ### [ClinicalTrials.gov Scraper — Études, éligibilité et résultats](https://proooxy.com/fr/tools/clinical-trials-scraper/) Interrogez l’API officielle ClinicalTrials.gov v2 par condition, intervention, promoteur, lieu, statut ou ID NCT. Exportez des fiches d’études normalisées avec éligibilité, métadonnées de résultats et mises à jour incrémentales — sans clé API. - Marchés: Mondial - Stack: TypeScript, REST API - Apify: https://apify.com/autofacts/clinical-trials-scraper ### [CourtListener Scraper — Décisions, dockets et texte intégral](https://proooxy.com/fr/tools/courtlistener-scraper/) Interrogez CourtListener pour les décisions de justice US, les dockets RECAP, les plaidoiries orales, les juges et les citations — texte intégral et chunks prêts pour le RAG. Filtrez par tribunal, date ou mot-clé. - Marchés: États-Unis - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/courtlistener-scraper ### [SEC EDGAR Scraper — Dépôts, texte intégral et données financières XBRL](https://proooxy.com/fr/tools/sec-edgar-scraper/) Extrayez métadonnées de dépôts SEC EDGAR, sections en texte intégral des 10-K/10-Q, résultats de recherche EDGAR, et faits financiers XBRL, en JSON propre et prêt pour le RAG. Aucune clé API requise. - Marchés: États-Unis - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/sec-edgar-scraper ### [USAspending.gov Scraper — Financements fédéraux, bénéficiaires et agrégats](https://proooxy.com/fr/tools/usaspending-scraper/) Interrogez l’API officielle USAspending.gov v2 pour contrats, subventions et prêts fédéraux. Filtrez par agence, bénéficiaire, NAICS/PSC ou date, et extrayez profils de bénéficiaires, totaux par catégorie, et agrégats géographiques état/comté/circonscription. Sans clé API. - Marchés: États-Unis - Stack: TypeScript, REST API - Apify: https://apify.com/autofacts/usaspending-scraper ### [YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/fr/tools/youtube-transcript-scraper/) Extrayez sous-titres et transcriptions YouTube — vidéos, Shorts, playlists et chaînes — en JSON, SRT, VTT, texte brut, ou texte prêt pour LLM. Plus de 100 langues, métadonnées riches, sans clé API — extractions échouées gratuites. - Marchés: Mondial - Stack: TypeScript, InnerTube - Apify: https://apify.com/autofacts/youtube-subtitle-transcript-scraper ### [Sephora Scraper (Mondial)](https://proooxy.com/fr/tools/sephora-scraper/) Acteur Apify qui extrait les données produits complètes de Sephora — variantes, prix, images, ingrédients et avis — depuis 21 boutiques aux États-Unis, au Canada, sur 9 marchés de l’UE et 10 marchés Asie-Pacifique, dans un schéma normalisé unique. - Marchés: États-Unis, Canada, France, Italie, Allemagne, Espagne, Pologne, République tchèque, Grèce, Roumanie, Portugal, Nouvelle-Zélande, Australie, Singapour, Malaisie, Thaïlande, Indonésie, Philippines, Hong Kong, Taïwan, Brunei - Stack: Python, Crawlee, curl_cffi - Apify: https://apify.com/autofacts/sephora ### [Boohoo Scraper — Données produits dans 7 régions](https://proooxy.com/fr/tools/boohoo-scraper/) Extrayez les données produits des sites e-commerce Boohoo dans 7 régions, avec pagination automatique, filtres à facettes et support multi-devises. - Marchés: Pays-Bas, Suède, Royaume-Uni, Irlande, France, Australie, États-Unis - Stack: TypeScript, Cheerio, Fingerprint Generator - Apify: https://apify.com/autofacts/boohoo-scraper ### [Farfetch Scraper — Données produits mode de luxe](https://proooxy.com/fr/tools/farfetch-scraper/) Extrayez les données produits mode de luxe de Farfetch : tarification multi-devises, variations de taille/coupe, et recommandations de produits. - Marchés: Mondial - Stack: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/farfetch ### [Global API Load Tester — Test de charge 10K+ RPS](https://proooxy.com/fr/tools/load-tester/) Outil de test de charge haute performance simulant plus de 10 000 requêtes par seconde, avec trafic géodistribué, cibles pondérées et rapports HTML interactifs. - Marchés: Mondial - Stack: Go, Vegeta - Apify: https://apify.com/autofacts/global-api-load-tester ### [Lululemon Scraper — Produits, variantes et prix](https://proooxy.com/fr/tools/lululemon-scraper/) Parcourez et extrayez les détails produits Lululemon : variantes, options de couleur, galeries média et informations de prix. - Marchés: États-Unis - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/lululemon-scraper ### [Schema Markup Scraper & SEO Auditor](https://proooxy.com/fr/tools/schema-markup-scraper/) Extrayez JSON-LD, Microdata, RDFa, Open Graph et Twitter Cards de n’importe quelle URL, avec un système complet de scoring d’audit SEO. - Marchés: Mondial - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/metadata-scraper ### [Sephora EU Scraper — 9 marchés européens](https://proooxy.com/fr/tools/sephora-eu-scraper/) Extrayez les données produits complètes de Sephora Europe sur 9 marchés UE : extraction multi-variantes, contournement du WAF Akamai, et gestion intelligente des tokens. - Marchés: France, Italie, Allemagne, Espagne, Pologne, République tchèque, Grèce, Roumanie, Portugal - Stack: TypeScript, Crawlee, Akamai Bypass - Apify: https://apify.com/autofacts/sephora-eu-scraper ### [Shopify Scraper — Données produits de n’importe quelle boutique](https://proooxy.com/fr/tools/shopify-scraper/) Outil professionnel pour extraire des données produits haute fidélité depuis n’importe quelle boutique Shopify : collections, recherche et recommandations de produits. - Marchés: Mondial - Stack: TypeScript, got-scraping - Apify: https://apify.com/autofacts/shopify-scraper-ppe ### [Ulta Beauty Scraper — Produits, prix et SKUs](https://proooxy.com/fr/tools/ulta-scraper/) Extrayez détails produits, tarification, images et informations SKU d’Ulta Beauty — pages de catégorie, de marque et sections soldes. - Marchés: États-Unis - Stack: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/ulta-scraper ### [Universal Web Printer — URL et HTML vers PDF, image](https://proooxy.com/fr/tools/web-printer/) Convertissez URL ou HTML en PDF, PNG, JPEG ou WebP : assemblage de défilement intelligent, extraction d’éléments, chiffrement PDF et filigrane. - Marchés: Mondial - Stack: TypeScript, Playwright, PDF-lib, Sharp - Apify: https://apify.com/autofacts/universal-web-printer ## Blog - [Bonnes pratiques de web scraping en 2026 : le guide du praticien](https://proooxy.com/fr/blog/web-scraping-best-practices-2026/) — Des stratégies de web scraping éprouvées, issues de plus de 12 ans d’expérience en production — modèles d’architecture, gestion des erreurs, gestion des proxies et normalisation de la sortie. - [Comprendre la protection anti-bot : ce qui fonctionne en 2026](https://proooxy.com/fr/blog/bypassing-anti-bot-protection-guide/) — Une plongée technique dans les systèmes anti-bot modernes — Cloudflare, Akamai, Datadome — et les techniques de contournement légitimes utilisées en scraping de production. ## Plan du site - [À propos de Richard Feng](https://proooxy.com/fr/about/) — parcours, expertise, services - [Contact](https://proooxy.com/fr/contact/) — pour les projets de scraper sur mesure / DaaS - [Apify Store](https://apify.com/autofacts) — essayez n’importe quel outil gratuitement - [GitHub](https://github.com/autofacts) — code source pour une sélection de projets - [Contenu complet en texte brut](https://proooxy.com/fr/llms-full.txt) — toutes les pages concaténées pour les fenêtres de contexte IA