<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Proooxy — Données web prêtes pour le RAG, pour agents IA et LLM</title><link>https://proooxy.com/fr/</link><description>Recent content on Proooxy — Données web prêtes pour le RAG, pour agents IA et LLM</description><generator>Hugo</generator><language>fr</language><lastBuildDate>Wed, 15 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://proooxy.com/fr/index.xml" rel="self" type="application/rss+xml"/><item><title>Macy's Scraper — Produits, prix, SKUs et actualités</title><link>https://proooxy.com/fr/tools/macys-scraper/</link><pubDate>Wed, 15 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/macys-scraper/</guid><description>Produits, prix, SKUs/UPC et actualités Macy&amp;rsquo;s — résistant à Akamai, sans navigateur.</description></item><item><title>Bluesky Scraper — Posts, profils, feeds et interactions</title><link>https://proooxy.com/fr/tools/bluesky-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/bluesky-scraper/</guid><description>Extrayez posts, profils, feeds et interactions Bluesky.</description></item><item><title>ClinicalTrials.gov Scraper — Études, éligibilité et résultats</title><link>https://proooxy.com/fr/tools/clinical-trials-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/clinical-trials-scraper/</guid><description>Recherchez études, éligibilité et résultats sur ClinicalTrials.gov.</description></item><item><title>CourtListener Scraper — Décisions, dockets et texte intégral</title><link>https://proooxy.com/fr/tools/courtlistener-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/courtlistener-scraper/</guid><description>Jurisprudence américaine, dockets et texte intégral des décisions pour l’IA juridique.</description></item><item><title>SEC EDGAR Scraper — Dépôts, texte intégral et données financières XBRL</title><link>https://proooxy.com/fr/tools/sec-edgar-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/sec-edgar-scraper/</guid><description>Dépôts SEC, texte des 10-K/10-Q et données financières XBRL — prêts pour le RAG.</description></item><item><title>USAspending.gov Scraper — Financements fédéraux, bénéficiaires et agrégats</title><link>https://proooxy.com/fr/tools/usaspending-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/usaspending-scraper/</guid><description>Financements fédéraux, bénéficiaires et agrégats de dépenses depuis USAspending.gov.</description></item><item><title>YouTube Subtitle &amp; Transcript Scraper — JSON, SRT, VTT, LLM</title><link>https://proooxy.com/fr/tools/youtube-transcript-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/youtube-transcript-scraper/</guid><description>Transcriptions YouTube en JSON, SRT, VTT, ou texte prêt pour LLM.</description></item><item><title>Sephora Scraper (Mondial)</title><link>https://proooxy.com/fr/tools/sephora-scraper/</link><pubDate>Sat, 18 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/sephora-scraper/</guid><description>Extrayez n’importe quelle boutique Sephora — 21 marchés, un seul acteur.</description></item><item><title>Boohoo Scraper — Données produits dans 7 régions</title><link>https://proooxy.com/fr/tools/boohoo-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/boohoo-scraper/</guid><description>Extrayez les données produits Boohoo dans 7 boutiques régionales.</description></item><item><title>Farfetch Scraper — Données produits mode de luxe</title><link>https://proooxy.com/fr/tools/farfetch-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/farfetch-scraper/</guid><description>Extrayez les produits de mode de luxe Farfetch avec support multi-devises.</description></item><item><title>Global API Load Tester — Test de charge 10K+ RPS</title><link>https://proooxy.com/fr/tools/load-tester/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/load-tester/</guid><description>Simulez 10K+ RPS avec des tests de charge géodistribués.</description></item><item><title>Lululemon Scraper — Produits, variantes et prix</title><link>https://proooxy.com/fr/tools/lululemon-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/lululemon-scraper/</guid><description>Extrayez les données produits avec variantes et médias de Lululemon.</description></item><item><title>Schema Markup Scraper &amp; SEO Auditor</title><link>https://proooxy.com/fr/tools/schema-markup-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/schema-markup-scraper/</guid><description>Extrayez les données structurées et auditez le SEO de n’importe quel site.</description></item><item><title>Sephora EU Scraper — 9 marchés européens</title><link>https://proooxy.com/fr/tools/sephora-eu-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/sephora-eu-scraper/</guid><description>Extrayez les données produits de Sephora sur 9 marchés européens.</description></item><item><title>Shopify Scraper — Données produits de n’importe quelle boutique</title><link>https://proooxy.com/fr/tools/shopify-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/shopify-scraper/</guid><description>Extrayez les données produits de n’importe quelle boutique Shopify.</description></item><item><title>Ulta Beauty Scraper — Produits, prix et SKUs</title><link>https://proooxy.com/fr/tools/ulta-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/ulta-scraper/</guid><description>Extrayez les données produits complètes d’Ulta Beauty.</description></item><item><title>Universal Web Printer — URL et HTML vers PDF, image</title><link>https://proooxy.com/fr/tools/web-printer/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/tools/web-printer/</guid><description>Convertissez URLs et HTML en PDF, PNG, JPEG ou WebP.</description></item><item><title>Bonnes pratiques de web scraping en 2026 : le guide du praticien</title><link>https://proooxy.com/fr/blog/web-scraping-best-practices-2026/</link><pubDate>Wed, 01 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/blog/web-scraping-best-practices-2026/</guid><description>&lt;p&gt;Après avoir développé et maintenu 15 scrapers de production qui servent plus de 3 100 utilisateurs avec des taux de réussite &amp;gt;99%, voici les pratiques qui comptent vraiment.&lt;/p&gt;
&lt;h2 id="architecture--penser-en-pipelines-pas-en-scripts"&gt;Architecture : penser en pipelines, pas en scripts&lt;/h2&gt;
&lt;p&gt;La plus grosse erreur que je constate consiste à traiter le scraping comme un processus en une seule étape. Les scrapers de production sont des pipelines de données :&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Découverte des URL&lt;/strong&gt; — identifier quoi scraper (sitemaps, pages de catégorie, recherche, API)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Exécution des requêtes&lt;/strong&gt; — récupérer les données avec une stratégie de retry et de rotation adaptée&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Parsing&lt;/strong&gt; — extraire les champs structurés à partir des réponses brutes&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Normalisation&lt;/strong&gt; — nettoyer, valider et standardiser la sortie&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Stockage&lt;/strong&gt; — pousser vers des datasets, des bases de données ou des systèmes en aval&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Chaque étape doit pouvoir être testée et relancée indépendamment. Quand Sephora change la mise en page de ses pages produit, seule l’étape 3 doit être mise à jour — le reste du pipeline reste stable.&lt;/p&gt;</description></item><item><title>Comprendre la protection anti-bot : ce qui fonctionne en 2026</title><link>https://proooxy.com/fr/blog/bypassing-anti-bot-protection-guide/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/blog/bypassing-anti-bot-protection-guide/</guid><description>&lt;p&gt;La protection anti-bot est une course à l’armement. En tant que développeur qui conçoit quotidiennement des scrapers de production capables de contourner ces systèmes, voici un regard de praticien sur le paysage actuel — ce que ces protections vérifient réellement, et à quoi ressemblent les techniques de contournement légitimes.&lt;/p&gt;
&lt;h2 id="les-couches-de-détection"&gt;Les couches de détection&lt;/h2&gt;
&lt;p&gt;Les systèmes anti-bot modernes fonctionnent par couches. Comprendre ces couches est la clé d’un contournement fiable :&lt;/p&gt;
&lt;h3 id="couche-1--réputation-ip"&gt;Couche 1 : réputation IP&lt;/h3&gt;
&lt;p&gt;La vérification la plus simple. Les services anti-bot maintiennent des bases de données de plages IP datacenter connues, de sorties VPN, et d’IP déjà signalées.&lt;/p&gt;</description></item><item><title>À propos</title><link>https://proooxy.com/fr/about/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/about/</guid><description>&lt;h2 id="qui-je-suis"&gt;Qui je suis&lt;/h2&gt;
&lt;p&gt;Je m’appelle Richard Feng, ingénieur freelance en automatisation web avec plus de 12 ans d’expérience en développement. Je suis spécialisé en &lt;strong&gt;web scraping, extraction de données et rétro-ingénierie d’API&lt;/strong&gt; — je transforme des sites web complexes et protégés en données structurées propres, directement exploitables par les systèmes d’IA.&lt;/p&gt;
&lt;p&gt;Ma boîte à outils couvre &lt;strong&gt;Node.js (TypeScript), Python, Go et Java&lt;/strong&gt;, avec une expertise approfondie de &lt;strong&gt;Crawlee, Playwright et Cheerio&lt;/strong&gt;. J’ai développé des systèmes de production qui traitent des millions de requêtes avec &lt;strong&gt;&amp;gt;99% de réussite&lt;/strong&gt;.&lt;/p&gt;</description></item><item><title>Contact</title><link>https://proooxy.com/fr/contact/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/fr/contact/</guid><description>&lt;h2 id="obtenez-les-données-absentes-du-catalogue"&gt;Obtenez les données absentes du catalogue&lt;/h2&gt;
&lt;p&gt;Je conçois des scrapers web et des pipelines de données RAG sur mesure — pour des équipes IA, des plateformes de données, et toute personne ayant besoin du web ouvert sous forme de JSON propre et structuré. Extraction ponctuelle ou flux mis à jour en continu, je peux vous aider.&lt;/p&gt;
&lt;h3 id="ce-que-je-construis"&gt;Ce que je construis&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Scrapers sur mesure&lt;/strong&gt; — conçus spécifiquement pour vos sites cibles, avec contournement anti-bot intégré&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Pipelines de données RAG&lt;/strong&gt; — extraction, normalisation, découpage en chunks, et livraison de JSON prêt pour la récupération vers votre base vectorielle ou votre entrepôt de données&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Rétro-ingénierie d’API privées&lt;/strong&gt; — transformer des endpoints mobiles/web non documentés en sources stables et structurées&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Maintenance de scrapers&lt;/strong&gt; — garder vos extracteurs existants opérationnels quand les sites cibles changent&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Conseil technique&lt;/strong&gt; — audit d’architecture pour votre stack de scraping et d’ingestion de données&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="comment-ça-marche"&gt;Comment ça marche&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Décrivez les données&lt;/strong&gt; — la source, les champs dont vous avez besoin, et le format de livraison&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Étude de faisabilité gratuite&lt;/strong&gt; — j’évalue la complexité de la cible et son niveau de protection anti-bot, sans frais&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Proposition &amp;amp; délais&lt;/strong&gt; — périmètre clair, tarif fixe, date de livraison&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Développement &amp;amp; livraison&lt;/strong&gt; — extracteur de qualité production avec documentation et sortie propre&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="démarrer-un-projet"&gt;Démarrer un projet&lt;/h3&gt;
&lt;form action="https://api.web3forms.com/submit" method="POST" class="form contact-form"&gt;
 &lt;input type="hidden" name="access_key" value="9ed3e6ad-95b9-46d5-b3f7-3ffd428d9c3a"&gt;
 &lt;div class="field"&gt;
 &lt;label for="name"&gt;nom&lt;/label&gt;
 &lt;input type="text" name="name" id="name" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="email"&gt;email&lt;/label&gt;
 &lt;input type="email" name="email" id="email" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="project"&gt;type de projet&lt;/label&gt;
 &lt;select name="project" id="project"&gt;
 &lt;option value="custom-scraper"&gt;Scraper sur mesure&lt;/option&gt;
 &lt;option value="rag-pipeline"&gt;Pipeline de données RAG&lt;/option&gt;
 &lt;option value="api-reverse-engineering"&gt;Rétro-ingénierie d’API privées&lt;/option&gt;
 &lt;option value="consulting"&gt;Conseil technique&lt;/option&gt;
 &lt;option value="other"&gt;Autre&lt;/option&gt;
 &lt;/select&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="message"&gt;de quoi avez-vous besoin ?&lt;/label&gt;
 &lt;textarea name="message" id="message" rows="5" required&gt;&lt;/textarea&gt;
 &lt;/div&gt;
 &lt;button type="submit" class="btn btn--primary btn--lg"&gt;envoyer le message&lt;/button&gt;
&lt;/form&gt;
&lt;h3 id="ou-contactez-moi-directement"&gt;Ou contactez-moi directement&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Email&lt;/strong&gt; : &lt;a href="mailto:p8p9cmk96@mozmail.com"&gt;p8p9cmk96@mozmail.com&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GitHub&lt;/strong&gt; : &lt;a href="https://github.com/autofacts"&gt;@autofacts&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Apify&lt;/strong&gt; : &lt;a href="https://apify.com/autofacts"&gt;apify.com/autofacts&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>