À propos
Richard Feng — ingénieur web scraping avec plus de 12 ans d’expérience. Je transforme les sites web protégés en données structurées propres, prêtes pour le RAG, pour agents IA, pipelines de récupération et LLM.
Qui je suis
Je m’appelle Richard Feng, ingénieur freelance en automatisation web avec plus de 12 ans d’expérience en développement. Je suis spécialisé en web scraping, extraction de données et rétro-ingénierie d’API — je transforme des sites web complexes et protégés en données structurées propres, directement exploitables par les systèmes d’IA.
Ma boîte à outils couvre Node.js (TypeScript), Python, Go et Java, avec une expertise approfondie de Crawlee, Playwright et Cheerio. J’ai développé des systèmes de production qui traitent des millions de requêtes avec >99% de réussite.
Ce que je fais
Je développe et maintiens 16 acteurs Apify de qualité production, utilisés par plus de 3 100 utilisateurs avec un taux de réussite des exécutions >99% constant. Chaque acteur produit du JSON propre, prêt pour le RAG — cohérent avec son schéma, dédupliqué, et prêt à être injecté dans une base vectorielle, un pipeline de récupération ou un jeu d’entraînement. La plupart des acteurs de données publiques ne nécessitent aucune clé API. Mon travail couvre quatre domaines :
E-commerce et données retail
Des scrapers pour les grandes plateformes de beauté et de mode, dont Sephora (21 boutiques dans le monde), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, et un scraper Shopify universel qui fonctionne avec n’importe quelle boutique propulsée par Shopify.
Données publiques, financières et juridiques
Des jeux de données officiels du gouvernement américain sous forme de JSON propre et prêt pour le RAG — dépôts SEC EDGAR et données financières XBRL, financements fédéraux USAspending.gov, décisions de justice CourtListener, et essais cliniques ClinicalTrials.gov.
Veille réseaux sociaux et médias
Posts, profils et interactions Bluesky via l’AT Protocol, ainsi qu’un scraper de sous-titres et transcriptions YouTube qui génère du JSON, SRT, VTT ou du texte prêt pour LLM en plus de 100 langues.
Outils pour développeurs
Des outils au-delà du scraping — audit SEO et données structurées, conversion de pages web en PDF/image, et tests de charge haute performance.
Spécialités
- Rétro-ingénierie d’API privées — transformer des endpoints mobiles/web non documentés en sources de données fiables
- Contournement anti-bot — Cloudflare, DataDome, Akamai WAF, et protections personnalisées
- Sortie prête pour le RAG — JSON normalisé et cohérent avec son schéma, conçu pour la récupération et le grounding
- Scraping multi-régions — locales, devises et conformité pris en charge
- Systèmes haute fiabilité — des extracteurs qui maintiennent >99% de réussite à grande échelle
Stack technique
| Catégorie | Technologies |
|---|---|
| Langages | TypeScript, Python, Go, Java |
| Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Anti-bot | Générateurs de fingerprint, fingerprinting TLS, rotation de sessions |
| Infrastructure | Apify Platform, Docker, GitHub Actions |
| Tests | Vegeta, frameworks de test de charge personnalisés |
Travailler avec moi
Je propose des solutions de scraping sur mesure, la conception de pipelines de données RAG, et des services d’extraction de données en continu. Si votre IA a besoin du web réel sous forme de données propres — parlons-en.