Über mich
Richard Feng — Web-Scraping-Engineer. Ich verwandle geschützte Websites in saubere, RAG-fertige strukturierte Daten für KI-Agenten, Retrieval-Pipelines und LLMs.
Wer ich bin
Ich bin Richard Feng, freiberuflicher Web-Automatisierungs-Engineer. Meine Spezialgebiete sind Web-Scraping, Datenextraktion und API-Reverse-Engineering — die Umwandlung komplexer, geschützter Websites in saubere, strukturierte Daten, die KI-Systeme tatsächlich nutzen können.
Mein Werkzeugkasten umfasst Node.js (TypeScript), Python, Go und Java, mit tiefgehender Expertise in Crawlee, Playwright und Cheerio.
Was ich mache
Ich entwickle und betreue die produktionsreifen Apify-Actors in diesem Katalog. Jeder Actor liefert sauberes, RAG-fertiges JSON — schemakonsistent, dedupliziert und bereit für den Einsatz in einer Vektordatenbank, Retrieval-Pipeline oder als Trainingsdatensatz. Die meisten Actors für öffentliche Daten benötigen keinen API-Key. Meine Arbeit erstreckt sich über fünf Bereiche:
E-Commerce & Einzelhandelsdaten
Scraper für führende Beauty-, Fashion- und Einzelhandelsplattformen, darunter Sephora (Storefronts in den USA, Kanada, der EU, dem Nahen Osten, Großbritannien, Indien und Asien-Pazifik), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s und Talabat Mart sowie universelle Scraper für jeden Shopify- oder WooCommerce-Shop.
Öffentliche, Finanz- und Rechtsdaten
Offizielle US-Datensätze als sauberes, RAG-fertiges JSON — SEC-EDGAR-Filings & XBRL-Finanzdaten, USAspending.gov-Bundesvergaben, CourtListener-Gerichtsentscheidungen und ClinicalTrials.gov-Studien.
Unternehmens-, Job- und Lead-Daten
Stellenanzeigen und Arbeitgeberdaten von Indeed, Shopify-Store-Leads, jede Google-Anzeige, die ein Wettbewerber schaltet und Standorte virtueller Postfächer (CMRA).
Social-Media-Intelligence
Bluesky-Beiträge, -Profile und -Interaktionen über das AT Protocol, dazu ein YouTube-Untertitel- & Transkript-Scraper, der JSON, SRT, VTT oder LLM-fertigen Text in über 100 Sprachen ausgibt, sowie ein TikTok-Transkript-Scraper.
Entwickler-Tools
Tools jenseits des Scrapings — SEO-Audits & strukturierte Daten und Web-to-PDF/Bild-Rendering.
Spezialgebiete
- Reverse Engineering privater APIs — die Umwandlung undokumentierter Mobile-/Web-Endpunkte in zuverlässige Datenquellen
- Anti-Bot-Bypass — Cloudflare, Akamai WAF und individuelle Schutzmechanismen
- RAG-fertiger Output — normalisiertes, schemakonsistentes JSON für Retrieval und Grounding
- Multi-Region-Scraping — Locales, Währungen und Compliance inklusive
- Hochzuverlässige Systeme — Extraktoren, die für unbeaufsichtigten Betrieb im großen Maßstab ausgelegt sind
Tech-Stack
| Kategorie | Technologien |
|---|---|
| Sprachen | TypeScript, Python, Go, Java |
| Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Anti-Bot | Fingerprint generators, TLS fingerprinting, session rotation |
| Infrastruktur | Apify Platform, Docker, GitHub Actions |
| Testing | Vegeta, custom load-testing frameworks |
Zusammenarbeit
Ich biete maßgeschneiderte Scraping-Lösungen, RAG-Datenpipeline-Engineering und laufende Datenextraktions-Services. Wenn eine KI das echte Web als saubere Daten braucht — jetzt Kontakt aufnehmen.