# Proooxy — RAG-fertige Webdaten für KI-Agenten & LLMs > Strukturierte, RAG-fertige Webdaten für KI-Agenten, Retrieval-Pipelines und LLMs. Richard Feng entwickelt produktionsreife Apify-Actors für E-Commerce, SEC/EDGAR-Filings, US-Bundesausgaben, Gerichtsentscheidungen, klinische Studien sowie Social- und Videodaten — Anti-Bot-Bypass, sauberes, schemakonsistentes JSON, keine API-Keys für öffentliche Daten. Richard Feng ist ein unabhängiger Web-Scraping-Engineer, der das offene Web in saubere, RAG-fertige strukturierte Daten für KI-Agenten, Retrieval-Pipelines und LLMs verwandelt. Er entwickelt produktionsreife Apify-Actors in vier Bereichen: E-Commerce & Einzelhandel, öffentliche & Finanzdaten (SEC-EDGAR-Filings & XBRL, USAspending.gov-Bundesvergaben, CourtListener-Gerichtsentscheidungen, ClinicalTrials.gov-Studien), Social & Media (Bluesky, YouTube-Untertitel/-Transkripte) sowie Entwickler-/SEO-Tools. Jeder Actor liefert schemakonsistentes JSON für Grounding und Retrieval — die meisten Actors für öffentliche Daten benötigen keinen API-Key —, dazu Anti-Bot-Bypass (Cloudflare, DataDome, Akamai), Unterstützung für Residential-Proxys wo nötig, Pay-per-Event-Preise und >99% Run-Erfolgsquote im produktiven Einsatz. **Ideal für:** Grounding von KI-Agenten und RAG-Systemen mit aktuellen Webdaten, den Aufbau von LLM-Trainings-/Eval-Datensätzen, Markt- und Wettbewerbsanalysen sowie Alternative-Data-Pipelines. ## Auf einen Blick - **Website:** https://proooxy.com/de/ - **Autor:** Richard Feng (p8p9cmk96@mozmail.com) - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **Anzahl Tools:** 17 - **Stack:** Python (Crawlee, curl_cffi, Parsel) und TypeScript (Apify SDK, Crawlee, Cheerio) - **Hosting:** Apify Cloud — Pay-per-Event-Preise, kostenloser Tarif verfügbar ## Tools ### [Macy's Scraper — Produkte, Preise, SKUs & News](https://proooxy.com/de/tools/macys-scraper/) Macy's-Produktdaten extrahieren — Preise, Varianten, SKU-/UPC-Barcodes, Bilder, Bewertungen & Rezensionen — plus Macy's-Inc.-News, aus Such-, Kategorie-, Trending- und Produkt-URLs. Ohne Browser, Akamai-sicher. - Märkte: USA - Stack: TypeScript, Crawlee, Cheerio - Apify: https://apify.com/autofacts/macy-s-scraper ### [Bluesky Scraper — Beiträge, Profile, Feeds & Interaktionen](https://proooxy.com/de/tools/bluesky-scraper/) Bluesky-Beiträge, -Profile, -Follower, -Feeds, -Threads, -Liker und -Reposter über das AT Protocol extrahieren — plus authentifizierte Suche und Hashtag-Ergebnisse mit einem App-Passwort. Sauberes, normalisiertes JSON. - Märkte: Weltweit - Stack: TypeScript, AT Protocol - Apify: https://apify.com/autofacts/bluesky-scraper ### [ClinicalTrials.gov Scraper — Studien, Eignungskriterien & Ergebnisse](https://proooxy.com/de/tools/clinical-trials-scraper/) Die offizielle ClinicalTrials.gov-v2-API durchsuchen nach Erkrankung, Intervention, Sponsor, Standort, Status oder NCT-ID. Normalisierte Studiendatensätze mit Eignungskriterien, Ergebnis-Metadaten und inkrementellen Updates exportieren — kein API-Key nötig. - Märkte: Weltweit - Stack: TypeScript, REST API - Apify: https://apify.com/autofacts/clinical-trials-scraper ### [CourtListener Scraper — Gerichtsentscheidungen, Dockets & Volltext](https://proooxy.com/de/tools/courtlistener-scraper/) CourtListener durchsuchen nach US-Gerichtsentscheidungen, RECAP-Dockets, mündlichen Verhandlungen, Richtern und Zitaten — mit vollständigem Urteilstext und RAG-fertigen Chunks. Filterbar nach Gericht, Datum oder Stichwort. - Märkte: USA - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/courtlistener-scraper ### [SEC EDGAR Scraper — Filings, Volltext & XBRL-Finanzdaten](https://proooxy.com/de/tools/sec-edgar-scraper/) SEC-EDGAR-Filing-Metadaten, Volltext-Abschnitte aus 10-K/10-Q, EDGAR-Volltextsuche-Ergebnisse und XBRL-Finanzdaten als sauberes, RAG-fertiges JSON extrahieren. Kein API-Key erforderlich. - Märkte: USA - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/sec-edgar-scraper ### [USAspending.gov Scraper — Bundesvergaben, Empfänger & Aggregate](https://proooxy.com/de/tools/usaspending-scraper/) Die offizielle USAspending.gov-API v2 nach Bundesverträgen, -zuschüssen und -darlehen durchsuchen. Filterbar nach Behörde, Empfänger, NAICS/PSC oder Datum; Empfängerprofile, Kategorie-Summen und geografische Aggregate nach Bundesstaat/County/Distrikt abrufen. Kein API-Key. - Märkte: USA - Stack: TypeScript, REST API - Apify: https://apify.com/autofacts/usaspending-scraper ### [YouTube-Untertitel- & Transkript-Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/de/tools/youtube-transcript-scraper/) YouTube-Untertitel und -Transkripte aus Videos, Shorts, Playlists und Kanälen extrahieren — als JSON, SRT, VTT, Klartext oder sauberen LLM-fertigen Text. Über 100 Sprachen, umfangreiche Metadaten, kein API-Key — und fehlgeschlagene Extraktionen sind kostenlos. - Märkte: Weltweit - Stack: TypeScript, InnerTube - Apify: https://apify.com/autofacts/youtube-subtitle-transcript-scraper ### [Sephora Scraper (Weltweit)](https://proooxy.com/de/tools/sephora-scraper/) Apify-Actor, der vollständige Sephora-Produktdaten extrahiert — Varianten, Preise, Bilder, Inhaltsstoffe und Rezensionen — aus 21 Storefronts in den USA, Kanada, 9 EU-Märkten und 10 Asien-Pazifik-Märkten, in einem einzigen normalisierten Schema. - Märkte: USA, Kanada, Frankreich, Italien, Deutschland, Spanien, Polen, Tschechien, Griechenland, Rumänien, Portugal, Neuseeland, Australien, Singapur, Malaysia, Thailand, Indonesien, Philippinen, Hongkong, Taiwan, Brunei - Stack: Python, Crawlee, curl_cffi - Apify: https://apify.com/autofacts/sephora ### [Boohoo Scraper — Produktdaten aus 7 Regionen](https://proooxy.com/de/tools/boohoo-scraper/) Produktdaten von Boohoo-E-Commerce-Seiten aus 7 Regionen extrahieren — mit automatischer Paginierung, Facettenfilterung und Multi-Währungs-Unterstützung. - Märkte: Niederlande, Schweden, Großbritannien, Irland, Frankreich, Australien, USA - Stack: TypeScript, Cheerio, Fingerprint Generator - Apify: https://apify.com/autofacts/boohoo-scraper ### [Farfetch Scraper — Luxusmode-Produktdaten](https://proooxy.com/de/tools/farfetch-scraper/) Produktdaten aus dem Luxusmode-Segment von Farfetch extrahieren — inklusive Multi-Währungs-Preisen, Größen-/Passform-Varianten und Produktempfehlungen. - Märkte: Weltweit - Stack: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/farfetch ### [Global API Load Tester — 10K+ RPS Stresstest](https://proooxy.com/de/tools/load-tester/) Hochleistungs-Lasttest-Tool, das über 10.000 Anfragen pro Sekunde simuliert — mit geoverteiltem Traffic, gewichteten Zielen und interaktiven HTML-Reports. - Märkte: Weltweit - Stack: Go, Vegeta - Apify: https://apify.com/autofacts/global-api-load-tester ### [Lululemon Scraper — Produkte, Varianten & Preise](https://proooxy.com/de/tools/lululemon-scraper/) Produktdetails von Lululemon crawlen und extrahieren — inklusive Variantendaten, Farboptionen, Mediengalerien und Preisinformationen. - Märkte: USA - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/lululemon-scraper ### [Schema Markup Scraper & SEO-Auditor](https://proooxy.com/de/tools/schema-markup-scraper/) JSON-LD, Microdata, RDFa, Open Graph und Twitter Cards von jeder URL extrahieren — mit einem umfassenden SEO-Audit-Scoring-System. - Märkte: Weltweit - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/metadata-scraper ### [Sephora EU Scraper — 9 europäische Märkte](https://proooxy.com/de/tools/sephora-eu-scraper/) Vollständige Produktdaten von Sephora Europe aus 9 EU-Märkten scrapen — mit Multi-Varianten-Extraktion, Akamai-WAF-Bypass und intelligentem Token-Management. - Märkte: Frankreich, Italien, Deutschland, Spanien, Polen, Tschechien, Griechenland, Rumänien, Portugal - Stack: TypeScript, Crawlee, Akamai Bypass - Apify: https://apify.com/autofacts/sephora-eu-scraper ### [Shopify Scraper — Produktdaten aus jedem Shop](https://proooxy.com/de/tools/shopify-scraper/) Professionelles Tool zur Extraktion hochpräziser Produktdaten aus jedem Shopify-Shop — inklusive Collections, Suche und Produktempfehlungen. - Märkte: Weltweit - Stack: TypeScript, got-scraping - Apify: https://apify.com/autofacts/shopify-scraper-ppe ### [Ulta Beauty Scraper — Produkte, Preise & SKUs](https://proooxy.com/de/tools/ulta-scraper/) Produktdetails, Preise, Bilder und SKU-Informationen von Ulta Beauty extrahieren — inklusive Kategorieseiten, Markenseiten und Sale-Bereichen. - Märkte: USA - Stack: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/ulta-scraper ### [Universal Web Printer — URL & HTML zu PDF, Bild](https://proooxy.com/de/tools/web-printer/) Jede URL oder jedes HTML in PDF, PNG, JPEG oder WebP umwandeln — mit intelligentem Scroll-Stitching, Element-Extraktion, PDF-Verschlüsselung und Wasserzeichen. - Märkte: Weltweit - Stack: TypeScript, Playwright, PDF-lib, Sharp - Apify: https://apify.com/autofacts/universal-web-printer ## Blog - [Web-Scraping Best Practices 2026: Ein Leitfaden aus der Praxis](https://proooxy.com/de/blog/web-scraping-best-practices-2026/) — Praxiserprobte Web-Scraping-Strategien aus über 12 Jahren Produktionserfahrung — Architekturmuster, Fehlerbehandlung, Proxy-Management und Output-Normalisierung. - [Anti-Bot-Schutz verstehen: Was 2026 funktioniert](https://proooxy.com/de/blog/bypassing-anti-bot-protection-guide/) — Ein technischer Deep-Dive in moderne Anti-Bot-Systeme — Cloudflare, Akamai, Datadome — und die legitimen Bypass-Techniken, die im produktiven Scraping eingesetzt werden. ## Sitemap - [Über Richard Feng](https://proooxy.com/de/about/) — Hintergrund, Expertise, Leistungen - [Kontakt](https://proooxy.com/de/contact/) — für individuelle Scraper- / DaaS-Projekte - [Apify Store](https://apify.com/autofacts) — jedes Tool kostenlos testen - [GitHub](https://github.com/autofacts) — Quellcode für ausgewählte Projekte - [Vollständiger Inhalt als Klartext](https://proooxy.com/de/llms-full.txt) — alle Seiten aneinandergereiht für KI-Kontextfenster