<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Proooxy — RAG-fertige Webdaten für KI-Agenten &amp; LLMs</title><link>https://proooxy.com/de/</link><description>Recent content on Proooxy — RAG-fertige Webdaten für KI-Agenten &amp; LLMs</description><generator>Hugo</generator><language>de</language><lastBuildDate>Wed, 15 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://proooxy.com/de/index.xml" rel="self" type="application/rss+xml"/><item><title>Macy's Scraper — Produkte, Preise, SKUs &amp; News</title><link>https://proooxy.com/de/tools/macys-scraper/</link><pubDate>Wed, 15 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/macys-scraper/</guid><description>Macy&amp;rsquo;s-Produkte, Preise, SKUs/UPCs &amp;amp; News — Akamai-sicher, ohne Browser.</description></item><item><title>Bluesky Scraper — Beiträge, Profile, Feeds &amp; Interaktionen</title><link>https://proooxy.com/de/tools/bluesky-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/bluesky-scraper/</guid><description>Bluesky-Beiträge, -Profile, -Feeds und -Interaktionen scrapen.</description></item><item><title>ClinicalTrials.gov Scraper — Studien, Eignungskriterien &amp; Ergebnisse</title><link>https://proooxy.com/de/tools/clinical-trials-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/clinical-trials-scraper/</guid><description>ClinicalTrials.gov-Studien, Eignungskriterien und Ergebnisse durchsuchen.</description></item><item><title>CourtListener Scraper — Gerichtsentscheidungen, Dockets &amp; Volltext</title><link>https://proooxy.com/de/tools/courtlistener-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/courtlistener-scraper/</guid><description>US-Rechtsprechung, Dockets und vollständige Urteilstexte für Rechts-KI.</description></item><item><title>SEC EDGAR Scraper — Filings, Volltext &amp; XBRL-Finanzdaten</title><link>https://proooxy.com/de/tools/sec-edgar-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/sec-edgar-scraper/</guid><description>SEC-Filings, 10-K/10-Q-Text und XBRL-Finanzdaten — RAG-fertig.</description></item><item><title>USAspending.gov Scraper — Bundesvergaben, Empfänger &amp; Aggregate</title><link>https://proooxy.com/de/tools/usaspending-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/usaspending-scraper/</guid><description>Bundesvergaben, Empfänger und Ausgaben-Aggregate von USAspending.gov.</description></item><item><title>YouTube-Untertitel- &amp; Transkript-Scraper — JSON, SRT, VTT, LLM</title><link>https://proooxy.com/de/tools/youtube-transcript-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/youtube-transcript-scraper/</guid><description>YouTube-Transkripte als JSON, SRT, VTT oder LLM-fertiger Text.</description></item><item><title>Sephora Scraper (Weltweit)</title><link>https://proooxy.com/de/tools/sephora-scraper/</link><pubDate>Sat, 18 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/sephora-scraper/</guid><description>Jede Sephora-Storefront scrapen — 21 Märkte, ein Actor.</description></item><item><title>Boohoo Scraper — Produktdaten aus 7 Regionen</title><link>https://proooxy.com/de/tools/boohoo-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/boohoo-scraper/</guid><description>Boohoo-Produktdaten aus 7 regionalen Shops scrapen.</description></item><item><title>Farfetch Scraper — Luxusmode-Produktdaten</title><link>https://proooxy.com/de/tools/farfetch-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/farfetch-scraper/</guid><description>Luxusmode-Produkte von Farfetch scrapen, mit Multi-Währungs-Unterstützung.</description></item><item><title>Global API Load Tester — 10K+ RPS Stresstest</title><link>https://proooxy.com/de/tools/load-tester/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/load-tester/</guid><description>10K+ RPS simulieren mit geoverteiltem Lasttest.</description></item><item><title>Lululemon Scraper — Produkte, Varianten &amp; Preise</title><link>https://proooxy.com/de/tools/lululemon-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/lululemon-scraper/</guid><description>Produktdaten mit Varianten und Medien von Lululemon extrahieren.</description></item><item><title>Schema Markup Scraper &amp; SEO-Auditor</title><link>https://proooxy.com/de/tools/schema-markup-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/schema-markup-scraper/</guid><description>Strukturierte Daten extrahieren und SEO für jede Website auditieren.</description></item><item><title>Sephora EU Scraper — 9 europäische Märkte</title><link>https://proooxy.com/de/tools/sephora-eu-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/sephora-eu-scraper/</guid><description>Produktdaten von Sephora aus 9 europäischen Märkten extrahieren.</description></item><item><title>Shopify Scraper — Produktdaten aus jedem Shop</title><link>https://proooxy.com/de/tools/shopify-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/shopify-scraper/</guid><description>Produktdaten aus jedem Shopify-Shop extrahieren.</description></item><item><title>Ulta Beauty Scraper — Produkte, Preise &amp; SKUs</title><link>https://proooxy.com/de/tools/ulta-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/ulta-scraper/</guid><description>Vollständige Produktdaten von Ulta Beauty scrapen.</description></item><item><title>Universal Web Printer — URL &amp; HTML zu PDF, Bild</title><link>https://proooxy.com/de/tools/web-printer/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/tools/web-printer/</guid><description>URLs und HTML in PDF, PNG, JPEG oder WebP umwandeln.</description></item><item><title>Web-Scraping Best Practices 2026: Ein Leitfaden aus der Praxis</title><link>https://proooxy.com/de/blog/web-scraping-best-practices-2026/</link><pubDate>Wed, 01 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/blog/web-scraping-best-practices-2026/</guid><description>&lt;p&gt;Nach dem Aufbau und Betrieb von 15 produktionsreifen Scrapern, die über 3.100 Nutzer mit &amp;gt;99% Erfolgsquote bedienen, hier die Praktiken, die wirklich zählen.&lt;/p&gt;
&lt;h2 id="architektur-in-pipelines-denken-nicht-in-skripten"&gt;Architektur: In Pipelines denken, nicht in Skripten&lt;/h2&gt;
&lt;p&gt;Der größte Fehler, den ich immer wieder sehe: Scraping als Ein-Schritt-Prozess zu behandeln. Produktionsreife Scraper sind Datenpipelines:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;URL-Erkennung&lt;/strong&gt; — finden, was gescraped werden soll (Sitemaps, Kategorieseiten, Suche, APIs)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Request-Ausführung&lt;/strong&gt; — Daten abrufen, mit sauberem Retry und Rotation&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Parsing&lt;/strong&gt; — strukturierte Felder aus Rohantworten extrahieren&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Normalisierung&lt;/strong&gt; — Output bereinigen, validieren und standardisieren&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Speicherung&lt;/strong&gt; — in Datasets, Datenbanken oder nachgelagerte Systeme schreiben&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Jeder Schritt sollte unabhängig testbar und wiederholbar sein. Wenn Sephora das Layout der Produktseite ändert, muss nur Schritt 3 angepasst werden — der Rest der Pipeline bleibt stabil.&lt;/p&gt;</description></item><item><title>Anti-Bot-Schutz verstehen: Was 2026 funktioniert</title><link>https://proooxy.com/de/blog/bypassing-anti-bot-protection-guide/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/blog/bypassing-anti-bot-protection-guide/</guid><description>&lt;p&gt;Anti-Bot-Schutz ist ein Wettrüsten. Als jemand, der täglich produktionsreife Scraper baut, die diese Systeme umgehen, hier ein Praktiker-Blick auf die Landschaft — was die Schutzmechanismen tatsächlich prüfen und wie legitime Bypass-Techniken aussehen.&lt;/p&gt;
&lt;h2 id="die-erkennungsebenen"&gt;Die Erkennungsebenen&lt;/h2&gt;
&lt;p&gt;Moderne Anti-Bot-Systeme arbeiten in Schichten. Diese Schichten zu verstehen, ist der Schlüssel zu zuverlässigem Bypass:&lt;/p&gt;
&lt;h3 id="layer-1-ip-reputation"&gt;Layer 1: IP-Reputation&lt;/h3&gt;
&lt;p&gt;Die einfachste Prüfung. Anti-Bot-Dienste pflegen Datenbanken bekannter Rechenzentrums-IP-Bereiche, VPN-Exits und bereits markierter IPs.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Was geprüft wird:&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Stammt diese IP von AWS, GCP, Azure oder einem bekannten Hosting-Anbieter?&lt;/li&gt;
&lt;li&gt;Wurde diese IP schon einmal wegen Bot-Aktivität markiert?&lt;/li&gt;
&lt;li&gt;Wie viele Anfragen kamen zuletzt von dieser IP?&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;Gegenstrategie:&lt;/strong&gt; Residential Proxys von Diensten wie Apify Proxy oder Bright Data liefern IP-Adressen, die echten ISPs gehören — auf IP-Ebene nicht von normalen Nutzern zu unterscheiden.&lt;/p&gt;</description></item><item><title>Kontakt</title><link>https://proooxy.com/de/contact/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/contact/</guid><description>&lt;h2 id="daten-die-nicht-im-katalog-stehen"&gt;Daten, die nicht im Katalog stehen&lt;/h2&gt;
&lt;p&gt;Ich baue maßgeschneiderte Web-Scraper und RAG-Datenpipelines — für KI-Teams, Datenplattformen und alle, die das offene Web als sauberes, strukturiertes JSON brauchen. Ob einmalige Datenlieferung oder fortlaufend aktualisierter Feed — ich helfe weiter.&lt;/p&gt;
&lt;h3 id="was-ich-baue"&gt;Was ich baue&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Individuelle Scraper&lt;/strong&gt; — maßgeschneidert für die jeweiligen Zielseiten, mit eingebautem Anti-Bot-Bypass&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;RAG-Datenpipelines&lt;/strong&gt; — Extraktion, Normalisierung, Chunking und Auslieferung von retrieval-fertigem JSON in die eigene Vektordatenbank oder das eigene Warehouse&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Reverse Engineering privater APIs&lt;/strong&gt; — die Umwandlung undokumentierter Mobile-/Web-Endpunkte in stabile, strukturierte Quellen&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Scraper-Wartung&lt;/strong&gt; — bestehende Extraktoren am Laufen halten, wenn sich Zielseiten ändern&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Technische Beratung&lt;/strong&gt; — Architektur-Review für den bestehenden Scraping- und Daten-Ingestion-Stack&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="ablauf"&gt;Ablauf&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Daten beschreiben&lt;/strong&gt; — Quelle, benötigte Felder und Lieferformat&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Kostenlose Machbarkeitsprüfung&lt;/strong&gt; — ich analysiere Komplexität und Anti-Bot-Schutz der Zielseite kostenlos&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Angebot &amp;amp; Zeitplan&lt;/strong&gt; — klarer Scope, Festpreis, Liefertermin&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Umsetzung &amp;amp; Auslieferung&lt;/strong&gt; — produktionsreifer Extraktor mit Dokumentation und sauberem Output&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="projekt-starten"&gt;Projekt starten&lt;/h3&gt;
&lt;form action="https://api.web3forms.com/submit" method="POST" class="form contact-form"&gt;
 &lt;input type="hidden" name="access_key" value="9ed3e6ad-95b9-46d5-b3f7-3ffd428d9c3a"&gt;
 &lt;div class="field"&gt;
 &lt;label for="name"&gt;Name&lt;/label&gt;
 &lt;input type="text" name="name" id="name" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="email"&gt;E-Mail&lt;/label&gt;
 &lt;input type="email" name="email" id="email" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="project"&gt;Projekttyp&lt;/label&gt;
 &lt;select name="project" id="project"&gt;
 &lt;option value="custom-scraper"&gt;Individueller Scraper&lt;/option&gt;
 &lt;option value="rag-pipeline"&gt;RAG-Datenpipeline&lt;/option&gt;
 &lt;option value="api-reverse-engineering"&gt;Reverse Engineering privater APIs&lt;/option&gt;
 &lt;option value="consulting"&gt;Technische Beratung&lt;/option&gt;
 &lt;option value="other"&gt;Sonstiges&lt;/option&gt;
 &lt;/select&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="message"&gt;Was wird benötigt?&lt;/label&gt;
 &lt;textarea name="message" id="message" rows="5" required&gt;&lt;/textarea&gt;
 &lt;/div&gt;
 &lt;button type="submit" class="btn btn--primary btn--lg"&gt;Nachricht senden&lt;/button&gt;
&lt;/form&gt;
&lt;h3 id="oder-direkter-kontakt"&gt;Oder direkter Kontakt&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;E-Mail&lt;/strong&gt;: &lt;a href="mailto:p8p9cmk96@mozmail.com"&gt;p8p9cmk96@mozmail.com&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GitHub&lt;/strong&gt;: &lt;a href="https://github.com/autofacts"&gt;@autofacts&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Apify&lt;/strong&gt;: &lt;a href="https://apify.com/autofacts"&gt;apify.com/autofacts&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Über mich</title><link>https://proooxy.com/de/about/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/de/about/</guid><description>&lt;h2 id="wer-ich-bin"&gt;Wer ich bin&lt;/h2&gt;
&lt;p&gt;Ich bin Richard Feng, freiberuflicher Web-Automatisierungs-Engineer mit über 12 Jahren Programmiererfahrung. Meine Spezialgebiete sind &lt;strong&gt;Web-Scraping, Datenextraktion und API-Reverse-Engineering&lt;/strong&gt; — die Umwandlung komplexer, geschützter Websites in saubere, strukturierte Daten, die KI-Systeme tatsächlich nutzen können.&lt;/p&gt;
&lt;p&gt;Mein Werkzeugkasten umfasst &lt;strong&gt;Node.js (TypeScript), Python, Go und Java&lt;/strong&gt;, mit tiefgehender Expertise in &lt;strong&gt;Crawlee, Playwright und Cheerio&lt;/strong&gt;. Ich habe produktionsreife Systeme gebaut, die Millionen von Anfragen bei &lt;strong&gt;&amp;gt;99% Erfolgsquote&lt;/strong&gt; verarbeiten.&lt;/p&gt;
&lt;h2 id="was-ich-mache"&gt;Was ich mache&lt;/h2&gt;
&lt;p&gt;Ich entwickle und betreue &lt;strong&gt;16 produktionsreife Apify-Actors&lt;/strong&gt;, die über &lt;strong&gt;3.100 Nutzer&lt;/strong&gt; bei konstant &lt;strong&gt;&amp;gt;99% Run-Erfolgsquote&lt;/strong&gt; bedienen. Jeder Actor liefert sauberes, &lt;strong&gt;RAG-fertiges JSON&lt;/strong&gt; — schemakonsistent, dedupliziert und bereit für den Einsatz in einer Vektordatenbank, Retrieval-Pipeline oder als Trainingsdatensatz. Die meisten Actors für öffentliche Daten benötigen keinen API-Key. Meine Arbeit erstreckt sich über vier Bereiche:&lt;/p&gt;</description></item></channel></rss>