# Proooxy — RAG-fertige Webdaten für KI-Agenten & LLMs — Vollständiger Inhalt (llms-full.txt) > Strukturierte, RAG-fertige Webdaten für KI-Agenten, Retrieval-Pipelines und LLMs. Richard Feng entwickelt produktionsreife Apify-Actors für E-Commerce, SEC/EDGAR-Filings, US-Bundesausgaben, Gerichtsentscheidungen, klinische Studien sowie Social- und Videodaten — Anti-Bot-Bypass, sauberes, schemakonsistentes JSON, keine API-Keys für öffentliche Daten. Diese Datei ist eine Aneinanderreihung aller öffentlichen Seiten von https://proooxy.com/de/ in einem einzigen Dokument, gedacht für die direkte Verarbeitung durch LLMs und KI-Agenten. Jeder Seite geht ein Fact-Block mit strukturierten Frontmatter-Daten voraus (URL, Typ, Kategorie, Technologie, Regionen, Datumsangaben), gefolgt vom vollständigen Markdown-Inhalt. Automatisch generiert von der Live-Website. --- ## Website-Metadaten - **Website:** Proooxy — RAG-fertige Webdaten für KI-Agenten & LLMs - **URL:** https://proooxy.com/de/ - **Beschreibung:** Strukturierte, RAG-fertige Webdaten für KI-Agenten, Retrieval-Pipelines und LLMs. Richard Feng entwickelt produktionsreife Apify-Actors für E-Commerce, SEC/EDGAR-Filings, US-Bundesausgaben, Gerichtsentscheidungen, klinische Studien sowie Social- und Videodaten — Anti-Bot-Bypass, sauberes, schemakonsistentes JSON, keine API-Keys für öffentliche Daten. - **Autor:** Richard Feng - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **Tools:** 17 produktionsreife Actors - **Beiträge:** 2 - **Zuletzt generiert:** 2026-08-04 --- ## Tool-Katalog-Index - [Macy's Scraper — Produkte, Preise, SKUs & News](https://proooxy.com/de/tools/macys-scraper/) — Macy's-Produkte, Preise, SKUs/UPCs & News — Akamai-sicher, ohne Browser. - [Bluesky Scraper — Beiträge, Profile, Feeds & Interaktionen](https://proooxy.com/de/tools/bluesky-scraper/) — Bluesky-Beiträge, -Profile, -Feeds und -Interaktionen scrapen. - [ClinicalTrials.gov Scraper — Studien, Eignungskriterien & Ergebnisse](https://proooxy.com/de/tools/clinical-trials-scraper/) — ClinicalTrials.gov-Studien, Eignungskriterien und Ergebnisse durchsuchen. - [CourtListener Scraper — Gerichtsentscheidungen, Dockets & Volltext](https://proooxy.com/de/tools/courtlistener-scraper/) — US-Rechtsprechung, Dockets und vollständige Urteilstexte für Rechts-KI. - [SEC EDGAR Scraper — Filings, Volltext & XBRL-Finanzdaten](https://proooxy.com/de/tools/sec-edgar-scraper/) — SEC-Filings, 10-K/10-Q-Text und XBRL-Finanzdaten — RAG-fertig. - [USAspending.gov Scraper — Bundesvergaben, Empfänger & Aggregate](https://proooxy.com/de/tools/usaspending-scraper/) — Bundesvergaben, Empfänger und Ausgaben-Aggregate von USAspending.gov. - [YouTube-Untertitel- & Transkript-Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/de/tools/youtube-transcript-scraper/) — YouTube-Transkripte als JSON, SRT, VTT oder LLM-fertiger Text. - [Sephora Scraper (Weltweit)](https://proooxy.com/de/tools/sephora-scraper/) — Jede Sephora-Storefront scrapen — 21 Märkte, ein Actor. - [Boohoo Scraper — Produktdaten aus 7 Regionen](https://proooxy.com/de/tools/boohoo-scraper/) — Boohoo-Produktdaten aus 7 regionalen Shops scrapen. - [Farfetch Scraper — Luxusmode-Produktdaten](https://proooxy.com/de/tools/farfetch-scraper/) — Luxusmode-Produkte von Farfetch scrapen, mit Multi-Währungs-Unterstützung. - [Global API Load Tester — 10K+ RPS Stresstest](https://proooxy.com/de/tools/load-tester/) — 10K+ RPS simulieren mit geoverteiltem Lasttest. - [Lululemon Scraper — Produkte, Varianten & Preise](https://proooxy.com/de/tools/lululemon-scraper/) — Produktdaten mit Varianten und Medien von Lululemon extrahieren. - [Schema Markup Scraper & SEO-Auditor](https://proooxy.com/de/tools/schema-markup-scraper/) — Strukturierte Daten extrahieren und SEO für jede Website auditieren. - [Sephora EU Scraper — 9 europäische Märkte](https://proooxy.com/de/tools/sephora-eu-scraper/) — Produktdaten von Sephora aus 9 europäischen Märkten extrahieren. - [Shopify Scraper — Produktdaten aus jedem Shop](https://proooxy.com/de/tools/shopify-scraper/) — Produktdaten aus jedem Shopify-Shop extrahieren. - [Ulta Beauty Scraper — Produkte, Preise & SKUs](https://proooxy.com/de/tools/ulta-scraper/) — Vollständige Produktdaten von Ulta Beauty scrapen. - [Universal Web Printer — URL & HTML zu PDF, Bild](https://proooxy.com/de/tools/web-printer/) — URLs und HTML in PDF, PNG, JPEG oder WebP umwandeln. --- # Macy's Scraper — Produkte, Preise, SKUs & News - **URL:** https://proooxy.com/de/tools/macys-scraper/ - **Typ:** tools - **Beschreibung:** Macy's-Produktdaten extrahieren — Preise, Varianten, SKU-/UPC-Barcodes, Bilder, Bewertungen & Rezensionen — plus Macy's-Inc.-News, aus Such-, Kategorie-, Trending- und Produkt-URLs. Ohne Browser, Akamai-sicher. - **Zusammenfassung:** Macy's-Produkte, Preise, SKUs/UPCs & News — Akamai-sicher, ohne Browser. - **Kategorie:** ecommerce - **Tech-Stack:** TypeScript, Crawlee, Cheerio - **Märkte / Regionen:** USA - **Apify-Eintrag:** https://apify.com/autofacts/macy-s-scraper - **Keywords:** macys scraper deutsch, macy's produktdaten, macys preisüberwachung, kaufhaus scraper, macys sku upc daten, macys rezensionen scraper, einzelhandel produktdaten - **Veröffentlicht:** 2026-07-15 - **Geändert:** 2026-07-15 **Hauptfunktionen:** - Vier Datenquellen in einem Actor — Produktsuche, Kategorie, Trending und Macy's-Inc.-News - Umgeht Akamai Bot Manager ohne Browser, durch Nutzung von Macy's eigenen Mobile- & Website-JSON-APIs - UPC-Barcodes pro SKU mit Farbe, Größe, Verfügbarkeit und Preis für jede kaufbare Variante - Preise als Integer-Cent plus lokalisierte, formatierte Strings — keine Floating-Point-Rundungsfehler - Vollständige Rezensions-Intelligence — Sterne-Histogramm, Weiterempfehlungs-Zahlen und sekundäre Passform-/Größen-Bewertungen - Alle Farbtöne und Größen unter einem Produktdatensatz gruppiert, nicht eine Zeile pro Variante - Ausschließlich saubere kanonische URLs — interne API-Endpunkte und Client-Keys tauchen nie im Output auf - Ein normalisiertes Schema über Search-, Category-, Trending- und Produktdetail-Ergebnisse hinweg **Anwendungsfälle:** - Kaufhaus-Preis- und Promotion-Monitoring auf SKU-Ebene - Wettbewerbsanalyse — Macy's vs. Nordstrom, Ulta oder Marken-DTC-Preise - Katalogabgleich zwischen Händlern über UPC-Barcodes je Variante - Rezensions- und Bewertungs-Intelligence für bei Macy's verkaufte Marken - Retail-News-Monitoring — Pressemitteilungen und Quartalszahlen von Macy's Inc. **Eingabeparameter:** - `scrapeType` (string, erforderlich) — Zu scrapende Quelle: search, category, trending, news oder all (Standard: search). - `query` (string, optional) — Keyword für die Produktsuche, z. B. women shoes. - `startUrls` (array, optional) — Macy's-Produkt-/Kategorie-URLs oder Macy's-Inc.-News-URLs. - `categoryIds` (array, optional) — Macy's-Kategorie-IDs (z. B. 5449). Kategorie-URLs werden bevorzugt, wenn bekannt. - `trendingUrls` (array, optional) — Trending-, Bestseller- oder kuratierte Listing-URLs. - `newsUrls` (array, optional) — Macy's-Inc.-News-Listing- oder Artikel-URLs. - `includeProductDetails` (boolean, optional) — Listing-Einträge um vollständige Produktdetails anreichern — Varianten, SKUs, Galerien (Standard: true). - `maxPages` (number, optional) — Maximale Paginierungstiefe pro Listing-/News-Quelle. - `maxResults` (number, optional) — Obergrenze für Output-Datensätze. 0 = keine Obergrenze. - `proxy` (object, erforderlich) — Apify Proxy oder eigene Proxy-URLs. Residential, Land USA empfohlen. **FAQ:** **Q: Wie kommt es ohne Browser an Akamai vorbei?** Es tritt gar nicht erst gegen die JS-Challenge an. Listings stammen aus Macy's Mobile-App-API, Produktdetails aus der JSON-API der Website — beide laufen auf separater Infrastruktur, die anonyme Leseanfragen beantwortet. Kein Login, keine Cookies, kein API-Key. **Q: Sind die Preise in Dollar oder Cent angegeben?** In Integer-Cent (5999 = $59.99), um Floating-Point-Rundungsfehler zu vermeiden, zusätzlich mit lokalisierten, formatierten Strings ($59.99). **Q: Wie werden Varianten und UPCs gehandhabt?** Alle Farben und Größen werden unter einem einzigen Produktdatensatz mit einem variants[]-Array gruppiert. Jede Variante trägt ihren eigenen UPC-Barcode, Farbe, Größe, Verfügbarkeit und Preis — gewonnen aus Macy's SKU-Beziehungsdaten, nicht von einem Swatch-Widget gescraped. **Q: Kann ich Produkte und News in einem Run zusammen scrapen?** Ja. scrapeType auf all setzen und eine beliebige Kombination aus query, startUrls, categoryIds, trendingUrls und newsUrls angeben. ## Beispiel-Output ```json { "type": "product", "source": { "id": "12345678", "canonicalUrl": "https://www.macys.com/shop/product/calvin-klein-womens-sheath-dress?ID=12345678", "retailer": "macys", "currency": "USD" }, "title": "Women's Sleeveless Sheath Dress", "brand": "Calvin Klein", "categories": ["Women", "Dresses", "Work Dresses"], "price": { "sale": 5999, "list": 9800, "currentFormatted": "$59.99", "stockStatus": "InStock" }, "stats": { "rating": 4.6, "reviewCount": 9, "ratingPercentage": 92 }, "options": [ { "type": "Color", "values": [{ "id": "1", "name": "Black" }] }, { "type": "Size", "values": [{ "id": "10", "name": "M" }, { "id": "12", "name": "L" }] } ], "variants": [ { "id": "987654", "sku": "192837465012", "options": ["Black", "M"], "price": { "stockStatus": "InStock" }, "extraInfo": { "upc": "192837465012" } } ], "medias": [{ "type": "Image", "url": "https://slimages.macysassets.com/is/image/MCY/products/.../main.jpg" }] } ``` ## Preise Pay-per-Event — abgerechnet wird nur für tatsächlich gespeicherte Items: | Event | Preis | Was abgedeckt ist | |---|---|---| | Produkt gescraped | $0.006 | Ein Produkt mit vollständigem Detail — Varianten, SKUs/UPCs, Preise, Bilder, Bewertungen | | Artikel gescraped | $0.002 | Ein Macy's-Inc.-News-Artikel — Titel, Autor, Datum, Text, Bilder | Mengenrabatte gelten automatisch bei höheren Apify-Plänen (bis zu $0.0045 pro Produkt). Ein Crawl von 1.000 Produkten kostet zum Listenpreis ~$6.00. ## Tipps - **Residential US-Proxys verwenden.** Der Produktdetail-Endpunkt ist zeitweise rate-limitiert; Residential-Session-Rotation kommt sauber durch, während Rechenzentrums-IPs mehr 403er sehen. - **Concurrency moderat halten.** `maxConcurrency` von 2–3 ist der Sweet Spot — höhere Werte erhöhen Rate-Limit-Treffer, ohne den Durchsatz zu verbessern. - **Kategorie-URLs gegenüber reinen IDs bevorzugen.** Die URL enthält den Kategoriepfad, den die API erwartet; eine reine ID kann zu einem breiteren oder leeren Ergebnis führen. - **`includeProductDetails` deaktivieren** für einen schnellen Durchlauf auf Listing-Ebene (Name, Marke, Listenpreis, Bild, Bewertung), wenn Varianten oder Beschreibungen nicht gebraucht werden. --- # Bluesky Scraper — Beiträge, Profile, Feeds & Interaktionen - **URL:** https://proooxy.com/de/tools/bluesky-scraper/ - **Typ:** tools - **Beschreibung:** Bluesky-Beiträge, -Profile, -Follower, -Feeds, -Threads, -Liker und -Reposter über das AT Protocol extrahieren — plus authentifizierte Suche und Hashtag-Ergebnisse mit einem App-Passwort. Sauberes, normalisiertes JSON. - **Zusammenfassung:** Bluesky-Beiträge, -Profile, -Feeds und -Interaktionen scrapen. - **Kategorie:** social - **Tech-Stack:** TypeScript, AT Protocol - **Märkte / Regionen:** Weltweit - **Apify-Eintrag:** https://apify.com/autofacts/bluesky-scraper - **Keywords:** bluesky scraper deutsch, bluesky api daten, bluesky beiträge exportieren, at protocol daten extrahieren, bluesky profildaten, bluesky hashtag suche, social media daten scraping - **Veröffentlicht:** 2026-07-01 - **Geändert:** 2026-07-01 **Hauptfunktionen:** - Elf Modi — search, profile, posts, followers, following, feed, thread, likers, reposters, actorLikes und hashtag - Public API ohne Zugangsdaten für Profile, Beiträge, Follower, Following, Feeds, Threads, Liker und Reposter - Authentifizierte App-Passwort-Modi — search, hashtag und die eigenen Account-Likes - Post-Engagement-Export — vollständige Liker- und Reposter-Listen pro Beitrag - Thread-Flattening — durchläuft einen Antwortbaum bis zu einer konfigurierbaren Tiefe - Automatische Cursor-Paginierung auf jedem Listen-Endpunkt bis zur eigenen Item-Obergrenze - Normalisierte JSON-Struktur für Beiträge und Profile über alle Modi hinweg - Robustes HTTP — Request-Throttling, Exponential Backoff und Retry bei 429/5xx **Anwendungsfälle:** - Marken- und Keyword-Monitoring über authentifizierte Suche - Hashtag- und Trend-Tracking im gesamten Netzwerk - Follower- und Following-Listen einzelner Creator oder Marken - Engagement-Analyse — genau nachvollziehen, wer einen bestimmten Beitrag geliked oder repostet hat - Dataset-Aufbau für BI, Analytics oder RAG-Pipelines aus sauberem, normalisiertem JSON - Archivierung von Konversationen und Threads unter einem Beitrag **Eingabeparameter:** - `mode` (string, optional) — Was gescraped werden soll: posts, profile, followers, following, feed, thread, likers, reposters, actorLikes, search oder hashtag (Standard: posts). - `handles` (array, optional) — Bluesky-Handles für die Modi profile/posts/followers/following/actorLikes, z. B. bsky.app. - `query` (string, optional) — Suchtext (Modus search) oder Hashtag (Modus hashtag — automatisch mit # versehen). - `postUri` (string, optional) — AT-URI eines Beitrags — verwendet von den Modi thread, likers und reposters. - `feedUri` (string, optional) — AT-URI eines benutzerdefinierten Feeds — verwendet vom Modus feed. - `identifier` (string, optional) — Bluesky-Login-Handle/E-Mail für authentifizierte Modi (search, hashtag, actorLikes). - `appPassword` (string, optional) — Bluesky-App-Passwort (nicht das Hauptpasswort des Accounts) für authentifizierte Modi. - `maxItems` (number, optional) — Maximal gespeicherte Beiträge/Profile; jedes ist ein abgerechnetes Event (Standard: 100). **FAQ:** **Q: Brauche ich Bluesky-Zugangsdaten?** Nur für die Modi search, hashtag und actorLikes — ein App-Passwort in den Bluesky-Einstellungen erzeugen und als appPassword übergeben. Die Modi profile, posts, followers, following, feed, thread, likers und reposters funktionieren alle ohne Zugangsdaten über die öffentliche AT-Protocol-API. **Q: Kann ich die Likes eines beliebigen Accounts exportieren?** Nein. Blueskys API stellt actorLikes nur für den authentifizierten Account selbst bereit — Handle und Login-Identifier müssen also denselben Account referenzieren. **Q: Wie finde ich die URI eines Beitrags oder Feeds?** AT-URIs sehen so aus: at://did:plc:.../app.bsky.feed.post/... — sie lassen sich aus Blueskys API-Output oder Entwickler-Tools kopieren. Feed-URIs nutzen die app.bsky.feed.generator-Collection. **Q: Ist es sicher, mein App-Passwort zu verwenden?** Ja — ein Bluesky-App-Passwort verwenden (erstellt unter Settings → App Passwords), niemals das Hauptpasswort. Es ist eingeschränkt (scoped), widerrufbar und wird als geheimer Input übergeben. ## Beispiel-Output ```json { "itemType": "post", "mode": "posts", "uri": "at://did:plc:.../app.bsky.feed.post/...", "author": { "did": "did:plc:...", "handle": "bsky.app", "displayName": "Bluesky", "followersCount": 1234567 }, "text": "Example post text", "createdAt": "2026-06-11T00:00:00Z", "replyCount": 10, "repostCount": 20, "likeCount": 100, "langs": ["en"], "url": "https://bsky.app/profile/bsky.app/post/..." } ``` ## Preise Pay-per-Event: **$0.001 pro gespeichertem Item** (Beitrag oder Profil). Ein Export von 1.000 Items kostet ~$1.00, `maxItems` begrenzt sowohl Menge als auch Kosten. ## Tipps - **Mit den öffentlichen Modi starten.** Profile, Beiträge, Follower und Engagement (likers/reposters) brauchen kein Login — App-Passwort-Auth für search- und hashtag-Runs aufheben. - **Nicht nur Beiträge exportieren, auch Engagement.** Die Modi likers und reposters zeigen genau, wer einen Beitrag verstärkt hat — ein Signal, das die meisten Bluesky-Scraper auslassen. - **`maxItems` begrenzen** bei Follower-/Following-Abzügen großer Accounts, damit Runs schnell und Kosten planbar bleiben. --- # ClinicalTrials.gov Scraper — Studien, Eignungskriterien & Ergebnisse - **URL:** https://proooxy.com/de/tools/clinical-trials-scraper/ - **Typ:** tools - **Beschreibung:** Die offizielle ClinicalTrials.gov-v2-API durchsuchen nach Erkrankung, Intervention, Sponsor, Standort, Status oder NCT-ID. Normalisierte Studiendatensätze mit Eignungskriterien, Ergebnis-Metadaten und inkrementellen Updates exportieren — kein API-Key nötig. - **Zusammenfassung:** ClinicalTrials.gov-Studien, Eignungskriterien und Ergebnisse durchsuchen. - **Kategorie:** public-data - **Tech-Stack:** TypeScript, REST API - **Märkte / Regionen:** Weltweit - **Apify-Eintrag:** https://apify.com/autofacts/clinical-trials-scraper - **Keywords:** clinicaltrials.gov api deutsch, klinische studien daten, klinische studien datensatz, rekrutierende studien daten, studien eignungskriterien daten, pharma pipeline monitoring, klinische studien für rag - **Veröffentlicht:** 2026-07-01 - **Geändert:** 2026-07-01 **Hauptfunktionen:** - Offizielle ClinicalTrials.gov-v2-API — kein API-Key erforderlich - Mehrfeld-Suche — Erkrankung, Intervention, Sponsor, Standort und Freitextsuche - Filter nach Rekrutierungsstatus (9 Werte, ODER-verknüpft) und Phase (Early Phase 1 → Phase 4) - Direkte NCT-ID-Abfrage für eine oder mehrere bestimmte Studien - Inkrementelles Monitoring über updatedSince — liefert nur Studien, die an oder nach einem Datum geändert wurden - Summary- oder Full-Output — full ergänzt rohe Protocol-, Derived- und Results-Abschnitte - RAG-fertiges Absatz-Chunking aus Titeln, Zusammenfassungen, Eignungskriterien und Endpunkten - Ergebnis-Signale — hasResults plus Flags für Participant-Flow, Outcome-Measures und Adverse-Events - Abgeleitete MeSH-Begriffe sowie normalisierte Sponsor-, Kollaborator- und Standortdaten **Anwendungsfälle:** - Pharma-/Biotech-Pipeline-Monitoring nach Sponsor oder Erkrankung - CRO- und Standort-Machbarkeitsrecherche — rekrutierende Studien nach Standort, Phase und Erkrankung - Wettbewerbsanalyse zu neu veröffentlichten oder aktualisierten Studien - Patientenrekrutierungs-Recherche über aktiv rekrutierende Studien - Systematische Reviews — Eignungskriterien, Endpunkte und Ergebnis-Metadaten im großen Maßstab - Medizinische KI-/RAG-Wissensdatenbanken aus gechunktem Studientext **Eingabeparameter:** - `condition` (string, optional) — Zu suchende Erkrankung, z. B. Diabetes. - `status` (array, optional) — Rekrutierungsstatus-Filter, ODER-verknüpft, z. B. RECRUITING, COMPLETED. - `phase` (array, optional) — Studienphasen — Not Applicable, Early Phase 1, Phase 1–4. - `nctIds` (array, optional) — Bestimmte Studien anhand der ClinicalTrials.gov-NCT-ID abrufen. - `updatedSince` (string, optional) — YYYY-MM-DD — liefert Studien mit LastUpdatePostDate an oder nach diesem Datum. - `outputFields` (string, optional) — summary (Standard, normalisiert) oder full (ergänzt rohe Protocol-/Derived-/Results-Abschnitte). - `chunking` (string, optional) — RAG-Text-Chunking: paragraph (Standard) oder none. - `maxItems` (number, optional) — Maximal gespeicherte Studien; jede ist ein abgerechnetes Event (Standard: 10). **FAQ:** **Q: Brauche ich einen API-Key?** Nein. Die v2-API von ClinicalTrials.gov ist vollständig öffentlich — der Actor sendet nur einen beschreibenden User-Agent, ganz ohne Authentifizierung. **Q: Kann ich die rohen Studiendaten bekommen, nicht nur normalisierte Felder?** Ja. outputFields auf „full” setzen, um protocolSection, derivedSection und resultsSection im Rohformat zusätzlich zu den normalisierten Summary-Feldern zu erhalten. **Q: Wie überwache ich kürzlich geänderte Studien?** updatedSince auf ein Datum im Format YYYY-MM-DD setzen. Der Actor filtert nach ClinicalTrials.govs LastUpdatePostDate und liefert nur Studien, die an oder nach diesem Tag aktualisiert wurden — ideal für tägliches Pipeline-Monitoring. **Q: Ist die Abdeckung global oder nur USA?** Global. ClinicalTrials.gov registriert Studien weltweit, und das locations-Array jeder Studie enthält, sofern angegeben, Land, Bundesland/Region, Stadt und Einrichtung. ## Beispiel-Output ```json { "itemType": "study", "nctId": "NCT01884792", "title": "Example Diabetes Study", "officialTitle": "A Study of Example Diabetes Study", "status": "COMPLETED", "phase": ["PHASE2"], "studyType": "INTERVENTIONAL", "conditions": ["Diabetes Mellitus"], "sponsors": { "lead": "Example Sponsor Inc.", "collaborators": [] }, "locations": [ { "facility": "Example Medical Center", "city": "Boston", "state": "MA", "country": "United States", "status": "COMPLETED" } ], "hasResults": true, "resultsSummary": { "hasParticipantFlow": true, "hasOutcomeMeasures": true, "hasAdverseEvents": true }, "lastUpdate": "2026-06-01", "url": "https://clinicaltrials.gov/study/NCT01884792" } ``` ## Preise Pay-per-Event: **$0.002 pro gespeicherter Studie**, unabhängig vom Output-Modus (summary oder full). Ein Export von 1.000 Studien kostet ~$2.00, `maxItems` begrenzt sowohl Menge als auch Kosten. ## Tipps - **`updatedSince` für Änderungs-Monitoring nutzen.** Einen täglichen Run mit dem Datum von gestern planen, um nur neu veröffentlichte oder geänderte Studien zu erfassen — der günstigste Weg, die Pipeline eines Wettbewerbers zu verfolgen. - **`condition` + `status: [RECRUITING]` + `phase` kombinieren**, um eine gezielte Machbarkeitsliste zu erstellen, ohne das gesamte Register abzurufen. - **`outputFields: full` nur setzen**, wenn rohe Abschnitte wirklich gebraucht werden — die normalisierte Summary enthält bereits Eignungskriterien, Sponsoren, Standorte und Ergebnis-Flags. --- # CourtListener Scraper — Gerichtsentscheidungen, Dockets & Volltext - **URL:** https://proooxy.com/de/tools/courtlistener-scraper/ - **Typ:** tools - **Beschreibung:** CourtListener durchsuchen nach US-Gerichtsentscheidungen, RECAP-Dockets, mündlichen Verhandlungen, Richtern und Zitaten — mit vollständigem Urteilstext und RAG-fertigen Chunks. Filterbar nach Gericht, Datum oder Stichwort. - **Zusammenfassung:** US-Rechtsprechung, Dockets und vollständige Urteilstexte für Rechts-KI. - **Kategorie:** public-data - **Tech-Stack:** TypeScript, Cheerio - **Märkte / Regionen:** USA - **Apify-Eintrag:** https://apify.com/autofacts/courtlistener-scraper - **Keywords:** courtlistener api deutsch, us rechtsprechung daten api, gerichtsentscheidungen scraper, recap docket daten, rechtsrecherche daten, us case law datensatz, rechtsprechung für rag - **Veröffentlicht:** 2026-07-01 - **Geändert:** 2026-07-01 **Hauptfunktionen:** - Sechs Suchtypen in einem Actor — Gerichtsentscheidungen, Dockets (RECAP), RECAP-Dokumente, mündliche Verhandlungen, Richter und Zitat-Abfrage - Vollständiger Urteilstext — folgt Suchtreffern in die Datenbank für komplette Entscheidungen, nicht nur 300-Zeichen-Schnipsel - RAG-fertiges Chunking — ~2000-Zeichen-Absatz-Chunks, jeweils mit Reihenfolge-Index - Zitat-Auflösung — bis zu 250 Zitat-Strings (z. B. 576 U.S. 644) zu passenden Fällen auflösen - Boolesche Volltextsuche plus Filter für Gerichts-ID, Einreichungsdatum-Bereich und Sortierreihenfolge - Rate-Limit-bewusstes Timing mit präzisem 429-Backoff über alle Antwortformate von CourtListener hinweg - Cursor-Paginierungs-Streaming bis zur konfigurierten Item-Obergrenze - Eigenes Token mitbringen oder den eingebauten rotierenden Token-Pool nutzen **Anwendungsfälle:** - Rechtsrecherche — Volltext-Rechtsprechung nach Gericht, Zeitraum oder Stichwort abrufen - Litigation Intelligence — Docket-Aktivität eines Gerichts nach Thema und Datum verfolgen - Rechts-KI / RAG — einen gechunkten, embedding-fertigen Rechtsprechungs-Korpus aufbauen - Zitat-Analyse — Zitate aus einem Schriftsatz zu verlinkten Fallakten und Zitierzahlen auflösen - Empirische Rechtsforschung — Richter, Metadaten zu mündlichen Verhandlungen und Trends bei Gerichtsentscheidungen - Rechtsjournalismus — neu eingereichte Entscheidungen oder Dockets bei bestimmten Gerichten überwachen **Eingabeparameter:** - `searchType` (string, optional) — Was abgerufen werden soll: opinions, dockets, recap_docs, oral_arguments, judges oder citation (Standard: opinions). - `query` (string, optional) — Volltext-Query mit booleschen Operatoren — erforderlich, außer bei Nutzung eines Gerichtsfilters oder einer Zitat-Abfrage. - `citations` (array, optional) — Aufzulösende Zitat-Strings (bis zu 250) — erforderlich im Modus citation. - `court` (string, optional) — CourtListener-Gerichts-ID, z. B. scotus, ca9, nyed. - `dateFrom` (string, optional) — Einreichungsdatum ab (YYYY-MM-DD). - `includeFullText` (boolean, optional) — Vollständigen Urteilstext und RAG-Chunks für opinions abrufen (Standard: false). - `apiToken` (string, optional) — Das eigene CourtListener-API-Token; ohne Angabe wird auf den eingebauten rotierenden Pool zurückgegriffen. - `maxItems` (number, optional) — Maximal gespeicherte Items; jedes ist ein abgerechnetes Event (Standard: 5). **FAQ:** **Q: Brauche ich ein CourtListener-API-Token?** Ja, CourtListener verlangt eines. Entweder ein eigenes kostenloses Token über apiToken angeben oder sich auf den eingebauten rotierenden Fallback-Pool des Actors verlassen. Ein eigenes Token erlaubt höheren Durchsatz auf einer bezahlten Mitgliedschaftsstufe. **Q: Ist der vollständige Urteilstext bei jedem Suchtyp verfügbar?** Nein. Volltext plus Chunking (includeFullText) gilt nur für opinions und ist standardmäßig deaktiviert, damit Runs schnell bleiben. Dockets, RECAP-Dokumente, mündliche Verhandlungen, Richter und Zitat-Ergebnisse liefern nur Metadaten. **Q: Welche Gerichte werden abgedeckt?** Alles, was CourtListener indexiert — US-Bundesgerichte (SCOTUS, Courts of Appeals und District Courts über RECAP) sowie viele Gerichte der Bundesstaaten, adressiert über CourtListeners eigene Gerichts-IDs wie scotus, ca9 oder nyed. **Q: Wie schnell kann es laufen?** Der Durchsatz ist durch das Rate-Limit des Tokens begrenzt (CourtListeners kostenlose Stufe erlaubt wenige Anfragen pro Minute) mit automatischem 429-Backoff; ein Mitgliedschafts-Token hebt die Obergrenze an. ## Beispiel-Output ```json { "itemType": "legal", "searchType": "opinions", "id": "10380001", "title": "Climate United Fund v. Citibank, N.A.", "court": "Court of Appeals for the D.C. Circuit", "date": "2025-04-16", "url": "https://www.courtlistener.com/opinion/10380001/...", "citations": [], "citeCount": 0, "docketNumber": "23-5138", "fullText": "...", "chunks": [{ "text": "...", "order": 0 }], "meta": { "courtId": "cadc", "clusterId": 10380001 } } ``` ## Preise Pay-per-Event — abgerechnet wird nur für gespeicherte Items: | Event | Preis | Was abgedeckt ist | |---|---|---| | Gerichtsentscheidung mit Volltext | $0.005 | Eine gespeicherte Entscheidung mit vollständigem Text + RAG-Chunks | | Metadaten-Item | $0.002 | Ein Docket, eine mündliche Verhandlung, ein Richter, ein Zitat oder ein reiner Metadaten-Datensatz | Ein Volltext-Korpus mit 1.000 Entscheidungen kostet ~$5.00; `maxItems` begrenzt sowohl Menge als auch Kosten. ## Tipps - **`includeFullText` nur für Entscheidungen aktivieren, die tatsächlich embedded werden.** Es kostet zusätzliche Anfragen pro Entscheidung und ist standardmäßig deaktiviert — zuerst eng nach Gericht und Datum filtern. - **Den Modus `citation` nutzen, um einen Schriftsatz anzureichern.** Zitat-Strings einfügen und in einem Run verlinkte Fallakten sowie Zitierzahlen zurückbekommen. - **Ein eigenes CourtListener-Token mitbringen** für größere Jobs — das niedrige Rate-Limit der kostenlosen Stufe ist der Haupt-Flaschenhals beim Durchsatz. --- # SEC EDGAR Scraper — Filings, Volltext & XBRL-Finanzdaten - **URL:** https://proooxy.com/de/tools/sec-edgar-scraper/ - **Typ:** tools - **Beschreibung:** SEC-EDGAR-Filing-Metadaten, Volltext-Abschnitte aus 10-K/10-Q, EDGAR-Volltextsuche-Ergebnisse und XBRL-Finanzdaten als sauberes, RAG-fertiges JSON extrahieren. Kein API-Key erforderlich. - **Zusammenfassung:** SEC-Filings, 10-K/10-Q-Text und XBRL-Finanzdaten — RAG-fertig. - **Kategorie:** public-data - **Tech-Stack:** TypeScript, Cheerio - **Märkte / Regionen:** USA - **Apify-Eintrag:** https://apify.com/autofacts/sec-edgar-scraper - **Keywords:** sec edgar api deutsch, sec edgar scraper, 10-k filing daten, 10-q scraper, xbrl finanzdaten, edgar volltextsuche, sec filings für rag, unternehmensfinanzdaten api - **Veröffentlicht:** 2026-07-01 - **Geändert:** 2026-07-01 **Hauptfunktionen:** - Vier Modi in einem Actor — Filing-Metadaten, vollständiger Dokumenttext, EDGAR-Volltextsuche und XBRL-Finanzdaten - RAG-fertiges Chunking — section, paragraph (~2000 Zeichen) oder none; jeder Chunk ist mit Quell-Item und Reihenfolge getaggt - Automatisches Parsing der „Item N”-Abschnitte für 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A und mehr) - XBRL-Facts mit Taxonomie, Tag, Label, Einheit, Wert, Geschäftsjahr/-periode, Formular und Accession Number - Fact-Deduplizierung reduziert XBRL-Neufassungen auf eine Zeile pro Periode und behält die früheste Offenlegung - Unternehmens-Auflösung per Ticker, CIK oder Name gegen die offizielle Ticker-Datei der SEC, mit Fuzzy-Fallback - EDGAR-Volltextsuche mit zitierten Phrasen, Formulartyp- und Datumsbereich-Filtern (2001 → heute) - SEC-konformes Rate-Limiting und User-Agent — kein API-Key und kein Login erforderlich **Anwendungsfälle:** - Finanz-RAG-/LLM-Pipelines, die abschnittsweise gechunkten, embedding-fertigen 10-K- und 10-Q-Text brauchen - Investment-Research — Umsatz-, Nettogewinn- und Diluted-EPS-Zeitreihen als saubere XBRL-Zeilen abrufen - Compliance- & Beteiligungs-Monitoring — Form 4, SC 13D/13G und Risk-Factor-Formulierungen über Unternehmen hinweg - Fintech-Produkte, die strukturierte EDGAR-Daten brauchen, ohne einen eigenen Crawler zu bauen - Markt- und Branchenrecherche über Volltextsuche — wer eine bestimmte Formulierung offenlegt, und seit wann - BI- und Spreadsheet-Workflows, die saubere XBRL-Finanzdatenzeilen verarbeiten **Eingabeparameter:** - `mode` (string, erforderlich) — Extraktionsmodus: filings, fulltext, search oder facts (Standard: filings). - `ticker` (string, optional) — Börsenticker, z. B. AAPL. Eines von ticker/cik/companyName ist zur Laufzeit erforderlich. - `cik` (string, optional) — SEC Central Index Key, z. B. 320193 — hat Vorrang vor ticker und companyName. - `companyName` (string, optional) — SEC-Registrant-Name, exakt oder per Fuzzy-Matching gegen die offizielle Ticker-Datei abgeglichen. - `query` (string, optional) — EDGAR-Volltextsuchausdruck, z. B. "supply chain disruption" — erforderlich im Modus search. - `formTypes` (array, optional) — Einzuschließende Formulartypen, z. B. 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Leer = alle Formulare. - `chunking` (string, optional) — RAG-Strategie für Fulltext: section, paragraph (~2000 Zeichen) oder none (Standard: section). - `maxItems` (number, optional) — Maximal gespeicherte Items; jedes gespeicherte Item ist ein abgerechnetes Event (Standard: 100). **FAQ:** **Q: Brauche ich einen SEC-API-Key?** Nein. SEC EDGAR sind frei zugängliche öffentliche Daten. Der Actor identifiziert sich mit einem konformen User-Agent und drosselt sich automatisch unterhalb des Rate-Limits der SEC — kein Key, kein Login. **Q: Wie weit reichen die Daten zurück?** Die EDGAR-Volltextsuche (EFTS) deckt Filings ab dem 2001-05-04 ab und ist auf 10.000 Treffer pro Abfrage begrenzt. Filing-Metadaten reichen bis 1994 zurück, und XBRL-Finanzdaten decken alles ab, was das Unternehmen in XBRL gemeldet hat. **Q: Ist der Output bereit für LLMs und RAG?** Ja. Im Modus fulltext parst der Actor 10-K/10-Q in „Item N”-Abschnitte und erzeugt embedding-fertige Chunks (section oder ~2000-Zeichen-paragraph), jeweils getaggt mit Quell-Item und Reihenfolge-Index. **Q: Warum werden manche Filings im Modus fulltext übersprungen?** Filings, deren Hauptdokument weder HTML noch TXT ist (zum Beispiel reines XBRL-Form-4-XML), lassen sich nicht in Abschnitte parsen und werden daher übersprungen — und nicht berechnet. ## Beispiel-Output ```json { "itemType": "filing-fulltext", "title": "Apple Inc. — 10-K 2025-10-31", "company": "Apple Inc.", "ticker": "AAPL", "cik": "0000320193", "formType": "10-K", "filedAt": "2025-10-31", "accessionNo": "0000320193-25-000123", "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...", "sections": [ { "name": "Item 1A — Risk Factors", "charCount": 38241 }, { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 } ], "chunks": [ { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 } ], "textLength": 220151 } ``` ## Preise Pay-per-Event — abgerechnet wird nur für tatsächlich gespeicherte Items: | Event | Preis | Was abgedeckt ist | |---|---|---| | Filing-Metadaten / Suchtreffer | $0.001 | Ein Filing-Metadaten-Datensatz oder ein Volltextsuche-Ergebnis | | Volltext-Filing | $0.005 | Ein Filing extrahiert, in Abschnitte geparst und für RAG gechunkt | | XBRL-Fact | $0.0002 | Eine XBRL-Finanzdatenzeile | Ein Abruf von 1.000 Filing-Metadaten kostet ~$1.00; 1.000 XBRL-Facts kosten ~$0.20. `maxItems` begrenzt sowohl Menge als auch Kosten. ## Tipps - **Für Finanzdaten mit dem Modus `facts` starten.** Das Abrufen von XBRL-Zeilen (Umsatz, Nettogewinn, EPS) ist deutlich günstiger und sauberer als das Parsen ganzer Filings, wenn nur die Zahlen gebraucht werden. - **`chunking: section` für RAG nutzen.** Das hält jedes Item (Risk Factors, MD&A) intakt, sodass Retrieval kohärente, zitierfähige Passagen liefert. - **Die Volltextsuche deckt die Zeit ab 2001 ab.** Für ältere Offenlegungen das Unternehmen per CIK auflösen und Filing-Metadaten direkt abrufen. --- # USAspending.gov Scraper — Bundesvergaben, Empfänger & Aggregate - **URL:** https://proooxy.com/de/tools/usaspending-scraper/ - **Typ:** tools - **Beschreibung:** Die offizielle USAspending.gov-API v2 nach Bundesverträgen, -zuschüssen und -darlehen durchsuchen. Filterbar nach Behörde, Empfänger, NAICS/PSC oder Datum; Empfängerprofile, Kategorie-Summen und geografische Aggregate nach Bundesstaat/County/Distrikt abrufen. Kein API-Key. - **Zusammenfassung:** Bundesvergaben, Empfänger und Ausgaben-Aggregate von USAspending.gov. - **Kategorie:** public-data - **Tech-Stack:** TypeScript, REST API - **Märkte / Regionen:** USA - **Apify-Eintrag:** https://apify.com/autofacts/usaspending-scraper - **Keywords:** usaspending api deutsch, us bundesvertrag daten, regierungsausgaben daten, bundeszuschuss daten, govcon marktforschung, bundesvergaben daten, naics psc vertragsdaten - **Veröffentlicht:** 2026-07-01 - **Geändert:** 2026-07-01 **Hauptfunktionen:** - Offizielle USAspending.gov-API v2 — kein API-Key erforderlich - Vergabe-Suche über Keywords, Geschäftsjahr/Datumsbereich, Behörde, Empfänger, NAICS, PSC, Betrag und Vergabetyp - Sechs Modi — Vergabe-Suche, Vergabe-Detail, Sub-Vergaben, Empfängerprofil, Kategorie-Summen und Geografie - 18 Kategorie-Aggregationsdimensionen (Empfänger, NAICS, PSC, Behörde, County, Distrikt, CFDA, TAS und mehr) - Geografische Aggregate nach Bundesstaat, County, Kongress-Distrikt und Land, mit Bevölkerungs- und Pro-Kopf-Feldern - Automatische Datums-Segmentierung (monatlich/quartalsweise) für große Mehrjahres-Ergebnismengen - Automatisches Batching von Vergabetyp-Codes in gültige API-Anfragegruppen - Exakte Vergabe-Detail- und Sub-Vergabe-Abfrage per generierter Award-ID **Anwendungsfälle:** - GovCon-Geschäftsentwicklung — Opportunities und aktuelle Auftragnehmer nach NAICS, PSC oder Behörde finden - Wettbewerbsanalyse zur Vergabehistorie und den Behördenbeziehungen eines Wettbewerbers - Investigativer Journalismus, der Bundesausgaben zu bestimmten Empfängern oder Regionen zurückverfolgt - Politik- und akademische Forschung zu Ausgabentrends nach Kategorie, Vergabetyp oder Zeitraum - Due-Diligence-Prüfung der Vergabe- und Ausgabenhistorie eines Empfängers - BI-Dashboards, die Bundesausgaben nach Bundesstaat, County oder Kongress-Distrikt abbilden **Eingabeparameter:** - `mode` (string, optional) — Workflow: awards, awardDetail, subawards, recipient, byCategory oder geography (Standard: awards). - `keywords` (array, optional) — Freitext-Keyword-Filter von USAspending für die Vergabe-Suche. - `fiscalYear` (number, optional) — Föderales Geschäftsjahr (entspricht dem Zeitraum 1. Okt. – 30. Sep.). - `awardTypes` (array, optional) — USAspending-Vergabetyp-Codes; gemischte Gruppen werden automatisch in gültige Anfragen aufgeteilt. - `agency` (string, optional) — Exakter Filter nach vergebender oder finanzierender Behörde. - `naicsCodes` (array, optional) — NAICS-Codes, denen eine Vergabe entsprechen muss. - `awardId` (string, optional) — Generierte Award-ID — zur Laufzeit erforderlich für die Modi awardDetail und subawards. - `maxItems` (number, optional) — Maximal gespeicherte Datensätze; jede Zeile ist ein abgerechnetes Event (Standard: 100). **FAQ:** **Q: Brauche ich einen API-Key?** Nein. Die USAspending.gov-API v2 ist öffentlich und benötigt weder Key noch Login. **Q: Warum werden gemischte Vergabetyp-Codes auf mehrere Anfragen aufgeteilt?** USAspending lehnt eine einzelne Suche ab, die Codes aus unterschiedlichen Vergabetyp-Gruppen mischt (Contracts, IDVs, Grants, Loans, Other Financial Assistance, Direct Payments). Der Actor gruppiert die angeforderten Codes automatisch und taggt jede Output-Zeile mit den passenden Vergabetyp-Codes. **Q: Welche geografischen Aufschlüsselungen sind verfügbar?** Bundesstaat, County, Kongress-Distrikt und Land — bezogen entweder auf den Leistungsort oder den Empfängerstandort, jeweils inklusive Bevölkerungs- und Pro-Kopf-Feldern. **Q: Wie wird ein Run abgerechnet?** Pay-per-Event zu $0.001 pro gespeicherter Zeile, abgerechnet einmal pro erfolgreich zurückgegebenem Datensatz. maxItems begrenzt die Anzahl der Zeilen und damit die Kosten. ## Beispiel-Output ```json { "itemType": "award", "title": "HT940216C0001 — HUMANA GOVERNMENT BUSINESS INC", "date": "2016-02-01", "awardId": "HT940216C0001", "generatedId": "CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-", "recipient": { "name": "HUMANA GOVERNMENT BUSINESS INC", "uei": "...", "duns": "..." }, "awardingAgency": "Department of Defense", "fundingAgency": "Department of Defense", "amount": 51269205263.03, "awardType": "IDV_B_C", "naics": { "code": "...", "description": "..." }, "placeOfPerformance": { "stateCode": "...", "state": "..." }, "awardTypeCodes": ["IDV_B_C"], "url": "https://www.usaspending.gov/award/CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-" } ``` ## Preise Pay-per-Event: **$0.001 pro gespeichertem Datensatz**, abgerechnet einmal pro erfolgreich zurückgegebener Zeile. Ein Run mit ~1.000 Datensätzen kostet ~$1.00, `maxItems` begrenzt sowohl Menge als auch Kosten. ## Tipps - **Mit NAICS- oder PSC-Codes einsteigen** für GovCon-Prospecting — sie bilden die verkauften Produkte/Dienstleistungen direkt ab und liefern die sauberste Menge relevanter Vergaben. - **Den Modus `byCategory` nutzen**, um die Top-Empfänger oder -Behörden für einen Markt zu ranken, bevor einzelne Vergabe-Details abgerufen werden. - **Der Modus geography liefert die erste Seite (bis zu 100 Zeilen)** pro Kombination aus Datumsbereich/Vergabetyp — für Roll-ups nach Bundesstaat/County/Distrikt lieber die Filter verengen als `maxItems` zu erhöhen. --- # YouTube-Untertitel- & Transkript-Scraper — JSON, SRT, VTT, LLM - **URL:** https://proooxy.com/de/tools/youtube-transcript-scraper/ - **Typ:** tools - **Beschreibung:** YouTube-Untertitel und -Transkripte aus Videos, Shorts, Playlists und Kanälen extrahieren — als JSON, SRT, VTT, Klartext oder sauberen LLM-fertigen Text. Über 100 Sprachen, umfangreiche Metadaten, kein API-Key — und fehlgeschlagene Extraktionen sind kostenlos. - **Zusammenfassung:** YouTube-Transkripte als JSON, SRT, VTT oder LLM-fertiger Text. - **Kategorie:** social - **Tech-Stack:** TypeScript, InnerTube - **Märkte / Regionen:** Weltweit - **Apify-Eintrag:** https://apify.com/autofacts/youtube-subtitle-transcript-scraper - **Keywords:** youtube transkript scraper, youtube untertitel herunterladen, youtube transcript api deutsch, youtube untertitel als text, youtube transkripte massenweise, youtube untertitel srt vtt, youtube transkripte für llm - **Veröffentlicht:** 2026-07-01 - **Geändert:** 2026-07-01 **Hauptfunktionen:** - Ein Input deckt Videos, Shorts, youtu.be-Links, Playlists und Kanäle ab — gemischt in einem einzigen Run - Fünf Output-Formate — JSON (mit Zeitstempeln), SRT, VTT, Klartext und LLM-fertig (entfernt [Music], [Applause] und Sprecher-Labels) - 100+ Sprachen mit priorisierter Sprachliste und umschaltbarem Fallback auf Auto-Untertitel - Umfangreiche Metadaten — Titel, Kanal, Beschreibung, Veröffentlichungsdatum, Aufrufzahl, Thumbnail, Dauer und verfügbare Sprachen - Ganze Playlists und Kanäle im Batch verarbeiten, mit maxVideos-Obergrenze und 1–10 Concurrency - Unterstützung für Residential Proxys plus optionale Cookies zur Reduzierung von Bot-Check-Blockaden - Mehrschichtige Extraktion — bis zu neun Fallbacks über InnerTube-Clients hinweg, mit yt-dlp-PO-Token als letztem Ausweg - Circuit Breaker und Fehlerbehandlung pro Item halten große Batches am Laufen **Anwendungsfälle:** - KI-/ML-Teams, die RAG- oder Fine-Tuning-Datensätze aus gesprochenem Video aufbauen (LLM-fertiger Text-Output) - Content-Teams, die Transkripte zu Blogbeiträgen, Show-Notes und Social-Captions weiterverarbeiten - SEO-Marketer, die durchsuchbaren Videotext für Indexierung und Keyword-Recherche extrahieren - Redakteure und Verlage, die Standard-SRT/VTT-Untertiteldateien brauchen - Forschende, die Transkripte im Batch über einen ganzen Kanal oder eine Playlist sammeln - Entwickler, die strukturierte, zeitgestempelte Untertitel ohne YouTube-API-Key brauchen **Eingabeparameter:** - `urls` (array, optional) — YouTube-URLs oder reine IDs — Videos, Shorts, youtu.be-Links, Playlists oder Kanäle. Zur Laufzeit erforderlich. - `outputFormat` (string, optional) — Transkript-Format: json, srt, vtt, text oder llm (Standard: json). - `languages` (array, optional) — Bevorzugte Untertitelsprachen in Prioritätsreihenfolge, ISO-639-1-Codes (Standard: en). - `includeAutoGenerated` (boolean, optional) — Rückfall auf automatisch generierte Untertitel, wenn manuelle fehlen (Standard: true). - `maxVideos` (number, optional) — Obergrenze für verarbeitete Videos pro Run, z. B. bei Playlists/Kanälen (Standard: 0 = unbegrenzt). - `maxConcurrency` (number, optional) — Parallel verarbeitete Videos, 1–10 (Standard: 3). - `proxyConfiguration` (object, optional) — Proxy-Einstellungen; Standard ist Apify Residential, festgelegt auf die USA. - `youtubeCookies` (string, optional) — Optionale YouTube-Cookies (Cookie-Header oder cookies.txt) zur Reduzierung von Bot-Check-Blockaden. **FAQ:** **Q: Brauche ich einen YouTube-API-Key oder einen Login?** Nein. Der Actor extrahiert Untertitel direkt — kein YouTube-Data-API-Key und kein Login. Optional lässt sich ein Cookies-Input angeben, um „Sign in to confirm you're not a bot”-Blockaden bei manchen Videos zu reduzieren. **Q: Welche Sprachen und Untertitel-Typen werden unterstützt?** Über 100 Sprachen. Eine priorisierte Liste von ISO-639-1-Codes angeben (Standard: en); der Actor bevorzugt manuell erstellte Untertitel und fällt auf automatisch generierte zurück, sofern includeAutoGenerated nicht deaktiviert wird. **Q: Werde ich für Videos berechnet, deren Extraktion fehlschlägt?** Nein. Die Abrechnung erfolgt Pay-per-Event auf ein einzelnes „Transkript extrahiert”-Event, berechnet erst, nachdem ein Transkript erfolgreich gespeichert wurde. Fehlgeschlagene Videos erscheinen im Output mit einem error-Feld und werden nicht berechnet. **Q: Kann ich sauberen, LLM-fertigen Text für RAG bekommen?** Ja. outputFormat auf „llm” setzen, um [Music]/[Applause]-Annotationen und Sprecher-Labels zu entfernen — das Ergebnis ist sauberer Fließtext, ideal für Embeddings und Fine-Tuning. ## Beispiel-Output ```json { "videoId": "dQw4w9WgXcQ", "url": "https://www.youtube.com/watch?v=dQw4w9WgXcQ", "title": "Rick Astley - Never Gonna Give You Up (Official Video)", "channelName": "Rick Astley", "channelId": "UCuAXFkgsw1L7xaCfnd5JJOw", "publishDate": "2009-10-25", "viewCount": 1761003712, "availableLanguages": ["en", "de-DE", "ja", "pt-BR", "es-419"], "language": "en", "isAutoGenerated": false, "duration": 213, "wordCount": 487, "segmentCount": 61, "text": "We're no strangers to love, you know the rules and so do I...", "segments": [{ "text": "We're no strangers to love", "start": 18.64, "end": 21.88 }], "error": null } ``` ## Preise Pay-per-Event: abgerechnet einmal pro **erfolgreich extrahiertem Transkript** — fehlgeschlagene Videos werden nie berechnet. Einen ganzen Kanal oder eine Playlist einspeisen und nur für die tatsächlich erhaltenen Untertitel bezahlen. ## Tipps - **`outputFormat: llm` nutzen** für RAG und Fine-Tuning — entfernt Nicht-Sprache-Annotationen, sodass Embeddings sauberen Fließtext sehen. - **Residential Proxy aktiviert lassen.** YouTube blockiert Rechenzentrums-IPs aggressiv; der Actor nutzt nicht ohne Grund standardmäßig US-Residential. - **`maxConcurrency` bei großen Jobs mit 1–3 starten** und schrittweise erhöhen — hohe Concurrency erhöht das Rate-Limit-Risiko bei großen Kanal-Scrapes. --- # Sephora Scraper (Weltweit) - **URL:** https://proooxy.com/de/tools/sephora-scraper/ - **Typ:** tools - **Beschreibung:** Apify-Actor, der vollständige Sephora-Produktdaten extrahiert — Varianten, Preise, Bilder, Inhaltsstoffe und Rezensionen — aus 21 Storefronts in den USA, Kanada, 9 EU-Märkten und 10 Asien-Pazifik-Märkten, in einem einzigen normalisierten Schema. - **Zusammenfassung:** Jede Sephora-Storefront scrapen — 21 Märkte, ein Actor. - **Kategorie:** ecommerce - **Tech-Stack:** Python, Crawlee, curl_cffi - **Märkte / Regionen:** USA, Kanada, Frankreich, Italien, Deutschland, Spanien, Polen, Tschechien, Griechenland, Rumänien, Portugal, Neuseeland, Australien, Singapur, Malaysia, Thailand, Indonesien, Philippinen, Hongkong, Taiwan, Brunei - **Anti-Bot-Strategie:** Akamai-Bypass über Residential Proxys + curl_cffi-TLS-Fingerprinting - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/sephora - **Keywords:** sephora scraper deutsch, sephora produktdaten, sephora api, sephora produkte scrapen, sephora preistracker, beauty produktdaten, kosmetik daten extraktion, sephora global scraper - **Veröffentlicht:** 2026-04-18 - **Geändert:** 2026-04-18 **Hauptfunktionen:** - 21 Storefronts in einem Actor — USA, Kanada, 9 EU-Märkte und 10 APAC-Märkte, abgedeckt von einer einzigen SKU - Automatische Markterkennung — eine beliebige sephora.*-URL einfügen, der Dispatcher leitet sie ans richtige Modul weiter - Gemischte Multi-Markt-Runs — US- + EU- + SEA-URLs in einer startUrls-Liste, gestreamt in ein einziges Dataset, getaggt mit `market` - Locale-korrekte Preise — NZD, EUR, USD, AUD und 17 weitere Währungen, geliefert von Sephoras eigener Lokalisierungsschicht - Normalisiertes Schema — jeder Markt liefert dieselbe `source / brand / title / options / variants / medias / stats`-Struktur - Session-Isolation pro Markt — Auth-Status kann nicht zwischen Regionen überspringen - Globaler Circuit Breaker — 50 aufeinanderfolgende Fehlschläge brechen den Run ab, um kein Compute an einem ausgefallenen Ziel zu verbrennen **Anwendungsfälle:** - Regionsübergreifende Preis-Intelligence über US-, EU- und APAC-Beauty-Märkte - Marktübergreifendes Monitoring von Produktverfügbarkeit und Sortiment - Wettbewerbsanalyse für Marken, die in neue Sephora-Regionen starten - Inhaltsstoffvergleiche über regionale Rezepturen hinweg - Tracking von Rezensionen und Bewertungen — inklusive SEA-Wishlist-Signalen und US-KI-Sentiment-Zusammenfassungen - Audits von Loyalty-/Mitgliedschaftspreisen je Markt **Eingabeparameter:** - `startUrls` (array, erforderlich) — Produkt- oder Kategorie-URLs von jeder beliebigen sephora.*-Storefront. Der Markt wird automatisch anhand des Hostnamens erkannt. - `market` (string, optional) — Optionale Markt-Überschreibung (us, eu-fr, eu-it, eu-de, eu-es, eu-pl, eu-cz, eu-gr, eu-ro, eu-pt, sea-nz, sea-au, sea-sg, sea-my, sea-th, sea-id, sea-ph, sea-hk, sea-tw, sea-bn). - `locale` (string, optional) — Optionale BCP-47-Locale (z. B. fr-FR, en-NZ) — überschreibt den Markt-Standardwert. - `categoryIds` (array, optional) — Nur EU. SFCC-Kategorie-IDs wie C479 — Alternative zum Einfügen von Kategorie-URLs. - `proxy` (object, optional) — Apify-Proxy-Konfiguration. Residential dringend empfohlen; apifyProxyCountry auf den Zielmarkt festlegen. - `maxConcurrency` (number, optional) — Gleichzeitige Anfragen. Standard 5. US: 2–5. EU: 3. SEA: 8–16. - `maxRequestsPerCrawl` (number, optional) — Globale harte Obergrenze über alle Märkte hinweg. 0 = unbegrenzt. **FAQ:** **Q: Welche Sephora-Storefronts unterstützt dieser Scraper?** 21 Storefronts: USA (sephora.com), Kanada (sephora.ca), 9 EU-Märkte (FR, IT, DE, ES, PL, CZ, GR, RO, PT) und 10 APAC-Märkte (NZ, AU, SG, MY, TH, ID, PH, HK, TW, BN). Der Markt wird automatisch anhand des Hostnamens erkannt — beim Mischen von Märkten sind keine Input-Änderungen nötig. **Q: Kann ich mehrere Märkte in einem einzigen Run scrapen?** Ja. sephora.com-, sephora.fr- und sephora.nz-URLs in einer startUrls-Liste mischen. Der Dispatcher gruppiert sie nach Markt, führt jedes Modul gleichzeitig mit marktgerechter Auth aus und taggt jedes Dataset-Item mit einem `market`-Feld. **Q: Wie geht der Scraper mit Anti-Bot-Schutz um?** Er nutzt Residential Proxys für alle Märkte und curl_cffi für browserechtes TLS-Fingerprinting bei EU- und SEA-Traffic, um Akamai zu umgehen. US-Traffic läuft über Crawlees HttpCrawler mit einem Session-Pool, der bei 403/429 rotiert. **Q: Funktionieren meine bestehenden v1.x-US-Run-Konfigurationen weiter?** Ja. Pre-2.0-Inputs — startUrls, maxConcurrency, proxy, maxRequestsPerCrawl — verhalten sich identisch. Die einzige Output-Änderung ist ein neuer `market`-Key bei jedem Item, eine rein additive Änderung. **Q: Warum sind manche Felder in SEA-Daten null?** Sephora SEAs API stellt keinen `lovesCount`-Zähler bereit, daher haben APAC-Items `stats.lovesCount = null`. Stattdessen hat jede Variante ein boolesches `wishlisted`-Feld. Umgekehrt sind `sentiments` (KI-Rezensions-Zusammenfassungen) und `source.crawlUrl` nur für die USA verfügbar. **Q: Brauche ich separate API-Tokens oder Accounts pro Markt?** Nein. Das bestehende Apify-API-Token funktioniert unverändert. Der Actor verwaltet Guest-Tokens pro Markt intern — für EU/SEA sind keine Zugangsdaten nötig, und die USA laufen über Standard-Apify-Residential-Proxys. ## Unterstützte Märkte | Region | Markt-ID | Land | Währung | Hostname | |---|---|---|---|---| | Amerika | `us` | USA | USD | sephora.com | | Amerika | `us` | Kanada | CAD | sephora.ca | | EU | `eu-fr` | Frankreich | EUR | sephora.fr | | EU | `eu-it` | Italien | EUR | sephora.it | | EU | `eu-de` | Deutschland | EUR | sephora.de | | EU | `eu-es` | Spanien | EUR | sephora.es | | EU | `eu-pl` | Polen | PLN | sephora.pl | | EU | `eu-cz` | Tschechien | CZK | sephora.cz | | EU | `eu-gr` | Griechenland | EUR | sephora.gr | | EU | `eu-ro` | Rumänien | RON | sephora.ro | | EU | `eu-pt` | Portugal | EUR | sephora.pt | | APAC | `sea-nz` | Neuseeland | NZD | sephora.nz | | APAC | `sea-au` | Australien | AUD | sephora.com.au | | APAC | `sea-sg` | Singapur | SGD | sephora.sg | | APAC | `sea-my` | Malaysia | MYR | sephora.com.my | | APAC | `sea-th` | Thailand | THB | sephora.co.th | | APAC | `sea-id` | Indonesien | IDR | sephora.co.id | | APAC | `sea-ph` | Philippinen | PHP | sephora.ph | | APAC | `sea-hk` | Hongkong | HKD | sephora.hk | | APAC | `sea-tw` | Taiwan | TWD | sephora.tw | | APAC | `sea-bn` | Brunei | BND | sephora.bn | ## Beispiel-Output ```json { "market": "sea-nz", "source": { "id": 58792, "canonicalUrl": "https://www.sephora.nz/products/rare-beauty-true-to-myself-natural-matte-longwear-foundation", "retailer": "SEPHORA", "currency": "NZD" }, "brand": "Rare Beauty", "title": "True To Myself Natural Matte Longwear Foundation", "description": "

A self-priming and self-setting foundation...

", "ingredients": "Aqua/Water, Cyclopentasiloxane, Glycerin...", "currentSku": "770225", "categories": ["makeup/face/foundation"], "options": [ { "name": "shade", "id": "66488", "values": [{"value": "1 Fair Neutral", "orderable": true}] } ], "variants": [ { "id": "276343", "sku": "770225", "price": { "current": 77.0, "original": 77.0, "stockStatus": "IN_STOCK" }, "options": [{"name": "shade", "value": "1 Fair Neutral"}], "highlights": ["NEW", "Only at Sephora"], "wishlisted": null } ], "medias": [{ "url": "https://www.sephora.nz/.../foundation-shade.jpg", "type": "image" }], "stats": { "reviewCount": 971, "rating": 4.8, "lovesCount": null } } ``` ## Tipps - **Proxy-Land auf den Zielmarkt festlegen.** Ein Residential-Exit in einem falschen Land ist die mit Abstand größte Quelle für 403er von Sephoras Akamai-Schicht. `apifyProxyCountry` auf den ISO-Code der Storefront setzen (`US`, `FR`, `NZ` usw.). - **Zuerst einen Smoke-Test durchführen.** `maxRequestsPerCrawl=10` setzen, bevor der erste produktive Run in einem neuen Markt gestartet wird. - **Concurrency pro Region abstimmen.** US: 2–5. EU: 3. SEA: 8–16. Jeder Markt bekommt in gemischten Runs sein eigenes Semaphore. --- # Boohoo Scraper — Produktdaten aus 7 Regionen - **URL:** https://proooxy.com/de/tools/boohoo-scraper/ - **Typ:** tools - **Beschreibung:** Produktdaten von Boohoo-E-Commerce-Seiten aus 7 Regionen extrahieren — mit automatischer Paginierung, Facettenfilterung und Multi-Währungs-Unterstützung. - **Zusammenfassung:** Boohoo-Produktdaten aus 7 regionalen Shops scrapen. - **Kategorie:** ecommerce - **Tech-Stack:** TypeScript, Cheerio, Fingerprint Generator - **Märkte / Regionen:** Niederlande, Schweden, Großbritannien, Irland, Frankreich, Australien, USA - **Anti-Bot-Strategie:** Fingerprint-Generierung für Anti-Bot-Bypass - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/boohoo-scraper - **Keywords:** boohoo scraper deutsch, boohoo produktdaten, boohoo preisüberwachung, fast fashion scraper, modekatalog daten, fashion daten mehrere regionen - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Unterstützung für 7 regionale Shops — Niederlande (EUR), Schweden (SEK), Großbritannien (GBP), Irland (EUR), Frankreich (EUR), Australien (AUD), USA (USD) - Kategorie- und Such-Scraping mit automatischer Paginierung - Facettenfilter-Unterstützung — Größe, Farbe, Preisspanne, Stil - Vollständige Produktdetails inklusive Varianten und Lagerstatus - Browser-Fingerprint-Generierung für Anti-Bot-Bypass - Multi-Währungs-Preise je nach regionalem Shop **Anwendungsfälle:** - Wettbewerbspreisanalyse im Fast-Fashion-Segment - Regionsübergreifender Preisvergleich für dieselben Produkte - Trend-Monitoring im Bereich erschwingliche Mode - Bestands- und Lagerverfolgung über mehrere Regionen hinweg - Fashion-Marktforschung in europäischen und globalen Märkten **Eingabeparameter:** - `startUrls` (array, erforderlich) — Boohoo-Produkt- oder Kategorie-URLs - `maxRequestsPerCrawl` (number, optional) — Anfragelimit (Standard: 5) - `maxConcurrency` (number, optional) — Parallele Anfragen (Standard: 5) - `proxy` (object, optional) — Proxy-Konfiguration **FAQ:** **Q: Welche regionalen Boohoo-Shops werden unterstützt?** Niederlande (EUR), Schweden (SEK), Großbritannien (GBP), Irland (EUR), Frankreich (EUR), Australien (AUD) und die USA (USD). **Q: Kann ich Produkte nach Größe oder Farbe filtern?** Ja, der Scraper unterstützt Facettenfilterung. Gefilterte Kategorie-URLs können übergeben werden, und der Scraper berücksichtigt die angewendeten Filter. **Q: Wie geht der Scraper mit Paginierung um?** Die Paginierung erfolgt automatisch. Eine Kategorie- oder Such-URL übergeben, und der Scraper folgt allen Paginierungslinks, um jedes Produkt zu extrahieren. ## Beispiel-Output ```json { "source": "https://www.boohoo.com/...", "brand": "boohoo", "title": "Oversized Hoodie", "description": "Stay cozy in this oversized hoodie...", "categories": ["Women", "Hoodies & Sweatshirts"], "price": { "current": 1500, "original": 3000, "currency": "GBP" }, "variants": [ { "sku": "BH-OH-BLK-S", "size": "S", "color": "Black", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Farfetch Scraper — Luxusmode-Produktdaten - **URL:** https://proooxy.com/de/tools/farfetch-scraper/ - **Typ:** tools - **Beschreibung:** Produktdaten aus dem Luxusmode-Segment von Farfetch extrahieren — inklusive Multi-Währungs-Preisen, Größen-/Passform-Varianten und Produktempfehlungen. - **Zusammenfassung:** Luxusmode-Produkte von Farfetch scrapen, mit Multi-Währungs-Unterstützung. - **Kategorie:** ecommerce - **Tech-Stack:** TypeScript, Cheerio, Crawlee - **Märkte / Regionen:** Weltweit - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/farfetch - **Keywords:** farfetch scraper deutsch, farfetch produktdaten, luxusmode daten, designer mode scraper, farfetch preisüberwachung, luxus einzelhandel daten - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Scraping von Kategorie- und Produktdetailseiten - Multi-Währungs-Preise — automatische Erkennung basierend auf dem Proxy-Standort - Optionale Extraktion von Größen-/Passform-Varianten - Bis zu 90 empfohlene Produkte pro Artikel - Vollständige Mediengalerien und detaillierte Beschreibungen - Extraktion von Marke, Kategorie und Zusatzinformationen **Anwendungsfälle:** - Marktanalysen im Luxusmode-Segment - Plattformübergreifender Preisvergleich für Designer-Marken - Mode-Trendanalyse und Produktentdeckung - Wettbewerbspreise für Multi-Brand-Händler - Trainingsdaten für Produktempfehlungs-Engines **Eingabeparameter:** - `startUrls` (array, erforderlich) — Farfetch-Produkt- oder Kategorie-URLs - `proxy` (object, optional) — Proxy-Konfiguration — Standort beeinflusst die Währung - `maxRequestsPerCrawl` (number, optional) — Anfragelimit (Standard: 100) - `maxConcurrency` (number, optional) — Parallele Anfragen (Standard: 5) - `withSizeFit` (boolean, optional) — Größen-/Passform-Daten einschließen (Standard: false) - `withRecommends` (boolean, optional) — Empfehlungen einschließen (Standard: false) **FAQ:** **Q: Wie funktionieren die Multi-Währungs-Preise?** Farfetch zeigt Preise standortabhängig an. Der Scraper nutzt den Standort des Proxys, um zu bestimmen, welche Währung zurückgegeben wird. Für USD einen US-Proxy verwenden, für GBP einen UK-Proxy usw. **Q: Wie viele empfohlene Produkte können extrahiert werden?** Bis zu 90 empfohlene Produkte pro Artikel, wenn withRecommends aktiviert ist. Nützlich für den Aufbau von Produktgraphen und Empfehlungs-Datensätzen. ## Beispiel-Output ```json { "source": "https://www.farfetch.com/shopping/...", "brand": "Gucci", "title": "GG Marmont Matelasse Shoulder Bag", "description": "Crafted from matelasse leather...", "details": ["Made in Italy", "100% Calf Leather"], "categories": ["Women", "Bags", "Shoulder Bags"], "options": [ { "name": "Size", "values": ["One Size"] } ], "variants": [ { "sku": "FF-GU-001", "price": 229000, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Global API Load Tester — 10K+ RPS Stresstest - **URL:** https://proooxy.com/de/tools/load-tester/ - **Typ:** tools - **Beschreibung:** Hochleistungs-Lasttest-Tool, das über 10.000 Anfragen pro Sekunde simuliert — mit geoverteiltem Traffic, gewichteten Zielen und interaktiven HTML-Reports. - **Zusammenfassung:** 10K+ RPS simulieren mit geoverteiltem Lasttest. - **Kategorie:** utility - **Tech-Stack:** Go, Vegeta - **Märkte / Regionen:** Weltweit - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/global-api-load-tester - **Keywords:** api lasttest tool, http load testing deutsch, stresstest tool, performance testing tool, load test 10k rps, geoverteilter lasttest, vegeta load testing - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Extreme Performance — über 10.000 Anfragen pro Sekunde - Geoverteilte Tests aus USA, EU und Asien - Gewichtete Multi-Target-Attacken (z. B. 90% Reads / 10% Writes) - Unterstützung für Residential Proxys für realistischen Traffic - Constant-Rate-Pacing zur Vermeidung von Coordinated Omission - Interaktive HTML-Reports via Vegeta Plots - Detaillierte Latenz-, Durchsatz- und Fehler-Metriken **Anwendungsfälle:** - API-Performance-Benchmarking vor dem Launch - Kapazitätsplanung und Infrastruktur-Dimensionierung - Auffinden von Breaking Points und Engpässen - Testen von CDN- und Load-Balancer-Konfigurationen - Geoverteilte Latenztests - Regressionstests für performance-kritische Endpunkte **Eingabeparameter:** - `targets` (array, erforderlich) — Ziel-Endpunkte mit URL, Methode, Body, Headern und Gewichtung - `rate` (number, optional) — Anfragen pro Sekunde (Standard: 50) - `duration` (number, optional) — Testdauer in Sekunden (Standard: 60) - `geoDistribution` (array, optional) — Regionen mit Ländercodes und Traffic-Gewichtungen - `useStickySessions` (boolean, optional) — Session-Affinität beibehalten (Standard: true) - `maxCostLimit` (number, optional) — Kostenobergrenze für den Test-Run **FAQ:** **Q: Wie funktionieren geoverteilte Tests?** Ländercodes und Traffic-Gewichtungen werden angegeben. Das Tool verteilt Anfragen auf Apify-Proxy-Server in diesen Regionen und simuliert so realistische globale Traffic-Muster. **Q: Was ist Coordinated Omission?** Eine verbreitete Falle bei Lasttests: Das Tool wird langsamer, wenn das Ziel überlastet ist, wodurch die Ergebnisse besser aussehen als die Realität. Vegeta nutzt Constant-Rate-Pacing, um das zu vermeiden. **Q: Kann ich authentifizierte Endpunkte testen?** Ja, Autorisierungs-Header in die Zielkonfiguration aufnehmen. Jedes Ziel kann eigene Header, eine eigene Methode und einen eigenen Body haben. ## Beispiel-Output Der Load Tester erzeugt interaktive HTML-Reports und strukturierte Metriken: ```json { "summary": { "totalRequests": 50000, "duration": "60s", "rps": 833.33, "successRate": 99.8, "latency": { "mean": "12.4ms", "p50": "10.1ms", "p95": "28.7ms", "p99": "89.2ms", "max": "342.1ms" }, "statusCodes": { "200": 49900, "503": 100 } } } ``` --- # Lululemon Scraper — Produkte, Varianten & Preise - **URL:** https://proooxy.com/de/tools/lululemon-scraper/ - **Typ:** tools - **Beschreibung:** Produktdetails von Lululemon crawlen und extrahieren — inklusive Variantendaten, Farboptionen, Mediengalerien und Preisinformationen. - **Zusammenfassung:** Produktdaten mit Varianten und Medien von Lululemon extrahieren. - **Kategorie:** ecommerce - **Tech-Stack:** TypeScript, Crawlee - **Märkte / Regionen:** USA - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/lululemon-scraper - **Keywords:** lululemon scraper deutsch, lululemon produktdaten, lululemon preistracker, activewear produktdaten, athleisure preisdaten, lululemon lagerbestand scraper - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Crawling von Kategorie- und Produktseiten - Variantenextraktion mit Farb- und Größenoptionen - Vollständige Mediengalerien mit farbspezifischen Bildern - Preistracking mit strukturiertem Output - Extraktion der Kategoriehierarchie - Leichtgewichtig und schnell dank Crawlee-Framework **Anwendungsfälle:** - Marktforschung und Wettbewerbsanalyse für Sportbekleidung - Preisüberwachung für Reseller und Vergleichsplattformen - Produktkatalog-Aggregation für Fitness-E-Commerce - Verfügbarkeits-Tracking nach Farbe und Größe - Trendanalyse im Bereich Activewear **Eingabeparameter:** - `startUrls` (array, erforderlich) — Lululemon-Produkt- oder Kategorie-URLs - `proxy` (object, optional) — Proxy-Konfiguration - `maxConcurrency` (number, optional) — Limit für parallele Anfragen **FAQ:** **Q: Verarbeitet der Scraper unterschiedliche Farbvarianten?** Ja, jede Farbvariante wird mit eigenen Bildern, eigener SKU und eigenem Verfügbarkeitsstatus extrahiert. Die Mediengalerie ist farbspezifisch. **Q: Kann ich ganze Lululemon-Kategorien scrapen?** Ja, eine Kategorie-URL angeben, und der Scraper crawlt alle Produkte innerhalb dieser Kategorie. ## Beispiel-Output ```json { "source": "https://shop.lululemon.com/p/...", "brand": "lululemon", "title": "Align High-Rise Pant 25\"", "description": "Buttery-soft, weightless Nulu fabric...", "categories": ["Women", "Pants", "Yoga Pants"], "options": [ { "name": "Color", "values": ["Black", "True Navy", "Dark Olive"] }, { "name": "Size", "values": ["2", "4", "6", "8", "10", "12"] } ], "variants": [ { "sku": "LL-AHR-BLK-6", "name": "Black / 6", "price": 9800, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://...", "color": "Black" } ], "stats": { "rating": 4.7, "reviewCount": 15234 } } ``` --- # Schema Markup Scraper & SEO-Auditor - **URL:** https://proooxy.com/de/tools/schema-markup-scraper/ - **Typ:** tools - **Beschreibung:** JSON-LD, Microdata, RDFa, Open Graph und Twitter Cards von jeder URL extrahieren — mit einem umfassenden SEO-Audit-Scoring-System. - **Zusammenfassung:** Strukturierte Daten extrahieren und SEO für jede Website auditieren. - **Kategorie:** utility - **Tech-Stack:** TypeScript, Crawlee - **Märkte / Regionen:** Weltweit - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/metadata-scraper - **Keywords:** schema markup checker deutsch, strukturierte daten extraktor, json-ld extraktor, seo audit tool, open graph checker, microdata scraper, rich results testen - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Extraktion strukturierter Daten — JSON-LD, Microdata und RDFa - Social-Meta-Tags — Open Graph, Twitter Cards, Dublin Core - SEO-Analyse mit Scoring von 0–100 - Validierung von kanonischer URL und hreflang - Autoren-Extraktion für EEAT-Signale - LocalBusiness-Erkennung mit über 80 Subtypen - Audit von Bild-Alt-Texten - Validierung von Breadcrumb-Schema - Extraktion von Geo-Tags und NAP-Daten **Anwendungsfälle:** - Technisches SEO-Auditing im großen Maßstab - Validierung strukturierter Daten für Websites - Wettbewerbs-SEO-Analyse — Schema Markup über Wettbewerber hinweg vergleichen - Bewertung von EEAT-Signalen für Content-Websites - Local-SEO-Auditing für Unternehmen - SEO-Checklisten-Validierung vor dem Launch **Eingabeparameter:** - `startUrls` (array, erforderlich) — Zu analysierende URLs - `proxy` (object, optional) — Proxy-Konfiguration - `maxRequestsPerCrawl` (number, optional) — Limit für die Gesamtzahl zu auditierender URLs - `maxConcurrency` (number, optional) — Parallele Anfragen - `extractMetaTags` (boolean, optional) — Meta-Tags extrahieren (Standard: true) - `extractSeoAnalysis` (boolean, optional) — SEO-Analyse durchführen (Standard: true) - `computeSeoScore` (boolean, optional) — SEO-Score von 0–100 berechnen (Standard: true) - `extractGeoData` (boolean, optional) — Geo-Tags und NAP-Daten extrahieren **FAQ:** **Q: Welche Formate für strukturierte Daten werden unterstützt?** JSON-LD, Microdata und RDFa. Der Scraper extrahiert außerdem Open-Graph-, Twitter-Cards- und Dublin-Core-Metadaten. **Q: Wie wird der SEO-Score berechnet?** Der Score von 0–100 bewertet Title-Tags, Meta-Descriptions, Überschriftenhierarchie, Bild-Alt-Texte, kanonische URLs, Mobile-Viewport, das Vorhandensein strukturierter Daten und mehr. **Q: Kann ich mehrere Seiten gleichzeitig auditieren?** Ja, mehrere URLs in startUrls angeben. Der Scraper verarbeitet sie parallel für schnelles Bulk-Auditing. ## Beispiel-Output ```json { "url": "https://example.com/product/...", "title": "Example Product Page", "linkedData": [ { "@type": "Product", "name": "..." } ], "openGraph": { "og:title": "Example Product", "og:type": "product" }, "twitterCard": { "card": "summary_large_image" }, "seoAudit": { "score": 78, "issues": [ "Missing alt text on 3 images", "No hreflang tags detected" ] }, "headings": { "h1": ["Example Product"], "h2": ["Description", "Reviews"] } } ``` --- # Sephora EU Scraper — 9 europäische Märkte - **URL:** https://proooxy.com/de/tools/sephora-eu-scraper/ - **Typ:** tools - **Beschreibung:** Vollständige Produktdaten von Sephora Europe aus 9 EU-Märkten scrapen — mit Multi-Varianten-Extraktion, Akamai-WAF-Bypass und intelligentem Token-Management. - **Zusammenfassung:** Produktdaten von Sephora aus 9 europäischen Märkten extrahieren. - **Kategorie:** ecommerce - **Tech-Stack:** TypeScript, Crawlee, Akamai Bypass - **Märkte / Regionen:** Frankreich, Italien, Deutschland, Spanien, Polen, Tschechien, Griechenland, Rumänien, Portugal - **Anti-Bot-Strategie:** Akamai WAF — browserechtes TLS-Fingerprinting - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/sephora-eu-scraper - **Keywords:** sephora europa scraper, sephora eu produktdaten, europäische beauty daten, sephora frankreich scraper, sephora deutschland scraper, europäische kosmetik daten, akamai waf bypass - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Unterstützung für 9 EU-Märkte — Frankreich, Italien, Deutschland, Spanien, Polen, Tschechien, Griechenland, Rumänien, Portugal - Multi-Varianten-Extraktion mit individuellen Preisen und Lagerstatus - Hochauflösende Bildergalerien für jedes Produkt - Kategorie-Browsing über Kategorie-IDs für Bulk-Extraktion - Browserechtes TLS-Fingerprinting zur Umgehung von Akamai WAF - Guest-Token-Management mit automatischem Refresh und Exponential Backoff **Anwendungsfälle:** - Paneuropäischer Preisvergleich im Beauty-Markt - Marktübergreifendes Monitoring der Produktverfügbarkeit - Recherche zur EU-Markterschließung für Beauty-Marken - Wettbewerbsanalyse über europäische Märkte hinweg - Analyse regionaler Preisstrategien **Eingabeparameter:** - `startUrls` (array, optional) — Zu scrapende Sephora-EU-Produkt-URLs - `categoryIds` (array, optional) — Kategorie-IDs für Bulk-Produktextraktion - `locale` (string, optional) — Ziel-Markt-Locale (z. B. fr-FR, it-IT) - `maxProducts` (number, optional) — Maximal zu extrahierende Produkte - `maxConcurrency` (number, optional) — Limit für parallele Anfragen - `proxyConfiguration` (object, optional) — Proxy-Einstellungen — Residential empfohlen **FAQ:** **Q: Welche europäischen Sephora-Märkte werden unterstützt?** Frankreich (fr-FR), Italien (it-IT), Deutschland (de-DE), Spanien (es-ES), Polen (pl-PL), Tschechien (cs-CZ), Griechenland (el-GR), Rumänien (ro-RO) und Portugal (pt-PT). **Q: Wie umgeht der Scraper Akamai WAF?** Er nutzt browserechtes TLS-Fingerprinting, um echte Browser-Verbindungen nachzubilden — die Anfragen sind von echtem Nutzer-Traffic nicht zu unterscheiden. **Q: Kann ich ganze Kategorien scrapen?** Ja, Kategorie-IDs können angegeben werden, um alle Produkte innerhalb einer Kategorie zu extrahieren. Das ist der effizienteste Weg für Bulk-Extraktion. ## Beispiel-Output ```json { "source": "https://www.sephora.fr/p/...", "brand": "Rare Beauty", "title": "Soft Pinch Liquid Blush", "description": "Un blush liquide longue tenue...", "shortDescription": "Blush liquide", "categories": ["Maquillage", "Teint", "Blush"], "options": [ { "name": "Shade", "values": ["Joy", "Hope", "Grace"] } ], "variants": [ { "sku": "EU-RB-001", "name": "Joy", "price": 2800, "currency": "EUR", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ], "stats": { "rating": 4.7, "reviewCount": 3421 } } ``` --- # Shopify Scraper — Produktdaten aus jedem Shop - **URL:** https://proooxy.com/de/tools/shopify-scraper/ - **Typ:** tools - **Beschreibung:** Professionelles Tool zur Extraktion hochpräziser Produktdaten aus jedem Shopify-Shop — inklusive Collections, Suche und Produktempfehlungen. - **Zusammenfassung:** Produktdaten aus jedem Shopify-Shop extrahieren. - **Kategorie:** ecommerce - **Tech-Stack:** TypeScript, got-scraping - **Märkte / Regionen:** Weltweit - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/shopify-scraper-ppe - **Keywords:** shopify scraper deutsch, shopify produkte exportieren, shopify shop scrapen, shopify produktdaten, shopify api alternative, e-commerce daten extraktion, shopify collection scraper - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Universell — funktioniert mit jedem Shopify-Shop - Shopweite Katalogextraktion und Suchunterstützung - Produktempfehlungen (bis zu 20 pro Produkt) - Scraping von Collections und einzelnen Produkten - Extraktion von Tags und Kategorien - Währungsnormalisierung (Preise x100) für Präzision **Anwendungsfälle:** - Marktforschung über Shopify-Shops in jeder Nische - Wettbewerbsanalyse für DTC-Marken - Produktkatalog-Aggregation für Vergleichsplattformen - Trend-Monitoring über unabhängige E-Commerce-Shops - Aufbau von Produktempfehlungs-Datensätzen - Preisüberwachung für Reseller **Eingabeparameter:** - `startUrls` (array, erforderlich) — Shopify-Shop-URLs — Produkt, Collection oder Shop-Startseite - `proxy` (object, optional) — Residential Proxy für beste Ergebnisse empfohlen - `maxRequestsPerCrawl` (number, optional) — Anfragelimit (Standard: 100) - `maxRecommendationsPerProduct` (number, optional) — Abzurufende empfohlene Produkte (Standard: 0, max.: 20) - `query` (string, optional) — Suchanfrage, um Produkte innerhalb eines Shops zu finden **FAQ:** **Q: Funktioniert das mit jedem Shopify-Shop?** Ja, der Scraper funktioniert mit jedem auf Shopify basierenden Shop. Er nutzt Shopifys Standard-Produktdatenstruktur, die über alle Shops hinweg konsistent ist. **Q: Kann ich nach bestimmten Produkten suchen?** Ja, den Parameter query nutzen, um innerhalb eines bestimmten Shops zu suchen. Nützlich, um bestimmte Produkttypen zu finden, ohne den gesamten Katalog zu scrapen. **Q: Wie werden Produktempfehlungen extrahiert?** maxRecommendationsPerProduct setzen, um verwandte Produkte abzurufen. Bis zu 20 Empfehlungen sind pro Produkt verfügbar, nützlich für den Aufbau von Produktgraphen. ## Beispiel-Output ```json { "source": "https://store.example.com/products/...", "brand": "Example Brand", "title": "Premium Organic Cotton T-Shirt", "description": "Made from 100% organic cotton...", "categories": ["Tops", "T-Shirts"], "tags": ["organic", "sustainable", "cotton"], "options": [ { "name": "Size", "values": ["S", "M", "L", "XL"] }, { "name": "Color", "values": ["White", "Black", "Navy"] } ], "variants": [ { "sku": "SHOP-OCT-WHT-M", "name": "White / M", "price": 4500, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Ulta Beauty Scraper — Produkte, Preise & SKUs - **URL:** https://proooxy.com/de/tools/ulta-scraper/ - **Typ:** tools - **Beschreibung:** Produktdetails, Preise, Bilder und SKU-Informationen von Ulta Beauty extrahieren — inklusive Kategorieseiten, Markenseiten und Sale-Bereichen. - **Zusammenfassung:** Vollständige Produktdaten von Ulta Beauty scrapen. - **Kategorie:** ecommerce - **Tech-Stack:** TypeScript, Cheerio, Crawlee - **Märkte / Regionen:** USA - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/ulta-scraper - **Keywords:** ulta scraper deutsch, ulta beauty scraper, ulta produktdaten, ulta preistracker, ulta sku scraper, ulta sale monitoring, beauty einzelhandel daten - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Unterstützt Kategorie-, Produktdetail-, Marken- und Sale-Seiten - Vollständige Produktdetails mit Preisen, Beschreibungen und Bildern - Datenextraktion auf SKU-Ebene mit Variantengruppierung - Automatische Erkennung des Seitentyps anhand der URL - Leichtgewichtiges Cheerio-basiertes Parsing für Geschwindigkeit - Gruppiert zusammengehörige SKUs unter demselben Produkt **Anwendungsfälle:** - Wettbewerbsanalyse in der Beauty-Branche — Preise von Ulta vs. Sephora - Aufbau von Produktkatalogen für Preisvergleichsplattformen - Sale- und Promotion-Monitoring - Markenerkennung und Tracking der Marktpräsenz - Bestandsüberwachung auf SKU-Ebene **Eingabeparameter:** - `startUrls` (array, erforderlich) — Ulta-Produkt-, Kategorie-, Marken- oder Sale-URLs - `proxy` (object, optional) — Proxy-Konfiguration - `maxConcurrency` (number, optional) — Maximale parallele Anfragen - `maxRequestsPerCrawl` (number, optional) — Limit für Gesamtanfragen pro Run **FAQ:** **Q: Welche Arten von Ulta-Seiten können gescraped werden?** Der Scraper unterstützt Produktdetailseiten, Kategorie-Listing-Seiten, Markenseiten und Sale-/Promotion-Seiten. Der Seitentyp wird automatisch anhand der URL erkannt. **Q: Wie werden Produktvarianten gehandhabt?** Varianten (unterschiedliche Farbtöne, Größen) werden unter demselben übergeordneten Produkt gruppiert. Jede Variante hat ihre eigene SKU, ihren eigenen Preis und Verfügbarkeitsstatus. ## Beispiel-Output ```json { "source": "https://www.ulta.com/p/...", "brand": "NYX Professional Makeup", "title": "Butter Gloss", "description": "A buttery soft and silky lip gloss...", "categories": ["Makeup", "Lips", "Lip Gloss"], "variants": [ { "sku": "ULTA-NYX-BG-001", "name": "Angel Food Cake", "price": 900, "currency": "USD", "inStock": true } ], "stats": { "rating": 4.5, "reviewCount": 8932 } } ``` --- # Universal Web Printer — URL & HTML zu PDF, Bild - **URL:** https://proooxy.com/de/tools/web-printer/ - **Typ:** tools - **Beschreibung:** Jede URL oder jedes HTML in PDF, PNG, JPEG oder WebP umwandeln — mit intelligentem Scroll-Stitching, Element-Extraktion, PDF-Verschlüsselung und Wasserzeichen. - **Zusammenfassung:** URLs und HTML in PDF, PNG, JPEG oder WebP umwandeln. - **Kategorie:** utility - **Tech-Stack:** TypeScript, Playwright, PDF-lib, Sharp - **Märkte / Regionen:** Weltweit - **Gemeldete Erfolgsquote:** >99% - **Apify-Eintrag:** https://apify.com/autofacts/universal-web-printer - **Keywords:** html zu pdf api, url zu pdf konverter, website screenshot api, webseite zu pdf, url zu bild, webseite zu png, pdf generierung api - **Veröffentlicht:** 2026-04-04 - **Geändert:** 2026-04-04 **Hauptfunktionen:** - Multi-Format-Output — PDF, PNG, JPEG, WebP - Mehrere Ansichtsmodi — Viewport, Full-Page, CSS-Selektor, Readability - Intelligentes Scroll-Stitching für präzise Full-Page-Aufnahmen - Extraktion auf Element-Ebene über CSS-Selektoren - Seitenmanipulation — Elemente entfernen, Buttons klicken, CSS injizieren, fixierte Header ausblenden - PDF-Verschlüsselung (RC4 128-Bit) und Wasserzeichen - PDF-Merging für mehrseitige Dokumente - Konfigurierbarer Viewport und Skalierungsfaktor **Anwendungsfälle:** - Automatisierte Report-Generierung aus Web-Dashboards - Website-Archivierung und -Dokumentation - Snapshots für visuelle Regressionstests - Screenshots von E-Commerce-Produktseiten für Kataloge - Rechtliche Compliance — Web-Inhalte als Beweismittel festhalten - Generierung von PDFs aus Webanwendungen **Eingabeparameter:** - `startUrls` (array, optional) — Zu rendernde URLs - `htmlContent` (string, optional) — Rohes HTML zum Rendern - `outputFormat` (string, optional) — pdf, png, jpeg oder webp (Standard: pdf) - `viewMode` (string, optional) — viewport, fullPage, selector oder readability - `targetSelector` (string, optional) — CSS-Selektor für die Aufnahme auf Element-Ebene - `viewportWidth` (number, optional) — Viewport-Breite des Browsers (Standard: 1280) - `viewportHeight` (number, optional) — Viewport-Höhe des Browsers (Standard: 720) - `removeSelectors` (array, optional) — CSS-Selektoren von Elementen, die vor der Aufnahme entfernt werden - `pdfPassword` (string, optional) — PDF mit RC4-128-Bit-Verschlüsselung verschlüsseln **FAQ:** **Q: Kann ich nur ein bestimmtes Element der Seite erfassen?** Ja, den Parameter targetSelector mit einem CSS-Selektor nutzen, um nur ein bestimmtes Element zu erfassen. Zum Beispiel „#main-content” verwenden, um nur den Hauptinhaltsbereich zu erfassen. **Q: Wie funktioniert intelligentes Scroll-Stitching?** Bei Full-Page-Aufnahmen scrollt das Tool die Seite in Schritten, erfasst jede Viewport-Scheibe und fügt sie anschließend zusammen. So werden lazy-geladene Inhalte und Animationen korrekt erfasst. **Q: Kann ich Cookie-Banner oder Werbung vor der Aufnahme entfernen?** Ja, removeSelectors nutzen, um CSS-Selektoren der zu entfernenden Elemente anzugeben. Zusätzlich lässt sich hideFixedElements nutzen, um sticky Header und schwebende Elemente auszublenden. ## Beispiel-Output Das Tool erzeugt Dateien im gewählten Format (PDF, PNG, JPEG oder WebP) und speichert sie im Apify-Dataset. Jeder Output enthält Metadaten: ```json { "url": "https://example.com", "format": "pdf", "fileName": "example-com.pdf", "fileSize": 245832, "viewMode": "fullPage", "viewport": { "width": 1280, "height": 720 }, "encrypted": false } ``` --- # Web-Scraping Best Practices 2026: Ein Leitfaden aus der Praxis - **URL:** https://proooxy.com/de/blog/web-scraping-best-practices-2026/ - **Typ:** blog - **Beschreibung:** Praxiserprobte Web-Scraping-Strategien aus über 12 Jahren Produktionserfahrung — Architekturmuster, Fehlerbehandlung, Proxy-Management und Output-Normalisierung. - **Keywords:** web scraping best practices deutsch, produktionsreife scraper bauen, datenextraktion leitfaden, scraper architektur, web scraping fehlerbehandlung, proxy management scraping - **Veröffentlicht:** 2026-04-01 - **Geändert:** 2026-04-01 Nach dem Aufbau und Betrieb von 15 produktionsreifen Scrapern, die über 3.100 Nutzer mit >99% Erfolgsquote bedienen, hier die Praktiken, die wirklich zählen. ## Architektur: In Pipelines denken, nicht in Skripten Der größte Fehler, den ich immer wieder sehe: Scraping als Ein-Schritt-Prozess zu behandeln. Produktionsreife Scraper sind Datenpipelines: 1. **URL-Erkennung** — finden, was gescraped werden soll (Sitemaps, Kategorieseiten, Suche, APIs) 2. **Request-Ausführung** — Daten abrufen, mit sauberem Retry und Rotation 3. **Parsing** — strukturierte Felder aus Rohantworten extrahieren 4. **Normalisierung** — Output bereinigen, validieren und standardisieren 5. **Speicherung** — in Datasets, Datenbanken oder nachgelagerte Systeme schreiben Jeder Schritt sollte unabhängig testbar und wiederholbar sein. Wenn Sephora das Layout der Produktseite ändert, muss nur Schritt 3 angepasst werden — der Rest der Pipeline bleibt stabil. ## APIs immer HTML-Parsing vorziehen Bevor auch nur ein einziger CSS-Selektor geschrieben wird: prüfen, ob die Seite Folgendes bietet: - **Öffentliche APIs** — dokumentierte Endpunkte, die JSON zurückgeben - **Private APIs** — XHR-/Fetch-Calls, sichtbar in den Browser-DevTools - **GraphQL-Endpunkte** — zunehmend verbreitet, oft mit aktivierter Introspection - **Eingebettetes JSON** — `__NEXT_DATA__`, `window.__INITIAL_STATE__` oder JSON-LD im HTML API-Antworten sind strukturiert, versioniert und deutlich stabiler als HTML-Layouts. Mein [Sephora Scraper](/de/tools/sephora-scraper/) wandelt jede Web-URL in einen API-Call um — er ist noch nie wegen eines Frontend-Redesigns kaputtgegangen. ## Proxy-Strategie: Passend zum Schutzniveau Nicht jede Seite braucht Residential Proxys. Hier mein Entscheidungsraster: | Schutzniveau | Proxy-Typ | Beispiel-Sites | |-----------------|------------|---------------| | Keins / Basic | Rechenzentrum | Die meisten Shopify-Shops, kleine Seiten | | Rate-Limiting | Rotierendes Rechenzentrum | Mittlerer E-Commerce, Content-Seiten | | Fingerprinting | Residential | Sephora, Farfetch, große Marken | | Erweiterte WAF | Residential + TLS-Fingerprint | Akamai, Cloudflare Enterprise | Die Kernerkenntnis: **Proxy-Kosten skalieren mit dem Schutzniveau**. Kein Geld für Residential Proxys verschwenden, wenn eine Seite nur die IP-Reputation prüft. Mein [Shopify Scraper](/de/tools/shopify-scraper/) läuft problemlos mit Rechenzentrums-Proxys, weil Shopifys Standardschutz minimal ist. ## Session-Management ist alles Der Unterschied zwischen 60% und 99% Erfolgsquote liegt meist im Session-Management: - **Sessions rotieren, nicht nur IPs** — eine neue IP mit denselben Cookies wirkt verdächtig - **Sessions aufwärmen** — die Startseite besuchen, bevor Produktseiten angefragt werden - **Rate Limits respektieren** — 5 gleichzeitige Anfragen schlagen 50, die geblockt werden - **Exponential Backoff** — Retries nach 1s, 2s, 4s, 8s, nicht sofort erneut versuchen Mein [Sephora-EU-Scraper](/de/tools/sephora-eu-scraper/) verwaltet Guest-Token mit automatischem Refresh und Exponential Backoff. Er hält persistente Sessions aufrecht, die wie echte Browsing-Muster aussehen. ## Output normalisieren Rohe gescrapte Daten sind unordentlich. Alles normalisieren: ### Preise Als Integer speichern (Cent, nicht Euro/Dollar). `$29.99` wird zu `2999`. Das vermeidet Floating-Point-Präzisionsfehler, die Finanzdaten nachgelagert verfälschen. Jeder meiner E-Commerce-Scraper nutzt diese Konvention. ### URLs Immer absolute URLs speichern, nie relative Pfade. Zum Zeitpunkt der Extraktion auflösen. ### Datumsangaben ISO 8601 (`2026-04-01T00:00:00Z`), immer mit Zeitzone. Niemals lokal formatierte Datumswerte speichern. ### Text Überschüssige Leerzeichen entfernen, Unicode normalisieren und eine HTML-Handling-Policy festlegen (Tags entfernen vs. Formatierung erhalten). ## Fehlerbehandlung: Mit Fehlschlägen rechnen Produktionsreife Scraper scheitern ständig — die Frage ist, wie elegant. Mein Ansatz: ``` Request fails (network error, timeout, 4xx/5xx) → Retry with exponential backoff (up to 5 attempts) → Rotate session/proxy on retry → Log failure with full context if all retries exhausted → Continue processing remaining URLs (don't crash the batch) ``` Erfolgsquoten pro URL-Muster nachverfolgen. Wenn `/category/*`-Seiten plötzlich unter 90% Erfolgsquote fallen, hat sich auf der Seite wahrscheinlich etwas geändert — das fällt auf, bevor Nutzer es melden. ## Monitoring und Alerting Ein Scraper ohne Monitoring ist ein Scraper, der nur darauf wartet, still zu versagen. Nachverfolgen: - **Erfolgsquote** pro Run und pro URL-Muster - **Output-Anzahl** — plötzliche Einbrüche bedeuten, dass etwas kaputt ist - **Datenqualität** — Null-Felder, unerwartete Werte, Schema-Verletzungen - **Kosten** — Proxy-Nutzung, Rechenzeit, Storage Alle meine Apify-Actors stellen diese Metriken bereit. Sinkt die Erfolgsquote, werde ich innerhalb von Stunden benachrichtigt — oft bevor es einem Nutzer auffällt. ## Einfach starten, Komplexität nach Bedarf hinzufügen Jeder Scraper, den ich baue, startet als die einfachste Lösung, die funktioniert: 1. **HTTP + Cheerio** zuerst (am schnellsten, am günstigsten) 2. **Fingerprinting ergänzen** nur bei Blockaden 3. **Browser-Rendering ergänzen** nur wenn JavaScript erforderlich ist 4. **Proxy-Rotation ergänzen** nur bei Rate-Limiting Mein [Ulta Scraper](/de/tools/ulta-scraper/) ist reines Cheerio — kein Browser nötig. Mein [Universal Web Printer](/de/tools/web-printer/) nutzt Playwright, weil er JavaScript rendern muss. Das richtige Werkzeug für die jeweilige Aufgabe. --- Das sind keine theoretischen Prinzipien — sie stammen aus produktiven Scrapern im Live-Betrieb, die Millionen von Anfragen verarbeiten. Für einen individuellen Scraper nach diesen Prinzipien — [jetzt Kontakt aufnehmen](/de/contact/). --- # Anti-Bot-Schutz verstehen: Was 2026 funktioniert - **URL:** https://proooxy.com/de/blog/bypassing-anti-bot-protection-guide/ - **Typ:** blog - **Beschreibung:** Ein technischer Deep-Dive in moderne Anti-Bot-Systeme — Cloudflare, Akamai, Datadome — und die legitimen Bypass-Techniken, die im produktiven Scraping eingesetzt werden. - **Keywords:** anti-bot bypass anleitung, cloudflare bypass deutsch, akamai bypass techniken, datadome umgehen, bot erkennung umgehen, web scraping schutz umgehen - **Veröffentlicht:** 2026-03-15 - **Geändert:** 2026-03-15 Anti-Bot-Schutz ist ein Wettrüsten. Als jemand, der täglich produktionsreife Scraper baut, die diese Systeme umgehen, hier ein Praktiker-Blick auf die Landschaft — was die Schutzmechanismen tatsächlich prüfen und wie legitime Bypass-Techniken aussehen. ## Die Erkennungsebenen Moderne Anti-Bot-Systeme arbeiten in Schichten. Diese Schichten zu verstehen, ist der Schlüssel zu zuverlässigem Bypass: ### Layer 1: IP-Reputation Die einfachste Prüfung. Anti-Bot-Dienste pflegen Datenbanken bekannter Rechenzentrums-IP-Bereiche, VPN-Exits und bereits markierter IPs. **Was geprüft wird:** - Stammt diese IP von AWS, GCP, Azure oder einem bekannten Hosting-Anbieter? - Wurde diese IP schon einmal wegen Bot-Aktivität markiert? - Wie viele Anfragen kamen zuletzt von dieser IP? **Gegenstrategie:** Residential Proxys von Diensten wie Apify Proxy oder Bright Data liefern IP-Adressen, die echten ISPs gehören — auf IP-Ebene nicht von normalen Nutzern zu unterscheiden. ### Layer 2: TLS-Fingerprinting Hier wird es interessant. Jeder HTTP-Client hat eine einzigartige TLS-Handshake-Signatur, basierend auf: - Unterstützten Cipher Suites und ihrer Reihenfolge - TLS-Erweiterungen und ihrer Reihenfolge - Unterstützten TLS-Versionen - ALPN-Protokollen Eine Standard-Bibliothek wie `axios` oder `requests` hat einen TLS-Fingerprint, der förmlich „Bot" schreit, weil er zu keinem echten Browser passt. Dienste wie Akamai und Cloudflare pflegen Fingerprint-Datenbanken für jede Browser-Version. **Gegenstrategie:** Bibliotheken wie `got-scraping` (die mein [Shopify Scraper](/de/tools/shopify-scraper/) nutzt) und spezialisierte TLS-Clients können browserechte TLS-Fingerprints nachbilden. Mein [Sephora-EU-Scraper](/de/tools/sephora-eu-scraper/) nutzt browserechtes TLS-Fingerprinting, um Akamai WAF zu umgehen. ### Layer 3: HTTP/2-Fingerprinting Über TLS hinaus verraten HTTP/2-Einstellungen den Client-Typ: - SETTINGS-Frame-Parameter (Header-Table-Size, maximale gleichzeitige Streams) - WINDOW_UPDATE-Frame-Werte - Priority-Tree-Struktur - Header-Kompressionsmuster (HPACK) Jeder Browser hat charakteristische HTTP/2-Einstellungen. Chrome, Firefox und Safari sehen auf dieser Ebene alle unterschiedlich aus. ### Layer 4: JavaScript-Challenges Cloudflares „checking your browser"-Seite und ähnliche Challenges führen JavaScript aus, das: - Browser-APIs prüft (Canvas, WebGL, AudioContext) - Ausführungszeiten misst - DOM-Eigenschaften validiert - Challenge-Antworten zurück an den Server sendet **Gegenstrategie:** Headless-Browser (Playwright, Puppeteer) führen diese Challenges nativ aus. Entscheidend ist, dass der Headless-Browser keine Automatisierungssignale leakt (dazu mehr weiter unten). ### Layer 5: Verhaltensanalyse Die ausgefeilteste Ebene. Diese Systeme analysieren: - Mausbewegungsmuster (zu linear = Bot) - Scroll-Verhalten (sofortiges Scrollen zum Seitenende = Bot) - Zeit zwischen Aktionen (zu konstant = Bot) - Navigationsmuster (direkter Sprung zu Produktseiten ohne vorheriges Browsen = verdächtig) - Anfragetakt (perfekt gleichmäßige Intervalle = Bot) ## Schutzprofile: Wissen, womit man es zu tun hat ### Cloudflare **Häufig bei:** Kleinen bis mittleren Websites, Blogs, APIs Cloudflare bietet mehrere Schutzstufen: - **Basic** — IP-Reputation + Rate-Limiting. Rechenzentrums-Proxys mit angemessenem Anfragetempo funktionieren meist. - **Managed Challenge** — JavaScript-Challenge + Turnstile. Erfordert Browser oder Challenge-Solver. - **Enterprise/Bot Management** — Vollständige Verhaltensanalyse + Fingerprinting. Erfordert Residential Proxy + korrektes Fingerprinting. ### Akamai Bot Manager **Häufig bei:** Enterprise-E-Commerce (Sephora EU, große Handelsketten) Akamai gehört zu den am schwersten zu umgehenden Systemen, aufgrund von: - Aggressivem TLS-Fingerprinting - Sensordatenerfassung über clientseitiges JavaScript - Verhaltensanalyse auf Session-Ebene - Cookie-Integritätsprüfung Mein Ansatz für Akamai: browserechtes TLS-Fingerprinting + Guest-Token-Management + Anfrage-Timing, das menschliches Browsing nachahmt. ### Datadome **Häufig bei:** E-Commerce, Ticketing Datadome konzentriert sich auf: - Device-Fingerprinting über JavaScript - CAPTCHA-Challenges bei verdächtigem Traffic - Echtzeit-Verhaltensscoring ### PerimeterX (jetzt HUMAN) **Häufig bei:** Einzelhandel, Finanzdienstleistungen Bekannt für aggressive JavaScript-Challenges und Verhaltensanalyse. ## Architektur für legitimen Bypass Für produktive Systeme, die zuverlässige, laufende Datenextraktion brauchen, hier das Architekturmuster, das ich verwende: ### 1. API-First-Ansatz Bevor überhaupt versucht wird, einen Schutzmechanismus zu umgehen: prüfen, ob es einen API-Pfad gibt, der die WAF komplett umgeht. Viele Schutzmechanismen gelten nur für browserseitige Endpunkte, nicht für API-Routen. Mein [Sephora Scraper](/de/tools/sephora-scraper/) wandelt jede Web-URL in einen API-Call um. Die API-Endpunkte sind schwächer geschützt als die Website, weil sie für mobile Apps ausgelegt sind. ### 2. Session-Warming Nicht direkt zur Datenseite springen. Eine realistische Browsing-Session aufbauen: ``` Visit homepage → Browse categories → View product listing → Access product detail ``` Jeder Schritt baut Session-Glaubwürdigkeit auf. Das Anti-Bot-System sieht ein Muster, das echtem Nutzerverhalten entspricht. ### 3. Fingerprint-Konsistenz Das ist entscheidend: Der Fingerprint muss **intern konsistent** sein. Wenn das TLS „Chrome 120" sagt, der User-Agent aber „Chrome 118", ist das ein Erkennungssignal. Aufeinander abstimmen: - TLS-Fingerprint - HTTP/2-Einstellungen - User-Agent-Header - Accept-Language und andere Header - JavaScript-Browser-Eigenschaften (bei Headless-Einsatz) ### 4. Anfrage-Timing Echte Menschen stellen keine Anfragen in exakt 1-Sekunden-Intervallen. Realistische Varianz einbauen: - Grundverzögerung zwischen Anfragen (2–5 Sekunden) - Zufälliger Jitter (+/- 30%) - Längere Pausen nach Navigationsereignissen - Gelegentliche „Idle"-Phasen ### 5. Graceful Degradation Bei einer Challenge oder Blockade: 1. Nicht sofort erneut versuchen — das bestätigt Bot-Verhalten 2. Exponentiell zurückfahren 3. Zu einer frischen Session wechseln (neue IP + neue Cookies) 4. Eine andere Proxy-Region probieren 5. Bei anhaltendem Problem auf einen browserbasierten Ansatz wechseln ## Was (nicht mehr) funktioniert - **Nur den User-Agent ändern** — Erkennungssysteme prüfen Dutzende Signale, nicht nur einen Header - **Zufällige Verzögerungen allein** — ohne korrektes Fingerprinting bringt Timing nichts - **Headless Chrome mit Standardeinstellungen** — Automatisierungssignale leaken überall (`navigator.webdriver`, fehlende Plugins, Chrome-DevTools-Protocol-Artefakte) - **Cookie Replay** — moderne Systeme koppeln Cookies an TLS-Fingerprints und IP-Bereiche ## Ethische Überlegungen Anti-Bot-Bypass ist ein Werkzeug. Wie jedes Werkzeug kann es verantwortungsvoll oder unverantwortlich eingesetzt werden. **Legitime Anwendungsfälle:** - Preisvergleiche im Verbraucherinteresse - Marktforschung mit öffentlichen Daten - Barrierefreiheit (Daten in strukturierten Formaten verfügbar machen) - Akademische Forschung - Qualitätssicherung und Monitoring **Immer beachten:** - robots.txt-Direktiven - Rate Limits (auch wenn sie technisch überschritten werden könnten — nicht tun) - Datenschutzbestimmungen (DSGVO, CCPA) - Nutzungsbedingungen (die Rechtslage in der jeweiligen Jurisdiktion prüfen) Alle meine [Tools](/de/tools/) sind für legitime Datenextraktion ausgelegt, mit eingebautem Rate-Limiting und Proxy-Best-Practices. --- Wer Anti-Bot-Systeme versteht, wird zum besseren Scraping-Engineer. Wer produktionsreife Scraper braucht, die diese Herausforderungen zuverlässig meistern, findet sie in den [Tools](/de/tools/) — oder [nimmt Kontakt auf](/de/contact/) für individuelle Arbeit. --- # Kontakt - **URL:** https://proooxy.com/de/contact/ - **Typ:** page - **Beschreibung:** Individuellen Scraper oder RAG-Datenpipeline beauftragen — reverse-engineerte private APIs, Anti-Bot-Bypass und sauberes, strukturiertes JSON, geliefert direkt in den bestehenden KI-Stack. - **Keywords:** web scraping entwickler engagieren, individuelle scraper entwicklung, web scraping dienstleistung, rag datenpipeline entwicklung, datenextraktion service, web scraping berater - **Veröffentlicht:** 0001-01-01 - **Geändert:** 0001-01-01 ## Daten, die nicht im Katalog stehen Ich baue maßgeschneiderte Web-Scraper und RAG-Datenpipelines — für KI-Teams, Datenplattformen und alle, die das offene Web als sauberes, strukturiertes JSON brauchen. Ob einmalige Datenlieferung oder fortlaufend aktualisierter Feed — ich helfe weiter. ### Was ich baue - **Individuelle Scraper** — maßgeschneidert für die jeweiligen Zielseiten, mit eingebautem Anti-Bot-Bypass - **RAG-Datenpipelines** — Extraktion, Normalisierung, Chunking und Auslieferung von retrieval-fertigem JSON in die eigene Vektordatenbank oder das eigene Warehouse - **Reverse Engineering privater APIs** — die Umwandlung undokumentierter Mobile-/Web-Endpunkte in stabile, strukturierte Quellen - **Scraper-Wartung** — bestehende Extraktoren am Laufen halten, wenn sich Zielseiten ändern - **Technische Beratung** — Architektur-Review für den bestehenden Scraping- und Daten-Ingestion-Stack ### Ablauf 1. **Daten beschreiben** — Quelle, benötigte Felder und Lieferformat 2. **Kostenlose Machbarkeitsprüfung** — ich analysiere Komplexität und Anti-Bot-Schutz der Zielseite kostenlos 3. **Angebot & Zeitplan** — klarer Scope, Festpreis, Liefertermin 4. **Umsetzung & Auslieferung** — produktionsreifer Extraktor mit Dokumentation und sauberem Output ### Projekt starten
### Oder direkter Kontakt - **E-Mail**: [p8p9cmk96@mozmail.com](mailto:p8p9cmk96@mozmail.com) - **GitHub**: [@autofacts](https://github.com/autofacts) - **Apify**: [apify.com/autofacts](https://apify.com/autofacts) --- # Über mich - **URL:** https://proooxy.com/de/about/ - **Typ:** page - **Beschreibung:** Richard Feng — Web-Scraping-Engineer mit über 12 Jahren Erfahrung. Ich verwandle geschützte Websites in saubere, RAG-fertige strukturierte Daten für KI-Agenten, Retrieval-Pipelines und LLMs. - **Keywords:** web scraping entwickler, datenextraktion berater, individuelle scraper entwicklung, anti-bot bypass experte, rag datenpipeline berater, api reverse engineering deutschland - **Veröffentlicht:** 0001-01-01 - **Geändert:** 0001-01-01 ## Wer ich bin Ich bin Richard Feng, freiberuflicher Web-Automatisierungs-Engineer mit über 12 Jahren Programmiererfahrung. Meine Spezialgebiete sind **Web-Scraping, Datenextraktion und API-Reverse-Engineering** — die Umwandlung komplexer, geschützter Websites in saubere, strukturierte Daten, die KI-Systeme tatsächlich nutzen können. Mein Werkzeugkasten umfasst **Node.js (TypeScript), Python, Go und Java**, mit tiefgehender Expertise in **Crawlee, Playwright und Cheerio**. Ich habe produktionsreife Systeme gebaut, die Millionen von Anfragen bei **>99% Erfolgsquote** verarbeiten. ## Was ich mache Ich entwickle und betreue **16 produktionsreife Apify-Actors**, die über **3.100 Nutzer** bei konstant **>99% Run-Erfolgsquote** bedienen. Jeder Actor liefert sauberes, **RAG-fertiges JSON** — schemakonsistent, dedupliziert und bereit für den Einsatz in einer Vektordatenbank, Retrieval-Pipeline oder als Trainingsdatensatz. Die meisten Actors für öffentliche Daten benötigen keinen API-Key. Meine Arbeit erstreckt sich über vier Bereiche: ### E-Commerce & Einzelhandelsdaten Scraper für führende Beauty- und Fashion-Plattformen, darunter [Sephora](/de/tools/sephora-scraper/) (21 globale Storefronts), [Ulta Beauty](/de/tools/ulta-scraper/), [Farfetch](/de/tools/farfetch-scraper/), [Lululemon](/de/tools/lululemon-scraper/), [Boohoo](/de/tools/boohoo-scraper/), [Macy's](/de/tools/macys-scraper/) sowie ein universeller [Shopify Scraper](/de/tools/shopify-scraper/), der mit jedem Shopify-Shop funktioniert. ### Öffentliche, Finanz- und Rechtsdaten Offizielle US-Datensätze als sauberes, RAG-fertiges JSON — [SEC-EDGAR-Filings & XBRL-Finanzdaten](/de/tools/sec-edgar-scraper/), [USAspending.gov-Bundesvergaben](/de/tools/usaspending-scraper/), [CourtListener-Gerichtsentscheidungen](/de/tools/courtlistener-scraper/) und [ClinicalTrials.gov-Studien](/de/tools/clinical-trials-scraper/). ### Social-Media-Intelligence [Bluesky](/de/tools/bluesky-scraper/)-Beiträge, -Profile und -Interaktionen über das AT Protocol, dazu ein [YouTube-Untertitel- & Transkript-Scraper](/de/tools/youtube-transcript-scraper/), der JSON, SRT, VTT oder LLM-fertigen Text in über 100 Sprachen ausgibt. ### Entwickler-Tools Tools jenseits des Scrapings — [SEO-Audits & strukturierte Daten](/de/tools/schema-markup-scraper/), [Web-to-PDF/Bild-Rendering](/de/tools/web-printer/) und [Hochleistungs-Lasttests](/de/tools/load-tester/). ## Spezialgebiete - **Reverse Engineering privater APIs** — die Umwandlung undokumentierter Mobile-/Web-Endpunkte in zuverlässige Datenquellen - **Anti-Bot-Bypass** — Cloudflare, DataDome, Akamai WAF und individuelle Schutzmechanismen - **RAG-fertiger Output** — normalisiertes, schemakonsistentes JSON für Retrieval und Grounding - **Multi-Region-Scraping** — Locales, Währungen und Compliance inklusive - **Hochzuverlässige Systeme** — Extraktoren, die auch im großen Maßstab >99% Erfolgsquote halten ## Tech-Stack | Kategorie | Technologien | |----------|-------------| | Sprachen | TypeScript, Python, Go, Java | | Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping | | Anti-Bot | Fingerprint generators, TLS fingerprinting, session rotation | | Infrastruktur | Apify Platform, Docker, GitHub Actions | | Testing | Vegeta, custom load-testing frameworks | ## Zusammenarbeit Ich biete maßgeschneiderte Scraping-Lösungen, RAG-Datenpipeline-Engineering und laufende Datenextraktions-Services. Wenn eine KI das echte Web als saubere Daten braucht — [jetzt Kontakt aufnehmen](/de/contact/). ---