# Proooxy — Data Web Siap-RAG untuk Agen AI & LLM — Konten Lengkap (llms-full.txt) > Data web terstruktur dan siap-RAG untuk agen AI, pipeline retrieval, dan LLM. Richard Feng membangun Apify Actor kelas produksi untuk e-commerce, laporan SEC/EDGAR, belanja federal, putusan pengadilan, uji klinis, serta data sosial dan video — menembus proteksi anti-bot, JSON bersih dengan skema konsisten, tanpa API key untuk data publik. File ini adalah gabungan satu dokumen dari setiap halaman publik di https://proooxy.com/id/, ditujukan untuk di-ingest langsung oleh LLM dan agen AI. Setiap halaman didahului oleh fact-block berisi frontmatter terstruktur (URL, type, category, technology, regions, dates) dan diikuti oleh isi Markdown lengkapnya. Dihasilkan otomatis dari situs live. --- ## Metadata situs - **Situs:** Proooxy — Data Web Siap-RAG untuk Agen AI & LLM - **URL:** https://proooxy.com/id/ - **Deskripsi:** Data web terstruktur dan siap-RAG untuk agen AI, pipeline retrieval, dan LLM. Richard Feng membangun Apify Actor kelas produksi untuk e-commerce, laporan SEC/EDGAR, belanja federal, putusan pengadilan, uji klinis, serta data sosial dan video — menembus proteksi anti-bot, JSON bersih dengan skema konsisten, tanpa API key untuk data publik. - **Penulis:** Richard Feng - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **Tools:** 17 Apify Actor produksi - **Postingan:** 2 - **Terakhir dibuat:** 2026-08-04 --- ## Indeks katalog tools - [Macy's Scraper — Produk, Harga, SKU & Berita](https://proooxy.com/id/tools/macys-scraper/) — Produk, harga, SKU/UPC & berita Macy's — tahan Akamai, tanpa browser. - [Bluesky Scraper — Postingan, Profil, Feed & Interaksi](https://proooxy.com/id/tools/bluesky-scraper/) — Scrape postingan, profil, feed, dan interaksi Bluesky. - [ClinicalTrials.gov Scraper — Studi, Kelayakan & Hasil](https://proooxy.com/id/tools/clinical-trials-scraper/) — Cari studi, kelayakan, dan hasil ClinicalTrials.gov. - [CourtListener Scraper — Putusan, Berkas Perkara & Teks Lengkap](https://proooxy.com/id/tools/courtlistener-scraper/) — Case law AS, docket, dan teks putusan lengkap untuk legal AI. - [SEC EDGAR Scraper — Laporan, Teks Lengkap & Data Keuangan XBRL](https://proooxy.com/id/tools/sec-edgar-scraper/) — Laporan SEC, teks 10-K/10-Q, dan data keuangan XBRL — siap-RAG. - [USAspending.gov Scraper — Dana Federal, Penerima & Agregat](https://proooxy.com/id/tools/usaspending-scraper/) — Dana federal, penerima, dan agregat belanja dari USAspending.gov. - [YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/id/tools/youtube-transcript-scraper/) — Transcript YouTube sebagai JSON, SRT, VTT, atau teks siap-LLM. - [Sephora Scraper (Global)](https://proooxy.com/id/tools/sephora-scraper/) — Scrape storefront Sephora mana pun — 21 pasar, satu actor. - [Boohoo Scraper — Data Produk di 7 Wilayah](https://proooxy.com/id/tools/boohoo-scraper/) — Scrape data produk Boohoo dari 7 toko regional. - [Farfetch Scraper — Data Produk Fashion Mewah](https://proooxy.com/id/tools/farfetch-scraper/) — Scrape produk fashion mewah dari Farfetch dengan dukungan multi-mata uang. - [Global API Load Tester — Stress Test 10K+ RPS](https://proooxy.com/id/tools/load-tester/) — Simulasikan 10K+ RPS dengan load testing geo-distributed. - [Lululemon Scraper — Produk, Varian & Harga](https://proooxy.com/id/tools/lululemon-scraper/) — Ekstrak data produk lengkap dengan varian dan media dari Lululemon. - [Schema Markup Scraper & Auditor SEO](https://proooxy.com/id/tools/schema-markup-scraper/) — Ekstrak structured data dan audit SEO untuk situs web mana pun. - [Sephora EU Scraper — 9 Pasar Eropa](https://proooxy.com/id/tools/sephora-eu-scraper/) — Ekstrak data produk dari Sephora di 9 pasar Eropa. - [Shopify Scraper — Data Produk dari Toko Manapun](https://proooxy.com/id/tools/shopify-scraper/) — Ekstrak data produk dari toko Shopify mana pun. - [Ulta Beauty Scraper — Produk, Harga & SKU](https://proooxy.com/id/tools/ulta-scraper/) — Scrape data produk lengkap dari Ulta Beauty. - [Universal Web Printer — URL & HTML ke PDF, Gambar](https://proooxy.com/id/tools/web-printer/) — Konversi URL dan HTML ke PDF, PNG, JPEG, atau WebP. --- # Macy's Scraper — Produk, Harga, SKU & Berita - **URL:** https://proooxy.com/id/tools/macys-scraper/ - **Tipe:** tools - **Deskripsi:** Ekstrak data produk Macy's — harga, varian, barcode SKU/UPC, gambar, rating & ulasan — plus berita Macy's Inc., dari URL search, kategori, trending, dan produk. Tanpa browser, tahan Akamai. - **Ringkasan:** Produk, harga, SKU/UPC & berita Macy's — tahan Akamai, tanpa browser. - **Kategori:** ecommerce - **Tech stack:** TypeScript, Crawlee, Cheerio - **Pasar / wilayah:** Amerika Serikat - **Listing Apify:** https://apify.com/autofacts/macy-s-scraper - **Kata Kunci:** scraper macys, data produk macy's, monitoring harga macys, scraper department store, data sku upc macys, scraper ulasan macys, data produk retail - **Diterbitkan:** 2026-07-15 - **Diperbarui:** 2026-07-15 **Fitur utama:** - Empat surface dalam satu actor — product search, category, trending, dan berita Macy's Inc. - Mengalahkan Akamai Bot Manager tanpa browser dengan memakai JSON API mobile & website milik Macy's sendiri - Barcode UPC per-SKU lengkap dengan warna, ukuran, ketersediaan, dan harga untuk setiap varian yang bisa dibeli - Harga sebagai integer cents plus string berformat lokal — tanpa pembulatan floating-point - Review intelligence lengkap — histogram bintang, recommend count, dan rating fit/size sekunder - Semua shade dan ukuran dikelompokkan di bawah satu product record, bukan satu baris per varian - Hanya canonical URL yang bersih — endpoint API internal dan client key tidak pernah bocor ke output - Satu skema yang dinormalisasi untuk hasil search, category, trending, dan product-detail **Use case:** - Monitoring harga dan promosi department store di level SKU - Analisis kompetitif — harga Macy's vs Nordstrom, Ulta, atau brand DTC - Pencocokan katalog lintas peritel via barcode UPC per-varian - Review dan rating intelligence untuk brand yang dijual di Macy's - Monitoring berita retail — press release dan pengumuman earnings Macy's Inc. **Parameter input:** - `scrapeType` (string, wajib) — Surface yang mau di-scrape: search, category, trending, news, atau all (default: search). - `query` (string, opsional) — Keyword untuk product search, contoh: women shoes. - `startUrls` (array, opsional) — URL produk/kategori Macy's atau URL berita Macy's Inc. - `categoryIds` (array, opsional) — Category ID Macy's (contoh: 5449). URL kategori lebih disarankan jika sudah diketahui. - `trendingUrls` (array, opsional) — URL listing trending, bestseller, atau curated. - `newsUrls` (array, opsional) — URL listing berita atau artikel Macy's Inc. - `includeProductDetails` (boolean, opsional) — Perkaya item listing dengan detail produk lengkap — varian, SKU, galeri (default: true). - `maxPages` (number, opsional) — Kedalaman paginasi maksimum per sumber listing/news. - `maxResults` (number, opsional) — Batas jumlah record output. 0 = tanpa batas. - `proxy` (object, wajib) — Apify Proxy atau URL proxy custom. Residential, country US disarankan. **FAQ:** **Q: Bagaimana cara melewati Akamai tanpa browser?** Actor ini sama sekali tidak melawan JS challenge-nya. Listing berasal dari API aplikasi mobile Macy's, dan detail produk dari JSON API website — keduanya berjalan di infrastruktur terpisah yang menjawab read request anonim. Tanpa login, tanpa cookie, tanpa API key. **Q: Apakah harganya dalam dolar atau sen?** Integer cents (5999 = $59.99) untuk menghindari pembulatan floating-point, berdampingan dengan string berformat lokal ($59.99). **Q: Bagaimana varian dan UPC ditangani?** Semua warna dan ukuran dikelompokkan di bawah satu product record dengan array variants[]. Setiap varian membawa barcode UPC, warna, ukuran, ketersediaan, dan harganya masing-masing — diperoleh dari data relasi SKU milik Macy's, bukan di-scrape dari swatch widget. **Q: Bisakah saya men-scrape produk dan berita dalam satu run?** Bisa. Set scrapeType ke all dan berikan kombinasi apa pun dari query, startUrls, categoryIds, trendingUrls, dan newsUrls. ## Contoh Output ```json { "type": "product", "source": { "id": "12345678", "canonicalUrl": "https://www.macys.com/shop/product/calvin-klein-womens-sheath-dress?ID=12345678", "retailer": "macys", "currency": "USD" }, "title": "Women's Sleeveless Sheath Dress", "brand": "Calvin Klein", "categories": ["Women", "Dresses", "Work Dresses"], "price": { "sale": 5999, "list": 9800, "currentFormatted": "$59.99", "stockStatus": "InStock" }, "stats": { "rating": 4.6, "reviewCount": 9, "ratingPercentage": 92 }, "options": [ { "type": "Color", "values": [{ "id": "1", "name": "Black" }] }, { "type": "Size", "values": [{ "id": "10", "name": "M" }, { "id": "12", "name": "L" }] } ], "variants": [ { "id": "987654", "sku": "192837465012", "options": ["Black", "M"], "price": { "stockStatus": "InStock" }, "extraInfo": { "upc": "192837465012" } } ], "medias": [{ "type": "Image", "url": "https://slimages.macysassets.com/is/image/MCY/products/.../main.jpg" }] } ``` ## Harga Pay-per-event — Anda hanya dikenakan biaya untuk item yang benar-benar tersimpan: | Event | Harga | Yang dicakup | |---|---|---| | Produk di-scrape | $0.006 | Satu produk dengan detail lengkap — varian, SKU/UPC, harga, gambar, rating | | Artikel di-scrape | $0.002 | Satu artikel berita Macy's Inc. — judul, penulis, tanggal, isi, gambar | Diskon volume berlaku otomatis di plan Apify yang lebih tinggi (turun hingga $0.0045 per produk). Crawl 1,000-produk berharga ~$6.00 pada harga normal. ## Tips - **Gunakan residential proxy US.** Endpoint product-detail sesekali kena rate limit; rotasi sesi residential berhasil melewatinya dengan lancar, sementara IP datacenter lebih sering kena 403. - **Jaga concurrency tetap moderat.** `maxConcurrency` di angka 2–3 adalah titik optimalnya — nilai lebih tinggi justru menaikkan rate-limit hit tanpa meningkatkan throughput. - **Utamakan URL kategori dibanding ID polos.** URL membawa category path yang diharapkan API; ID polos bisa saja ter-resolve ke hasil yang lebih luas atau malah kosong. - **Matikan `includeProductDetails`** untuk sweep cepat di level listing (nama, brand, harga listing, gambar, rating) saat Anda tidak butuh varian atau deskripsi. --- # Bluesky Scraper — Postingan, Profil, Feed & Interaksi - **URL:** https://proooxy.com/id/tools/bluesky-scraper/ - **Tipe:** tools - **Deskripsi:** Ekstrak postingan, profil, follower, feed, thread, likers, dan reposters Bluesky via AT Protocol — plus hasil search dan hashtag terautentikasi dengan app password. JSON bersih dan dinormalisasi. - **Ringkasan:** Scrape postingan, profil, feed, dan interaksi Bluesky. - **Kategori:** social - **Tech stack:** TypeScript, AT Protocol - **Pasar / wilayah:** Global - **Listing Apify:** https://apify.com/autofacts/bluesky-scraper - **Kata Kunci:** bluesky scraper, scraper bluesky, api bluesky, data at protocol, download postingan bluesky, data profil bluesky, scraper hashtag bluesky, ekstraksi data media sosial - **Diterbitkan:** 2026-07-01 - **Diperbarui:** 2026-07-01 **Fitur utama:** - Sebelas mode — search, profile, posts, followers, following, feed, thread, likers, reposters, actorLikes, dan hashtag - API publik tanpa kredensial untuk profiles, posts, followers, following, feeds, threads, likers, dan reposters - Mode terautentikasi dengan app password — search, hashtag, dan likes akun Anda sendiri - Ekspor post-engagement — daftar lengkap likers dan reposters per post - Thread flattening — menyusuri reply tree hingga depth yang bisa dikonfigurasi - Cursor pagination otomatis di setiap list endpoint hingga mencapai item cap Anda - Bentuk JSON yang dinormalisasi untuk posts dan profiles di semua mode - HTTP yang resilient — request throttling, exponential back-off, dan retry pada 429/5xx **Use case:** - Monitoring brand dan keyword via authenticated search - Pelacakan hashtag dan tren di seluruh jaringan - Ekspor audiens — daftar followers dan following milik creator atau brand - Analisis engagement — mengetahui persis siapa yang like atau repost sebuah post - Membangun dataset untuk BI, analitik, atau pipeline RAG dari JSON yang bersih dan dinormalisasi - Pengarsipan percakapan dan thread di bawah sebuah post **Parameter input:** - `mode` (string, opsional) — Yang mau di-scrape: posts, profile, followers, following, feed, thread, likers, reposters, actorLikes, search, atau hashtag (default: posts). - `handles` (array, opsional) — Handle Bluesky untuk mode profile/posts/followers/following/actorLikes, contoh: bsky.app. - `query` (string, opsional) — Teks pencarian (mode search) atau hashtag (mode hashtag — otomatis diberi awalan #). - `postUri` (string, opsional) — AT URI dari sebuah post — dipakai oleh mode thread, likers, dan reposters. - `feedUri` (string, opsional) — AT URI dari custom feed — dipakai oleh mode feed. - `identifier` (string, opsional) — Handle login/email Bluesky untuk mode terautentikasi (search, hashtag, actorLikes). - `appPassword` (string, opsional) — App password Bluesky (bukan password akun utama Anda) untuk mode terautentikasi. - `maxItems` (number, opsional) — Jumlah maksimum posts/profiles yang disimpan; masing-masing dihitung sebagai satu billed event (default: 100). **FAQ:** **Q: Apakah saya perlu kredensial Bluesky?** Hanya untuk mode search, hashtag, dan actorLikes — generate app password di setting Bluesky Anda dan masukkan sebagai appPassword. Mode profile, posts, followers, following, feed, thread, likers, dan reposters semuanya berfungsi tanpa kredensial via API publik AT Protocol. **Q: Bisakah saya mengekspor likes dari akun mana pun?** Tidak. API Bluesky hanya mengekspos actorLikes untuk akun yang terautentikasi itu sendiri, jadi handle dan login identifier harus merujuk ke akun yang sama. **Q: Bagaimana cara menemukan URI post atau feed?** AT URI terlihat seperti at://did:plc:.../app.bsky.feed.post/... — salin dari output API Bluesky atau developer tooling. Feed URI memakai collection app.bsky.feed.generator. **Q: Apakah aman menggunakan app password saya?** Aman — gunakan app password Bluesky (dibuat di Settings → App Passwords), jangan pernah pakai password utama Anda. App password ini scoped, bisa dicabut kapan saja, dan dikirim sebagai secret input. ## Contoh Output ```json { "itemType": "post", "mode": "posts", "uri": "at://did:plc:.../app.bsky.feed.post/...", "author": { "did": "did:plc:...", "handle": "bsky.app", "displayName": "Bluesky", "followersCount": 1234567 }, "text": "Example post text", "createdAt": "2026-06-11T00:00:00Z", "replyCount": 10, "repostCount": 20, "likeCount": 100, "langs": ["en"], "url": "https://bsky.app/profile/bsky.app/post/..." } ``` ## Harga Pay-per-event: **$0.001 per item** (post atau profile) yang disimpan. Ekspor 1,000 item berharga sekitar ~$1.00, dan `maxItems` membatasi volume sekaligus biayanya. ## Tips - **Mulai dengan mode publik.** Profiles, posts, followers, dan engagement (likers/reposters) tidak perlu login — simpan autentikasi app-password untuk run search dan hashtag. - **Ekspor engagement, bukan cuma posts.** Mode likers dan reposters menunjukkan persis siapa yang mem-amplifikasi sebuah post — sinyal yang dilewatkan sebagian besar scraper Bluesky lain. - **Batasi `maxItems`** saat menarik data follower/following dari akun besar, supaya run tetap cepat dan biaya tetap bisa diprediksi. --- # ClinicalTrials.gov Scraper — Studi, Kelayakan & Hasil - **URL:** https://proooxy.com/id/tools/clinical-trials-scraper/ - **Tipe:** tools - **Deskripsi:** Cari di API resmi ClinicalTrials.gov v2 berdasarkan condition, intervensi, sponsor, lokasi, status, atau NCT ID. Ekspor data studi yang dinormalisasi lengkap dengan kelayakan, metadata hasil, dan update inkremental — tanpa API key. - **Ringkasan:** Cari studi, kelayakan, dan hasil ClinicalTrials.gov. - **Kategori:** public-data - **Tech stack:** TypeScript, REST API - **Pasar / wilayah:** Global - **Listing Apify:** https://apify.com/autofacts/clinical-trials-scraper - **Kata Kunci:** data clinicaltrials.gov, data uji klinis, dataset uji klinis, data trial yang sedang merekrut, data kelayakan uji klinis, monitoring pipeline farmasi, uji klinis untuk RAG - **Diterbitkan:** 2026-07-01 - **Diperbarui:** 2026-07-01 **Fitur utama:** - API resmi ClinicalTrials.gov v2 — tanpa API key - Search multi-field — condition, intervensi, sponsor, lokasi, dan free-text query - Filter berdasarkan status perekrutan (9 nilai, dikombinasikan dengan OR) dan phase (Early Phase 1 → Phase 4) - Lookup NCT-ID langsung untuk satu atau banyak studi spesifik - Monitoring inkremental via updatedSince — hanya mengembalikan studi yang berubah pada/setelah tanggal tertentu - Output summary atau full — full menambahkan section protocol, derived, dan results mentah - Chunking paragraph siap-RAG dari judul, ringkasan, kelayakan, dan outcome - Sinyal hasil — hasResults plus flag participant-flow, outcome-measures, dan adverse-events - MeSH term turunan serta data sponsor, kolaborator, dan lokasi yang dinormalisasi **Use case:** - Monitoring pipeline farmasi/bioteknologi berdasarkan sponsor atau condition - Riset CRO dan kelayakan lokasi (site-feasibility) — trial yang sedang merekrut berdasarkan lokasi, phase, dan condition - Competitive intelligence untuk studi yang baru diposting atau baru diperbarui - Riset perekrutan pasien di seluruh trial yang sedang aktif merekrut - Systematic review — kriteria kelayakan, outcome, dan metadata hasil dalam skala besar - Knowledge base medical AI / RAG yang dibangun dari teks trial yang sudah di-chunk **Parameter input:** - `condition` (string, opsional) — Condition atau penyakit yang dicari, contoh: diabetes. - `status` (array, opsional) — Filter status perekrutan, dikombinasikan dengan OR, contoh: RECRUITING, COMPLETED. - `phase` (array, opsional) — Phase studi — Not Applicable, Early Phase 1, Phase 1–4. - `nctIds` (array, opsional) — Ambil studi spesifik berdasarkan NCT ID ClinicalTrials.gov. - `updatedSince` (string, opsional) — YYYY-MM-DD — mengembalikan studi dengan LastUpdatePostDate pada/setelah tanggal ini. - `outputFields` (string, opsional) — summary (default, dinormalisasi) atau full (menambahkan section protocol/derived/results mentah). - `chunking` (string, opsional) — Chunking teks RAG: paragraph (default) atau none. - `maxItems` (number, opsional) — Jumlah maksimum studi yang disimpan; masing-masing dihitung sebagai satu billed event (default: 10). **FAQ:** **Q: Apakah saya perlu API key?** Tidak. API v2 ClinicalTrials.gov sepenuhnya publik — actor ini hanya mengirim User-Agent deskriptif, tanpa autentikasi. **Q: Bisakah saya mendapatkan data studi mentah, bukan cuma field yang dinormalisasi?** Bisa. Set outputFields ke 'full' untuk menyertakan protocolSection, derivedSection, dan resultsSection mentah, berdampingan dengan field summary yang sudah dinormalisasi. **Q: Bagaimana cara memonitor studi yang baru saja berubah?** Set updatedSince ke tanggal berformat YYYY-MM-DD. Actor ini memfilter berdasarkan LastUpdatePostDate milik ClinicalTrials.gov dan hanya mengembalikan studi yang diperbarui pada atau setelah hari itu — ideal untuk monitoring pipeline harian. **Q: Apakah cakupannya global atau hanya AS?** Global. ClinicalTrials.gov mendaftarkan trial dari seluruh dunia, dan array locations tiap studi menyertakan country, state, city, dan facility bila tersedia. ## Contoh Output ```json { "itemType": "study", "nctId": "NCT01884792", "title": "Example Diabetes Study", "officialTitle": "A Study of Example Diabetes Study", "status": "COMPLETED", "phase": ["PHASE2"], "studyType": "INTERVENTIONAL", "conditions": ["Diabetes Mellitus"], "sponsors": { "lead": "Example Sponsor Inc.", "collaborators": [] }, "locations": [ { "facility": "Example Medical Center", "city": "Boston", "state": "MA", "country": "United States", "status": "COMPLETED" } ], "hasResults": true, "resultsSummary": { "hasParticipantFlow": true, "hasOutcomeMeasures": true, "hasAdverseEvents": true }, "lastUpdate": "2026-06-01", "url": "https://clinicaltrials.gov/study/NCT01884792" } ``` ## Harga Pay-per-event: **$0.002 per study** yang disimpan, terlepas dari mode output summary atau full. Ekspor 1,000 studi berharga sekitar ~$2.00, dan `maxItems` membatasi volume sekaligus biaya. ## Tips - **Gunakan `updatedSince` untuk monitoring perubahan.** Jadwalkan run harian dengan tanggal kemarin untuk menangkap hanya trial yang baru diposting atau diamendemen — cara termurah untuk melacak pipeline kompetitor. - **Kombinasikan `condition` + `status: [RECRUITING]` + `phase`** untuk membangun daftar kelayakan yang tertarget tanpa perlu menarik seluruh registry. - **Set `outputFields: full`** hanya jika Anda butuh section mentah — summary yang sudah dinormalisasi sudah mencakup eligibility, sponsors, locations, dan results flag. --- # CourtListener Scraper — Putusan, Berkas Perkara & Teks Lengkap - **URL:** https://proooxy.com/id/tools/courtlistener-scraper/ - **Tipe:** tools - **Deskripsi:** Query CourtListener untuk putusan pengadilan AS, RECAP docket, oral argument, hakim, dan sitasi — lengkap dengan teks putusan penuh dan chunk siap-RAG. Filter berdasarkan pengadilan, tanggal, atau keyword. - **Ringkasan:** Case law AS, docket, dan teks putusan lengkap untuk legal AI. - **Kategori:** public-data - **Tech stack:** TypeScript, Cheerio - **Pasar / wilayah:** Amerika Serikat - **Listing Apify:** https://apify.com/autofacts/courtlistener-scraper - **Kata Kunci:** api courtlistener, data case law, scraper putusan pengadilan, data docket recap, data riset hukum, dataset case law amerika, case law untuk RAG - **Diterbitkan:** 2026-07-01 - **Diperbarui:** 2026-07-01 **Fitur utama:** - Enam search type dalam satu actor — opinions, dockets (RECAP), RECAP document, oral argument, judges, dan citation lookup - Teks putusan lengkap — mengikuti hasil search ke dalam database untuk mendapatkan putusan lengkap, bukan snippet 300 karakter - Chunking siap-RAG — chunk paragraph ~2000 karakter, masing-masing dengan order index - Resolusi sitasi — me-resolve hingga 250 string sitasi (contoh: 576 U.S. 644) ke case yang cocok - Boolean full-text search plus filter court ID, rentang filed-date, dan sort-order - Pacing yang sadar rate-limit dengan back-off 429 yang presisi di seluruh format respons CourtListener - Streaming cursor-pagination hingga item cap yang Anda konfigurasi - Bawa token Anda sendiri, atau gunakan rotating token pool bawaan **Use case:** - Riset hukum — menarik case law full-text berdasarkan pengadilan, rentang tanggal, atau keyword - Litigation intelligence — melacak aktivitas docket pengadilan berdasarkan subjek dan tanggal - Legal AI / RAG — membangun corpus case-law yang sudah di-chunk dan siap-embedding - Analisis sitasi — me-resolve sitasi dari sebuah brief ke case record terkait dan cite count - Studi hukum empiris — hakim, metadata oral-argument, dan tren putusan - Jurnalisme hukum — memonitor putusan atau docket yang baru diajukan di pengadilan tertentu **Parameter input:** - `searchType` (string, opsional) — Yang mau diambil: opinions, dockets, recap_docs, oral_arguments, judges, atau citation (default: opinions). - `query` (string, opsional) — Query full-text dengan boolean operator — wajib diisi kecuali memakai filter court atau citation lookup. - `citations` (array, opsional) — String sitasi yang akan di-resolve (hingga 250) — wajib untuk mode citation. - `court` (string, opsional) — Court ID CourtListener, contoh: scotus, ca9, nyed. - `dateFrom` (string, opsional) — Tanggal filed-after (YYYY-MM-DD). - `includeFullText` (boolean, opsional) — Ambil teks putusan lengkap dan chunk RAG untuk opinions (default: false). - `apiToken` (string, opsional) — API token CourtListener Anda; jika tidak diisi, akan memakai rotating pool bawaan. - `maxItems` (number, opsional) — Jumlah maksimum item yang disimpan; masing-masing dihitung sebagai satu billed event (default: 5). **FAQ:** **Q: Apakah saya perlu API token CourtListener?** CourtListener mewajibkannya. Berikan token gratis Anda sendiri via apiToken, atau andalkan rotating fallback pool bawaan actor. Membawa token sendiri memungkinkan Anda menaikkan throughput di tier berbayar/membership. **Q: Apakah teks putusan lengkap tersedia untuk semua search type?** Tidak. Teks lengkap plus chunking (includeFullText) hanya berlaku untuk opinions, dan defaultnya mati (off) agar run tetap cepat. Docket, RECAP document, oral argument, judges, dan hasil citation hanya mengembalikan metadata. **Q: Pengadilan mana saja yang dicakup?** Apa pun yang diindeks CourtListener — pengadilan federal AS (SCOTUS, Courts of Appeals, dan District court via RECAP) plus banyak pengadilan negara bagian, dialamatkan dengan court ID milik CourtListener sendiri seperti scotus, ca9, atau nyed. **Q: Seberapa cepat actor ini bisa berjalan?** Throughput dibatasi oleh rate limit token Anda (tier gratis CourtListener hanya beberapa request per menit) dengan 429 back-off otomatis; token membership menaikkan batasnya. ## Contoh Output ```json { "itemType": "legal", "searchType": "opinions", "id": "10380001", "title": "Climate United Fund v. Citibank, N.A.", "court": "Court of Appeals for the D.C. Circuit", "date": "2025-04-16", "url": "https://www.courtlistener.com/opinion/10380001/...", "citations": [], "citeCount": 0, "docketNumber": "23-5138", "fullText": "...", "chunks": [{ "text": "...", "order": 0 }], "meta": { "courtId": "cadc", "clusterId": 10380001 } } ``` ## Harga Pay-per-event — Anda hanya dikenakan biaya untuk item yang tersimpan: | Event | Harga | Yang dicakup | |---|---|---| | Opinion dengan teks lengkap | $0.005 | Satu opinion tersimpan dengan teks lengkap + chunk RAG | | Item metadata | $0.002 | Satu docket, oral argument, judge, citation, atau record metadata-only | Corpus full-text 1,000-opinion berharga sekitar ~$5.00; `maxItems` membatasi volume sekaligus biaya. ## Tips - **Aktifkan `includeFullText` hanya untuk opinion yang benar-benar akan Anda embed.** Fitur ini menambah request per opinion dan defaultnya mati — filter dulu secara ketat berdasarkan court dan tanggal. - **Gunakan mode `citation` untuk memperkaya sebuah brief.** Tempel string sitasinya dan dapatkan case record terkait beserta cite count dalam satu run. - **Bawa token CourtListener Anda sendiri** untuk pekerjaan yang lebih besar — rate limit rendah di tier gratis adalah bottleneck utama throughput. --- # SEC EDGAR Scraper — Laporan, Teks Lengkap & Data Keuangan XBRL - **URL:** https://proooxy.com/id/tools/sec-edgar-scraper/ - **Tipe:** tools - **Deskripsi:** Ekstrak metadata laporan SEC EDGAR, section full-text 10-K/10-Q, hasil EDGAR full-text search, dan XBRL financial facts sebagai JSON bersih dan siap-RAG. Tanpa API key. - **Ringkasan:** Laporan SEC, teks 10-K/10-Q, dan data keuangan XBRL — siap-RAG. - **Kategori:** public-data - **Tech stack:** TypeScript, Cheerio - **Pasar / wilayah:** Amerika Serikat - **Listing Apify:** https://apify.com/autofacts/sec-edgar-scraper - **Kata Kunci:** data sec edgar, scraper sec edgar, data laporan 10-K, scraper 10-Q, data keuangan xbrl, edgar full-text search, laporan sec untuk RAG, api data keuangan perusahaan - **Diterbitkan:** 2026-07-01 - **Diperbarui:** 2026-07-01 **Fitur utama:** - Empat mode dalam satu actor — metadata filing, teks dokumen lengkap, EDGAR full-text search, dan XBRL financial facts - Chunking siap-RAG — section, paragraph (~2000 karakter), atau none; setiap chunk ditandai dengan Item sumber dan urutannya - Parsing section 'Item N' otomatis untuk 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A, dan lainnya) - XBRL facts lengkap dengan taxonomy, tag, label, unit, value, fiscal year/period, form, dan accession number - Deduplikasi fact menggabungkan restatement XBRL menjadi satu baris per periode, mempertahankan disclosure paling awal - Resolusi perusahaan berdasarkan ticker, CIK, atau nama terhadap ticker file resmi SEC, dengan fuzzy fallback - EDGAR full-text search dengan quoted phrase, filter form-type, dan rentang tanggal (2001 → sekarang) - Rate limiting dan User-Agent yang sesuai ketentuan SEC — tanpa API key dan tanpa login **Use case:** - Pipeline RAG/LLM finansial yang butuh teks 10-K dan 10-Q ter-chunk per section dan siap-embedding - Riset investasi — menarik time series revenue, net income, dan diluted EPS sebagai baris XBRL yang bersih - Monitoring compliance & kepemilikan — Form 4, SC 13D/13G, dan bahasa risk-factor di berbagai perusahaan - Produk fintech yang butuh data EDGAR terstruktur tanpa perlu membangun crawler custom - Riset pasar dan industri via full-text search — siapa yang mengungkap sebuah frasa, dan sejak kapan - Workflow BI dan spreadsheet yang mengonsumsi baris XBRL financial fact yang bersih **Parameter input:** - `mode` (string, wajib) — Mode ekstraksi: filings, fulltext, search, atau facts (default: filings). - `ticker` (string, opsional) — Ticker saham, contoh: AAPL. Salah satu dari ticker/cik/companyName wajib diisi saat runtime. - `cik` (string, opsional) — SEC Central Index Key, contoh: 320193 — lebih diutamakan dibanding ticker dan companyName. - `companyName` (string, opsional) — Nama registrant SEC, dicocokkan secara exact atau fuzzy terhadap ticker file resmi. - `query` (string, opsional) — Ekspresi EDGAR full-text search, contoh: "supply chain disruption" — wajib untuk mode search. - `formTypes` (array, opsional) — Form type yang disertakan, contoh: 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Kosong = semua form. - `chunking` (string, opsional) — Strategi RAG fulltext: section, paragraph (~2000 karakter), atau none (default: section). - `maxItems` (number, opsional) — Jumlah maksimum item yang disimpan; setiap item tersimpan dihitung sebagai satu billed event (default: 100). **FAQ:** **Q: Apakah saya perlu API key SEC?** Tidak. SEC EDGAR adalah data publik gratis. Actor ini mengidentifikasi dirinya dengan User-Agent yang sesuai ketentuan dan mengatur throttle sendiri di bawah rate limit SEC secara otomatis — tanpa key dan tanpa login. **Q: Sejauh apa data ini mundur ke belakang?** EDGAR full-text search (EFTS) mencakup filing sejak 2001-05-04 dan dibatasi hingga 10,000 hit per query. Metadata filing mundur hingga 1994, dan XBRL financial facts mencakup semua yang pernah dilaporkan perusahaan dalam XBRL. **Q: Apakah outputnya siap untuk LLM dan RAG?** Ya. Di mode fulltext, actor ini mem-parsing 10-K/10-Q menjadi section 'Item N' dan menghasilkan chunk siap-embedding (section atau paragraph ~2000 karakter), masing-masing ditandai dengan Item sumber dan order index-nya. **Q: Mengapa sebagian filing dilewati di mode fulltext?** Filing yang dokumen utamanya bukan HTML atau TXT (misalnya, Form 4 XML yang hanya berisi XBRL) tidak bisa di-section-parsing, sehingga dilewati — dan tidak dikenai biaya. ## Contoh Output ```json { "itemType": "filing-fulltext", "title": "Apple Inc. — 10-K 2025-10-31", "company": "Apple Inc.", "ticker": "AAPL", "cik": "0000320193", "formType": "10-K", "filedAt": "2025-10-31", "accessionNo": "0000320193-25-000123", "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...", "sections": [ { "name": "Item 1A — Risk Factors", "charCount": 38241 }, { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 } ], "chunks": [ { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 } ], "textLength": 220151 } ``` ## Harga Pay-per-event — Anda hanya dikenakan biaya untuk item yang benar-benar tersimpan: | Event | Harga | Yang dicakup | |---|---|---| | Metadata filing / hasil search | $0.001 | Satu record metadata filing atau satu hasil full-text search | | Filing full-text | $0.005 | Satu filing yang diekstrak, di-section-parsing, dan di-chunk untuk RAG | | XBRL fact | $0.0002 | Satu baris XBRL financial fact | Menarik metadata 1,000-filing berharga ~$1.00; 1,000 XBRL facts berharga ~$0.20. `maxItems` membatasi volume sekaligus biaya. ## Tips - **Mulai dengan mode `facts` untuk data finansial.** Menarik baris XBRL (revenue, net income, EPS) jauh lebih murah dan lebih bersih dibanding mem-parsing filing lengkap saat Anda hanya butuh angkanya. - **Gunakan `chunking: section` untuk RAG.** Ini menjaga setiap Item (Risk Factors, MD&A) tetap utuh sehingga retrieval mengembalikan passage yang koheren dan bisa disitasi. - **Full-text search mencakup 2001 dan seterusnya.** Untuk disclosure yang lebih lama, resolve perusahaan berdasarkan CIK dan tarik metadata filing secara langsung. --- # USAspending.gov Scraper — Dana Federal, Penerima & Agregat - **URL:** https://proooxy.com/id/tools/usaspending-scraper/ - **Tipe:** tools - **Deskripsi:** Query API resmi USAspending.gov v2 untuk kontrak, hibah, dan pinjaman federal. Filter berdasarkan agency, penerima, NAICS/PSC, atau tanggal, dan tarik profil penerima, category total, serta agregat geografi state/county/district. Tanpa API key. - **Ringkasan:** Dana federal, penerima, dan agregat belanja dari USAspending.gov. - **Kategori:** public-data - **Tech stack:** TypeScript, REST API - **Pasar / wilayah:** Amerika Serikat - **Listing Apify:** https://apify.com/autofacts/usaspending-scraper - **Kata Kunci:** api usaspending, data kontrak federal, data belanja pemerintah, data hibah federal, riset pasar govcon, data dana federal, data kontrak naics psc - **Diterbitkan:** 2026-07-01 - **Diperbarui:** 2026-07-01 **Fitur utama:** - API resmi USAspending.gov v2 — tanpa API key - Pencarian dana lintas keywords, fiscal year/rentang tanggal, agency, penerima, NAICS, PSC, jumlah, dan award type - Enam mode — award search, award detail, subawards, recipient profile, category totals, dan geography - 18 dimensi category-aggregation (recipient, NAICS, PSC, agency, county, district, CFDA, TAS, dan lainnya) - Agregat geografi berdasarkan state, county, congressional district, dan country dengan field population dan per-capita - Date slicing otomatis (bulanan/kuartalan) untuk result set multi-tahun yang besar - Batching award-type-code otomatis menjadi grup request API yang valid - Lookup award-detail dan subaward yang presisi berdasarkan generated award ID **Use case:** - Business development GovCon — menemukan peluang dan incumbent contractor berdasarkan NAICS, PSC, atau agency - Competitive intelligence atas riwayat dana kompetitor dan hubungan agency-nya - Jurnalisme investigatif yang menelusuri belanja federal ke penerima atau geografi tertentu - Riset kebijakan dan akademis atas tren belanja berdasarkan category, award type, atau periode waktu - Review due-diligence atas riwayat dana federal dan belanja seorang penerima - Dashboard BI yang memetakan belanja federal berdasarkan state, county, atau congressional district **Parameter input:** - `mode` (string, opsional) — Workflow: awards, awardDetail, subawards, recipient, byCategory, atau geography (default: awards). - `keywords` (array, opsional) — Filter keyword free-text USAspending untuk award search. - `fiscalYear` (number, opsional) — Fiscal year federal (memetakan ke rentang tanggal 1 Okt – 30 Sep). - `awardTypes` (array, opsional) — Kode award type USAspending; grup campuran otomatis dipecah menjadi request yang valid. - `agency` (string, opsional) — Filter nama awarding atau funding agency yang exact. - `naicsCodes` (array, opsional) — Kode NAICS yang harus dicocokkan oleh sebuah award. - `awardId` (string, opsional) — Generated award ID — wajib diisi saat runtime untuk mode awardDetail dan subawards. - `maxItems` (number, opsional) — Jumlah maksimum record yang disimpan; setiap baris dihitung sebagai satu billed event (default: 100). **FAQ:** **Q: Apakah saya perlu API key?** Tidak. API USAspending.gov v2 bersifat publik dan tidak memerlukan key atau login. **Q: Mengapa kode award-type yang campuran dipecah menjadi beberapa request?** USAspending menolak satu search yang mencampur kode dari grup award-type berbeda (contracts, IDVs, grants, loans, other financial assistance, direct payments). Actor ini mengelompokkan kode yang diminta secara otomatis dan menandai setiap baris output dengan kode award type yang cocok. **Q: Breakdown geografis apa saja yang tersedia?** State, county, congressional district, dan country — di-scope ke place of performance atau recipient location, lengkap dengan field population dan per-capita. **Q: Bagaimana biaya sebuah run dihitung?** Pay-per-event sebesar $0.001 per baris yang disimpan, dikenakan sekali per record yang berhasil dikembalikan. maxItems membatasi jumlah baris dan karenanya juga biayanya. ## Contoh Output ```json { "itemType": "award", "title": "HT940216C0001 — HUMANA GOVERNMENT BUSINESS INC", "date": "2016-02-01", "awardId": "HT940216C0001", "generatedId": "CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-", "recipient": { "name": "HUMANA GOVERNMENT BUSINESS INC", "uei": "...", "duns": "..." }, "awardingAgency": "Department of Defense", "fundingAgency": "Department of Defense", "amount": 51269205263.03, "awardType": "IDV_B_C", "naics": { "code": "...", "description": "..." }, "placeOfPerformance": { "stateCode": "...", "state": "..." }, "awardTypeCodes": ["IDV_B_C"], "url": "https://www.usaspending.gov/award/CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-" } ``` ## Harga Pay-per-event: **$0.001 per record** yang disimpan, dikenakan sekali per baris yang berhasil dikembalikan. Run ~1,000-record berharga sekitar ~$1.00, dan `maxItems` membatasi volume sekaligus biaya. ## Tips - **Mulai dengan kode NAICS atau PSC** untuk prospecting GovCon — kode ini langsung memetakan ke produk/layanan yang Anda jual dan mengembalikan kumpulan dana yang paling relevan dan bersih. - **Gunakan mode `byCategory`** untuk me-ranking penerima atau agency teratas di sebuah pasar sebelum menarik detail dana individual. - **Mode geography mengembalikan halaman pertama (hingga 100 baris)** per kombinasi date-range/award-type — persempit filternya, jangan menaikkan `maxItems`, untuk roll-up state/county/district. --- # YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM - **URL:** https://proooxy.com/id/tools/youtube-transcript-scraper/ - **Tipe:** tools - **Deskripsi:** Ekstrak subtitle dan transcript YouTube dari video, Shorts, playlist, dan channel sebagai JSON, SRT, VTT, plain text, atau teks siap-LLM yang bersih. 100+ bahasa, metadata lengkap, tanpa API key — dan ekstraksi yang gagal tidak dikenakan biaya. - **Ringkasan:** Transcript YouTube sebagai JSON, SRT, VTT, atau teks siap-LLM. - **Kategori:** social - **Tech stack:** TypeScript, InnerTube - **Pasar / wilayah:** Global - **Listing Apify:** https://apify.com/autofacts/youtube-subtitle-transcript-scraper - **Kata Kunci:** unduh transkrip youtube, scraper subtitle youtube, api transkrip youtube, download caption youtube, transkrip youtube massal, transkrip youtube srt vtt, transkrip youtube untuk LLM - **Diterbitkan:** 2026-07-01 - **Diperbarui:** 2026-07-01 **Fitur utama:** - Satu input menangani video, Shorts, link youtu.be, playlist, dan channel — dicampur dalam satu run - Lima format output — JSON (timestamped), SRT, VTT, plain text, dan siap-LLM (menghapus [Music], [Applause], dan label pembicara) - 100+ bahasa dengan daftar bahasa yang berurutan prioritas dan fallback auto-caption yang bisa di-toggle - Metadata lengkap — judul, channel, deskripsi, tanggal publish, view count, thumbnail, durasi, dan bahasa yang tersedia - Batch seluruh playlist dan channel dengan batas maxVideos dan concurrency 1–10 - Dukungan residential proxy plus cookies opsional untuk mengurangi block bot-check - Ekstraksi multi-layer — hingga sembilan fallback di berbagai klien InnerTube, dengan yt-dlp PO-token sebagai upaya terakhir - Circuit breaker dan error handling per-item menjaga batch besar tetap berjalan **Use case:** - Tim AI/ML yang membangun dataset RAG atau fine-tuning dari video spoken (output teks siap-LLM) - Tim konten yang menggunakan ulang transcript menjadi blog post, show notes, dan caption sosial - SEO marketer yang mengekstrak teks video yang bisa dicari untuk indexing dan riset keyword - Editor dan publisher yang butuh file subtitle SRT/VTT standar - Peneliti yang mengumpulkan transcript secara batch di seluruh channel atau playlist - Developer yang butuh caption terstruktur dan timestamped tanpa YouTube API key **Parameter input:** - `urls` (array, opsional) — URL YouTube atau ID polos — video, Shorts, link youtu.be, playlist, atau channel. Wajib diisi saat runtime. - `outputFormat` (string, opsional) — Format transcript: json, srt, vtt, text, atau llm (default: json). - `languages` (array, opsional) — Bahasa subtitle yang diutamakan berdasarkan urutan prioritas, kode ISO 639-1 (default: en). - `includeAutoGenerated` (boolean, opsional) — Fallback ke caption auto-generated saat caption manual tidak tersedia (default: true). - `maxVideos` (number, opsional) — Batas video yang diproses per run, misalnya untuk playlist/channel (default: 0 = tanpa batas). - `maxConcurrency` (number, opsional) — Video yang diproses secara paralel, 1–10 (default: 3). - `proxyConfiguration` (object, opsional) — Pengaturan proxy; default ke Apify Residential yang di-pin ke US. - `youtubeCookies` (string, opsional) — Cookies YouTube opsional (header Cookie atau cookies.txt) untuk mengurangi block bot-check. **FAQ:** **Q: Apakah saya perlu YouTube API key atau harus login?** Tidak. Actor ini mengekstrak caption secara langsung — tanpa YouTube Data API key dan tanpa login. Input cookies opsional bisa diberikan untuk mengurangi block 'Sign in to confirm you're not a bot' pada beberapa video. **Q: Bahasa dan jenis caption apa saja yang didukung?** Lebih dari 100 bahasa. Berikan daftar kode ISO 639-1 berurutan prioritas (default: en); actor ini mengutamakan caption yang dibuat manual dan fallback ke caption auto-generated kecuali Anda menonaktifkan includeAutoGenerated. **Q: Apakah saya dikenakan biaya untuk video yang gagal diekstrak?** Tidak. Billing bersifat pay-per-event pada satu event transcript-extracted, dikenakan hanya setelah transcript berhasil disimpan. Video yang gagal tetap muncul di output dengan field error dan tidak dikenakan biaya. **Q: Bisakah saya mendapatkan teks bersih siap-LLM untuk RAG?** Bisa. Set outputFormat ke 'llm' untuk menghapus anotasi [Music]/[Applause] dan label pembicara, menghasilkan prosa bersih yang ideal untuk embedding dan fine-tuning. ## Contoh Output ```json { "videoId": "dQw4w9WgXcQ", "url": "https://www.youtube.com/watch?v=dQw4w9WgXcQ", "title": "Rick Astley - Never Gonna Give You Up (Official Video)", "channelName": "Rick Astley", "channelId": "UCuAXFkgsw1L7xaCfnd5JJOw", "publishDate": "2009-10-25", "viewCount": 1761003712, "availableLanguages": ["en", "de-DE", "ja", "pt-BR", "es-419"], "language": "en", "isAutoGenerated": false, "duration": 213, "wordCount": 487, "segmentCount": 61, "text": "We're no strangers to love, you know the rules and so do I...", "segments": [{ "text": "We're no strangers to love", "start": 18.64, "end": 21.88 }], "error": null } ``` ## Harga Pay-per-event: dikenakan biaya sekali per **transcript yang berhasil diekstrak** — video yang gagal tidak pernah dikenakan biaya. Masukkan seluruh channel atau playlist dan bayar hanya untuk caption yang benar-benar Anda dapatkan. ## Tips - **Gunakan `outputFormat: llm`** untuk RAG dan fine-tuning — ini menghapus anotasi non-speech sehingga embedding Anda melihat prosa yang bersih. - **Pertahankan residential proxy tetap aktif.** YouTube secara agresif memblokir IP datacenter; actor ini default ke US residential bukan tanpa alasan. - **Mulai `maxConcurrency` di angka 1–3 untuk pekerjaan besar** dan naikkan secara bertahap — concurrency tinggi meningkatkan risiko rate-limit pada scraping channel besar. --- # Sephora Scraper (Global) - **URL:** https://proooxy.com/id/tools/sephora-scraper/ - **Tipe:** tools - **Deskripsi:** Apify Actor yang mengekstrak data produk Sephora lengkap — varian, harga, gambar, ingredient, dan ulasan — dari 21 storefront di US, Kanada, 9 pasar EU, dan 10 pasar Asia-Pasifik dalam satu skema yang dinormalisasi. - **Ringkasan:** Scrape storefront Sephora mana pun — 21 pasar, satu actor. - **Kategori:** ecommerce - **Tech stack:** Python, Crawlee, curl_cffi - **Pasar / wilayah:** Amerika Serikat, Kanada, Prancis, Italia, Jerman, Spanyol, Polandia, Ceko, Yunani, Rumania, Portugal, Selandia Baru, Australia, Singapura, Malaysia, Thailand, Indonesia, Filipina, Hong Kong, Taiwan, Brunei - **Strategi anti-bot:** Bypass Akamai via residential proxy + TLS fingerprinting curl_cffi - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/sephora - **Kata Kunci:** scraper sephora, data produk sephora, api sephora, scrape produk sephora, pelacak harga sephora, data produk kecantikan, ekstraksi data kosmetik, scraper sephora global - **Diterbitkan:** 2026-04-18 - **Diperbarui:** 2026-04-18 **Fitur utama:** - 21 storefront dalam satu actor — US, Kanada, 9 pasar EU, dan 10 pasar APAC dicakup oleh satu SKU - Pasar terdeteksi otomatis — tempel URL sephora.* apa pun dan dispatcher akan merutekannya ke module yang tepat - Run multi-pasar campuran — URL US + EU + SEA dalam satu list startUrls, di-stream ke satu dataset yang ditandai dengan `market` - Harga sesuai locale — NZD, EUR, USD, AUD dan 17 mata uang lain yang dikembalikan oleh localization layer milik Sephora sendiri - Skema yang dinormalisasi — setiap pasar menghasilkan bentuk `source / brand / title / options / variants / medias / stats` yang sama - Isolasi sesi per pasar — auth state tidak bisa saling terkontaminasi antar region - Circuit breaker global — 50 kegagalan berturut-turut akan menghentikan run untuk menghindari pemborosan compute pada target yang down **Use case:** - Pricing intelligence pan-regional di pasar kecantikan US, EU, dan APAC - Monitoring ketersediaan produk dan assortment lintas pasar - Analisis kompetitif untuk brand yang meluncurkan produk di region Sephora baru - Perbandingan ingredient di berbagai formulasi regional - Pelacakan review dan rating — termasuk sinyal wishlist SEA dan ringkasan sentimen AI US - Audit harga loyalty/membership per pasar **Parameter input:** - `startUrls` (array, wajib) — URL produk atau kategori dari storefront sephora.* mana pun. Pasar terdeteksi otomatis dari hostname. - `market` (string, opsional) — Override pasar opsional (us, eu-fr, eu-it, eu-de, eu-es, eu-pl, eu-cz, eu-gr, eu-ro, eu-pt, sea-nz, sea-au, sea-sg, sea-my, sea-th, sea-id, sea-ph, sea-hk, sea-tw, sea-bn). - `locale` (string, opsional) — Locale BCP 47 opsional (contoh: fr-FR, en-NZ) — meng-override default pasar. - `categoryIds` (array, opsional) — Khusus EU. Category ID SFCC seperti C479 — alternatif dari menempel URL kategori. - `proxy` (object, opsional) — Konfigurasi Apify proxy. Residential sangat disarankan; pin apifyProxyCountry ke pasar target. - `maxConcurrency` (number, opsional) — Request concurrent. Default 5. US: 2-5. EU: 3. SEA: 8-16. - `maxRequestsPerCrawl` (number, opsional) — Hard cap global di semua pasar. 0 = tanpa batas. **FAQ:** **Q: Storefront Sephora mana saja yang didukung scraper ini?** 21 storefront: US (sephora.com), Kanada (sephora.ca), 9 pasar EU (Prancis, Italia, Jerman, Spanyol, Polandia, Ceko, Yunani, Rumania, Portugal), dan 10 pasar APAC (Selandia Baru, Australia, Singapura, Malaysia, Thailand, Indonesia, Filipina, Hong Kong, Taiwan, Brunei). Pasar terdeteksi otomatis dari hostname — tidak perlu mengubah input saat mencampur pasar. **Q: Bisakah saya men-scrape banyak pasar dalam satu run?** Bisa. Campurkan URL sephora.com, sephora.fr, dan sephora.nz dalam satu list startUrls. Dispatcher akan mengelompokkannya berdasarkan pasar, menjalankan setiap module secara concurrent dengan auth yang sesuai pasarnya, dan menandai setiap item dataset dengan field `market`. **Q: Bagaimana scraper ini menangani proteksi anti-bot?** Scraper ini memakai residential proxy untuk semua pasar dan curl_cffi untuk TLS fingerprinting setara browser pada traffic EU dan SEA guna bypass Akamai. Traffic US memakai HttpCrawler milik Crawlee dengan session pool yang berotasi saat 403/429. **Q: Apakah konfigurasi run v1.x US saya yang sudah ada tetap berfungsi?** Ya. Input pre-2.0 — startUrls, maxConcurrency, proxy, maxRequestsPerCrawl — berperilaku identik. Satu-satunya perubahan output adalah key `market` baru di setiap item, yang merupakan perubahan additive yang aman (soft). **Q: Mengapa sebagian field bernilai null di data SEA?** API Sephora SEA tidak mengekspos counter `lovesCount`, sehingga item APAC memiliki `stats.lovesCount = null`. Sebagai gantinya, setiap varian punya field boolean `wishlisted`. Sebaliknya, `sentiments` (ringkasan review AI) dan `source.crawlUrl` hanya tersedia untuk US. **Q: Apakah saya perlu API token atau akun terpisah per pasar?** Tidak. API token Apify Anda yang sudah ada tetap berfungsi tanpa perubahan. Actor ini menangani guest token per pasar secara internal — tidak perlu kredensial untuk EU/SEA, dan US berjalan dengan residential proxy standar Apify. ## Pasar yang didukung | Wilayah | Market ID | Negara | Mata Uang | Hostname | |---|---|---|---|---| | Amerika | `us` | Amerika Serikat | USD | sephora.com | | Amerika | `us` | Kanada | CAD | sephora.ca | | EU | `eu-fr` | Prancis | EUR | sephora.fr | | EU | `eu-it` | Italia | EUR | sephora.it | | EU | `eu-de` | Jerman | EUR | sephora.de | | EU | `eu-es` | Spanyol | EUR | sephora.es | | EU | `eu-pl` | Polandia | PLN | sephora.pl | | EU | `eu-cz` | Republik Ceko | CZK | sephora.cz | | EU | `eu-gr` | Yunani | EUR | sephora.gr | | EU | `eu-ro` | Rumania | RON | sephora.ro | | EU | `eu-pt` | Portugal | EUR | sephora.pt | | APAC | `sea-nz` | Selandia Baru | NZD | sephora.nz | | APAC | `sea-au` | Australia | AUD | sephora.com.au | | APAC | `sea-sg` | Singapura | SGD | sephora.sg | | APAC | `sea-my` | Malaysia | MYR | sephora.com.my | | APAC | `sea-th` | Thailand | THB | sephora.co.th | | APAC | `sea-id` | Indonesia | IDR | sephora.co.id | | APAC | `sea-ph` | Filipina | PHP | sephora.ph | | APAC | `sea-hk` | Hong Kong | HKD | sephora.hk | | APAC | `sea-tw` | Taiwan | TWD | sephora.tw | | APAC | `sea-bn` | Brunei | BND | sephora.bn | ## Contoh Output ```json { "market": "sea-nz", "source": { "id": 58792, "canonicalUrl": "https://www.sephora.nz/products/rare-beauty-true-to-myself-natural-matte-longwear-foundation", "retailer": "SEPHORA", "currency": "NZD" }, "brand": "Rare Beauty", "title": "True To Myself Natural Matte Longwear Foundation", "description": "

A self-priming and self-setting foundation...

", "ingredients": "Aqua/Water, Cyclopentasiloxane, Glycerin...", "currentSku": "770225", "categories": ["makeup/face/foundation"], "options": [ { "name": "shade", "id": "66488", "values": [{"value": "1 Fair Neutral", "orderable": true}] } ], "variants": [ { "id": "276343", "sku": "770225", "price": { "current": 77.0, "original": 77.0, "stockStatus": "IN_STOCK" }, "options": [{"name": "shade", "value": "1 Fair Neutral"}], "highlights": ["NEW", "Only at Sephora"], "wishlisted": null } ], "medias": [{ "url": "https://www.sephora.nz/.../foundation-shade.jpg", "type": "image" }], "stats": { "reviewCount": 971, "rating": 4.8, "lovesCount": null } } ``` ## Tips - **Pin negara proxy ke pasar target.** Exit residential di negara yang tidak sesuai adalah sumber terbesar 403 dari layer Akamai milik Sephora. Set `apifyProxyCountry` ke kode ISO storefront-nya (`US`, `FR`, `NZ`, dst.). - **Smoke-test dulu.** Set `maxRequestsPerCrawl=10` sebelum run produksi pertama Anda di pasar baru. - **Tune concurrency per region.** US: 2-5. EU: 3. SEA: 8-16. Setiap pasar mendapat semaphore-nya sendiri dalam run campuran. --- # Boohoo Scraper — Data Produk di 7 Wilayah - **URL:** https://proooxy.com/id/tools/boohoo-scraper/ - **Tipe:** tools - **Deskripsi:** Ekstrak data produk dari situs e-commerce Boohoo di 7 wilayah dengan paginasi otomatis, facet filtering, dan dukungan multi-mata uang. - **Ringkasan:** Scrape data produk Boohoo dari 7 toko regional. - **Kategori:** ecommerce - **Tech stack:** TypeScript, Cheerio, Fingerprint Generator - **Pasar / wilayah:** Belanda, Swedia, Inggris, Irlandia, Prancis, Australia, Amerika Serikat - **Strategi anti-bot:** Fingerprint generation untuk bypass anti-bot - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/boohoo-scraper - **Kata Kunci:** scraper boohoo, data produk boohoo, monitoring harga boohoo, scraper fast fashion, data katalog fashion, data fashion multi-region - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Dukungan 7 toko regional — Belanda (EUR), Swedia (SEK), Inggris (GBP), Irlandia (EUR), Prancis (EUR), Australia (AUD), Amerika Serikat (USD) - Scraping kategori dan search dengan paginasi otomatis - Dukungan facet filter — ukuran, warna, rentang harga, gaya (style) - Detail produk lengkap termasuk varian dan status stok - Browser fingerprint generation untuk bypass anti-bot - Harga multi-mata uang berdasarkan toko regional **Use case:** - Analisis harga kompetitif fast fashion - Perbandingan harga multi-region untuk produk yang sama - Monitoring tren di fashion terjangkau - Pelacakan inventory dan stok lintas region - Riset pasar fashion di pasar Eropa dan global **Parameter input:** - `startUrls` (array, wajib) — URL produk atau kategori Boohoo - `maxRequestsPerCrawl` (number, opsional) — Batas request (default: 5) - `maxConcurrency` (number, opsional) — Request paralel (default: 5) - `proxy` (object, opsional) — Konfigurasi proxy **FAQ:** **Q: Toko regional Boohoo mana saja yang didukung?** Belanda (EUR), Swedia (SEK), Inggris (GBP), Irlandia (EUR), Prancis (EUR), Australia (AUD), dan Amerika Serikat (USD). **Q: Bisakah saya memfilter produk berdasarkan ukuran atau warna?** Bisa, scraper ini mendukung facet filtering. Anda bisa memberikan URL kategori yang sudah difilter, dan scraper akan menghormati filter yang diterapkan. **Q: Bagaimana scraper ini menangani paginasi?** Paginasi berjalan otomatis. Berikan URL kategori atau search, dan scraper akan mengikuti semua link paginasi untuk mengekstrak setiap produk. ## Contoh Output ```json { "source": "https://www.boohoo.com/...", "brand": "boohoo", "title": "Oversized Hoodie", "description": "Stay cozy in this oversized hoodie...", "categories": ["Women", "Hoodies & Sweatshirts"], "price": { "current": 1500, "original": 3000, "currency": "GBP" }, "variants": [ { "sku": "BH-OH-BLK-S", "size": "S", "color": "Black", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Farfetch Scraper — Data Produk Fashion Mewah - **URL:** https://proooxy.com/id/tools/farfetch-scraper/ - **Tipe:** tools - **Deskripsi:** Ekstrak data produk fashion mewah dari Farfetch, termasuk harga multi-mata uang, variasi size/fit, dan rekomendasi produk. - **Ringkasan:** Scrape produk fashion mewah dari Farfetch dengan dukungan multi-mata uang. - **Kategori:** ecommerce - **Tech stack:** TypeScript, Cheerio, Crawlee - **Pasar / wilayah:** Global - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/farfetch - **Kata Kunci:** scraper farfetch, data produk farfetch, data fashion mewah, scraper fashion designer, monitoring harga farfetch, data retail mewah - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Scraping halaman kategori dan detail produk - Harga multi-mata uang — terdeteksi otomatis berdasarkan lokasi proxy - Ekstraksi variasi size/fit opsional - Hingga 90 produk rekomendasi per item - Galeri media lengkap dan deskripsi detail - Ekstraksi brand, kategori, dan extra info **Use case:** - Market intelligence fashion mewah - Perbandingan harga lintas platform untuk brand designer - Analisis tren fashion dan product discovery - Harga kompetitif untuk peritel multi-brand - Data training untuk product recommendation engine **Parameter input:** - `startUrls` (array, wajib) — URL produk atau kategori Farfetch - `proxy` (object, opsional) — Konfigurasi proxy — lokasi memengaruhi mata uang - `maxRequestsPerCrawl` (number, opsional) — Batas request (default: 100) - `maxConcurrency` (number, opsional) — Request paralel (default: 5) - `withSizeFit` (boolean, opsional) — Sertakan data size/fit (default: false) - `withRecommends` (boolean, opsional) — Sertakan rekomendasi (default: false) **FAQ:** **Q: Bagaimana cara kerja harga multi-mata uang?** Farfetch menampilkan harga berdasarkan lokasi Anda. Scraper ini memakai lokasi proxy Anda untuk menentukan mata uang yang dikembalikan. Gunakan proxy US untuk USD, proxy UK untuk GBP, dan seterusnya. **Q: Berapa banyak produk rekomendasi yang bisa diekstrak?** Hingga 90 produk rekomendasi per item saat withRecommends diaktifkan. Berguna untuk membangun product graph dan dataset rekomendasi. ## Contoh Output ```json { "source": "https://www.farfetch.com/shopping/...", "brand": "Gucci", "title": "GG Marmont Matelasse Shoulder Bag", "description": "Crafted from matelasse leather...", "details": ["Made in Italy", "100% Calf Leather"], "categories": ["Women", "Bags", "Shoulder Bags"], "options": [ { "name": "Size", "values": ["One Size"] } ], "variants": [ { "sku": "FF-GU-001", "price": 229000, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Global API Load Tester — Stress Test 10K+ RPS - **URL:** https://proooxy.com/id/tools/load-tester/ - **Tipe:** tools - **Deskripsi:** Tool load testing berperforma tinggi yang mensimulasikan 10,000+ request per detik dengan traffic geo-distributed, weighted target, dan laporan HTML interaktif. - **Ringkasan:** Simulasikan 10K+ RPS dengan load testing geo-distributed. - **Kategori:** utility - **Tech stack:** Go, Vegeta - **Pasar / wilayah:** Global - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/global-api-load-tester - **Kata Kunci:** tools load testing api, load testing http, tools stress testing, performance testing, load test 10k rps, load testing geo-distributed, vegeta load testing - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Performa ekstrem — 10,000+ request per detik - Testing geo-distributed dari US, EU, dan Asia - Weighted multi-target attack (contoh: 90% reads / 10% writes) - Dukungan residential proxy untuk traffic yang realistis - Constant-rate pacing untuk mencegah Coordinated Omission - Laporan HTML interaktif via Vegeta Plots - Metrik latency, throughput, dan error yang detail **Use case:** - Benchmark performa API sebelum launch - Capacity planning dan infrastructure sizing - Menemukan breaking point dan bottleneck - Testing konfigurasi CDN dan load balancer - Testing latency geo-distributed - Regression testing untuk endpoint yang performance-critical **Parameter input:** - `targets` (array, wajib) — Endpoint target dengan URL, method, body, header, dan weight - `rate` (number, opsional) — Request per detik (default: 50) - `duration` (number, opsional) — Durasi test dalam detik (default: 60) - `geoDistribution` (array, opsional) — Region dengan kode negara dan traffic weight - `useStickySessions` (boolean, opsional) — Pertahankan session affinity (default: true) - `maxCostLimit` (number, opsional) — Batas atas biaya untuk run test **FAQ:** **Q: Bagaimana cara kerja testing geo-distributed?** Anda menentukan kode negara dan traffic weight. Tool ini mendistribusikan request ke server proxy Apify di region-region tersebut, mensimulasikan pola traffic global yang realistis. **Q: Apa itu Coordinated Omission?** Ini adalah jebakan umum dalam load testing, di mana tool melambat saat target overload, sehingga hasilnya terlihat lebih baik dari kenyataan. Vegeta memakai constant-rate pacing untuk menghindari hal ini. **Q: Bisakah saya menguji endpoint yang terautentikasi?** Bisa, sertakan header authorization di konfigurasi target. Setiap target bisa punya header, method, dan body sendiri-sendiri. ## Contoh Output Load tester ini menghasilkan laporan HTML interaktif dan metrik terstruktur: ```json { "summary": { "totalRequests": 50000, "duration": "60s", "rps": 833.33, "successRate": 99.8, "latency": { "mean": "12.4ms", "p50": "10.1ms", "p95": "28.7ms", "p99": "89.2ms", "max": "342.1ms" }, "statusCodes": { "200": 49900, "503": 100 } } } ``` --- # Lululemon Scraper — Produk, Varian & Harga - **URL:** https://proooxy.com/id/tools/lululemon-scraper/ - **Tipe:** tools - **Deskripsi:** Crawl dan ekstrak detail produk dari Lululemon, termasuk data varian, opsi warna, galeri media, dan informasi harga. - **Ringkasan:** Ekstrak data produk lengkap dengan varian dan media dari Lululemon. - **Kategori:** ecommerce - **Tech stack:** TypeScript, Crawlee - **Pasar / wilayah:** Amerika Serikat - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/lululemon-scraper - **Kata Kunci:** scraper lululemon, data produk lululemon, pelacak harga lululemon, data produk activewear, data harga athleisure, scraper inventory lululemon - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Crawling halaman kategori dan produk - Ekstraksi varian dengan opsi warna dan ukuran - Galeri media lengkap dengan gambar spesifik per warna - Pelacakan harga dengan output terstruktur - Ekstraksi hierarki kategori - Ringan dan cepat dengan framework Crawlee **Use case:** - Riset pasar dan analisis kompetitif pakaian olahraga - Monitoring harga untuk reseller dan platform perbandingan - Agregasi katalog produk untuk e-commerce fitness - Pelacakan ketersediaan warna dan ukuran - Analisis tren fashion activewear **Parameter input:** - `startUrls` (array, wajib) — URL produk atau kategori Lululemon - `proxy` (object, opsional) — Konfigurasi proxy - `maxConcurrency` (number, opsional) — Batas request paralel **FAQ:** **Q: Apakah scraper ini menangani varian warna yang berbeda?** Ya, setiap varian warna diekstrak dengan gambar, SKU, dan status ketersediaannya masing-masing. Galeri medianya spesifik per warna. **Q: Bisakah saya men-scrape seluruh kategori Lululemon?** Bisa, berikan URL kategori dan scraper akan meng-crawl semua produk di dalam kategori tersebut. ## Contoh Output ```json { "source": "https://shop.lululemon.com/p/...", "brand": "lululemon", "title": "Align High-Rise Pant 25\"", "description": "Buttery-soft, weightless Nulu fabric...", "categories": ["Women", "Pants", "Yoga Pants"], "options": [ { "name": "Color", "values": ["Black", "True Navy", "Dark Olive"] }, { "name": "Size", "values": ["2", "4", "6", "8", "10", "12"] } ], "variants": [ { "sku": "LL-AHR-BLK-6", "name": "Black / 6", "price": 9800, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://...", "color": "Black" } ], "stats": { "rating": 4.7, "reviewCount": 15234 } } ``` --- # Schema Markup Scraper & Auditor SEO - **URL:** https://proooxy.com/id/tools/schema-markup-scraper/ - **Tipe:** tools - **Deskripsi:** Ekstrak JSON-LD, Microdata, RDFa, Open Graph, dan Twitter Cards dari URL mana pun dengan sistem scoring audit SEO yang komprehensif. - **Ringkasan:** Ekstrak structured data dan audit SEO untuk situs web mana pun. - **Kategori:** utility - **Tech stack:** TypeScript, Crawlee - **Pasar / wilayah:** Global - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/metadata-scraper - **Kata Kunci:** cek schema markup, extractor structured data, extractor json-ld, tools audit seo, cek open graph, scraper microdata, rich results testing - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Ekstraksi structured data — JSON-LD, Microdata, dan RDFa - Meta tag sosial — Open Graph, Twitter Cards, Dublin Core - Analisis SEO dengan scoring 0-100 - Validasi canonical URL dan hreflang - Ekstraksi author untuk sinyal EEAT - Deteksi LocalBusiness dengan 80+ subtype - Audit alt text gambar - Validasi schema breadcrumb - Ekstraksi geo tag dan NAP **Use case:** - Audit SEO teknis dalam skala besar - Validasi structured data untuk situs web - Analisis SEO kompetitif — bandingkan schema markup antar kompetitor - Penilaian sinyal EEAT untuk situs konten - Audit SEO lokal untuk bisnis - Validasi checklist SEO sebelum launch **Parameter input:** - `startUrls` (array, wajib) — URL yang akan dianalisis - `proxy` (object, opsional) — Konfigurasi proxy - `maxRequestsPerCrawl` (number, opsional) — Batas total URL yang diaudit - `maxConcurrency` (number, opsional) — Request paralel - `extractMetaTags` (boolean, opsional) — Ekstrak meta tag (default: true) - `extractSeoAnalysis` (boolean, opsional) — Jalankan analisis SEO (default: true) - `computeSeoScore` (boolean, opsional) — Hitung skor SEO 0-100 (default: true) - `extractGeoData` (boolean, opsional) — Ekstrak geo tag dan data NAP **FAQ:** **Q: Format structured data apa saja yang didukung?** JSON-LD, Microdata, dan RDFa. Scraper ini juga mengekstrak metadata Open Graph, Twitter Cards, dan Dublin Core. **Q: Bagaimana skor SEO dihitung?** Skor 0-100 ini mengevaluasi title tag, meta description, hierarki heading, alt text gambar, canonical URL, mobile viewport, keberadaan structured data, dan lainnya. **Q: Bisakah saya mengaudit banyak halaman sekaligus?** Bisa, berikan beberapa URL di startUrls. Scraper akan memprosesnya secara paralel untuk audit massal yang cepat. ## Contoh Output ```json { "url": "https://example.com/product/...", "title": "Example Product Page", "linkedData": [ { "@type": "Product", "name": "..." } ], "openGraph": { "og:title": "Example Product", "og:type": "product" }, "twitterCard": { "card": "summary_large_image" }, "seoAudit": { "score": 78, "issues": [ "Missing alt text on 3 images", "No hreflang tags detected" ] }, "headings": { "h1": ["Example Product"], "h2": ["Description", "Reviews"] } } ``` --- # Sephora EU Scraper — 9 Pasar Eropa - **URL:** https://proooxy.com/id/tools/sephora-eu-scraper/ - **Tipe:** tools - **Deskripsi:** Scrape data produk lengkap dari Sephora Europe di 9 pasar EU dengan ekstraksi multi-varian, bypass Akamai WAF, dan smart token management. - **Ringkasan:** Ekstrak data produk dari Sephora di 9 pasar Eropa. - **Kategori:** ecommerce - **Tech stack:** TypeScript, Crawlee, Akamai Bypass - **Pasar / wilayah:** Prancis, Italia, Jerman, Spanyol, Polandia, Ceko, Yunani, Rumania, Portugal - **Strategi anti-bot:** Akamai WAF — TLS fingerprinting setara browser - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/sephora-eu-scraper - **Kata Kunci:** scraper sephora eropa, data produk sephora eu, data kecantikan eropa, scraper sephora prancis, scraper sephora jerman, data kosmetik eropa, bypass akamai waf - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Dukungan 9 pasar EU — Prancis, Italia, Jerman, Spanyol, Polandia, Ceko, Yunani, Rumania, Portugal - Ekstraksi multi-varian dengan harga dan status stok masing-masing - Galeri gambar resolusi tinggi untuk setiap produk - Penjelajahan kategori via category ID untuk ekstraksi massal - TLS fingerprinting setara browser untuk bypass Akamai WAF - Manajemen guest token dengan refresh otomatis dan exponential backoff **Use case:** - Perbandingan harga pasar kecantikan pan-Eropa - Monitoring ketersediaan produk lintas pasar - Riset ekspansi pasar EU untuk brand kecantikan - Competitive intelligence di seluruh pasar Eropa - Analisis strategi harga regional **Parameter input:** - `startUrls` (array, opsional) — URL produk Sephora EU yang akan di-scrape - `categoryIds` (array, opsional) — Category ID untuk ekstraksi produk massal - `locale` (string, opsional) — Locale pasar target (contoh: fr-FR, it-IT) - `maxProducts` (number, opsional) — Jumlah maksimum produk yang diekstrak - `maxConcurrency` (number, opsional) — Batas request paralel - `proxyConfiguration` (object, opsional) — Pengaturan proxy — residential disarankan **FAQ:** **Q: Pasar Sephora Eropa mana saja yang didukung?** Prancis (fr-FR), Italia (it-IT), Jerman (de-DE), Spanyol (es-ES), Polandia (pl-PL), Republik Ceko (cs-CZ), Yunani (el-GR), Rumania (ro-RO), dan Portugal (pt-PT). **Q: Bagaimana scraper ini bypass Akamai WAF?** Scraper ini memakai TLS fingerprinting setara browser untuk meniru koneksi browser asli, sehingga request tidak bisa dibedakan dari traffic pengguna sungguhan. **Q: Bisakah saya men-scrape seluruh kategori?** Bisa, Anda bisa memberikan category ID untuk mengekstrak semua produk dalam sebuah kategori. Ini adalah cara paling efisien untuk melakukan ekstraksi massal. ## Contoh Output ```json { "source": "https://www.sephora.fr/p/...", "brand": "Rare Beauty", "title": "Soft Pinch Liquid Blush", "description": "Un blush liquide longue tenue...", "shortDescription": "Blush liquide", "categories": ["Maquillage", "Teint", "Blush"], "options": [ { "name": "Shade", "values": ["Joy", "Hope", "Grace"] } ], "variants": [ { "sku": "EU-RB-001", "name": "Joy", "price": 2800, "currency": "EUR", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ], "stats": { "rating": 4.7, "reviewCount": 3421 } } ``` --- # Shopify Scraper — Data Produk dari Toko Manapun - **URL:** https://proooxy.com/id/tools/shopify-scraper/ - **Tipe:** tools - **Deskripsi:** Tool kelas profesional untuk mengekstrak data produk dengan fidelitas tinggi dari toko Shopify mana pun, termasuk collection, search, dan rekomendasi produk. - **Ringkasan:** Ekstrak data produk dari toko Shopify mana pun. - **Kategori:** ecommerce - **Tech stack:** TypeScript, got-scraping - **Pasar / wilayah:** Global - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/shopify-scraper-ppe - **Kata Kunci:** scraping data shopify, scraper produk shopify, scrape toko shopify, data produk shopify, alternatif api shopify, ekstraksi data ecommerce, export produk shopify, scraper collection shopify - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Universal — bekerja dengan toko Shopify mana pun - Dukungan ekstraksi katalog seluruh toko dan search - Rekomendasi produk (hingga 20 per produk) - Scraping collection dan produk individual - Ekstraksi tag dan kategori - Normalisasi mata uang (harga x100) untuk presisi **Use case:** - Riset pasar di toko-toko Shopify pada niche apa pun - Analisis kompetitif untuk brand DTC - Agregasi katalog produk untuk platform perbandingan - Monitoring tren di toko-toko e-commerce independen - Membangun dataset rekomendasi produk - Monitoring harga untuk reseller **Parameter input:** - `startUrls` (array, wajib) — URL toko Shopify — produk, collection, atau home toko - `proxy` (object, opsional) — Residential proxy disarankan untuk hasil terbaik - `maxRequestsPerCrawl` (number, opsional) — Batas request (default: 100) - `maxRecommendationsPerProduct` (number, opsional) — Jumlah produk rekomendasi yang diambil (default: 0, max: 20) - `query` (string, opsional) — Search query untuk menemukan produk dalam sebuah toko **FAQ:** **Q: Apakah ini bekerja dengan toko Shopify mana pun?** Ya, scraper ini bekerja dengan toko mana pun yang memakai Shopify. Scraper ini memanfaatkan struktur data produk standar Shopify, yang konsisten di semua toko. **Q: Bisakah saya mencari produk tertentu?** Bisa, gunakan parameter query untuk mencari di dalam toko tertentu. Berguna untuk menemukan jenis produk tertentu tanpa harus men-scrape seluruh katalog. **Q: Bagaimana rekomendasi produk diekstrak?** Set maxRecommendationsPerProduct untuk mengambil produk terkait. Hingga 20 rekomendasi tersedia per produk, berguna untuk membangun product graph. ## Contoh Output ```json { "source": "https://store.example.com/products/...", "brand": "Example Brand", "title": "Premium Organic Cotton T-Shirt", "description": "Made from 100% organic cotton...", "categories": ["Tops", "T-Shirts"], "tags": ["organic", "sustainable", "cotton"], "options": [ { "name": "Size", "values": ["S", "M", "L", "XL"] }, { "name": "Color", "values": ["White", "Black", "Navy"] } ], "variants": [ { "sku": "SHOP-OCT-WHT-M", "name": "White / M", "price": 4500, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Ulta Beauty Scraper — Produk, Harga & SKU - **URL:** https://proooxy.com/id/tools/ulta-scraper/ - **Tipe:** tools - **Deskripsi:** Ekstrak detail produk, harga, gambar, dan informasi SKU dari Ulta Beauty, termasuk halaman kategori, halaman brand, dan section sale. - **Ringkasan:** Scrape data produk lengkap dari Ulta Beauty. - **Kategori:** ecommerce - **Tech stack:** TypeScript, Cheerio, Crawlee - **Pasar / wilayah:** Amerika Serikat - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/ulta-scraper - **Kata Kunci:** scraper ulta, scraper ulta beauty, data produk ulta, pelacak harga ulta, scraper sku ulta, monitoring sale ulta, data retail kecantikan - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Mendukung halaman category, product detail, brand, dan sale - Detail produk lengkap dengan harga, deskripsi, dan gambar - Ekstraksi data level SKU dengan pengelompokan varian - Deteksi otomatis jenis halaman dari URL - Parsing berbasis Cheerio yang ringan demi kecepatan - Mengelompokkan SKU terkait di bawah produk yang sama **Use case:** - Analisis kompetitif industri kecantikan — harga Ulta vs Sephora - Membangun katalog produk untuk platform comparison shopping - Monitoring sale dan promosi - Penemuan brand dan pelacakan kehadiran pasar - Monitoring inventory level SKU **Parameter input:** - `startUrls` (array, wajib) — URL produk, kategori, brand, atau sale Ulta - `proxy` (object, opsional) — Konfigurasi proxy - `maxConcurrency` (number, opsional) — Jumlah maksimum request paralel - `maxRequestsPerCrawl` (number, opsional) — Batas total request per run **FAQ:** **Q: Jenis halaman Ulta apa saja yang bisa di-scrape?** Scraper ini mendukung halaman product detail, halaman listing kategori, halaman brand, dan halaman sale/promosi. Jenis halamannya terdeteksi otomatis dari URL. **Q: Bagaimana varian produk ditangani?** Varian (shade, ukuran yang berbeda) dikelompokkan di bawah produk induk yang sama. Setiap varian menyertakan SKU, harga, dan status ketersediaannya masing-masing. ## Contoh Output ```json { "source": "https://www.ulta.com/p/...", "brand": "NYX Professional Makeup", "title": "Butter Gloss", "description": "A buttery soft and silky lip gloss...", "categories": ["Makeup", "Lips", "Lip Gloss"], "variants": [ { "sku": "ULTA-NYX-BG-001", "name": "Angel Food Cake", "price": 900, "currency": "USD", "inStock": true } ], "stats": { "rating": 4.5, "reviewCount": 8932 } } ``` --- # Universal Web Printer — URL & HTML ke PDF, Gambar - **URL:** https://proooxy.com/id/tools/web-printer/ - **Tipe:** tools - **Deskripsi:** Konversi URL atau HTML apa pun ke PDF, PNG, JPEG, atau WebP dengan smart scroll-stitch, ekstraksi elemen, enkripsi PDF, dan watermarking. - **Ringkasan:** Konversi URL dan HTML ke PDF, PNG, JPEG, atau WebP. - **Kategori:** utility - **Tech stack:** TypeScript, Playwright, PDF-lib, Sharp - **Pasar / wilayah:** Global - **Tingkat keberhasilan yang dilaporkan:** >99% - **Listing Apify:** https://apify.com/autofacts/universal-web-printer - **Kata Kunci:** api html ke pdf, konversi url ke pdf, api screenshot website, web page ke pdf, url ke gambar, webpage ke png, api pembuatan pdf - **Diterbitkan:** 2026-04-04 - **Diperbarui:** 2026-04-04 **Fitur utama:** - Output multi-format — PDF, PNG, JPEG, WebP - Beragam view mode — viewport, full-page, CSS selector, readability - Smart scroll-stitch untuk capture full-page yang akurat - Ekstraksi level elemen via CSS selector - Manipulasi halaman — hapus elemen, klik tombol, inject CSS, sembunyikan fixed header - Enkripsi PDF (RC4 128-bit) dan watermarking - PDF merging untuk dokumen multi-halaman - Konfigurasi viewport dan scale factor custom **Use case:** - Generasi laporan otomatis dari web dashboard - Pengarsipan dan dokumentasi situs web - Snapshot visual regression testing - Screenshot halaman produk e-commerce untuk katalog - Kepatuhan hukum — menangkap konten web sebagai bukti - Menghasilkan PDF dari aplikasi web **Parameter input:** - `startUrls` (array, opsional) — URL yang akan di-render - `htmlContent` (string, opsional) — Raw HTML yang akan di-render - `outputFormat` (string, opsional) — pdf, png, jpeg, atau webp (default: pdf) - `viewMode` (string, opsional) — viewport, fullPage, selector, atau readability - `targetSelector` (string, opsional) — CSS selector untuk capture level elemen - `viewportWidth` (number, opsional) — Lebar viewport browser (default: 1280) - `viewportHeight` (number, opsional) — Tinggi viewport browser (default: 720) - `removeSelectors` (array, opsional) — CSS selector dari elemen yang akan dihapus sebelum capture - `pdfPassword` (string, opsional) — Enkripsi PDF dengan enkripsi RC4 128-bit **FAQ:** **Q: Bisakah saya menangkap hanya elemen tertentu di halaman?** Bisa, gunakan parameter targetSelector dengan sebuah CSS selector untuk menangkap hanya elemen tertentu. Contohnya, gunakan '#main-content' untuk menangkap hanya area konten utama. **Q: Bagaimana cara kerja smart scroll-stitch?** Untuk capture full-page, tool ini men-scroll halaman secara bertahap, menangkap setiap potongan viewport, lalu menggabungkannya (stitch). Ini memastikan konten lazy-loaded dan animasi tertangkap dengan benar. **Q: Bisakah saya menghapus cookie banner atau iklan sebelum capture?** Bisa, gunakan removeSelectors untuk menentukan CSS selector dari elemen yang akan dihapus. Anda juga bisa memakai hideFixedElements untuk menyembunyikan sticky header dan elemen floating. ## Contoh Output Tool ini menghasilkan file dalam format pilihan Anda (PDF, PNG, JPEG, atau WebP) dan menyimpannya di Apify dataset. Setiap output menyertakan metadata: ```json { "url": "https://example.com", "format": "pdf", "fileName": "example-com.pdf", "fileSize": 245832, "viewMode": "fullPage", "viewport": { "width": 1280, "height": 720 }, "encrypted": false } ``` --- # Best Practice Web Scraping di 2026: Panduan Praktisi - **URL:** https://proooxy.com/id/blog/web-scraping-best-practices-2026/ - **Tipe:** blog - **Deskripsi:** Strategi web scraping yang teruji dari pengalaman produksi 12+ tahun — pola arsitektur, error handling, manajemen proxy, dan normalisasi output. - **Kata Kunci:** best practice web scraping, cara scraping data production, panduan ekstraksi data, arsitektur scraper yang baik, tips web scraping, manajemen proxy scraping - **Diterbitkan:** 2026-04-01 - **Diperbarui:** 2026-04-01 Setelah membangun dan memelihara 15 scraper produksi yang melayani lebih dari 3,100 pengguna dengan tingkat keberhasilan >99%, berikut praktik-praktik yang benar-benar penting. ## Arsitektur: Berpikir dalam Pipeline, Bukan Script Kesalahan terbesar yang sering saya lihat adalah memperlakukan scraping sebagai proses satu langkah. Scraper produksi adalah pipeline data: 1. **Penemuan URL** — menemukan apa yang perlu di-scrape (sitemap, halaman kategori, pencarian, API) 2. **Eksekusi Request** — mengambil data dengan retry dan rotasi yang tepat 3. **Parsing** — mengekstrak field terstruktur dari response mentah 4. **Normalisasi** — membersihkan, memvalidasi, dan menstandardisasi output 5. **Storage** — dikirim ke dataset, database, atau sistem downstream Setiap langkah harus bisa diuji dan di-retry secara independen. Saat Sephora mengubah layout halaman produknya, hanya langkah 3 yang perlu diperbarui — sisa pipeline-nya tetap stabil. ## Selalu Utamakan API Dibanding HTML Parsing Sebelum menulis satu pun CSS selector, cek dulu apakah situsnya punya: - **API publik** — endpoint terdokumentasi yang mengembalikan JSON - **API private** — panggilan XHR/fetch yang terlihat di browser DevTools - **Endpoint GraphQL** — makin umum ditemukan, sering dengan introspection aktif - **JSON tertanam** — `__NEXT_DATA__`, `window.__INITIAL_STATE__`, atau JSON-LD di dalam HTML Respons API terstruktur, ber-versi, dan jauh lebih stabil dibanding layout HTML. [Sephora scraper](/id/tools/sephora-scraper/) saya mengonversi setiap URL web menjadi panggilan API — belum pernah rusak sekalipun akibat redesign frontend. ## Strategi Proxy: Sesuaikan dengan Proteksinya Tidak semua situs butuh residential proxy. Berikut kerangka keputusan saya: | Level Proteksi | Jenis Proxy | Contoh Situs | |-----------------|------------|---------------| | Tidak ada / Basic | Datacenter | Sebagian besar toko Shopify, situs kecil | | Rate limiting | Datacenter berotasi | E-commerce menengah, situs konten | | Fingerprinting | Residential | Sephora, Farfetch, brand besar | | WAF tingkat lanjut | Residential + TLS fingerprint | Akamai, Cloudflare Enterprise | Insight kuncinya: **biaya proxy naik seiring level proteksi**. Jangan buang-buang uang untuk residential proxy pada situs yang cuma memeriksa reputasi IP. [Shopify scraper](/id/tools/shopify-scraper/) saya bekerja baik dengan datacenter proxy karena proteksi default Shopify minimal. ## Manajemen Sesi Adalah Segalanya Perbedaan antara tingkat keberhasilan 60% dan 99% biasanya terletak pada manajemen sesi: - **Rotasi sesi, bukan cuma IP** — IP baru dengan cookie yang sama terlihat mencurigakan - **Panaskan sesi (warm up)** — kunjungi homepage sebelum mengakses halaman produk - **Hormati rate limit** — 5 concurrent request lebih baik daripada 50 yang malah diblokir - **Exponential backoff** — retry 1s, 2s, 4s, 8s, bukan retry langsung [Sephora EU scraper](/id/tools/sephora-eu-scraper/) saya mengelola guest token dengan refresh otomatis dan exponential backoff. Scraper ini mempertahankan sesi persisten yang menyerupai pola browsing asli. ## Normalisasi Output Anda Data hasil scraping mentah itu berantakan. Normalisasi semuanya: ### Harga Simpan sebagai integer (sen, bukan dolar). `$29.99` menjadi `2999`. Ini menghindari error presisi floating-point yang bisa merusak data finansial di tahap selanjutnya. Setiap scraper e-commerce saya memakai konvensi ini. ### URL Selalu simpan absolute URL, jangan pernah relative path. Resolve URL-nya pada saat ekstraksi. ### Tanggal ISO 8601 (`2026-04-01T00:00:00Z`), selalu dengan timezone. Jangan pernah menyimpan tanggal dalam format locale tertentu. ### Teks Hapus whitespace berlebih, normalisasi Unicode, dan tentukan kebijakan penanganan HTML (hapus tag vs. pertahankan formatting). ## Error Handling: Bersiaplah untuk Kegagalan Scraper produksi gagal terus-menerus — pertanyaannya adalah seberapa graceful kegagalannya. Pendekatan saya: ``` Request fails (network error, timeout, 4xx/5xx) → Retry with exponential backoff (up to 5 attempts) → Rotate session/proxy on retry → Log failure with full context if all retries exhausted → Continue processing remaining URLs (don't crash the batch) ``` Lacak tingkat keberhasilan per pola URL. Jika halaman `/category/*` tiba-tiba turun di bawah 90% keberhasilan, kemungkinan besar situsnya mengubah sesuatu — Anda akan menyadarinya sebelum pengguna melapor. ## Monitor dan Alert Scraper tanpa monitoring adalah scraper yang tinggal menunggu waktu untuk gagal secara diam-diam. Lacak: - **Success rate** per run dan per pola URL - **Jumlah output** — penurunan tiba-tiba berarti ada yang rusak - **Kualitas data** — field null, nilai tak terduga, pelanggaran skema - **Biaya** — pemakaian proxy, waktu compute, storage Semua Apify Actor saya mengekspos metrik-metrik ini. Saat tingkat keberhasilan menurun, saya mendapat notifikasi dalam hitungan jam — seringkali sebelum ada pengguna yang menyadarinya. ## Mulai Sederhana, Tambahkan Kompleksitas Setiap scraper yang saya bangun dimulai dari hal paling sederhana yang bisa berfungsi: 1. **HTTP + Cheerio** dulu (paling cepat, paling murah) 2. **Tambahkan fingerprinting** hanya jika diblokir 3. **Tambahkan browser rendering** hanya jika JavaScript diperlukan 4. **Tambahkan rotasi proxy** hanya jika kena rate limit [Ulta scraper](/id/tools/ulta-scraper/) saya murni Cheerio — tidak perlu browser. [Universal Web Printer](/id/tools/web-printer/) saya memakai Playwright karena harus me-render JavaScript. Tool yang tepat untuk pekerjaan yang tepat. --- Ini bukan prinsip teoretis — semuanya diambil dari pengalaman menjalankan scraper produksi yang memproses jutaan request. Jika Anda butuh scraper custom yang dibangun dengan praktik-praktik ini, [mari bicara](/id/contact/). --- # Memahami Proteksi Anti-Bot: Apa yang Berhasil di 2026 - **URL:** https://proooxy.com/id/blog/bypassing-anti-bot-protection-guide/ - **Tipe:** blog - **Deskripsi:** Pembahasan teknis mendalam tentang sistem anti-bot modern — Cloudflare, Akamai, Datadome — dan teknik bypass yang sah dipakai dalam scraping produksi. - **Kata Kunci:** bypass anti-bot cloudflare, cara bypass akamai, bypass datadome, deteksi bot scraping, proteksi web scraping, teknik bypass anti-bot 2026 - **Diterbitkan:** 2026-03-15 - **Diperbarui:** 2026-03-15 Proteksi anti-bot adalah perlombaan senjata. Sebagai orang yang membangun scraper produksi yang menembus sistem-sistem ini setiap hari, berikut pandangan seorang praktisi tentang lanskapnya — apa yang sebenarnya diperiksa oleh sistem proteksi ini dan seperti apa teknik bypass yang sah. ## Lapisan-Lapisan Deteksi Sistem anti-bot modern beroperasi dalam beberapa lapisan. Memahami lapisan-lapisan ini adalah kunci untuk bypass yang andal: ### Lapisan 1: Reputasi IP Pemeriksaan paling sederhana. Layanan anti-bot memelihara database rentang IP datacenter yang dikenal, exit VPN, dan IP yang sebelumnya sudah ditandai. **Yang mereka periksa:** - Apakah IP ini berasal dari AWS, GCP, Azure, atau hosting provider yang dikenal? - Apakah IP ini pernah ditandai karena aktivitas bot sebelumnya? - Berapa banyak request yang baru-baru ini datang dari IP ini? **Cara mengatasinya:** Residential proxy dari layanan seperti Apify Proxy atau Bright Data menyediakan alamat IP milik ISP asli, sehingga tidak bisa dibedakan dari pengguna biasa di level IP. ### Lapisan 2: TLS Fingerprinting Di sinilah bagian yang menarik. Setiap klien HTTP punya signature TLS handshake yang unik, berdasarkan: - Cipher suite yang didukung beserta urutannya - Ekstensi TLS beserta urutannya - Versi TLS yang didukung - Protokol ALPN Library `axios` atau `requests` standar memiliki TLS fingerprint yang jelas-jelas berteriak "bot" karena tidak cocok dengan browser asli mana pun. Layanan seperti Akamai dan Cloudflare memelihara database fingerprint untuk setiap versi browser. **Cara mengatasinya:** Library seperti `got-scraping` (yang dipakai [Shopify scraper](/id/tools/shopify-scraper/) saya) dan klien TLS khusus bisa meniru TLS fingerprint setara browser asli. [Sephora EU scraper](/id/tools/sephora-eu-scraper/) saya menggunakan TLS fingerprinting setara browser untuk bypass Akamai WAF. ### Lapisan 3: HTTP/2 Fingerprinting Selain TLS, setting HTTP/2 juga mengungkap jenis klien: - Parameter frame SETTINGS (ukuran header table, max concurrent stream) - Nilai frame WINDOW_UPDATE - Struktur priority tree - Pola kompresi header (HPACK) Setiap browser punya setting HTTP/2 yang khas. Chrome, Firefox, dan Safari semuanya terlihat berbeda di level ini. ### Lapisan 4: JavaScript Challenge Halaman "checking your browser" milik Cloudflare dan challenge serupa menjalankan JavaScript yang: - Memeriksa API browser (canvas, WebGL, AudioContext) - Mengukur timing eksekusi - Memvalidasi properti DOM - Mengirim balik respons challenge ke server **Cara mengatasinya:** Headless browser (Playwright, Puppeteer) menjalankan challenge ini secara native. Kuncinya adalah memastikan headless browser Anda tidak membocorkan sinyal otomatisasi (lebih lanjut di bawah). ### Lapisan 5: Analisis Perilaku Lapisan paling canggih. Sistem ini menganalisis: - Pola pergerakan mouse (terlalu linear = bot) - Perilaku scroll (langsung scroll ke bawah secara instan = bot) - Jeda waktu antar-aksi (terlalu konsisten = bot) - Pola navigasi (langsung menuju halaman produk tanpa browsing = mencurigakan) - Cadence request (interval yang seragam sempurna = bot) ## Profil Proteksi: Kenali Apa yang Anda Hadapi ### Cloudflare **Umum ditemukan di:** Situs kecil hingga menengah, blog, API Cloudflare menawarkan beberapa level proteksi: - **Basic** — Reputasi IP + rate limiting. Datacenter proxy yang menghormati rate limit biasanya berhasil. - **Managed Challenge** — JavaScript challenge + turnstile. Butuh browser atau challenge solver. - **Enterprise/Bot Management** — Analisis perilaku penuh + fingerprinting. Butuh residential proxy + fingerprinting yang tepat. ### Akamai Bot Manager **Umum ditemukan di:** E-commerce enterprise (Sephora EU, peritel besar) Akamai adalah salah satu yang paling sulit di-bypass karena: - TLS fingerprinting yang agresif - Pengumpulan sensor data via JavaScript sisi klien - Analisis perilaku di level sesi - Verifikasi integritas cookie Pendekatan saya untuk Akamai: TLS fingerprinting setara browser + manajemen guest token + pacing request yang meniru browsing manusia. ### Datadome **Umum ditemukan di:** E-commerce, ticketing Datadome berfokus pada: - Device fingerprinting via JavaScript - Challenge CAPTCHA untuk traffic yang mencurigakan - Behavioral scoring real-time ### PerimeterX (kini HUMAN) **Umum ditemukan di:** Retail, layanan finansial Dikenal karena JavaScript challenge dan analisis perilaku yang agresif. ## Arsitektur Bypass yang Sah Untuk sistem produksi yang butuh ekstraksi data yang andal dan berkelanjutan, berikut pola arsitektur yang saya pakai: ### 1. Pendekatan API-First Sebelum mencoba bypass proteksi apa pun, cek dulu apakah ada jalur API yang sepenuhnya menghindari WAF. Banyak proteksi hanya berlaku untuk endpoint yang menghadap browser, bukan route API. [Sephora scraper](/id/tools/sephora-scraper/) saya mengonversi setiap URL web menjadi panggilan API. Endpoint API punya proteksi yang lebih ringan dibanding website karena dirancang untuk aplikasi mobile. ### 2. Pemanasan Sesi Jangan langsung loncat ke halaman data. Bangun sesi browsing yang realistis: ``` Visit homepage → Browse categories → View product listing → Access product detail ``` Setiap langkah membangun kredibilitas sesi. Sistem anti-bot melihat pola yang cocok dengan perilaku pengguna asli. ### 3. Konsistensi Fingerprint Ini krusial: fingerprint Anda harus **konsisten secara internal**. Jika TLS Anda bilang "Chrome 120" tapi User-Agent Anda bilang "Chrome 118", itu adalah sinyal deteksi. Selaraskan: - TLS fingerprint - Setting HTTP/2 - Header User-Agent - Accept-Language dan header lainnya - Properti browser JavaScript (jika memakai headless) ### 4. Request Pacing Manusia asli tidak membuat request pada interval tepat 1 detik. Terapkan variance yang realistis: - Delay dasar antar-request (2-5 detik) - Jitter acak (+/- 30%) - Jeda lebih panjang setelah event navigasi - Periode "idle" sesekali ### 5. Graceful Degradation Saat Anda menemui challenge atau block: 1. Jangan langsung retry — ini justru mengonfirmasi perilaku bot 2. Back off secara eksponensial 3. Rotasi ke sesi baru (IP baru + cookie baru) 4. Coba region proxy yang berbeda 5. Jika masih berlanjut, alihkan ke pendekatan berbasis browser ## Yang Sudah Tidak Berhasil (Lagi) - **Sekadar mengganti User-Agent** — sistem deteksi memeriksa puluhan sinyal, bukan cuma satu header - **Delay acak saja** — tanpa fingerprinting yang tepat, timing saja tidak membantu - **Headless Chrome dengan setting default** — sinyal otomatisasi bocor di mana-mana (`navigator.webdriver`, plugin yang hilang, artifact Chrome DevTools Protocol) - **Cookie replay** — sistem modern mengikat cookie ke TLS fingerprint dan rentang IP ## Pertimbangan Etis Bypass anti-bot adalah sebuah tool. Seperti tool lainnya, ia bisa dipakai secara bertanggung jawab atau tidak. **Use case yang sah:** - Perbandingan harga untuk kepentingan konsumen - Riset pasar dengan data publik - Aksesibilitas (menyediakan data dalam format terstruktur) - Riset akademis - Quality assurance dan monitoring **Selalu hormati:** - Aturan robots.txt - Rate limit (meski Anda bisa melampauinya, jangan lakukan) - Regulasi data pribadi (GDPR, CCPA) - Terms of service (pahami lanskap hukum di yurisdiksi Anda) Semua [tools](/id/tools/) saya dirancang untuk ekstraksi data yang sah, dengan rate limiting bawaan dan praktik terbaik proxy. --- Memahami sistem anti-bot membuat Anda menjadi scraping engineer yang lebih baik. Jika Anda butuh scraper kelas produksi yang menangani tantangan ini secara andal, lihat [tools](/id/tools/) saya atau [hubungi saya](/id/contact/) untuk pekerjaan custom. --- # Kontak - **URL:** https://proooxy.com/id/contact/ - **Tipe:** page - **Deskripsi:** Pesan scraper custom atau pipeline data RAG — reverse engineering private API, bypass anti-bot, dan JSON terstruktur bersih yang dikirim langsung ke stack AI Anda. - **Kata Kunci:** jasa web scraping developer, jasa pembuatan scraper custom, layanan web scraping, pipeline data RAG, jasa ekstraksi data, konsultan web scraping - **Diterbitkan:** 0001-01-01 - **Diperbarui:** 0001-01-01 ## Dapatkan data yang belum ada di katalog Saya membangun web scraper custom dan pipeline data RAG — untuk tim AI, platform data, dan siapa pun yang membutuhkan web terbuka sebagai JSON terstruktur yang bersih. Sekali tarik data atau feed yang terus diperbarui, saya bisa bantu. ### Yang saya bangun - **Scraper custom** — dibuat khusus untuk situs target Anda, dengan bypass anti-bot yang sudah tertanam - **Pipeline data RAG** — ekstraksi, normalisasi, chunking, dan pengiriman JSON siap-retrieval ke vector store atau warehouse Anda - **Reverse engineering private API** — mengubah endpoint mobile/web yang tidak terdokumentasi menjadi sumber data yang stabil dan terstruktur - **Maintenance scraper** — menjaga extractor yang sudah ada tetap berjalan saat situs target berubah - **Konsultasi teknis** — review arsitektur untuk stack scraping dan data-ingestion Anda ### Cara kerjanya 1. **Jelaskan datanya** — sumbernya, field yang Anda butuhkan, dan format pengiriman 2. **Cek kelayakan gratis** — saya menilai kompleksitas target dan tingkat proteksi anti-bot-nya tanpa biaya 3. **Proposal & timeline** — cakupan jelas, harga tetap, tanggal pengiriman 4. **Bangun & kirim** — extractor kelas produksi lengkap dengan dokumentasi dan output yang bersih ### Mulai sebuah proyek
### Atau hubungi saya langsung - **Email**: [p8p9cmk96@mozmail.com](mailto:p8p9cmk96@mozmail.com) - **GitHub**: [@autofacts](https://github.com/autofacts) - **Apify**: [apify.com/autofacts](https://apify.com/autofacts) --- # Tentang Saya - **URL:** https://proooxy.com/id/about/ - **Tipe:** page - **Deskripsi:** Richard Feng — web scraping engineer dengan pengalaman 12+ tahun. Saya mengubah situs web yang terproteksi menjadi data terstruktur yang bersih dan siap-RAG untuk agen AI, pipeline retrieval, dan LLM. - **Kata Kunci:** jasa web scraping engineer, konsultan ekstraksi data, jasa pembuatan scraper custom, ahli bypass anti-bot, konsultan pipeline data RAG, reverse engineering API, freelancer web scraping Indonesia, jasa scraping data untuk AI - **Diterbitkan:** 0001-01-01 - **Diperbarui:** 0001-01-01 ## Siapa saya Saya Richard Feng, seorang freelance web-automation engineer dengan pengalaman coding 12+ tahun. Saya berspesialisasi dalam **web scraping, ekstraksi data, dan reverse engineering API** — mengubah situs web yang kompleks dan terproteksi menjadi data terstruktur yang benar-benar bisa digunakan oleh sistem AI. Toolkit saya mencakup **Node.js (TypeScript), Python, Go, dan Java**, dengan keahlian mendalam di **Crawlee, Playwright, dan Cheerio**. Saya telah membangun sistem produksi yang menangani jutaan request dengan tingkat keberhasilan **>99%**. ## Apa yang saya kerjakan Saya membangun dan memelihara **16 Apify Actor kelas produksi** yang melayani lebih dari **3,100 pengguna** dengan **tingkat keberhasilan run >99%** secara konsisten. Setiap actor menghasilkan **JSON siap-RAG** yang bersih — konsisten skemanya, terdeduplikasi, dan siap langsung dipakai di vector store, pipeline retrieval, atau training set. Sebagian besar actor data publik tidak memerlukan API key. Pekerjaan saya mencakup empat bidang: ### Data e-commerce & ritel Scraper untuk platform kecantikan dan fashion besar, termasuk [Sephora](/id/tools/sephora-scraper/) (21 storefront global), [Ulta Beauty](/id/tools/ulta-scraper/), [Farfetch](/id/tools/farfetch-scraper/), [Lululemon](/id/tools/lululemon-scraper/), [Boohoo](/id/tools/boohoo-scraper/), [Macy's](/id/tools/macys-scraper/), dan [Shopify scraper](/id/tools/shopify-scraper/) universal yang bisa dipakai di toko Shopify mana pun. ### Data publik, keuangan & hukum Dataset resmi Amerika Serikat sebagai JSON bersih dan siap-RAG — [laporan SEC EDGAR & data keuangan XBRL](/id/tools/sec-edgar-scraper/), [dana federal dari USAspending.gov](/id/tools/usaspending-scraper/), [putusan pengadilan dari CourtListener](/id/tools/courtlistener-scraper/), dan [studi dari ClinicalTrials.gov](/id/tools/clinical-trials-scraper/). ### Intelijen sosial & media Postingan, profil, dan interaksi [Bluesky](/id/tools/bluesky-scraper/) via AT Protocol, ditambah [YouTube subtitle & transcript scraper](/id/tools/youtube-transcript-scraper/) yang menghasilkan output JSON, SRT, VTT, atau teks siap-LLM dalam 100+ bahasa. ### Utilitas developer Tools di luar scraping — [audit SEO & structured data](/id/tools/schema-markup-scraper/), [rendering web-ke-PDF/gambar](/id/tools/web-printer/), dan [load testing berperforma tinggi](/id/tools/load-tester/). ## Spesialisasi - **Reverse engineering private API** — mengubah endpoint mobile/web yang tidak terdokumentasi menjadi sumber data yang andal - **Bypass anti-bot** — Cloudflare, DataDome, Akamai WAF, dan proteksi custom - **Output siap-RAG** — JSON yang dinormalisasi dan konsisten skemanya, dibangun untuk retrieval dan grounding - **Scraping multi-region** — locale, mata uang, dan kepatuhan (compliance) sudah ditangani - **Sistem dengan reliabilitas tinggi** — extractor yang mempertahankan tingkat keberhasilan >99% dalam skala besar ## Tech stack | Kategori | Teknologi | |----------|-------------| | Bahasa | TypeScript, Python, Go, Java | | Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping | | Anti-bot | Fingerprint generator, TLS fingerprinting, rotasi sesi | | Infrastruktur | Apify Platform, Docker, GitHub Actions | | Testing | Vegeta, framework load-testing custom | ## Bekerja sama dengan saya Saya menawarkan solusi scraping custom, rekayasa pipeline data RAG, dan layanan ekstraksi data berkelanjutan. Jika AI Anda membutuhkan web asli sebagai data yang bersih — [mari bicara](/id/contact/). ---