<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Proooxy — Data Web Siap-RAG untuk Agen AI &amp; LLM</title><link>https://proooxy.com/id/</link><description>Recent content on Proooxy — Data Web Siap-RAG untuk Agen AI &amp; LLM</description><generator>Hugo</generator><language>id</language><lastBuildDate>Wed, 15 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://proooxy.com/id/index.xml" rel="self" type="application/rss+xml"/><item><title>Macy's Scraper — Produk, Harga, SKU &amp; Berita</title><link>https://proooxy.com/id/tools/macys-scraper/</link><pubDate>Wed, 15 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/macys-scraper/</guid><description>Produk, harga, SKU/UPC &amp;amp; berita Macy&amp;rsquo;s — tahan Akamai, tanpa browser.</description></item><item><title>Bluesky Scraper — Postingan, Profil, Feed &amp; Interaksi</title><link>https://proooxy.com/id/tools/bluesky-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/bluesky-scraper/</guid><description>Scrape postingan, profil, feed, dan interaksi Bluesky.</description></item><item><title>ClinicalTrials.gov Scraper — Studi, Kelayakan &amp; Hasil</title><link>https://proooxy.com/id/tools/clinical-trials-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/clinical-trials-scraper/</guid><description>Cari studi, kelayakan, dan hasil ClinicalTrials.gov.</description></item><item><title>CourtListener Scraper — Putusan, Berkas Perkara &amp; Teks Lengkap</title><link>https://proooxy.com/id/tools/courtlistener-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/courtlistener-scraper/</guid><description>Case law AS, docket, dan teks putusan lengkap untuk legal AI.</description></item><item><title>SEC EDGAR Scraper — Laporan, Teks Lengkap &amp; Data Keuangan XBRL</title><link>https://proooxy.com/id/tools/sec-edgar-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/sec-edgar-scraper/</guid><description>Laporan SEC, teks 10-K/10-Q, dan data keuangan XBRL — siap-RAG.</description></item><item><title>USAspending.gov Scraper — Dana Federal, Penerima &amp; Agregat</title><link>https://proooxy.com/id/tools/usaspending-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/usaspending-scraper/</guid><description>Dana federal, penerima, dan agregat belanja dari USAspending.gov.</description></item><item><title>YouTube Subtitle &amp; Transcript Scraper — JSON, SRT, VTT, LLM</title><link>https://proooxy.com/id/tools/youtube-transcript-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/youtube-transcript-scraper/</guid><description>Transcript YouTube sebagai JSON, SRT, VTT, atau teks siap-LLM.</description></item><item><title>Sephora Scraper (Global)</title><link>https://proooxy.com/id/tools/sephora-scraper/</link><pubDate>Sat, 18 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/sephora-scraper/</guid><description>Scrape storefront Sephora mana pun — 21 pasar, satu actor.</description></item><item><title>Boohoo Scraper — Data Produk di 7 Wilayah</title><link>https://proooxy.com/id/tools/boohoo-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/boohoo-scraper/</guid><description>Scrape data produk Boohoo dari 7 toko regional.</description></item><item><title>Farfetch Scraper — Data Produk Fashion Mewah</title><link>https://proooxy.com/id/tools/farfetch-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/farfetch-scraper/</guid><description>Scrape produk fashion mewah dari Farfetch dengan dukungan multi-mata uang.</description></item><item><title>Global API Load Tester — Stress Test 10K+ RPS</title><link>https://proooxy.com/id/tools/load-tester/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/load-tester/</guid><description>Simulasikan 10K+ RPS dengan load testing geo-distributed.</description></item><item><title>Lululemon Scraper — Produk, Varian &amp; Harga</title><link>https://proooxy.com/id/tools/lululemon-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/lululemon-scraper/</guid><description>Ekstrak data produk lengkap dengan varian dan media dari Lululemon.</description></item><item><title>Schema Markup Scraper &amp; Auditor SEO</title><link>https://proooxy.com/id/tools/schema-markup-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/schema-markup-scraper/</guid><description>Ekstrak structured data dan audit SEO untuk situs web mana pun.</description></item><item><title>Sephora EU Scraper — 9 Pasar Eropa</title><link>https://proooxy.com/id/tools/sephora-eu-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/sephora-eu-scraper/</guid><description>Ekstrak data produk dari Sephora di 9 pasar Eropa.</description></item><item><title>Shopify Scraper — Data Produk dari Toko Manapun</title><link>https://proooxy.com/id/tools/shopify-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/shopify-scraper/</guid><description>Ekstrak data produk dari toko Shopify mana pun.</description></item><item><title>Ulta Beauty Scraper — Produk, Harga &amp; SKU</title><link>https://proooxy.com/id/tools/ulta-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/ulta-scraper/</guid><description>Scrape data produk lengkap dari Ulta Beauty.</description></item><item><title>Universal Web Printer — URL &amp; HTML ke PDF, Gambar</title><link>https://proooxy.com/id/tools/web-printer/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/tools/web-printer/</guid><description>Konversi URL dan HTML ke PDF, PNG, JPEG, atau WebP.</description></item><item><title>Best Practice Web Scraping di 2026: Panduan Praktisi</title><link>https://proooxy.com/id/blog/web-scraping-best-practices-2026/</link><pubDate>Wed, 01 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/blog/web-scraping-best-practices-2026/</guid><description>&lt;p&gt;Setelah membangun dan memelihara 15 scraper produksi yang melayani lebih dari 3,100 pengguna dengan tingkat keberhasilan &amp;gt;99%, berikut praktik-praktik yang benar-benar penting.&lt;/p&gt;
&lt;h2 id="arsitektur-berpikir-dalam-pipeline-bukan-script"&gt;Arsitektur: Berpikir dalam Pipeline, Bukan Script&lt;/h2&gt;
&lt;p&gt;Kesalahan terbesar yang sering saya lihat adalah memperlakukan scraping sebagai proses satu langkah. Scraper produksi adalah pipeline data:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Penemuan URL&lt;/strong&gt; — menemukan apa yang perlu di-scrape (sitemap, halaman kategori, pencarian, API)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Eksekusi Request&lt;/strong&gt; — mengambil data dengan retry dan rotasi yang tepat&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Parsing&lt;/strong&gt; — mengekstrak field terstruktur dari response mentah&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Normalisasi&lt;/strong&gt; — membersihkan, memvalidasi, dan menstandardisasi output&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Storage&lt;/strong&gt; — dikirim ke dataset, database, atau sistem downstream&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Setiap langkah harus bisa diuji dan di-retry secara independen. Saat Sephora mengubah layout halaman produknya, hanya langkah 3 yang perlu diperbarui — sisa pipeline-nya tetap stabil.&lt;/p&gt;</description></item><item><title>Memahami Proteksi Anti-Bot: Apa yang Berhasil di 2026</title><link>https://proooxy.com/id/blog/bypassing-anti-bot-protection-guide/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/blog/bypassing-anti-bot-protection-guide/</guid><description>&lt;p&gt;Proteksi anti-bot adalah perlombaan senjata. Sebagai orang yang membangun scraper produksi yang menembus sistem-sistem ini setiap hari, berikut pandangan seorang praktisi tentang lanskapnya — apa yang sebenarnya diperiksa oleh sistem proteksi ini dan seperti apa teknik bypass yang sah.&lt;/p&gt;
&lt;h2 id="lapisan-lapisan-deteksi"&gt;Lapisan-Lapisan Deteksi&lt;/h2&gt;
&lt;p&gt;Sistem anti-bot modern beroperasi dalam beberapa lapisan. Memahami lapisan-lapisan ini adalah kunci untuk bypass yang andal:&lt;/p&gt;
&lt;h3 id="lapisan-1-reputasi-ip"&gt;Lapisan 1: Reputasi IP&lt;/h3&gt;
&lt;p&gt;Pemeriksaan paling sederhana. Layanan anti-bot memelihara database rentang IP datacenter yang dikenal, exit VPN, dan IP yang sebelumnya sudah ditandai.&lt;/p&gt;</description></item><item><title>Kontak</title><link>https://proooxy.com/id/contact/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/contact/</guid><description>&lt;h2 id="dapatkan-data-yang-belum-ada-di-katalog"&gt;Dapatkan data yang belum ada di katalog&lt;/h2&gt;
&lt;p&gt;Saya membangun web scraper custom dan pipeline data RAG — untuk tim AI, platform data, dan siapa pun yang membutuhkan web terbuka sebagai JSON terstruktur yang bersih. Sekali tarik data atau feed yang terus diperbarui, saya bisa bantu.&lt;/p&gt;
&lt;h3 id="yang-saya-bangun"&gt;Yang saya bangun&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Scraper custom&lt;/strong&gt; — dibuat khusus untuk situs target Anda, dengan bypass anti-bot yang sudah tertanam&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Pipeline data RAG&lt;/strong&gt; — ekstraksi, normalisasi, chunking, dan pengiriman JSON siap-retrieval ke vector store atau warehouse Anda&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Reverse engineering private API&lt;/strong&gt; — mengubah endpoint mobile/web yang tidak terdokumentasi menjadi sumber data yang stabil dan terstruktur&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Maintenance scraper&lt;/strong&gt; — menjaga extractor yang sudah ada tetap berjalan saat situs target berubah&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Konsultasi teknis&lt;/strong&gt; — review arsitektur untuk stack scraping dan data-ingestion Anda&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="cara-kerjanya"&gt;Cara kerjanya&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Jelaskan datanya&lt;/strong&gt; — sumbernya, field yang Anda butuhkan, dan format pengiriman&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Cek kelayakan gratis&lt;/strong&gt; — saya menilai kompleksitas target dan tingkat proteksi anti-bot-nya tanpa biaya&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Proposal &amp;amp; timeline&lt;/strong&gt; — cakupan jelas, harga tetap, tanggal pengiriman&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Bangun &amp;amp; kirim&lt;/strong&gt; — extractor kelas produksi lengkap dengan dokumentasi dan output yang bersih&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="mulai-sebuah-proyek"&gt;Mulai sebuah proyek&lt;/h3&gt;
&lt;form action="https://api.web3forms.com/submit" method="POST" class="form contact-form"&gt;
 &lt;input type="hidden" name="access_key" value="9ed3e6ad-95b9-46d5-b3f7-3ffd428d9c3a"&gt;
 &lt;div class="field"&gt;
 &lt;label for="name"&gt;nama&lt;/label&gt;
 &lt;input type="text" name="name" id="name" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="email"&gt;email&lt;/label&gt;
 &lt;input type="email" name="email" id="email" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="project"&gt;jenis proyek&lt;/label&gt;
 &lt;select name="project" id="project"&gt;
 &lt;option value="custom-scraper"&gt;Scraper custom&lt;/option&gt;
 &lt;option value="rag-pipeline"&gt;Pipeline data RAG&lt;/option&gt;
 &lt;option value="api-reverse-engineering"&gt;Reverse engineering private API&lt;/option&gt;
 &lt;option value="consulting"&gt;Konsultasi teknis&lt;/option&gt;
 &lt;option value="other"&gt;Lainnya&lt;/option&gt;
 &lt;/select&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="message"&gt;apa yang Anda butuhkan?&lt;/label&gt;
 &lt;textarea name="message" id="message" rows="5" required&gt;&lt;/textarea&gt;
 &lt;/div&gt;
 &lt;button type="submit" class="btn btn--primary btn--lg"&gt;kirim pesan&lt;/button&gt;
&lt;/form&gt;
&lt;h3 id="atau-hubungi-saya-langsung"&gt;Atau hubungi saya langsung&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Email&lt;/strong&gt;: &lt;a href="mailto:p8p9cmk96@mozmail.com"&gt;p8p9cmk96@mozmail.com&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GitHub&lt;/strong&gt;: &lt;a href="https://github.com/autofacts"&gt;@autofacts&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Apify&lt;/strong&gt;: &lt;a href="https://apify.com/autofacts"&gt;apify.com/autofacts&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Tentang Saya</title><link>https://proooxy.com/id/about/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/id/about/</guid><description>&lt;h2 id="siapa-saya"&gt;Siapa saya&lt;/h2&gt;
&lt;p&gt;Saya Richard Feng, seorang freelance web-automation engineer dengan pengalaman coding 12+ tahun. Saya berspesialisasi dalam &lt;strong&gt;web scraping, ekstraksi data, dan reverse engineering API&lt;/strong&gt; — mengubah situs web yang kompleks dan terproteksi menjadi data terstruktur yang benar-benar bisa digunakan oleh sistem AI.&lt;/p&gt;
&lt;p&gt;Toolkit saya mencakup &lt;strong&gt;Node.js (TypeScript), Python, Go, dan Java&lt;/strong&gt;, dengan keahlian mendalam di &lt;strong&gt;Crawlee, Playwright, dan Cheerio&lt;/strong&gt;. Saya telah membangun sistem produksi yang menangani jutaan request dengan tingkat keberhasilan &lt;strong&gt;&amp;gt;99%&lt;/strong&gt;.&lt;/p&gt;</description></item></channel></rss>