# Proooxy — AI एजेंट और LLM के लिए RAG-तैयार वेब डेटा — पूरा कंटेंट (llms-full.txt) > AI एजेंट, रिट्रीवल पाइपलाइन और LLM के लिए संरचित, RAG-तैयार वेब डेटा। Richard Feng ई-कॉमर्स, SEC/EDGAR फाइलिंग, संघीय खर्च, अदालती फैसलों, क्लिनिकल ट्रायल तथा सोशल और वीडियो डेटा के लिए प्रोडक्शन-ग्रेड Apify एक्टर बनाते हैं — एंटी-बॉट बाईपास, साफ और schema-सुसंगत JSON, सार्वजनिक डेटा के लिए कोई API key नहीं। यह फ़ाइल https://proooxy.com/hi/ के हर सार्वजनिक पेज को एक ही डॉक्यूमेंट में जोड़ती है, ताकि LLM और AI एजेंट इसे सीधे इनजेस्ट कर सकें। हर पेज से पहले संरचित फ्रंटमैटर (URL, टाइप, कैटेगरी, टेक्नोलॉजी, रीजन, तारीखें) का एक फैक्ट-ब्लॉक होता है, उसके बाद उसका पूरा Markdown बॉडी आता है। यह लाइव साइट से स्वचालित रूप से जनरेट होता है। --- ## साइट मेटाडेटा - **साइट:** Proooxy — AI एजेंट और LLM के लिए RAG-तैयार वेब डेटा - **URL:** https://proooxy.com/hi/ - **विवरण:** AI एजेंट, रिट्रीवल पाइपलाइन और LLM के लिए संरचित, RAG-तैयार वेब डेटा। Richard Feng ई-कॉमर्स, SEC/EDGAR फाइलिंग, संघीय खर्च, अदालती फैसलों, क्लिनिकल ट्रायल तथा सोशल और वीडियो डेटा के लिए प्रोडक्शन-ग्रेड Apify एक्टर बनाते हैं — एंटी-बॉट बाईपास, साफ और schema-सुसंगत JSON, सार्वजनिक डेटा के लिए कोई API key नहीं। - **लेखक:** Richard Feng - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **टूल्स:** 17 प्रोडक्शन एक्टर्स - **पोस्ट्स:** 2 - **आख़िरी बार जनरेट किया गया:** 2026-08-04 --- ## टूल कैटलॉग इंडेक्स - [Macy's Scraper — प्रोडक्ट, प्राइस, SKU और न्यूज़](https://proooxy.com/hi/tools/macys-scraper/) — Macy's प्रोडक्ट, प्राइस, SKU/UPC व न्यूज़ — Akamai-प्रूफ़, कोई ब्राउज़र नहीं। - [Bluesky Scraper — पोस्ट, प्रोफ़ाइल, फ़ीड और इंटरैक्शन](https://proooxy.com/hi/tools/bluesky-scraper/) — Bluesky पोस्ट, प्रोफ़ाइल, फ़ीड, और इंटरैक्शन स्क्रैप करें। - [ClinicalTrials.gov Scraper — स्टडीज़, एलिजिबिलिटी और रिज़ल्ट](https://proooxy.com/hi/tools/clinical-trials-scraper/) — ClinicalTrials.gov स्टडीज़, एलिजिबिलिटी, और रिज़ल्ट सर्च करें। - [CourtListener Scraper — Opinions, Dockets और पूरा टेक्स्ट](https://proooxy.com/hi/tools/courtlistener-scraper/) — लीगल AI के लिए US केस लॉ, dockets, और पूरा opinion टेक्स्ट। - [SEC EDGAR Scraper — फाइलिंग, फुल-टेक्स्ट और XBRL फाइनेंशियल्स](https://proooxy.com/hi/tools/sec-edgar-scraper/) — SEC फाइलिंग, 10-K/10-Q टेक्स्ट, और XBRL फाइनेंशियल्स — RAG-तैयार। - [USAspending.gov Scraper — फ़ेडरल अवार्ड्स, प्राप्तकर्ता और एग्रीगेट्स](https://proooxy.com/hi/tools/usaspending-scraper/) — USAspending.gov से फ़ेडरल अवार्ड्स, प्राप्तकर्ता, और स्पेंडिंग aggregates। - [YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/hi/tools/youtube-transcript-scraper/) — YouTube transcripts JSON, SRT, VTT, या LLM-तैयार टेक्स्ट के रूप में। - [Sephora Scraper (ग्लोबल)](https://proooxy.com/hi/tools/sephora-scraper/) — किसी भी Sephora स्टोरफ्रंट को स्क्रैप करें — 21 मार्केट, एक एक्टर। - [Boohoo Scraper — 7 रीजन में प्रोडक्ट डेटा](https://proooxy.com/hi/tools/boohoo-scraper/) — 7 रीजनल स्टोर में Boohoo प्रोडक्ट डेटा स्क्रैप करें। - [Farfetch Scraper — लग्ज़री फैशन प्रोडक्ट डेटा](https://proooxy.com/hi/tools/farfetch-scraper/) — मल्टी-करेंसी सपोर्ट के साथ Farfetch से लग्ज़री फैशन प्रोडक्ट स्क्रैप करें। - [Global API Load Tester — 10K+ RPS स्ट्रेस टेस्ट](https://proooxy.com/hi/tools/load-tester/) — geo-distributed लोड टेस्टिंग के साथ 10K+ RPS सिमुलेट करें। - [Lululemon Scraper — प्रोडक्ट, वेरिएंट और प्राइस](https://proooxy.com/hi/tools/lululemon-scraper/) — Lululemon से वेरिएंट और मीडिया सहित प्रोडक्ट डेटा एक्सट्रैक्ट करें। - [Schema Markup Scraper और SEO ऑडिटर](https://proooxy.com/hi/tools/schema-markup-scraper/) — किसी भी वेबसाइट के लिए संरचित डेटा एक्सट्रैक्ट करें और SEO ऑडिट करें। - [Sephora EU Scraper — 9 यूरोपीय मार्केट](https://proooxy.com/hi/tools/sephora-eu-scraper/) — 9 यूरोपीय मार्केट में Sephora से प्रोडक्ट डेटा एक्सट्रैक्ट करें। - [Shopify Scraper — किसी भी स्टोर का प्रोडक्ट डेटा](https://proooxy.com/hi/tools/shopify-scraper/) — किसी भी Shopify स्टोर से प्रोडक्ट डेटा एक्सट्रैक्ट करें। - [Ulta Beauty Scraper — प्रोडक्ट, प्राइस और SKU](https://proooxy.com/hi/tools/ulta-scraper/) — Ulta Beauty से पूरा प्रोडक्ट डेटा स्क्रैप करें। - [Universal Web Printer — URL और HTML को PDF, इमेज में बदलें](https://proooxy.com/hi/tools/web-printer/) — URL और HTML को PDF, PNG, JPEG, या WebP में बदलें। --- # Macy's Scraper — प्रोडक्ट, प्राइस, SKU और न्यूज़ - **URL:** https://proooxy.com/hi/tools/macys-scraper/ - **टाइप:** tools - **विवरण:** search, category, trending, और product URL से Macy's प्रोडक्ट डेटा — प्राइस, वेरिएंट, SKU/UPC बारकोड, इमेज, रेटिंग व रिव्यू — साथ ही Macy's Inc. न्यूज़ एक्सट्रैक्ट करें। कोई ब्राउज़र नहीं, Akamai-प्रूफ़। - **सारांश:** Macy's प्रोडक्ट, प्राइस, SKU/UPC व न्यूज़ — Akamai-प्रूफ़, कोई ब्राउज़र नहीं। - **कैटेगरी:** ecommerce - **टेक स्टैक:** TypeScript, Crawlee, Cheerio - **मार्केट्स / रीजन:** अमेरिका - **Apify लिस्टिंग:** https://apify.com/autofacts/macy-s-scraper - **कीवर्ड्स:** macys scraper india, macy's product data कैसे निकाले, macys price monitoring tool, department store scraper hindi, macys sku upc data api, macys reviews scraper, retail product data extraction - **प्रकाशित:** 2026-07-15 - **संशोधित:** 2026-07-15 **मुख्य विशेषताएं:** - एक ही एक्टर में चार surface — product search, category, trending, और Macy's Inc. न्यूज़ - Macy's के अपने मोबाइल व वेबसाइट JSON API इस्तेमाल करके बिना ब्राउज़र के Akamai Bot Manager को मात देता है - हर खरीदने लायक वेरिएंट के लिए color, size, availability, और price के साथ per-SKU UPC बारकोड - इंटीजर cents के रूप में प्राइस, साथ में localized फ़ॉर्मेटेड स्ट्रिंग — कोई floating-point राउंडिंग नहीं - पूरी review इंटेलिजेंस — star हिस्टोग्राम, recommend counts, और सेकेंडरी fit/size रेटिंग - सभी shades और sizes एक ही प्रोडक्ट रिकॉर्ड के अंदर ग्रुप्ड, हर वेरिएंट के लिए अलग row नहीं - सिर्फ़ साफ़ canonical URL — internal API endpoints और client keys कभी आउटपुट में लीक नहीं होते - search, category, trending, और product-detail रिज़ल्ट में एक ही normalized schema **यूज़ केस:** - SKU लेवल पर डिपार्टमेंट-स्टोर प्राइस और प्रमोशन मॉनिटरिंग - प्रतिस्पर्धी विश्लेषण — Macy's बनाम Nordstrom, Ulta, या ब्रांड DTC प्राइसिंग - per-variant UPC बारकोड के ज़रिए रिटेलर्स के बीच कैटलॉग मैचिंग - Macy's पर बिकने वाले ब्रांड्स के लिए review और rating इंटेलिजेंस - रिटेल न्यूज़ मॉनिटरिंग — Macy's Inc. प्रेस रिलीज़ और अर्निंग्स अनाउंसमेंट **इनपुट पैरामीटर:** - `scrapeType` (string, आवश्यक) — स्क्रैप करने के लिए surface: search, category, trending, news, या all (डिफ़ॉल्ट: search)। - `query` (string, वैकल्पिक) — प्रोडक्ट सर्च के लिए keyword, जैसे women shoes। - `startUrls` (array, वैकल्पिक) — Macy's प्रोडक्ट/कैटेगरी URL या Macy's Inc. न्यूज़ URL। - `categoryIds` (array, वैकल्पिक) — Macy's category ID (जैसे 5449)। मालूम होने पर category URL को प्राथमिकता दें। - `trendingUrls` (array, वैकल्पिक) — Trending, bestseller, या curated listing URL। - `newsUrls` (array, वैकल्पिक) — Macy's Inc. न्यूज़ लिस्टिंग या आर्टिकल URL। - `includeProductDetails` (boolean, वैकल्पिक) — listing आइटम को पूरी प्रोडक्ट डिटेल से समृद्ध करें — variants, SKUs, galleries (डिफ़ॉल्ट: true)। - `maxPages` (number, वैकल्पिक) — प्रति listing/news सोर्स अधिकतम पेजिनेशन डेप्थ। - `maxResults` (number, वैकल्पिक) — आउटपुट रिकॉर्ड पर कैप। 0 = कोई कैप नहीं। - `proxy` (object, आवश्यक) — Apify Proxy या कस्टम प्रॉक्सी URL। रेजिडेंशियल, country US की सलाह दी जाती है। **सामान्य प्रश्न:** **Q: यह बिना ब्राउज़र के Akamai को कैसे पार करता है?** यह JS challenge से लड़ता ही नहीं। Listings Macy's के mobile app API से आती हैं और product details वेबसाइट के JSON API से — दोनों अलग इंफ्रास्ट्रक्चर पर चलते हैं जो anonymous read रिक्वेस्ट का जवाब देता है। कोई login नहीं, कोई cookies नहीं, कोई API key नहीं। **Q: प्राइस डॉलर में हैं या cents में?** floating-point राउंडिंग से बचने के लिए इंटीजर cents (5999 = $59.99), साथ में localized फ़ॉर्मेटेड स्ट्रिंग ($59.99) भी। **Q: वेरिएंट और UPC कैसे हैंडल होते हैं?** सभी colors और sizes को एक variants[] array के साथ एक ही प्रोडक्ट रिकॉर्ड में ग्रुप किया जाता है। हर वेरिएंट का अपना UPC बारकोड, color, size, availability, और price होता है — जो Macy's के SKU relationship डेटा से मिलता है, किसी swatch widget से स्क्रैप करके नहीं। **Q: क्या मैं एक ही रन में प्रोडक्ट और न्यूज़ स्क्रैप कर सकता हूं?** हां। scrapeType को all पर सेट करें और query, startUrls, categoryIds, trendingUrls, और newsUrls का कोई भी मिक्स दें। ## आउटपुट का उदाहरण ```json { "type": "product", "source": { "id": "12345678", "canonicalUrl": "https://www.macys.com/shop/product/calvin-klein-womens-sheath-dress?ID=12345678", "retailer": "macys", "currency": "USD" }, "title": "Women's Sleeveless Sheath Dress", "brand": "Calvin Klein", "categories": ["Women", "Dresses", "Work Dresses"], "price": { "sale": 5999, "list": 9800, "currentFormatted": "$59.99", "stockStatus": "InStock" }, "stats": { "rating": 4.6, "reviewCount": 9, "ratingPercentage": 92 }, "options": [ { "type": "Color", "values": [{ "id": "1", "name": "Black" }] }, { "type": "Size", "values": [{ "id": "10", "name": "M" }, { "id": "12", "name": "L" }] } ], "variants": [ { "id": "987654", "sku": "192837465012", "options": ["Black", "M"], "price": { "stockStatus": "InStock" }, "extraInfo": { "upc": "192837465012" } } ], "medias": [{ "type": "Image", "url": "https://slimages.macysassets.com/is/image/MCY/products/.../main.jpg" }] } ``` ## प्राइसिंग Pay-per-event — आपसे सिर्फ़ असल में सेव किए गए आइटम के लिए बिल लिया जाता है: | इवेंट | प्राइस | इसमें क्या शामिल है | |---|---|---| | स्क्रैप किया गया प्रोडक्ट | $0.006 | पूरी डिटेल वाला एक प्रोडक्ट — variants, SKUs/UPCs, prices, images, ratings | | स्क्रैप किया गया आर्टिकल | $0.002 | Macy's Inc. का एक न्यूज़ आर्टिकल — title, author, date, body, images | हायर Apify प्लान पर वॉल्यूम डिस्काउंट ऑटोमैटिकली लागू होते हैं (प्रति प्रोडक्ट $0.0045 तक)। लिस्ट प्राइस पर 1,000-प्रोडक्ट क्रॉल की कीमत ~$6.00 है। ## टिप्स - **रेजिडेंशियल US प्रॉक्सी इस्तेमाल करें।** product-detail endpoint कभी-कभी rate-limited होता है; रेजिडेंशियल सेशन रोटेशन साफ़-साफ़ निकल जाता है, जबकि डेटासेंटर IP पर ज़्यादा 403s मिलते हैं। - **कॉन्करेंसी मध्यम रखें।** `maxConcurrency` का 2–3 स्वीट स्पॉट है — ज़्यादा वैल्यू थ्रूपुट सुधारे बिना rate-limit hits बढ़ा देती हैं। - **bare ID से ज़्यादा category URL को प्राथमिकता दें।** URL वह category path कैरी करता है जो API को चाहिए; एक bare ID एक ज़्यादा व्यापक या खाली result set पर रिज़ॉल्व हो सकता है। - जब आपको variants या descriptions नहीं चाहिए, तो तेज़ listing-level sweep (name, brand, listing price, image, rating) के लिए **`includeProductDetails` बंद करें।** --- # Bluesky Scraper — पोस्ट, प्रोफ़ाइल, फ़ीड और इंटरैक्शन - **URL:** https://proooxy.com/hi/tools/bluesky-scraper/ - **टाइप:** tools - **विवरण:** AT Protocol के ज़रिए Bluesky पोस्ट, प्रोफ़ाइल, फ़ॉलोअर्स, फ़ीड, थ्रेड, likers, और reposters एक्सट्रैक्ट करें — साथ ही app password के साथ ऑथेंटिकेटेड सर्च और hashtag रिज़ल्ट भी। साफ़, normalized JSON। - **सारांश:** Bluesky पोस्ट, प्रोफ़ाइल, फ़ीड, और इंटरैक्शन स्क्रैप करें। - **कैटेगरी:** social - **टेक स्टैक:** TypeScript, AT Protocol - **मार्केट्स / रीजन:** वैश्विक - **Apify लिस्टिंग:** https://apify.com/autofacts/bluesky-scraper - **कीवर्ड्स:** bluesky scraper india, bluesky से डेटा कैसे निकाले, at protocol data api, bluesky posts scraper hindi, bluesky profile data export, bluesky hashtag scraper, सोशल मीडिया डेटा एक्सट्रैक्शन टूल, bluesky followers list export - **प्रकाशित:** 2026-07-01 - **संशोधित:** 2026-07-01 **मुख्य विशेषताएं:** - ग्यारह मोड — search, profile, posts, followers, following, feed, thread, likers, reposters, actorLikes, और hashtag - बिना क्रेडेंशियल वाला पब्लिक API — profiles, posts, followers, following, feeds, threads, likers, और reposters के लिए - ऑथेंटिकेटेड app-password मोड — search, hashtag, और आपके अपने अकाउंट के likes - पोस्ट-एंगेजमेंट एक्सपोर्ट — हर पोस्ट की पूरी likers और reposters लिस्ट - थ्रेड फ़्लैटनिंग — रिप्लाई ट्री को एक कॉन्फ़िगर करने लायक डेप्थ तक फॉलो करता है - हर list एंडपॉइंट पर आपके item cap तक ऑटोमैटिक cursor पेजिनेशन - सभी मोड में posts और profiles के लिए normalized JSON शेप - रेज़िलिएंट HTTP — रिक्वेस्ट थ्रॉटलिंग, एक्सपोनेंशियल बैक-ऑफ़, और 429/5xx पर रीट्राई **यूज़ केस:** - ऑथेंटिकेटेड सर्च के ज़रिए ब्रांड और कीवर्ड मॉनिटरिंग - पूरे नेटवर्क पर hashtag और ट्रेंड ट्रैकिंग - ऑडियंस एक्सपोर्ट — किसी क्रिएटर या ब्रांड की followers और following लिस्ट - एंगेजमेंट एनालिसिस — किसी पोस्ट को ठीक-ठीक किसने लाइक या रीपोस्ट किया - साफ़, normalized JSON से BI, एनालिटिक्स, या RAG पाइपलाइन के लिए dataset बनाना - किसी पोस्ट के नीचे की बातचीत और थ्रेड का आर्काइविंग **इनपुट पैरामीटर:** - `mode` (string, वैकल्पिक) — क्या स्क्रैप करना है: posts, profile, followers, following, feed, thread, likers, reposters, actorLikes, search, या hashtag (डिफ़ॉल्ट: posts)। - `handles` (array, वैकल्पिक) — profile/posts/followers/following/actorLikes मोड के लिए Bluesky handles, जैसे bsky.app। - `query` (string, वैकल्पिक) — सर्च टेक्स्ट (search मोड) या hashtag (hashtag मोड — # अपने आप आगे जुड़ जाता है)। - `postUri` (string, वैकल्पिक) — किसी पोस्ट का AT URI — thread, likers, और reposters मोड में इस्तेमाल होता है। - `feedUri` (string, वैकल्पिक) — किसी कस्टम फ़ीड का AT URI — feed मोड में इस्तेमाल होता है। - `identifier` (string, वैकल्पिक) — ऑथेंटिकेटेड मोड (search, hashtag, actorLikes) के लिए Bluesky लॉगिन handle/ईमेल। - `appPassword` (string, वैकल्पिक) — ऑथेंटिकेटेड मोड के लिए Bluesky app password (आपका मुख्य अकाउंट पासवर्ड नहीं)। - `maxItems` (number, वैकल्पिक) — सेव किए जाने वाले अधिकतम posts/profiles; हर एक एक बिल किया जाने वाला इवेंट है (डिफ़ॉल्ट: 100)। **सामान्य प्रश्न:** **Q: क्या मुझे Bluesky क्रेडेंशियल चाहिए?** सिर्फ़ search, hashtag, और actorLikes मोड के लिए — Bluesky सेटिंग्स में एक app password जनरेट करें और उसे appPassword के रूप में पास करें। Profile, posts, followers, following, feed, thread, likers, और reposters मोड सभी बिना क्रेडेंशियल के पब्लिक AT Protocol API से काम करते हैं। **Q: क्या मैं किसी भी अकाउंट के likes एक्सपोर्ट कर सकता हूं?** नहीं। Bluesky का API सिर्फ़ ऑथेंटिकेटेड अकाउंट के लिए ही actorLikes एक्सपोज़ करता है, इसलिए handle और login identifier दोनों को एक ही अकाउंट का होना ज़रूरी है। **Q: मुझे किसी पोस्ट या फ़ीड का URI कैसे मिलेगा?** AT URI कुछ ऐसे दिखते हैं: at://did:plc:.../app.bsky.feed.post/... — इन्हें Bluesky के API आउटपुट या डेवलपर टूलिंग से कॉपी करें। Feed URI app.bsky.feed.generator कलेक्शन इस्तेमाल करते हैं। **Q: क्या अपना app password इस्तेमाल करना सुरक्षित है?** हां — Bluesky app password इस्तेमाल करें (जो Settings → App Passwords में बनता है), अपना मुख्य पासवर्ड कभी नहीं। यह scoped, revocable होता है, और एक secret input के रूप में पास होता है। ## आउटपुट का उदाहरण ```json { "itemType": "post", "mode": "posts", "uri": "at://did:plc:.../app.bsky.feed.post/...", "author": { "did": "did:plc:...", "handle": "bsky.app", "displayName": "Bluesky", "followersCount": 1234567 }, "text": "Example post text", "createdAt": "2026-06-11T00:00:00Z", "replyCount": 10, "repostCount": 20, "likeCount": 100, "langs": ["en"], "url": "https://bsky.app/profile/bsky.app/post/..." } ``` ## प्राइसिंग Pay-per-event: सेव किए गए हर **item** (post या profile) पर **$0.001**। 1,000-item एक्सपोर्ट की कीमत ~$1.00 होती है, और `maxItems` वॉल्यूम व कॉस्ट दोनों पर कैप लगाता है। ## टिप्स - **पब्लिक मोड से शुरुआत करें।** Profiles, posts, followers, और engagement (likers/reposters) को लॉगिन की ज़रूरत नहीं — app-password ऑथ को सिर्फ़ search और hashtag रन के लिए बचाकर रखें। - **सिर्फ़ posts नहीं, engagement भी एक्सपोर्ट करें।** likers और reposters मोड बिल्कुल सटीक बताते हैं कि किसी पोस्ट को किसने आगे बढ़ाया — यह एक ऐसा सिग्नल है जिसे ज़्यादातर Bluesky स्क्रैपर छोड़ देते हैं। - बड़े अकाउंट के follower/following पुल पर **`maxItems` को कैप करें** ताकि रन तेज़ रहें और कॉस्ट का अंदाज़ा लगाया जा सके। --- # ClinicalTrials.gov Scraper — स्टडीज़, एलिजिबिलिटी और रिज़ल्ट - **URL:** https://proooxy.com/hi/tools/clinical-trials-scraper/ - **टाइप:** tools - **विवरण:** आधिकारिक ClinicalTrials.gov v2 API को condition, intervention, sponsor, location, status, या NCT ID के आधार पर सर्च करें। एलिजिबिलिटी, रिज़ल्ट मेटाडेटा, और इंक्रीमेंटल अपडेट के साथ normalized स्टडी रिकॉर्ड एक्सपोर्ट करें — कोई API key नहीं। - **सारांश:** ClinicalTrials.gov स्टडीज़, एलिजिबिलिटी, और रिज़ल्ट सर्च करें। - **कैटेगरी:** public-data - **टेक स्टैक:** TypeScript, REST API - **मार्केट्स / रीजन:** वैश्विक - **Apify लिस्टिंग:** https://apify.com/autofacts/clinical-trials-scraper - **कीवर्ड्स:** clinicaltrials.gov api hindi, क्लिनिकल ट्रायल डेटा कैसे निकाले, clinical trials dataset for research, recruiting trials data india, pharma pipeline monitoring tool, clinical trials for RAG pipeline, दवा ट्रायल जानकारी सर्च टूल - **प्रकाशित:** 2026-07-01 - **संशोधित:** 2026-07-01 **मुख्य विशेषताएं:** - आधिकारिक ClinicalTrials.gov v2 API — किसी API key की ज़रूरत नहीं - मल्टी-फ़ील्ड सर्च — condition, intervention, sponsor, location, और फ्री-टेक्स्ट क्वेरी - recruitment status (9 वैल्यू, OR-कॉम्बाइंड) और phase (Early Phase 1 → Phase 4) के हिसाब से फ़िल्टर करें - एक या कई खास स्टडीज़ के लिए सीधा NCT-ID लुकअप - updatedSince के ज़रिए इंक्रीमेंटल मॉनिटरिंग — किसी तारीख को/के बाद बदली गई स्टडीज़ ही रिटर्न करता है - Summary या full आउटपुट — full में raw protocol, derived, और results सेक्शन जुड़ जाते हैं - titles, summaries, eligibility, और outcomes से RAG-तैयार paragraph chunking - Results सिग्नल — hasResults के साथ participant-flow, outcome-measures, और adverse-events फ़्लैग - डिराइव्ड MeSH टर्म और normalized sponsor, collaborator, और location डेटा **यूज़ केस:** - sponsor या condition के हिसाब से फार्मा/बायोटेक पाइपलाइन मॉनिटरिंग - CRO और साइट-फ़िज़िबिलिटी रिसर्च — location, phase, और condition के हिसाब से recruiting ट्रायल - नई पोस्ट हुई या नई अपडेट हुई स्टडीज़ पर प्रतिस्पर्धी इंटेलिजेंस - एक्टिवली recruiting ट्रायल में पेशेंट-रिक्रूटमेंट रिसर्च - सिस्टमैटिक रिव्यू — बड़े स्केल पर eligibility criteria, outcomes, और results मेटाडेटा - chunked ट्रायल टेक्स्ट से बने मेडिकल AI / RAG नॉलेज बेस **इनपुट पैरामीटर:** - `condition` (string, वैकल्पिक) — सर्च करने के लिए condition या बीमारी, जैसे diabetes। - `status` (array, वैकल्पिक) — Recruitment status फ़िल्टर, OR-कॉम्बाइंड, जैसे RECRUITING, COMPLETED। - `phase` (array, वैकल्पिक) — स्टडी phases — Not Applicable, Early Phase 1, Phase 1–4। - `nctIds` (array, वैकल्पिक) — ClinicalTrials.gov NCT ID से खास स्टडीज़ फ़ेच करें। - `updatedSince` (string, वैकल्पिक) — YYYY-MM-DD — इस तारीख को/के बाद LastUpdatePostDate वाली स्टडीज़ रिटर्न करता है। - `outputFields` (string, वैकल्पिक) — summary (डिफ़ॉल्ट, normalized) या full (raw protocol/derived/results सेक्शन जोड़ता है)। - `chunking` (string, वैकल्पिक) — RAG टेक्स्ट chunking: paragraph (डिफ़ॉल्ट) या none। - `maxItems` (number, वैकल्पिक) — सेव की जाने वाली अधिकतम स्टडीज़; हर एक एक बिल किया जाने वाला इवेंट है (डिफ़ॉल्ट: 10)। **सामान्य प्रश्न:** **Q: क्या मुझे API key चाहिए?** नहीं। ClinicalTrials.gov का v2 API पूरी तरह पब्लिक है — एक्टर सिर्फ़ एक descriptive User-Agent भेजता है, बिना किसी ऑथेंटिकेशन के। **Q: क्या मुझे सिर्फ़ normalized फ़ील्ड नहीं, raw स्टडी डेटा भी मिल सकता है?** हां। normalized summary फ़ील्ड के साथ raw protocolSection, derivedSection, और resultsSection शामिल करने के लिए outputFields को 'full' सेट करें। **Q: हाल ही में बदली गई स्टडीज़ को मैं कैसे मॉनिटर करूं?** updatedSince को एक YYYY-MM-DD तारीख पर सेट करें। एक्टर ClinicalTrials.gov के LastUpdatePostDate पर फ़िल्टर करता है और उस दिन को/के बाद अपडेट हुई स्टडीज़ ही रिटर्न करता है — डेली पाइपलाइन मॉनिटरिंग के लिए आदर्श। **Q: कवरेज ग्लोबल है या सिर्फ़ US तक?** ग्लोबल। ClinicalTrials.gov दुनिया भर के ट्रायल रजिस्टर करता है, और हर स्टडी के locations array में उपलब्ध होने पर country, state, city, और facility शामिल होता है। ## आउटपुट का उदाहरण ```json { "itemType": "study", "nctId": "NCT01884792", "title": "Example Diabetes Study", "officialTitle": "A Study of Example Diabetes Study", "status": "COMPLETED", "phase": ["PHASE2"], "studyType": "INTERVENTIONAL", "conditions": ["Diabetes Mellitus"], "sponsors": { "lead": "Example Sponsor Inc.", "collaborators": [] }, "locations": [ { "facility": "Example Medical Center", "city": "Boston", "state": "MA", "country": "United States", "status": "COMPLETED" } ], "hasResults": true, "resultsSummary": { "hasParticipantFlow": true, "hasOutcomeMeasures": true, "hasAdverseEvents": true }, "lastUpdate": "2026-06-01", "url": "https://clinicaltrials.gov/study/NCT01884792" } ``` ## प्राइसिंग Pay-per-event: summary हो या full आउटपुट मोड, सेव की गई हर **study** पर **$0.002**। 1,000-study एक्सपोर्ट की कीमत ~$2.00 होती है, और `maxItems` वॉल्यूम व कॉस्ट दोनों पर कैप लगाता है। ## टिप्स - **चेंज मॉनिटरिंग के लिए `updatedSince` इस्तेमाल करें।** कल की तारीख के साथ एक डेली रन शेड्यूल करें ताकि सिर्फ़ पोस्ट या अमेंड हुए ट्रायल कैप्चर हों — किसी कॉम्पिटिटर की पाइपलाइन ट्रैक करने का सबसे सस्ता तरीका। - पूरी रजिस्ट्री खींचे बिना एक टारगेटेड फ़िज़िबिलिटी लिस्ट बनाने के लिए **`condition` + `status: [RECRUITING]` + `phase` को कॉम्बाइन करें।** - **`outputFields: full` सेट करें** सिर्फ़ तब जब आपको raw सेक्शन चाहिए हों — normalized summary में पहले से ही eligibility, sponsors, locations, और results फ़्लैग शामिल हैं। --- # CourtListener Scraper — Opinions, Dockets और पूरा टेक्स्ट - **URL:** https://proooxy.com/hi/tools/courtlistener-scraper/ - **टाइप:** tools - **विवरण:** U.S. अदालती फैसलों, RECAP dockets, oral arguments, judges, और citations के लिए CourtListener को क्वेरी करें — पूरे opinion टेक्स्ट और RAG-तैयार chunks के साथ। court, date, या keyword से फ़िल्टर करें। - **सारांश:** लीगल AI के लिए US केस लॉ, dockets, और पूरा opinion टेक्स्ट। - **कैटेगरी:** public-data - **टेक स्टैक:** TypeScript, Cheerio - **मार्केट्स / रीजन:** संयुक्त राज्य अमेरिका - **Apify लिस्टिंग:** https://apify.com/autofacts/courtlistener-scraper - **कीवर्ड्स:** courtlistener api hindi, case law data कैसे निकाले, court opinions scraper india, recap docket data api, legal research data tool, us case law dataset, case law for RAG pipeline - **प्रकाशित:** 2026-07-01 - **संशोधित:** 2026-07-01 **मुख्य विशेषताएं:** - एक ही एक्टर में छह सर्च टाइप — opinions, dockets (RECAP), RECAP documents, oral arguments, judges, और citation lookup - पूरा opinion टेक्स्ट — सिर्फ़ 300-कैरेक्टर स्निपेट नहीं, पूरे फ़ैसलों के लिए सर्च हिट्स को डेटाबेस में फॉलो करता है - RAG-तैयार chunking — ~2000-कैरेक्टर के paragraph chunks, हर एक के साथ एक order index - Citation रिज़ॉल्यूशन — 250 तक citation स्ट्रिंग (जैसे 576 U.S. 644) को मैच किए गए केस से रिज़ॉल्व करें - Boolean फुल-टेक्स्ट सर्च के साथ court ID, filed-date रेंज, और sort-order फ़िल्टर - CourtListener के रिस्पॉन्स फ़ॉर्मेट्स में सटीक 429 back-off के साथ rate-limit-aware पेसिंग - आपके कॉन्फ़िगर किए गए item cap तक cursor-pagination स्ट्रीमिंग - अपना खुद का token लाएं, या बिल्ट-इन rotating token pool इस्तेमाल करें **यूज़ केस:** - लीगल रिसर्च — court, date रेंज, या keyword के हिसाब से फुल-टेक्स्ट केस लॉ खींचें - लिटिगेशन इंटेलिजेंस — subject और date के हिसाब से किसी court की docket एक्टिविटी ट्रैक करें - लीगल AI / RAG — chunked, embeddings-तैयार case-law corpus बनाएं - Citation एनालिसिस — किसी brief की citations को लिंक्ड केस रिकॉर्ड और cite counts से रिज़ॉल्व करें - एम्पिरिकल लीगल स्टडीज़ — judges, oral-argument मेटाडेटा, और opinion ट्रेंड - लीगल जर्नलिज़्म — खास courts में नए फ़ाइल हुए opinions या dockets मॉनिटर करें **इनपुट पैरामीटर:** - `searchType` (string, वैकल्पिक) — क्या रिट्रीव करना है: opinions, dockets, recap_docs, oral_arguments, judges, या citation (डिफ़ॉल्ट: opinions)। - `query` (string, वैकल्पिक) — boolean ऑपरेटर के साथ फुल-टेक्स्ट क्वेरी — court फ़िल्टर या citation lookup इस्तेमाल न करने पर ज़रूरी। - `citations` (array, वैकल्पिक) — रिज़ॉल्व करने के लिए citation स्ट्रिंग (250 तक) — citation मोड के लिए ज़रूरी। - `court` (string, वैकल्पिक) — CourtListener court ID, जैसे scotus, ca9, nyed। - `dateFrom` (string, वैकल्पिक) — Filed-after तारीख (YYYY-MM-DD)। - `includeFullText` (boolean, वैकल्पिक) — opinions के लिए पूरा opinion टेक्स्ट और RAG chunks फ़ेच करें (डिफ़ॉल्ट: false)। - `apiToken` (string, वैकल्पिक) — आपका CourtListener API token; न देने पर बिल्ट-इन rotating pool पर फ़ॉलबैक करता है। - `maxItems` (number, वैकल्पिक) — सेव किए जाने वाले अधिकतम आइटम; हर एक एक बिल किया जाने वाला इवेंट है (डिफ़ॉल्ट: 5)। **सामान्य प्रश्न:** **Q: क्या मुझे CourtListener API token चाहिए?** CourtListener को इसकी ज़रूरत होती है। apiToken के ज़रिए अपना मुफ़्त token दें, या एक्टर के बिल्ट-इन rotating fallback pool पर भरोसा करें। अपना token लाने पर आप paid/membership टियर पर थ्रूपुट बढ़ा सकते हैं। **Q: क्या हर सर्च टाइप के लिए पूरा opinion टेक्स्ट उपलब्ध है?** नहीं। पूरा टेक्स्ट और chunking (includeFullText) सिर्फ़ opinions पर लागू होता है, और रन तेज़ रखने के लिए डिफ़ॉल्ट रूप से बंद रहता है। Dockets, RECAP documents, oral arguments, judges, और citation रिज़ल्ट सिर्फ़ मेटाडेटा रिटर्न करते हैं। **Q: कौन-कौन से courts कवर होते हैं?** जो भी CourtListener इंडेक्स करता है — U.S. फ़ेडरल courts (SCOTUS, Courts of Appeals, और RECAP के ज़रिए District courts) साथ ही कई state courts, जिन्हें CourtListener अपने court IDs जैसे scotus, ca9, या nyed से एड्रेस करता है। **Q: यह कितनी तेज़ी से चल सकता है?** थ्रूपुट आपके token की rate limit से बंधा होता है (CourtListener के free tier में प्रति मिनट कुछ ही रिक्वेस्ट मिलते हैं) साथ में ऑटोमैटिक 429 back-off; एक membership token यह सीमा बढ़ा देता है। ## आउटपुट का उदाहरण ```json { "itemType": "legal", "searchType": "opinions", "id": "10380001", "title": "Climate United Fund v. Citibank, N.A.", "court": "Court of Appeals for the D.C. Circuit", "date": "2025-04-16", "url": "https://www.courtlistener.com/opinion/10380001/...", "citations": [], "citeCount": 0, "docketNumber": "23-5138", "fullText": "...", "chunks": [{ "text": "...", "order": 0 }], "meta": { "courtId": "cadc", "clusterId": 10380001 } } ``` ## प्राइसिंग Pay-per-event — आपसे सिर्फ़ सेव किए गए आइटम के लिए बिल लिया जाता है: | इवेंट | प्राइस | इसमें क्या शामिल है | |---|---|---| | पूरा टेक्स्ट वाला Opinion | $0.005 | पूरे टेक्स्ट + RAG chunks के साथ सेव किया गया एक opinion | | Metadata आइटम | $0.002 | एक docket, oral argument, judge, citation, या सिर्फ़-मेटाडेटा रिकॉर्ड | 1,000-opinion फुल-टेक्स्ट corpus की कीमत ~$5.00 है; `maxItems` वॉल्यूम व कॉस्ट दोनों पर कैप लगाता है। ## टिप्स - **`includeFullText` सिर्फ़ उन opinions के लिए ऑन करें जिन्हें आप असल में embed करेंगे।** इसमें हर opinion पर एक्स्ट्रा रिक्वेस्ट लगते हैं और यह डिफ़ॉल्ट रूप से बंद रहता है — पहले court और date से कसकर फ़िल्टर करें। - **किसी brief को समृद्ध करने के लिए `citation` मोड इस्तेमाल करें।** citation स्ट्रिंग पेस्ट करें और एक ही रन में लिंक्ड केस रिकॉर्ड और cite counts वापस पाएं। - बड़े jobs के लिए **अपना खुद का CourtListener token लाएं** — free tier की कम rate limit ही मुख्य थ्रूपुट बॉटलनेक है। --- # SEC EDGAR Scraper — फाइलिंग, फुल-टेक्स्ट और XBRL फाइनेंशियल्स - **URL:** https://proooxy.com/hi/tools/sec-edgar-scraper/ - **टाइप:** tools - **विवरण:** SEC EDGAR फाइलिंग मेटाडेटा, फुल-टेक्स्ट 10-K/10-Q सेक्शन, EDGAR फुल-टेक्स्ट सर्च रिज़ल्ट, और XBRL फाइनेंशियल फ़ैक्ट्स को साफ़, RAG-तैयार JSON के रूप में एक्सट्रैक्ट करें। किसी API key की ज़रूरत नहीं। - **सारांश:** SEC फाइलिंग, 10-K/10-Q टेक्स्ट, और XBRL फाइनेंशियल्स — RAG-तैयार। - **कैटेगरी:** public-data - **टेक स्टैक:** TypeScript, Cheerio - **मार्केट्स / रीजन:** संयुक्त राज्य अमेरिका - **Apify लिस्टिंग:** https://apify.com/autofacts/sec-edgar-scraper - **कीवर्ड्स:** sec edgar api hindi, sec edgar scraper india, 10-K filing data कैसे निकाले, 10-Q scraper tool, xbrl financial data api, edgar full text search, sec filings for RAG pipeline, company financials api free - **प्रकाशित:** 2026-07-01 - **संशोधित:** 2026-07-01 **मुख्य विशेषताएं:** - एक ही एक्टर में चार मोड — filing मेटाडेटा, फुल डॉक्यूमेंट टेक्स्ट, EDGAR फुल-टेक्स्ट सर्च, और XBRL फाइनेंशियल फ़ैक्ट्स - RAG-तैयार chunking — section, paragraph (~2000 chars), या none; हर chunk अपने सोर्स Item और order के साथ टैग किया गया - 10-K/10-Q के लिए ऑटोमैटिक 'Item N' सेक्शन पार्सिंग (Item 1A Risk Factors, Item 7 MD&A, और भी बहुत कुछ) - taxonomy, tag, label, unit, value, fiscal year/period, form, और accession number के साथ XBRL फ़ैक्ट्स - Fact deduplication XBRL restatements को प्रति period एक row में collapse करता है, सबसे पहले वाला disclosure रखते हुए - SEC की आधिकारिक ticker फ़ाइल के आधार पर ticker, CIK, या नाम से Company रिज़ॉल्यूशन, fuzzy फ़ॉलबैक के साथ - quoted phrases, form-type, और date-range फ़िल्टर (2001 → अभी तक) के साथ EDGAR फुल-टेक्स्ट सर्च - SEC-कम्प्लायंट rate limiting और User-Agent — कोई API key और कोई login ज़रूरी नहीं **यूज़ केस:** - section-chunked, embedding-तैयार 10-K और 10-Q टेक्स्ट चाहने वाली फाइनेंशियल RAG / LLM पाइपलाइन - इन्वेस्टमेंट रिसर्च — revenue, net income, और diluted EPS की टाइम सीरीज़ साफ़ XBRL rows के रूप में खींचें - कंप्लायंस व ownership मॉनिटरिंग — कंपनियों में Form 4, SC 13D/13G, और risk-factor भाषा - फिनटेक प्रोडक्ट जिन्हें कस्टम क्रॉलर बनाए बिना संरचित EDGAR डेटा चाहिए - फुल-टेक्स्ट सर्च के ज़रिए मार्केट और इंडस्ट्री रिसर्च — कौन कोई phrase डिस्क्लोज़ करता है, और कब से - साफ़ XBRL फाइनेंशियल fact rows इस्तेमाल करने वाले BI और स्प्रेडशीट वर्कफ़्लो **इनपुट पैरामीटर:** - `mode` (string, आवश्यक) — एक्सट्रैक्शन मोड: filings, fulltext, search, या facts (डिफ़ॉल्ट: filings)। - `ticker` (string, वैकल्पिक) — स्टॉक ticker, जैसे AAPL। runtime पर ticker/cik/companyName में से एक ज़रूरी है। - `cik` (string, वैकल्पिक) — SEC Central Index Key, जैसे 320193 — ticker और companyName से ऊपर प्राथमिकता रखता है। - `companyName` (string, वैकल्पिक) — SEC registrant नाम, आधिकारिक ticker फ़ाइल के आधार पर exact या fuzzy-matched। - `query` (string, वैकल्पिक) — EDGAR फुल-टेक्स्ट सर्च expression, जैसे "supply chain disruption" — search मोड के लिए ज़रूरी। - `formTypes` (array, वैकल्पिक) — शामिल करने के लिए Form types, जैसे 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4। खाली = सभी forms। - `chunking` (string, वैकल्पिक) — Fulltext RAG स्ट्रैटेजी: section, paragraph (~2000 chars), या none (डिफ़ॉल्ट: section)। - `maxItems` (number, वैकल्पिक) — सेव किए जाने वाले अधिकतम आइटम; हर सेव किया गया आइटम एक बिल किया जाने वाला इवेंट है (डिफ़ॉल्ट: 100)। **सामान्य प्रश्न:** **Q: क्या मुझे SEC API key चाहिए?** नहीं। SEC EDGAR मुफ़्त सार्वजनिक डेटा है। एक्टर एक कम्प्लायंट User-Agent के साथ खुद को पहचान देता है और SEC की rate limit के अंदर खुद को ऑटोमैटिकली throttle करता है — कोई key नहीं, कोई login नहीं। **Q: डेटा कितने पीछे तक जाता है?** EDGAR फुल-टेक्स्ट सर्च (EFTS) 2001-05-04 से आगे की filings कवर करता है और प्रति क्वेरी 10,000 hits पर कैप्ड है। Filing मेटाडेटा 1994 तक जाता है, और XBRL फाइनेंशियल फ़ैक्ट्स वह सब कवर करते हैं जो कंपनी ने XBRL में रिपोर्ट किया है। **Q: क्या आउटपुट LLM और RAG के लिए तैयार है?** हां। fulltext मोड में एक्टर 10-K/10-Q को 'Item N' सेक्शन में पार्स करता है और embedding-तैयार chunks (section या ~2000-कैरेक्टर paragraph) देता है, जिनमें से हर एक अपने सोर्स Item और order index के साथ टैग होता है। **Q: fulltext मोड में कुछ filings क्यों स्किप हो जाती हैं?** जिन filings का primary document HTML या TXT नहीं होता (जैसे, XBRL-only Form 4 XML), उन्हें section-parse नहीं किया जा सकता, इसलिए वे स्किप हो जाती हैं — और उनके लिए चार्ज नहीं लिया जाता। ## आउटपुट का उदाहरण ```json { "itemType": "filing-fulltext", "title": "Apple Inc. — 10-K 2025-10-31", "company": "Apple Inc.", "ticker": "AAPL", "cik": "0000320193", "formType": "10-K", "filedAt": "2025-10-31", "accessionNo": "0000320193-25-000123", "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...", "sections": [ { "name": "Item 1A — Risk Factors", "charCount": 38241 }, { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 } ], "chunks": [ { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 } ], "textLength": 220151 } ``` ## प्राइसिंग Pay-per-event — आपसे सिर्फ़ असल में सेव किए गए आइटम के लिए बिल लिया जाता है: | इवेंट | प्राइस | इसमें क्या शामिल है | |---|---|---| | Filing मेटाडेटा / सर्च हिट | $0.001 | एक filing मेटाडेटा रिकॉर्ड या फुल-टेक्स्ट सर्च रिज़ल्ट | | फुल-टेक्स्ट Filing | $0.005 | एक filing एक्सट्रैक्ट, section-parsed, और RAG के लिए chunked | | XBRL फ़ैक्ट | $0.0002 | एक XBRL फाइनेंशियल fact row | 1,000-filing मेटाडेटा पुल की कीमत ~$1.00 है; 1,000 XBRL facts की ~$0.20। `maxItems` वॉल्यूम व कॉस्ट दोनों पर कैप लगाता है। ## टिप्स - **फाइनेंशियल्स के लिए `facts` मोड से शुरू करें।** जब आपको सिर्फ़ नंबर चाहिए हों, तो पूरी filings पार्स करने से XBRL rows (revenue, net income, EPS) खींचना कहीं ज़्यादा सस्ता और साफ़ है। - **RAG के लिए `chunking: section` इस्तेमाल करें।** यह हर Item (Risk Factors, MD&A) को इंटैक्ट रखता है ताकि रिट्रीवल कोहेरेंट, citable passages लौटाए। - **फुल-टेक्स्ट सर्च 2001 से आगे को कवर करता है।** पुराने disclosures के लिए, कंपनी को CIK से रिज़ॉल्व करें और filing मेटाडेटा सीधे खींचें। --- # USAspending.gov Scraper — फ़ेडरल अवार्ड्स, प्राप्तकर्ता और एग्रीगेट्स - **URL:** https://proooxy.com/hi/tools/usaspending-scraper/ - **टाइप:** tools - **विवरण:** फ़ेडरल contracts, grants, और loans के लिए आधिकारिक USAspending.gov API v2 को क्वेरी करें। agency, recipient, NAICS/PSC, या date से फ़िल्टर करें, और recipient प्रोफ़ाइल, category totals, और state/county/district geography aggregates खींचें। कोई API key नहीं। - **सारांश:** USAspending.gov से फ़ेडरल अवार्ड्स, प्राप्तकर्ता, और स्पेंडिंग aggregates। - **कैटेगरी:** public-data - **टेक स्टैक:** TypeScript, REST API - **मार्केट्स / रीजन:** संयुक्त राज्य अमेरिका - **Apify लिस्टिंग:** https://apify.com/autofacts/usaspending-scraper - **कीवर्ड्स:** usaspending api hindi, federal contract data कैसे निकाले, government spending data api, federal grants data india, govcon market research tool, federal awards data extraction, naics psc contract data - **प्रकाशित:** 2026-07-01 - **संशोधित:** 2026-07-01 **मुख्य विशेषताएं:** - आधिकारिक USAspending.gov API v2 — किसी API key की ज़रूरत नहीं - keywords, fiscal year/date रेंज, agency, recipient, NAICS, PSC, amount, और award type में award सर्च - छह मोड — award search, award detail, subawards, recipient profile, category totals, और geography - 18 category-aggregation dimensions (recipient, NAICS, PSC, agency, county, district, CFDA, TAS, और भी बहुत कुछ) - population और per-capita फ़ील्ड के साथ state, county, congressional district, और country के हिसाब से geography aggregates - बड़े multi-year result sets के लिए ऑटोमैटिक date slicing (monthly/quarterly) - valid API रिक्वेस्ट ग्रुप में ऑटोमैटिक award-type-code बैचिंग - जनरेट किए गए award ID से सटीक award-detail और subaward लुकअप **यूज़ केस:** - GovCon बिज़नेस डेवलपमेंट — NAICS, PSC, या agency के हिसाब से opportunities और incumbent contractors ढूंढें - किसी कॉम्पिटिटर की award हिस्ट्री और agency संबंधों पर प्रतिस्पर्धी इंटेलिजेंस - खास प्राप्तकर्ताओं या geographies तक फ़ेडरल स्पेंडिंग ट्रेस करने वाली इन्वेस्टिगेटिव जर्नलिज़्म - category, award type, या time period के हिसाब से स्पेंडिंग ट्रेंड पर पॉलिसी और एकेडमिक रिसर्च - किसी प्राप्तकर्ता की फ़ेडरल award और स्पेंडिंग हिस्ट्री का due-diligence रिव्यू - state, county, या congressional district के हिसाब से फ़ेडरल spend मैप करने वाले BI डैशबोर्ड **इनपुट पैरामीटर:** - `mode` (string, वैकल्पिक) — वर्कफ़्लो: awards, awardDetail, subawards, recipient, byCategory, या geography (डिफ़ॉल्ट: awards)। - `keywords` (array, वैकल्पिक) — award सर्च के लिए फ्री-टेक्स्ट USAspending keyword फ़िल्टर। - `fiscalYear` (number, वैकल्पिक) — फ़ेडरल fiscal year (Oct 1 – Sep 30 date रेंज पर मैप होता है)। - `awardTypes` (array, वैकल्पिक) — USAspending award type codes; मिक्स्ड ग्रुप ऑटोमैटिकली valid रिक्वेस्ट में स्प्लिट हो जाते हैं। - `agency` (string, वैकल्पिक) — Exact awarding या funding agency नाम फ़िल्टर। - `naicsCodes` (array, वैकल्पिक) — NAICS codes जिनसे किसी award को मैच करना ज़रूरी है। - `awardId` (string, वैकल्पिक) — जनरेटेड award ID — awardDetail और subawards मोड के लिए runtime पर ज़रूरी। - `maxItems` (number, वैकल्पिक) — सेव किए जाने वाले अधिकतम रिकॉर्ड; हर row एक बिल किया जाने वाला इवेंट है (डिफ़ॉल्ट: 100)। **सामान्य प्रश्न:** **Q: क्या मुझे API key चाहिए?** नहीं। USAspending.gov API v2 पब्लिक है और इसके लिए किसी key या login की ज़रूरत नहीं। **Q: मिक्स्ड award-type codes को कई रिक्वेस्ट में क्यों स्प्लिट किया जाता है?** USAspending एक ऐसी सिंगल सर्च को रिजेक्ट कर देता है जो अलग-अलग award-type ग्रुप (contracts, IDVs, grants, loans, other financial assistance, direct payments) के codes मिक्स करती है। एक्टर रिक्वेस्टेड codes को ऑटोमैटिकली ग्रुप करता है और हर आउटपुट row को मैच हुए award type codes से टैग करता है। **Q: कौन-कौन से geographic breakdown उपलब्ध हैं?** State, county, congressional district, और country — या तो place of performance या recipient location पर scoped, population और per-capita फ़ील्ड सहित। **Q: एक रन की प्राइसिंग कैसे होती है?** Pay-per-event, प्रति सेव row $0.001, हर सफलतापूर्वक रिटर्न हुए रिकॉर्ड पर एक बार चार्ज। maxItems rows की संख्या और इस तरह कॉस्ट पर कैप लगाता है। ## आउटपुट का उदाहरण ```json { "itemType": "award", "title": "HT940216C0001 — HUMANA GOVERNMENT BUSINESS INC", "date": "2016-02-01", "awardId": "HT940216C0001", "generatedId": "CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-", "recipient": { "name": "HUMANA GOVERNMENT BUSINESS INC", "uei": "...", "duns": "..." }, "awardingAgency": "Department of Defense", "fundingAgency": "Department of Defense", "amount": 51269205263.03, "awardType": "IDV_B_C", "naics": { "code": "...", "description": "..." }, "placeOfPerformance": { "stateCode": "...", "state": "..." }, "awardTypeCodes": ["IDV_B_C"], "url": "https://www.usaspending.gov/award/CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-" } ``` ## प्राइसिंग Pay-per-event: सेव किए गए हर **record** पर **$0.001**, हर सफलतापूर्वक रिटर्न हुई row पर एक बार चार्ज। एक ~1,000-record रन की कीमत ~$1.00 है, और `maxItems` वॉल्यूम व कॉस्ट दोनों पर कैप लगाता है। ## टिप्स - GovCon prospecting के लिए **NAICS या PSC codes से शुरुआत करें** — ये सीधे उन प्रोडक्ट्स/सेवाओं पर मैप होते हैं जो आप बेचते हैं और सबसे साफ़ रिलेवेंट awards का सेट लौटाते हैं। - individual award डिटेल खींचने से पहले किसी मार्केट के टॉप recipients या agencies को रैंक करने के लिए **`byCategory` मोड इस्तेमाल करें।** - **Geography मोड हर date-range/award-type कॉम्बिनेशन के लिए पहला पेज (100 rows तक) रिटर्न करता है** — state/county/district roll-ups के लिए `maxItems` बढ़ाने के बजाय फ़िल्टर को संकरा करें। --- # YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM - **URL:** https://proooxy.com/hi/tools/youtube-transcript-scraper/ - **टाइप:** tools - **विवरण:** videos, Shorts, playlists, और channels से YouTube subtitles और transcripts को JSON, SRT, VTT, plain text, या साफ़ LLM-तैयार टेक्स्ट के रूप में एक्सट्रैक्ट करें। 100+ भाषाएं, समृद्ध मेटाडेटा, कोई API key नहीं — और फ़ेल हुए एक्सट्रैक्शन मुफ़्त हैं। - **सारांश:** YouTube transcripts JSON, SRT, VTT, या LLM-तैयार टेक्स्ट के रूप में। - **कैटेगरी:** social - **टेक स्टैक:** TypeScript, InnerTube - **मार्केट्स / रीजन:** वैश्विक - **Apify लिस्टिंग:** https://apify.com/autofacts/youtube-subtitle-transcript-scraper - **कीवर्ड्स:** youtube transcript downloader hindi, youtube transcript api free, youtube subtitle कैसे डाउनलोड करें, youtube captions to text converter, bulk youtube transcripts tool, youtube transcript srt vtt download, youtube transcripts for LLM training - **प्रकाशित:** 2026-07-01 - **संशोधित:** 2026-07-01 **मुख्य विशेषताएं:** - एक ही इनपुट videos, Shorts, youtu.be links, playlists, और channels हैंडल करता है — एक ही रन में मिक्स्ड - पांच आउटपुट फ़ॉर्मेट — JSON (timestamped), SRT, VTT, plain text, और LLM-तैयार ([Music], [Applause], और speaker labels हटाता है) - priority-ordered भाषा लिस्ट और toggleable auto-caption फ़ॉलबैक के साथ 100+ भाषाएं - समृद्ध मेटाडेटा — title, channel, description, publish date, view count, thumbnail, duration, और उपलब्ध भाषाएं - maxVideos cap और 1–10 कॉन्करेंसी के साथ पूरी playlists और channels को batch करें - bot-check blocks कम करने के लिए रेजिडेंशियल प्रॉक्सी सपोर्ट के साथ वैकल्पिक cookies - मल्टी-लेयर एक्सट्रैक्शन — InnerTube क्लाइंट्स में 9 तक फ़ॉलबैक, आखिरी उपाय के तौर पर yt-dlp PO-token के साथ - सर्किट ब्रेकर और per-item एरर हैंडलिंग बड़े batches को चलते रहने देते हैं **यूज़ केस:** - बोले गए वीडियो से RAG या fine-tuning dataset बनाने वाली AI/ML टीमें (LLM-तैयार टेक्स्ट आउटपुट) - transcripts को ब्लॉग पोस्ट, show notes, और सोशल captions में repurpose करने वाली कंटेंट टीमें - indexing और keyword रिसर्च के लिए सर्च होने लायक वीडियो टेक्स्ट एक्सट्रैक्ट करने वाले SEO मार्केटर - स्टैंडर्ड SRT/VTT subtitle फ़ाइलें चाहने वाले editors और publishers - पूरे channel या playlist में transcripts batch-collect करने वाले researchers - बिना YouTube API key के संरचित, timestamped captions चाहने वाले डेवलपर **इनपुट पैरामीटर:** - `urls` (array, वैकल्पिक) — YouTube URL या bare ID — videos, Shorts, youtu.be links, playlists, या channels। runtime पर ज़रूरी। - `outputFormat` (string, वैकल्पिक) — Transcript फ़ॉर्मेट: json, srt, vtt, text, या llm (डिफ़ॉल्ट: json)। - `languages` (array, वैकल्पिक) — प्राथमिकता क्रम में पसंदीदा subtitle भाषाएं, ISO 639-1 codes (डिफ़ॉल्ट: en)। - `includeAutoGenerated` (boolean, वैकल्पिक) — मैनुअल captions न होने पर auto-generated captions पर फ़ॉलबैक करें (डिफ़ॉल्ट: true)। - `maxVideos` (number, वैकल्पिक) — प्रति रन प्रोसेस किए गए videos पर cap, जैसे playlists/channels के लिए (डिफ़ॉल्ट: 0 = अनलिमिटेड)। - `maxConcurrency` (number, वैकल्पिक) — पैरेलल में प्रोसेस किए गए videos, 1–10 (डिफ़ॉल्ट: 3)। - `proxyConfiguration` (object, वैकल्पिक) — प्रॉक्सी सेटिंग्स; डिफ़ॉल्ट रूप से US पर पिन किया गया Apify Residential। - `youtubeCookies` (string, वैकल्पिक) — bot-check blocks कम करने के लिए वैकल्पिक YouTube cookies (Cookie header या cookies.txt)। **सामान्य प्रश्न:** **Q: क्या मुझे YouTube API key चाहिए या login करना होगा?** नहीं। एक्टर सीधे captions एक्सट्रैक्ट करता है — कोई YouTube Data API key नहीं और कोई login नहीं। कुछ videos पर 'Sign in to confirm you're not a bot' ब्लॉक कम करने के लिए एक वैकल्पिक cookies इनपुट दिया जा सकता है। **Q: कौन-कौन सी भाषाएं और caption टाइप सपोर्टेड हैं?** 100 से ज़्यादा भाषाएं। ISO 639-1 codes की प्राथमिकता-क्रम वाली लिस्ट दें (डिफ़ॉल्ट: en); एक्टर मैनुअली बनाए गए captions को प्राथमिकता देता है और includeAutoGenerated बंद न करने पर auto-generated वाले पर फ़ॉलबैक करता है। **Q: क्या एक्सट्रैक्ट न हो पाने वाले videos के लिए मुझसे चार्ज लिया जाता है?** नहीं। Billing एक सिंगल transcript-extracted इवेंट पर pay-per-event है, जो सिर्फ़ transcript सफलतापूर्वक सेव होने के बाद चार्ज होता है। फ़ेल हुए videos आउटपुट में एक error फ़ील्ड के साथ दिखते हैं और उनके लिए चार्ज नहीं लिया जाता। **Q: क्या मुझे RAG के लिए साफ़, LLM-तैयार टेक्स्ट मिल सकता है?** हां। [Music]/[Applause] annotations और speaker labels हटाने के लिए outputFormat को 'llm' सेट करें, जिससे embeddings और fine-tuning के लिए आदर्श साफ़ prose मिलता है। ## आउटपुट का उदाहरण ```json { "videoId": "dQw4w9WgXcQ", "url": "https://www.youtube.com/watch?v=dQw4w9WgXcQ", "title": "Rick Astley - Never Gonna Give You Up (Official Video)", "channelName": "Rick Astley", "channelId": "UCuAXFkgsw1L7xaCfnd5JJOw", "publishDate": "2009-10-25", "viewCount": 1761003712, "availableLanguages": ["en", "de-DE", "ja", "pt-BR", "es-419"], "language": "en", "isAutoGenerated": false, "duration": 213, "wordCount": 487, "segmentCount": 61, "text": "We're no strangers to love, you know the rules and so do I...", "segments": [{ "text": "We're no strangers to love", "start": 18.64, "end": 21.88 }], "error": null } ``` ## प्राइसिंग Pay-per-event: हर **सफलतापूर्वक एक्सट्रैक्ट हुए transcript** पर एक बार बिल — फ़ेल हुए videos के लिए कभी चार्ज नहीं लिया जाता। पूरा channel या playlist फ़ीड करें और सिर्फ़ उन captions के लिए पे करें जो आपको असल में वापस मिलते हैं। ## टिप्स - RAG और fine-tuning के लिए **`outputFormat: llm` इस्तेमाल करें** — यह non-speech annotations हटा देता है ताकि आपके embeddings को साफ़ prose मिले। - **रेजिडेंशियल प्रॉक्सी ऑन रखें।** YouTube डेटासेंटर IPs को आक्रामक तरीके से ब्लॉक करता है; एक्टर एक वजह से डिफ़ॉल्ट रूप से US रेजिडेंशियल इस्तेमाल करता है। - बड़े jobs के लिए **`maxConcurrency` को 1–3 पर शुरू करें** और इसे धीरे-धीरे बढ़ाएं — ज़्यादा कॉन्करेंसी बड़े channel स्क्रैप पर rate-limit रिस्क बढ़ा देती है। --- # Sephora Scraper (ग्लोबल) - **URL:** https://proooxy.com/hi/tools/sephora-scraper/ - **टाइप:** tools - **विवरण:** एक Apify एक्टर जो US, Canada, 9 EU मार्केट, और 10 एशिया-पैसिफ़िक मार्केट के 21 स्टोरफ्रंट से — वेरिएंट, प्राइस, इमेज, ingredients, और रिव्यू सहित — पूरा Sephora प्रोडक्ट डेटा एक ही normalized schema में एक्सट्रैक्ट करता है। - **सारांश:** किसी भी Sephora स्टोरफ्रंट को स्क्रैप करें — 21 मार्केट, एक एक्टर। - **कैटेगरी:** ecommerce - **टेक स्टैक:** Python, Crawlee, curl_cffi - **मार्केट्स / रीजन:** अमेरिका, कनाडा, फ्रांस, इटली, जर्मनी, स्पेन, पोलैंड, चेक गणराज्य, ग्रीस, रोमानिया, पुर्तगाल, न्यूज़ीलैंड, ऑस्ट्रेलिया, सिंगापुर, मलेशिया, थाईलैंड, इंडोनेशिया, फिलीपींस, हॉन्ग कॉन्ग, ताइवान, ब्रुनेई - **एंटी-बॉट रणनीति:** रेजिडेंशियल प्रॉक्सी + curl_cffi TLS फ़िंगरप्रिंटिंग के ज़रिए Akamai बाईपास - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/sephora - **कीवर्ड्स:** sephora scraper india, sephora product data कैसे निकाले, sephora api alternative, scrape sephora products hindi, sephora price tracker tool, beauty product data api, cosmetics data extraction tool, sephora global scraper all markets - **प्रकाशित:** 2026-04-18 - **संशोधित:** 2026-04-18 **मुख्य विशेषताएं:** - एक ही एक्टर में 21 स्टोरफ्रंट — US, Canada, 9 EU मार्केट, और 10 APAC मार्केट एक ही SKU से कवर - ऑटो-डिटेक्टेड मार्केट — कोई भी sephora.* URL पेस्ट करें और dispatcher उसे सही मॉड्यूल पर रूट कर देता है - मिक्स्ड मल्टी-मार्केट रन — US + EU + SEA URL एक ही startUrls लिस्ट में, `market` से टैग किए गए एक ही dataset में स्ट्रीम्ड - Locale-सही प्राइसिंग — NZD, EUR, USD, AUD और 17 अन्य करेंसी, जो Sephora के अपने localization लेयर से मिलती हैं - Normalized schema — हर मार्केट एक ही `source / brand / title / options / variants / medias / stats` शेप देता है - Per-market सेशन आइसोलेशन — auth state रीजन के बीच cross-contaminate नहीं हो सकता - ग्लोबल सर्किट ब्रेकर — किसी डाउन टारगेट पर कंप्यूट बर्न होने से बचाने के लिए 50 लगातार फ़ेलियर पर रन एबॉर्ट हो जाता है **यूज़ केस:** - US, EU, और APAC ब्यूटी मार्केट में पैन-रीजनल प्राइसिंग इंटेलिजेंस - क्रॉस-मार्केट प्रोडक्ट उपलब्धता और assortment मॉनिटरिंग - नए Sephora रीजन में लॉन्च करने वाले ब्रांड्स के लिए प्रतिस्पर्धी विश्लेषण - रीजनल formulations में ingredient कंपैरिज़न - रिव्यू और रेटिंग ट्रैकिंग — SEA wishlist सिग्नल और US AI sentiment summaries सहित - प्रति मार्केट Loyalty/membership प्राइसिंग ऑडिट **इनपुट पैरामीटर:** - `startUrls` (array, आवश्यक) — किसी भी sephora.* स्टोरफ्रंट से प्रोडक्ट या कैटेगरी URL। मार्केट hostname से ऑटो-डिटेक्ट होता है। - `market` (string, वैकल्पिक) — वैकल्पिक मार्केट override (us, eu-fr, eu-it, eu-de, eu-es, eu-pl, eu-cz, eu-gr, eu-ro, eu-pt, sea-nz, sea-au, sea-sg, sea-my, sea-th, sea-id, sea-ph, sea-hk, sea-tw, sea-bn)। - `locale` (string, वैकल्पिक) — वैकल्पिक BCP 47 locale (जैसे fr-FR, en-NZ) — मार्केट डिफ़ॉल्ट को override करता है। - `categoryIds` (array, वैकल्पिक) — सिर्फ़ EU के लिए। SFCC category ID जैसे C479 — कैटेगरी URL पेस्ट करने का विकल्प। - `proxy` (object, वैकल्पिक) — Apify प्रॉक्सी कॉन्फ़िग। रेजिडेंशियल की ज़ोरदार सलाह; apifyProxyCountry को टारगेट मार्केट पर पिन करें। - `maxConcurrency` (number, वैकल्पिक) — समवर्ती रिक्वेस्ट। डिफ़ॉल्ट 5। US: 2-5। EU: 3। SEA: 8-16। - `maxRequestsPerCrawl` (number, वैकल्पिक) — सभी मार्केट में ग्लोबल hard cap। 0 = अनलिमिटेड। **सामान्य प्रश्न:** **Q: यह स्क्रैपर कौन-कौन से Sephora स्टोरफ्रंट सपोर्ट करता है?** 21 स्टोरफ्रंट: अमेरिका (sephora.com), कनाडा (sephora.ca), 9 EU मार्केट (FR, IT, DE, ES, PL, CZ, GR, RO, PT), और 10 APAC मार्केट (NZ, AU, SG, MY, TH, ID, PH, HK, TW, BN)। मार्केट hostname से ऑटो-डिटेक्ट होता है — मार्केट मिक्स करते समय किसी इनपुट बदलाव की ज़रूरत नहीं। **Q: क्या मैं एक ही रन में कई मार्केट स्क्रैप कर सकता हूं?** हां। एक ही startUrls लिस्ट में sephora.com, sephora.fr, और sephora.nz URL मिक्स करें। Dispatcher इन्हें मार्केट के हिसाब से ग्रुप करता है, हर मॉड्यूल को मार्केट-उपयुक्त auth के साथ समवर्ती रूप से चलाता है, और हर dataset आइटम को एक `market` फ़ील्ड से टैग करता है। **Q: स्क्रैपर एंटी-बॉट प्रोटेक्शन कैसे हैंडल करता है?** यह सभी मार्केट के लिए रेजिडेंशियल प्रॉक्सी इस्तेमाल करता है और Akamai को बाईपास करने के लिए EU व SEA ट्रैफ़िक पर ब्राउज़र-ग्रेड TLS फ़िंगरप्रिंटिंग के लिए curl_cffi इस्तेमाल करता है। US ट्रैफ़िक Crawlee के HttpCrawler का इस्तेमाल करता है, एक सेशन पूल के साथ जो 403/429 पर रोटेट होता है। **Q: क्या मेरे मौजूदा v1.x US रन कॉन्फ़िग काम करते रहेंगे?** हां। Pre-2.0 इनपुट — startUrls, maxConcurrency, proxy, maxRequestsPerCrawl — बिल्कुल पहले जैसा ही व्यवहार करते हैं। सिर्फ़ आउटपुट में बदलाव यह है कि हर आइटम पर एक नया `market` key जुड़ जाता है, जो एक soft additive बदलाव है। **Q: SEA डेटा में कुछ फ़ील्ड null क्यों होते हैं?** Sephora SEA का API `lovesCount` काउंटर एक्सपोज़ नहीं करता, इसलिए APAC आइटम में `stats.lovesCount = null` होता है। इसके बजाय हर वेरिएंट में एक boolean `wishlisted` फ़ील्ड होता है। वहीं दूसरी ओर, `sentiments` (AI रिव्यू summaries) और `source.crawlUrl` सिर्फ़ US के लिए हैं। **Q: क्या मुझे प्रति मार्केट अलग API tokens या अकाउंट चाहिए?** नहीं। आपका मौजूदा Apify API token बिना किसी बदलाव के काम करता है। एक्टर per-market गेस्ट tokens को इंटरनली हैंडल करता है — EU/SEA के लिए किसी क्रेडेंशियल की ज़रूरत नहीं, और US स्टैंडर्ड Apify रेजिडेंशियल प्रॉक्सी पर काम करता है। ## सपोर्टेड मार्केट | रीजन | मार्केट ID | देश | करेंसी | होस्टनेम | |---|---|---|---|---| | अमेरिका | `us` | संयुक्त राज्य अमेरिका | USD | sephora.com | | अमेरिका | `us` | कनाडा | CAD | sephora.ca | | EU | `eu-fr` | फ्रांस | EUR | sephora.fr | | EU | `eu-it` | इटली | EUR | sephora.it | | EU | `eu-de` | जर्मनी | EUR | sephora.de | | EU | `eu-es` | स्पेन | EUR | sephora.es | | EU | `eu-pl` | पोलैंड | PLN | sephora.pl | | EU | `eu-cz` | चेक गणराज्य | CZK | sephora.cz | | EU | `eu-gr` | ग्रीस | EUR | sephora.gr | | EU | `eu-ro` | रोमानिया | RON | sephora.ro | | EU | `eu-pt` | पुर्तगाल | EUR | sephora.pt | | APAC | `sea-nz` | न्यूज़ीलैंड | NZD | sephora.nz | | APAC | `sea-au` | ऑस्ट्रेलिया | AUD | sephora.com.au | | APAC | `sea-sg` | सिंगापुर | SGD | sephora.sg | | APAC | `sea-my` | मलेशिया | MYR | sephora.com.my | | APAC | `sea-th` | थाईलैंड | THB | sephora.co.th | | APAC | `sea-id` | इंडोनेशिया | IDR | sephora.co.id | | APAC | `sea-ph` | फिलीपींस | PHP | sephora.ph | | APAC | `sea-hk` | हॉन्ग कॉन्ग | HKD | sephora.hk | | APAC | `sea-tw` | ताइवान | TWD | sephora.tw | | APAC | `sea-bn` | ब्रुनेई | BND | sephora.bn | ## आउटपुट का उदाहरण ```json { "market": "sea-nz", "source": { "id": 58792, "canonicalUrl": "https://www.sephora.nz/products/rare-beauty-true-to-myself-natural-matte-longwear-foundation", "retailer": "SEPHORA", "currency": "NZD" }, "brand": "Rare Beauty", "title": "True To Myself Natural Matte Longwear Foundation", "description": "

A self-priming and self-setting foundation...

", "ingredients": "Aqua/Water, Cyclopentasiloxane, Glycerin...", "currentSku": "770225", "categories": ["makeup/face/foundation"], "options": [ { "name": "shade", "id": "66488", "values": [{"value": "1 Fair Neutral", "orderable": true}] } ], "variants": [ { "id": "276343", "sku": "770225", "price": { "current": 77.0, "original": 77.0, "stockStatus": "IN_STOCK" }, "options": [{"name": "shade", "value": "1 Fair Neutral"}], "highlights": ["NEW", "Only at Sephora"], "wishlisted": null } ], "medias": [{ "url": "https://www.sephora.nz/.../foundation-shade.jpg", "type": "image" }], "stats": { "reviewCount": 971, "rating": 4.8, "lovesCount": null } } ``` ## टिप्स - **प्रॉक्सी country को टारगेट मार्केट पर पिन करें।** गलत country का रेजिडेंशियल exit Sephora के Akamai लेयर से मिलने वाले 403s का सबसे बड़ा सोर्स है। `apifyProxyCountry` को स्टोरफ्रंट के ISO कोड (`US`, `FR`, `NZ`, वगैरह) पर सेट करें। - **पहले smoke-test करें।** किसी नए मार्केट में अपने पहले प्रोडक्शन रन से पहले `maxRequestsPerCrawl=10` सेट करें। - **प्रति रीजन कॉन्करेंसी ट्यून करें।** US: 2-5। EU: 3। SEA: 8-16। मिक्स्ड रन में हर मार्केट को अपना सेमाफ़ोर मिलता है। --- # Boohoo Scraper — 7 रीजन में प्रोडक्ट डेटा - **URL:** https://proooxy.com/hi/tools/boohoo-scraper/ - **टाइप:** tools - **विवरण:** 7 रीजन में Boohoo ई-कॉमर्स साइट्स से ऑटोमैटिक पेजिनेशन, facet फ़िल्टरिंग, और मल्टी-करेंसी सपोर्ट के साथ प्रोडक्ट डेटा एक्सट्रैक्ट करें। - **सारांश:** 7 रीजनल स्टोर में Boohoo प्रोडक्ट डेटा स्क्रैप करें। - **कैटेगरी:** ecommerce - **टेक स्टैक:** TypeScript, Cheerio, Fingerprint Generator - **मार्केट्स / रीजन:** नीदरलैंड्स, स्वीडन, यूके, आयरलैंड, फ्रांस, ऑस्ट्रेलिया, अमेरिका - **एंटी-बॉट रणनीति:** एंटी-बॉट बाईपास के लिए फ़िंगरप्रिंट जनरेशन - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/boohoo-scraper - **कीवर्ड्स:** boohoo scraper india, boohoo प्रोडक्ट डेटा कैसे निकाले, boohoo price monitoring tool, fast fashion data scraper, fashion catalog data api, multi region fashion data hindi - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - 7 रीजनल स्टोर सपोर्ट — NL (EUR), SE (SEK), UK (GBP), IE (EUR), FR (EUR), AU (AUD), US (USD) - ऑटोमैटिक पेजिनेशन के साथ कैटेगरी और सर्च स्क्रैपिंग - Facet फ़िल्टर सपोर्ट — साइज़, कलर, प्राइस रेंज, स्टाइल - वेरिएंट और स्टॉक स्टेटस सहित पूरी प्रोडक्ट डिटेल - एंटी-बॉट बाईपास के लिए ब्राउज़र फ़िंगरप्रिंट जनरेशन - रीजनल स्टोर के आधार पर मल्टी-करेंसी प्राइसिंग **यूज़ केस:** - फ़ास्ट फ़ैशन प्रतिस्पर्धी प्राइसिंग विश्लेषण - एक ही प्रोडक्ट के लिए मल्टी-रीजन प्राइस कंपैरिज़न - अफ़ोर्डेबल फैशन में ट्रेंड मॉनिटरिंग - रीजन भर में इन्वेंट्री और स्टॉक ट्रैकिंग - यूरोपीय और वैश्विक मार्केट में फैशन मार्केट रिसर्च **इनपुट पैरामीटर:** - `startUrls` (array, आवश्यक) — Boohoo प्रोडक्ट या कैटेगरी URL - `maxRequestsPerCrawl` (number, वैकल्पिक) — रिक्वेस्ट लिमिट (डिफ़ॉल्ट: 5) - `maxConcurrency` (number, वैकल्पिक) — पैरेलल रिक्वेस्ट (डिफ़ॉल्ट: 5) - `proxy` (object, वैकल्पिक) — प्रॉक्सी कॉन्फ़िगरेशन **सामान्य प्रश्न:** **Q: कौन-कौन से रीजनल Boohoo स्टोर सपोर्टेड हैं?** नीदरलैंड्स (EUR), स्वीडन (SEK), यूनाइटेड किंगडम (GBP), आयरलैंड (EUR), फ्रांस (EUR), ऑस्ट्रेलिया (AUD), और संयुक्त राज्य अमेरिका (USD)। **Q: क्या मैं प्रोडक्ट को साइज़ या कलर के हिसाब से फ़िल्टर कर सकता हूं?** हां, स्क्रैपर facet फ़िल्टरिंग सपोर्ट करता है। आप फ़िल्टर किए गए कैटेगरी URL दे सकते हैं और स्क्रैपर लागू किए गए फ़िल्टर का पालन करेगा। **Q: स्क्रैपर पेजिनेशन कैसे हैंडल करता है?** पेजिनेशन ऑटोमैटिक है। एक कैटेगरी या सर्च URL दें और स्क्रैपर हर प्रोडक्ट एक्सट्रैक्ट करने के लिए सभी पेजिनेशन लिंक फॉलो करेगा। ## आउटपुट का उदाहरण ```json { "source": "https://www.boohoo.com/...", "brand": "boohoo", "title": "Oversized Hoodie", "description": "Stay cozy in this oversized hoodie...", "categories": ["Women", "Hoodies & Sweatshirts"], "price": { "current": 1500, "original": 3000, "currency": "GBP" }, "variants": [ { "sku": "BH-OH-BLK-S", "size": "S", "color": "Black", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Farfetch Scraper — लग्ज़री फैशन प्रोडक्ट डेटा - **URL:** https://proooxy.com/hi/tools/farfetch-scraper/ - **टाइप:** tools - **विवरण:** मल्टी-करेंसी प्राइसिंग, साइज़/फ़िट वेरिएशन, और प्रोडक्ट रिकमेंडेशन सहित Farfetch से लग्ज़री फैशन प्रोडक्ट डेटा एक्सट्रैक्ट करें। - **सारांश:** मल्टी-करेंसी सपोर्ट के साथ Farfetch से लग्ज़री फैशन प्रोडक्ट स्क्रैप करें। - **कैटेगरी:** ecommerce - **टेक स्टैक:** TypeScript, Cheerio, Crawlee - **मार्केट्स / रीजन:** वैश्विक - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/farfetch - **कीवर्ड्स:** farfetch scraper india, farfetch product data कैसे निकाले, luxury fashion data api, designer fashion scraper tool, farfetch price monitoring hindi, luxury retail data extraction - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - कैटेगरी और प्रोडक्ट डिटेल पेज स्क्रैपिंग - मल्टी-करेंसी प्राइसिंग — प्रॉक्सी लोकेशन के आधार पर ऑटो-डिटेक्ट होती है - वैकल्पिक साइज़/फ़िट वेरिएशन एक्सट्रैक्शन - प्रति आइटम 90 तक रिकमेंडेड प्रोडक्ट - पूरी मीडिया गैलरी और विस्तृत विवरण - ब्रांड, कैटेगरी, और अतिरिक्त जानकारी एक्सट्रैक्शन **यूज़ केस:** - लग्ज़री फैशन मार्केट इंटेलिजेंस - डिज़ाइनर ब्रांड्स के लिए क्रॉस-प्लेटफ़ॉर्म प्राइस कंपैरिज़न - फैशन ट्रेंड विश्लेषण और प्रोडक्ट डिस्कवरी - मल्टी-ब्रांड रिटेलर के लिए प्रतिस्पर्धी प्राइसिंग - प्रोडक्ट रिकमेंडेशन इंजन ट्रेनिंग डेटा **इनपुट पैरामीटर:** - `startUrls` (array, आवश्यक) — Farfetch प्रोडक्ट या कैटेगरी URL - `proxy` (object, वैकल्पिक) — प्रॉक्सी कॉन्फ़िग — लोकेशन करेंसी को प्रभावित करती है - `maxRequestsPerCrawl` (number, वैकल्पिक) — रिक्वेस्ट लिमिट (डिफ़ॉल्ट: 100) - `maxConcurrency` (number, वैकल्पिक) — पैरेलल रिक्वेस्ट (डिफ़ॉल्ट: 5) - `withSizeFit` (boolean, वैकल्पिक) — साइज़/फ़िट डेटा शामिल करें (डिफ़ॉल्ट: false) - `withRecommends` (boolean, वैकल्पिक) — रिकमेंडेशन शामिल करें (डिफ़ॉल्ट: false) **सामान्य प्रश्न:** **Q: मल्टी-करेंसी प्राइसिंग कैसे काम करती है?** Farfetch आपकी लोकेशन के आधार पर प्राइस दिखाता है। स्क्रैपर यह तय करने के लिए कि कौन-सी करेंसी रिटर्न होगी, आपकी प्रॉक्सी लोकेशन इस्तेमाल करता है। USD के लिए US प्रॉक्सी, GBP के लिए UK प्रॉक्सी वगैरह इस्तेमाल करें। **Q: कितने रिकमेंडेड प्रोडक्ट एक्सट्रैक्ट किए जा सकते हैं?** withRecommends ऑन होने पर प्रति आइटम 90 तक रिकमेंडेड प्रोडक्ट। यह प्रोडक्ट ग्राफ़ और रिकमेंडेशन dataset बनाने के लिए उपयोगी है। ## आउटपुट का उदाहरण ```json { "source": "https://www.farfetch.com/shopping/...", "brand": "Gucci", "title": "GG Marmont Matelasse Shoulder Bag", "description": "Crafted from matelasse leather...", "details": ["Made in Italy", "100% Calf Leather"], "categories": ["Women", "Bags", "Shoulder Bags"], "options": [ { "name": "Size", "values": ["One Size"] } ], "variants": [ { "sku": "FF-GU-001", "price": 229000, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Global API Load Tester — 10K+ RPS स्ट्रेस टेस्ट - **URL:** https://proooxy.com/hi/tools/load-tester/ - **टाइप:** tools - **विवरण:** हाई-परफ़ॉर्मेंस लोड टेस्टिंग टूल जो geo-distributed ट्रैफ़िक, weighted targets, और इंटरैक्टिव HTML रिपोर्ट के साथ 10,000+ रिक्वेस्ट प्रति सेकंड सिमुलेट करता है। - **सारांश:** geo-distributed लोड टेस्टिंग के साथ 10K+ RPS सिमुलेट करें। - **कैटेगरी:** utility - **टेक स्टैक:** Go, Vegeta - **मार्केट्स / रीजन:** वैश्विक - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/global-api-load-tester - **कीवर्ड्स:** api load testing tool india, http load testing कैसे करें, stress testing tool free, performance testing api hindi, load test 10k rps, geo distributed load testing, vegeta load testing tool - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - एक्सट्रीम परफ़ॉर्मेंस — 10,000+ रिक्वेस्ट प्रति सेकंड - US, EU, और Asia से Geo-distributed टेस्टिंग - Weighted मल्टी-टारगेट अटैक (जैसे, 90% reads / 10% writes) - असली जैसे ट्रैफ़िक के लिए रेजिडेंशियल प्रॉक्सी सपोर्ट - Coordinated Omission रोकने के लिए constant-rate पेसिंग - Vegeta Plots के ज़रिए इंटरैक्टिव HTML रिपोर्ट - विस्तृत लेटेंसी, थ्रूपुट, और एरर मेट्रिक्स **यूज़ केस:** - लॉन्च से पहले API परफ़ॉर्मेंस बेंचमार्किंग - कैपेसिटी प्लानिंग और इंफ्रास्ट्रक्चर साइज़िंग - ब्रेकिंग पॉइंट और बॉटलनेक ढूंढना - CDN और लोड बैलेंसर कॉन्फ़िगरेशन टेस्ट करना - Geo-distributed लेटेंसी टेस्टिंग - परफ़ॉर्मेंस-क्रिटिकल एंडपॉइंट के लिए रिग्रेशन टेस्टिंग **इनपुट पैरामीटर:** - `targets` (array, आवश्यक) — URL, method, body, headers, और weight के साथ टारगेट एंडपॉइंट - `rate` (number, वैकल्पिक) — रिक्वेस्ट प्रति सेकंड (डिफ़ॉल्ट: 50) - `duration` (number, वैकल्पिक) — टेस्ट अवधि सेकंड में (डिफ़ॉल्ट: 60) - `geoDistribution` (array, वैकल्पिक) — country codes और traffic weights के साथ रीजन - `useStickySessions` (boolean, वैकल्पिक) — सेशन एफ़िनिटी बनाए रखें (डिफ़ॉल्ट: true) - `maxCostLimit` (number, वैकल्पिक) — टेस्ट रन के लिए कॉस्ट सीलिंग **सामान्य प्रश्न:** **Q: Geo-distributed टेस्टिंग कैसे काम करती है?** आप country codes और traffic weights बताते हैं। टूल उन रीजन में Apify प्रॉक्सी सर्वर पर रिक्वेस्ट डिस्ट्रीब्यूट करता है, जिससे असली जैसे ग्लोबल ट्रैफ़िक पैटर्न सिमुलेट होते हैं। **Q: Coordinated Omission क्या है?** यह एक आम लोड टेस्टिंग pitfall है, जिसमें टारगेट के ओवरलोडेड होने पर टूल धीमा हो जाता है, जिससे रिज़ल्ट असलियत से बेहतर दिखते हैं। Vegeta इससे बचने के लिए constant-rate पेसिंग इस्तेमाल करता है। **Q: क्या मैं ऑथेंटिकेटेड एंडपॉइंट टेस्ट कर सकता हूं?** हां, टारगेट कॉन्फ़िगरेशन में authorization headers शामिल करें। हर टारगेट के अपने headers, method, और body हो सकते हैं। ## आउटपुट का उदाहरण लोड टेस्टर इंटरैक्टिव HTML रिपोर्ट और संरचित मेट्रिक्स जनरेट करता है: ```json { "summary": { "totalRequests": 50000, "duration": "60s", "rps": 833.33, "successRate": 99.8, "latency": { "mean": "12.4ms", "p50": "10.1ms", "p95": "28.7ms", "p99": "89.2ms", "max": "342.1ms" }, "statusCodes": { "200": 49900, "503": 100 } } } ``` --- # Lululemon Scraper — प्रोडक्ट, वेरिएंट और प्राइस - **URL:** https://proooxy.com/hi/tools/lululemon-scraper/ - **टाइप:** tools - **विवरण:** Lululemon से वेरिएंट डेटा, कलर ऑप्शन, मीडिया गैलरी, और प्राइसिंग जानकारी सहित प्रोडक्ट डिटेल क्रॉल और एक्सट्रैक्ट करें। - **सारांश:** Lululemon से वेरिएंट और मीडिया सहित प्रोडक्ट डेटा एक्सट्रैक्ट करें। - **कैटेगरी:** ecommerce - **टेक स्टैक:** TypeScript, Crawlee - **मार्केट्स / रीजन:** अमेरिका - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/lululemon-scraper - **कीवर्ड्स:** lululemon scraper india, lululemon product data कैसे निकाले, lululemon price tracker tool, activewear product data api, athleisure pricing data hindi, lululemon inventory scraper - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - कैटेगरी और प्रोडक्ट पेज क्रॉलिंग - कलर और साइज़ ऑप्शन के साथ वेरिएंट एक्सट्रैक्शन - कलर-स्पेसिफ़िक इमेजेज़ के साथ पूरी मीडिया गैलरी - संरचित आउटपुट के साथ प्राइस ट्रैकिंग - कैटेगरी hierarchy एक्सट्रैक्शन - Crawlee फ़्रेमवर्क के साथ लाइटवेट और तेज़ **यूज़ केस:** - एथलेटिक वियर मार्केट रिसर्च और प्रतिस्पर्धी विश्लेषण - रीसेलर और कंपैरिज़न प्लेटफ़ॉर्म के लिए प्राइस मॉनिटरिंग - फ़िटनेस ई-कॉमर्स के लिए प्रोडक्ट कैटलॉग एग्रीगेशन - कलर और साइज़ उपलब्धता ट्रैकिंग - एक्टिववियर फैशन में ट्रेंड विश्लेषण **इनपुट पैरामीटर:** - `startUrls` (array, आवश्यक) — Lululemon प्रोडक्ट या कैटेगरी URL - `proxy` (object, वैकल्पिक) — प्रॉक्सी कॉन्फ़िगरेशन - `maxConcurrency` (number, वैकल्पिक) — पैरेलल रिक्वेस्ट लिमिट **सामान्य प्रश्न:** **Q: क्या स्क्रैपर अलग-अलग कलर वेरिएंट हैंडल करता है?** हां, हर कलर वेरिएंट अपनी खुद की इमेजेज़, SKU, और उपलब्धता स्टेटस के साथ एक्सट्रैक्ट होता है। मीडिया गैलरी कलर-स्पेसिफ़िक होती है। **Q: क्या मैं पूरी Lululemon कैटेगरी स्क्रैप कर सकता हूं?** हां, एक कैटेगरी URL दें और स्क्रैपर उस कैटेगरी के अंदर सभी प्रोडक्ट क्रॉल करेगा। ## आउटपुट का उदाहरण ```json { "source": "https://shop.lululemon.com/p/...", "brand": "lululemon", "title": "Align High-Rise Pant 25\"", "description": "Buttery-soft, weightless Nulu fabric...", "categories": ["Women", "Pants", "Yoga Pants"], "options": [ { "name": "Color", "values": ["Black", "True Navy", "Dark Olive"] }, { "name": "Size", "values": ["2", "4", "6", "8", "10", "12"] } ], "variants": [ { "sku": "LL-AHR-BLK-6", "name": "Black / 6", "price": 9800, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://...", "color": "Black" } ], "stats": { "rating": 4.7, "reviewCount": 15234 } } ``` --- # Schema Markup Scraper और SEO ऑडिटर - **URL:** https://proooxy.com/hi/tools/schema-markup-scraper/ - **टाइप:** tools - **विवरण:** किसी भी URL से JSON-LD, Microdata, RDFa, Open Graph, और Twitter Cards एक व्यापक SEO ऑडिट स्कोरिंग सिस्टम के साथ एक्सट्रैक्ट करें। - **सारांश:** किसी भी वेबसाइट के लिए संरचित डेटा एक्सट्रैक्ट करें और SEO ऑडिट करें। - **कैटेगरी:** utility - **टेक स्टैक:** TypeScript, Crawlee - **मार्केट्स / रीजन:** वैश्विक - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/metadata-scraper - **कीवर्ड्स:** schema markup checker hindi, structured data extractor tool, json-ld extractor free, seo audit tool india, open graph checker online, seo टूल कैसे इस्तेमाल करें, rich results testing tool - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - संरचित डेटा एक्सट्रैक्शन — JSON-LD, Microdata, और RDFa - सोशल meta tags — Open Graph, Twitter Cards, Dublin Core - 0-100 स्कोरिंग के साथ SEO एनालिसिस - Canonical URL और hreflang वैलिडेशन - EEAT सिग्नल के लिए Author एक्सट्रैक्शन - 80+ सबटाइप के साथ LocalBusiness डिटेक्शन - Image alt text ऑडिट - Breadcrumb schema वैलिडेशन - Geo tags और NAP एक्सट्रैक्शन **यूज़ केस:** - बड़े स्केल पर टेक्निकल SEO ऑडिटिंग - वेबसाइटों के लिए संरचित डेटा वैलिडेशन - प्रतिस्पर्धी SEO एनालिसिस — कॉम्पिटिटर्स में schema markup कंपेयर करें - कंटेंट साइट्स के लिए EEAT सिग्नल असेसमेंट - बिज़नेस के लिए Local SEO ऑडिटिंग - प्री-लॉन्च SEO चेकलिस्ट वैलिडेशन **इनपुट पैरामीटर:** - `startUrls` (array, आवश्यक) — एनालाइज़ करने के लिए URL - `proxy` (object, वैकल्पिक) — प्रॉक्सी कॉन्फ़िगरेशन - `maxRequestsPerCrawl` (number, वैकल्पिक) — ऑडिट करने के लिए कुल URL सीमित करें - `maxConcurrency` (number, वैकल्पिक) — पैरेलल रिक्वेस्ट - `extractMetaTags` (boolean, वैकल्पिक) — meta tags एक्सट्रैक्ट करें (डिफ़ॉल्ट: true) - `extractSeoAnalysis` (boolean, वैकल्पिक) — SEO एनालिसिस चलाएं (डिफ़ॉल्ट: true) - `computeSeoScore` (boolean, वैकल्पिक) — 0-100 SEO स्कोर कैलकुलेट करें (डिफ़ॉल्ट: true) - `extractGeoData` (boolean, वैकल्पिक) — geo tags और NAP डेटा एक्सट्रैक्ट करें **सामान्य प्रश्न:** **Q: कौन-कौन से संरचित डेटा फ़ॉर्मेट सपोर्टेड हैं?** JSON-LD, Microdata, और RDFa। स्क्रैपर Open Graph, Twitter Cards, और Dublin Core मेटाडेटा भी एक्सट्रैक्ट करता है। **Q: SEO स्कोर कैसे कैलकुलेट होता है?** 0-100 स्कोर title tags, meta descriptions, heading hierarchy, image alt text, canonical URLs, mobile viewport, संरचित डेटा की मौजूदगी, और भी बहुत कुछ evaluate करता है। **Q: क्या मैं एक साथ कई पेज ऑडिट कर सकता हूं?** हां, startUrls में कई URL दें। स्क्रैपर तेज़ bulk ऑडिटिंग के लिए इन्हें पैरेलल में प्रोसेस करता है। ## आउटपुट का उदाहरण ```json { "url": "https://example.com/product/...", "title": "Example Product Page", "linkedData": [ { "@type": "Product", "name": "..." } ], "openGraph": { "og:title": "Example Product", "og:type": "product" }, "twitterCard": { "card": "summary_large_image" }, "seoAudit": { "score": 78, "issues": [ "Missing alt text on 3 images", "No hreflang tags detected" ] }, "headings": { "h1": ["Example Product"], "h2": ["Description", "Reviews"] } } ``` --- # Sephora EU Scraper — 9 यूरोपीय मार्केट - **URL:** https://proooxy.com/hi/tools/sephora-eu-scraper/ - **टाइप:** tools - **विवरण:** 9 EU मार्केट में Sephora Europe से मल्टी-वेरिएंट एक्सट्रैक्शन, Akamai WAF बाईपास, और स्मार्ट token मैनेजमेंट के साथ पूरा प्रोडक्ट डेटा स्क्रैप करें। - **सारांश:** 9 यूरोपीय मार्केट में Sephora से प्रोडक्ट डेटा एक्सट्रैक्ट करें। - **कैटेगरी:** ecommerce - **टेक स्टैक:** TypeScript, Crawlee, Akamai Bypass - **मार्केट्स / रीजन:** फ्रांस, इटली, जर्मनी, स्पेन, पोलैंड, चेक गणराज्य, ग्रीस, रोमानिया, पुर्तगाल - **एंटी-बॉट रणनीति:** Akamai WAF — ब्राउज़र-ग्रेड TLS फ़िंगरप्रिंटिंग - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/sephora-eu-scraper - **कीवर्ड्स:** sephora europe scraper, sephora eu product data कैसे निकाले, european beauty data api, sephora france scraper, sephora germany scraper hindi, european cosmetics data extraction, akamai waf bypass tool - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - 9 EU मार्केट सपोर्ट — FR, IT, DE, ES, PL, CZ, GR, RO, PT - इंडिविजुअल प्राइसिंग और स्टॉक स्टेटस के साथ मल्टी-वेरिएंट एक्सट्रैक्शन - हर प्रोडक्ट के लिए हाई-रिज़ॉल्यूशन इमेज गैलरी - bulk एक्सट्रैक्शन के लिए category IDs के ज़रिए कैटेगरी ब्राउज़िंग - Akamai WAF बाईपास करने के लिए ब्राउज़र-ग्रेड TLS फ़िंगरप्रिंटिंग - ऑटोमैटिक रिफ़्रेश और एक्सपोनेंशियल बैकऑफ़ के साथ गेस्ट token मैनेजमेंट **यूज़ केस:** - पैन-यूरोपीय ब्यूटी मार्केट प्राइस कंपैरिज़न - क्रॉस-मार्केट प्रोडक्ट उपलब्धता मॉनिटरिंग - ब्यूटी ब्रांड्स के लिए EU मार्केट एक्सपैंशन रिसर्च - यूरोपीय मार्केट में प्रतिस्पर्धी इंटेलिजेंस - रीजनल प्राइसिंग स्ट्रैटेजी विश्लेषण **इनपुट पैरामीटर:** - `startUrls` (array, वैकल्पिक) — स्क्रैप करने के लिए Sephora EU प्रोडक्ट URL - `categoryIds` (array, वैकल्पिक) — bulk प्रोडक्ट एक्सट्रैक्शन के लिए Category IDs - `locale` (string, वैकल्पिक) — टारगेट मार्केट locale (जैसे, fr-FR, it-IT) - `maxProducts` (number, वैकल्पिक) — एक्सट्रैक्ट करने के लिए अधिकतम प्रोडक्ट - `maxConcurrency` (number, वैकल्पिक) — पैरेलल रिक्वेस्ट लिमिट - `proxyConfiguration` (object, वैकल्पिक) — प्रॉक्सी सेटिंग्स — रेजिडेंशियल की सलाह दी जाती है **सामान्य प्रश्न:** **Q: कौन-कौन से यूरोपीय Sephora मार्केट सपोर्टेड हैं?** फ्रांस (fr-FR), इटली (it-IT), जर्मनी (de-DE), स्पेन (es-ES), पोलैंड (pl-PL), चेक गणराज्य (cs-CZ), ग्रीस (el-GR), रोमानिया (ro-RO), और पुर्तगाल (pt-PT)। **Q: स्क्रैपर Akamai WAF कैसे बाईपास करता है?** यह असली ब्राउज़र कनेक्शन की नकल करने के लिए ब्राउज़र-ग्रेड TLS फ़िंगरप्रिंटिंग इस्तेमाल करता है, जिससे रिक्वेस्ट को असली यूज़र ट्रैफ़िक से अलग पहचानना मुश्किल हो जाता है। **Q: क्या मैं पूरी कैटेगरी स्क्रैप कर सकता हूं?** हां, आप किसी कैटेगरी के अंदर सभी प्रोडक्ट एक्सट्रैक्ट करने के लिए category IDs दे सकते हैं। यह bulk एक्सट्रैक्शन करने का सबसे कारगर तरीका है। ## आउटपुट का उदाहरण ```json { "source": "https://www.sephora.fr/p/...", "brand": "Rare Beauty", "title": "Soft Pinch Liquid Blush", "description": "Un blush liquide longue tenue...", "shortDescription": "Blush liquide", "categories": ["Maquillage", "Teint", "Blush"], "options": [ { "name": "Shade", "values": ["Joy", "Hope", "Grace"] } ], "variants": [ { "sku": "EU-RB-001", "name": "Joy", "price": 2800, "currency": "EUR", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ], "stats": { "rating": 4.7, "reviewCount": 3421 } } ``` --- # Shopify Scraper — किसी भी स्टोर का प्रोडक्ट डेटा - **URL:** https://proooxy.com/hi/tools/shopify-scraper/ - **टाइप:** tools - **विवरण:** किसी भी Shopify-पावर्ड स्टोर से collections, search, और प्रोडक्ट recommendations सहित हाई-फ़िडेलिटी प्रोडक्ट डेटा एक्सट्रैक्ट करने के लिए प्रोफ़ेशनल-ग्रेड टूल। - **सारांश:** किसी भी Shopify स्टोर से प्रोडक्ट डेटा एक्सट्रैक्ट करें। - **कैटेगरी:** ecommerce - **टेक स्टैक:** TypeScript, got-scraping - **मार्केट्स / रीजन:** वैश्विक - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/shopify-scraper-ppe - **कीवर्ड्स:** shopify scraper india, shopify डेटा कैसे निकाले, scrape shopify store hindi, shopify product data api, shopify api alternative, ecommerce data extraction tool, export shopify products csv, shopify collection scraper - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - यूनिवर्सल — किसी भी Shopify-पावर्ड स्टोर के साथ काम करता है - स्टोर-वाइड कैटलॉग एक्सट्रैक्शन और सर्च सपोर्ट - प्रोडक्ट recommendations (प्रति प्रोडक्ट 20 तक) - Collection और individual प्रोडक्ट स्क्रैपिंग - Tag और कैटेगरी एक्सट्रैक्शन - सटीकता के लिए करेंसी नॉर्मलाइज़ेशन (prices x100) **यूज़ केस:** - किसी भी niche में Shopify स्टोर्स में मार्केट रिसर्च - DTC ब्रांड्स के लिए प्रतिस्पर्धी विश्लेषण - कंपैरिज़न प्लेटफ़ॉर्म के लिए प्रोडक्ट कैटलॉग एग्रीगेशन - इंडिपेंडेंट ई-कॉमर्स स्टोर्स में ट्रेंड मॉनिटरिंग - प्रोडक्ट recommendation dataset बनाना - रीसेलर के लिए प्राइस मॉनिटरिंग **इनपुट पैरामीटर:** - `startUrls` (array, आवश्यक) — Shopify स्टोर URL — product, collection, या स्टोर होम - `proxy` (object, वैकल्पिक) — बेहतरीन रिज़ल्ट के लिए रेजिडेंशियल प्रॉक्सी की सलाह दी जाती है - `maxRequestsPerCrawl` (number, वैकल्पिक) — रिक्वेस्ट लिमिट (डिफ़ॉल्ट: 100) - `maxRecommendationsPerProduct` (number, वैकल्पिक) — फ़ेच करने के लिए recommended प्रोडक्ट (डिफ़ॉल्ट: 0, मैक्स: 20) - `query` (string, वैकल्पिक) — किसी स्टोर के अंदर प्रोडक्ट ढूंढने के लिए सर्च क्वेरी **सामान्य प्रश्न:** **Q: क्या यह किसी भी Shopify स्टोर के साथ काम करता है?** हां, स्क्रैपर Shopify से पावर्ड किसी भी स्टोर के साथ काम करता है। यह Shopify के स्टैंडर्ड प्रोडक्ट डेटा स्ट्रक्चर का इस्तेमाल करता है, जो सभी स्टोर्स में एक जैसा रहता है। **Q: क्या मैं खास प्रोडक्ट सर्च कर सकता हूं?** हां, किसी खास स्टोर के अंदर सर्च करने के लिए query पैरामीटर इस्तेमाल करें। यह पूरा कैटलॉग स्क्रैप किए बिना खास प्रोडक्ट टाइप ढूंढने के लिए उपयोगी है। **Q: प्रोडक्ट recommendations कैसे एक्सट्रैक्ट होते हैं?** related प्रोडक्ट फ़ेच करने के लिए maxRecommendationsPerProduct सेट करें। प्रति प्रोडक्ट 20 तक recommendations उपलब्ध हैं, जो प्रोडक्ट ग्राफ़ बनाने के लिए उपयोगी है। ## आउटपुट का उदाहरण ```json { "source": "https://store.example.com/products/...", "brand": "Example Brand", "title": "Premium Organic Cotton T-Shirt", "description": "Made from 100% organic cotton...", "categories": ["Tops", "T-Shirts"], "tags": ["organic", "sustainable", "cotton"], "options": [ { "name": "Size", "values": ["S", "M", "L", "XL"] }, { "name": "Color", "values": ["White", "Black", "Navy"] } ], "variants": [ { "sku": "SHOP-OCT-WHT-M", "name": "White / M", "price": 4500, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Ulta Beauty Scraper — प्रोडक्ट, प्राइस और SKU - **URL:** https://proooxy.com/hi/tools/ulta-scraper/ - **टाइप:** tools - **विवरण:** कैटेगरी पेज, ब्रांड पेज, और sale सेक्शन सहित Ulta Beauty से प्रोडक्ट डिटेल, प्राइसिंग, इमेज, और SKU जानकारी एक्सट्रैक्ट करें। - **सारांश:** Ulta Beauty से पूरा प्रोडक्ट डेटा स्क्रैप करें। - **कैटेगरी:** ecommerce - **टेक स्टैक:** TypeScript, Cheerio, Crawlee - **मार्केट्स / रीजन:** अमेरिका - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/ulta-scraper - **कीवर्ड्स:** ulta scraper india, ulta beauty product data कैसे निकाले, ulta price tracker tool, ulta sku scraper, ulta sale monitoring hindi, beauty retail data api - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - कैटेगरी, प्रोडक्ट डिटेल, ब्रांड, और sale पेज सपोर्ट करता है - प्राइस, विवरण, और इमेज सहित पूरी प्रोडक्ट डिटेल - वेरिएंट ग्रुपिंग के साथ SKU-लेवल डेटा एक्सट्रैक्शन - URL से पेज टाइप की ऑटोमैटिक डिटेक्शन - स्पीड के लिए लाइटवेट Cheerio-बेस्ड पार्सिंग - एक ही प्रोडक्ट के अंदर related SKUs को ग्रुप करता है **यूज़ केस:** - ब्यूटी इंडस्ट्री प्रतिस्पर्धी विश्लेषण — Ulta बनाम Sephora प्राइसिंग - कंपैरिज़न शॉपिंग प्लेटफ़ॉर्म के लिए प्रोडक्ट कैटलॉग बनाना - Sale और प्रमोशन मॉनिटरिंग - ब्रांड डिस्कवरी और मार्केट presence ट्रैकिंग - SKU-लेवल इन्वेंट्री मॉनिटरिंग **इनपुट पैरामीटर:** - `startUrls` (array, आवश्यक) — Ulta प्रोडक्ट, कैटेगरी, ब्रांड, या sale URL - `proxy` (object, वैकल्पिक) — प्रॉक्सी कॉन्फ़िगरेशन - `maxConcurrency` (number, वैकल्पिक) — अधिकतम पैरेलल रिक्वेस्ट - `maxRequestsPerCrawl` (number, वैकल्पिक) — प्रति रन कुल रिक्वेस्ट सीमित करें **सामान्य प्रश्न:** **Q: किस तरह के Ulta पेज स्क्रैप किए जा सकते हैं?** स्क्रैपर प्रोडक्ट डिटेल पेज, कैटेगरी लिस्टिंग पेज, ब्रांड पेज, और sale/प्रमोशन पेज सपोर्ट करता है। यह URL से पेज टाइप को ऑटोमैटिकली डिटेक्ट करता है। **Q: प्रोडक्ट वेरिएंट कैसे हैंडल होते हैं?** वेरिएंट (अलग-अलग shades, sizes) एक ही parent प्रोडक्ट के अंदर ग्रुप होते हैं। हर वेरिएंट का अपना SKU, प्राइस, और उपलब्धता स्टेटस होता है। ## आउटपुट का उदाहरण ```json { "source": "https://www.ulta.com/p/...", "brand": "NYX Professional Makeup", "title": "Butter Gloss", "description": "A buttery soft and silky lip gloss...", "categories": ["Makeup", "Lips", "Lip Gloss"], "variants": [ { "sku": "ULTA-NYX-BG-001", "name": "Angel Food Cake", "price": 900, "currency": "USD", "inStock": true } ], "stats": { "rating": 4.5, "reviewCount": 8932 } } ``` --- # Universal Web Printer — URL और HTML को PDF, इमेज में बदलें - **URL:** https://proooxy.com/hi/tools/web-printer/ - **टाइप:** tools - **विवरण:** स्मार्ट scroll-stitch, एलिमेंट एक्सट्रैक्शन, PDF एन्क्रिप्शन, और वॉटरमार्किंग के साथ किसी भी URL या HTML को PDF, PNG, JPEG, या WebP में बदलें। - **सारांश:** URL और HTML को PDF, PNG, JPEG, या WebP में बदलें। - **कैटेगरी:** utility - **टेक स्टैक:** TypeScript, Playwright, PDF-lib, Sharp - **मार्केट्स / रीजन:** वैश्विक - **रिपोर्टेड सफलता दर:** >99% - **Apify लिस्टिंग:** https://apify.com/autofacts/universal-web-printer - **कीवर्ड्स:** html to pdf api hindi, url to pdf converter free, website screenshot api india, वेब पेज को PDF कैसे बनाएं, url to image converter, webpage to png tool, pdf generation api - **प्रकाशित:** 2026-04-04 - **संशोधित:** 2026-04-04 **मुख्य विशेषताएं:** - मल्टी-फ़ॉर्मेट आउटपुट — PDF, PNG, JPEG, WebP - कई व्यू मोड — viewport, full-page, CSS selector, readability - सटीक full-page कैप्चर के लिए स्मार्ट scroll-stitch - CSS selectors के ज़रिए एलिमेंट-लेवल एक्सट्रैक्शन - पेज मैनिपुलेशन — एलिमेंट हटाएं, बटन क्लिक करें, CSS inject करें, fixed headers छुपाएं - PDF एन्क्रिप्शन (RC4 128-bit) और वॉटरमार्किंग - मल्टी-पेज डॉक्यूमेंट के लिए PDF मर्जिंग - कस्टम viewport और scale factor कॉन्फ़िगरेशन **यूज़ केस:** - वेब डैशबोर्ड से ऑटोमेटेड रिपोर्ट जनरेशन - वेबसाइट आर्काइवल और डॉक्यूमेंटेशन - विज़ुअल रिग्रेशन टेस्टिंग स्नैपशॉट - कैटलॉग के लिए ई-कॉमर्स प्रोडक्ट पेज स्क्रीनशॉट - लीगल कंप्लायंस — वेब कंटेंट को एविडेंस के रूप में कैप्चर करना - वेब एप्लीकेशन से PDF जनरेट करना **इनपुट पैरामीटर:** - `startUrls` (array, वैकल्पिक) — रेंडर करने के लिए URL - `htmlContent` (string, वैकल्पिक) — रेंडर करने के लिए Raw HTML - `outputFormat` (string, वैकल्पिक) — pdf, png, jpeg, या webp (डिफ़ॉल्ट: pdf) - `viewMode` (string, वैकल्पिक) — viewport, fullPage, selector, या readability - `targetSelector` (string, वैकल्पिक) — एलिमेंट-लेवल कैप्चर के लिए CSS selector - `viewportWidth` (number, वैकल्पिक) — ब्राउज़र viewport चौड़ाई (डिफ़ॉल्ट: 1280) - `viewportHeight` (number, वैकल्पिक) — ब्राउज़र viewport ऊंचाई (डिफ़ॉल्ट: 720) - `removeSelectors` (array, वैकल्पिक) — कैप्चर से पहले हटाने के लिए एलिमेंट के CSS selectors - `pdfPassword` (string, वैकल्पिक) — RC4 128-bit एन्क्रिप्शन के साथ PDF एन्क्रिप्ट करें **सामान्य प्रश्न:** **Q: क्या मैं पेज पर सिर्फ़ किसी खास एलिमेंट को कैप्चर कर सकता हूं?** हां, सिर्फ़ किसी खास एलिमेंट को कैप्चर करने के लिए targetSelector पैरामीटर को एक CSS selector के साथ इस्तेमाल करें। उदाहरण के लिए, सिर्फ़ मुख्य कंटेंट एरिया कैप्चर करने के लिए '#main-content' इस्तेमाल करें। **Q: स्मार्ट scroll-stitch कैसे काम करता है?** full-page कैप्चर के लिए, टूल पेज को increments में स्क्रॉल करता है, हर viewport स्लाइस कैप्चर करता है, फिर उन्हें आपस में stitch करता है। इससे यह पक्का होता है कि lazy-loaded कंटेंट और एनिमेशन सही से कैप्चर हों। **Q: क्या मैं कैप्चर से पहले cookie banners या ads हटा सकता हूं?** हां, हटाने के लिए एलिमेंट के CSS selectors बताने के लिए removeSelectors इस्तेमाल करें। sticky headers और floating एलिमेंट छुपाने के लिए आप hideFixedElements भी इस्तेमाल कर सकते हैं। ## आउटपुट का उदाहरण टूल आपके चुने हुए फ़ॉर्मेट (PDF, PNG, JPEG, या WebP) में फ़ाइलें जनरेट करता है और उन्हें Apify dataset में स्टोर करता है। हर आउटपुट में मेटाडेटा शामिल होता है: ```json { "url": "https://example.com", "format": "pdf", "fileName": "example-com.pdf", "fileSize": 245832, "viewMode": "fullPage", "viewport": { "width": 1280, "height": 720 }, "encrypted": false } ``` --- # 2026 में वेब स्क्रैपिंग की बेस्ट प्रैक्टिसेज़: एक प्रैक्टिशनर की गाइड - **URL:** https://proooxy.com/hi/blog/web-scraping-best-practices-2026/ - **टाइप:** blog - **विवरण:** 12+ साल के प्रोडक्शन अनुभव से निकली बैटल-टेस्टेड वेब स्क्रैपिंग स्ट्रैटेजीज़ — आर्किटेक्चर पैटर्न, एरर हैंडलिंग, प्रॉक्सी मैनेजमेंट, और आउटपुट नॉर्मलाइज़ेशन। - **कीवर्ड्स:** web scraping best practices 2026, production scraper कैसे बनाएं, data extraction guide hindi, scraper architecture design, वेब स्क्रैपिंग टिप्स हिंदी में, proxy management for scraping, error handling in web scraper, scraping output normalization - **प्रकाशित:** 2026-04-01 - **संशोधित:** 2026-04-01 3,100+ यूज़र्स को >99% सफलता दर के साथ सर्व करने वाले 15 प्रोडक्शन स्क्रैपर बनाने और मेंटेन करने के बाद, यहां वे प्रैक्टिसेज़ हैं जो असल में मायने रखती हैं। ## आर्किटेक्चर: पाइपलाइन में सोचें, स्क्रिप्ट में नहीं सबसे बड़ी गलती जो मैं देखता हूं वह है स्क्रैपिंग को एक सिंगल-स्टेप प्रोसेस मान लेना। प्रोडक्शन स्क्रैपर असल में डेटा पाइपलाइन होते हैं: 1. **URL डिस्कवरी** — क्या स्क्रैप करना है यह पता लगाना (sitemaps, कैटेगरी पेज, सर्च, API) 2. **रिक्वेस्ट एक्ज़िक्यूशन** — सही रीट्राई और रोटेशन के साथ डेटा फ़ेच करना 3. **पार्सिंग** — रॉ रिस्पॉन्स से संरचित फ़ील्ड एक्सट्रैक्ट करना 4. **नॉर्मलाइज़ेशन** — आउटपुट को साफ़, वैलिडेट, और स्टैंडर्डाइज़ करना 5. **स्टोरेज** — dataset, डेटाबेस, या डाउनस्ट्रीम सिस्टम में पुश करना हर स्टेप स्वतंत्र रूप से टेस्ट करने और रीट्राई करने लायक होना चाहिए। जब Sephora अपने प्रोडक्ट पेज का लेआउट बदलता है, तो सिर्फ़ स्टेप 3 अपडेट करने की ज़रूरत होती है — बाकी पाइपलाइन स्थिर रहती है। ## हमेशा HTML पार्सिंग से ज़्यादा API को प्राथमिकता दें एक भी CSS selector लिखने से पहले, चेक करें कि साइट के पास क्या है: - **पब्लिक API** — डॉक्युमेंटेड एंडपॉइंट जो JSON रिटर्न करते हैं - **प्राइवेट API** — ब्राउज़र DevTools में दिखने वाले XHR/fetch कॉल - **GraphQL एंडपॉइंट** — दिन-ब-दिन आम होते जा रहे हैं, अक्सर introspection ऑन के साथ - **एम्बेडेड JSON** — HTML में `__NEXT_DATA__`, `window.__INITIAL_STATE__`, या JSON-LD API रिस्पॉन्स संरचित, वर्ज़न्ड होते हैं, और HTML लेआउट से कहीं ज़्यादा स्थिर होते हैं। मेरा [Sephora scraper](/hi/tools/sephora-scraper/) हर वेब URL को एक API कॉल में बदल देता है — यह किसी फ़्रंटएंड रीडिज़ाइन से आज तक एक बार भी नहीं टूटा। ## प्रॉक्सी स्ट्रैटेजी: प्रोटेक्शन के हिसाब से मैच करें हर साइट को रेजिडेंशियल प्रॉक्सी की ज़रूरत नहीं होती। यह रहा मेरा डिसीज़न फ़्रेमवर्क: | प्रोटेक्शन लेवल | प्रॉक्सी टाइप | उदाहरण साइट्स | |-----------------|------------|---------------| | कोई नहीं / Basic | डेटासेंटर | ज़्यादातर Shopify स्टोर, छोटी साइट्स | | रेट लिमिटिंग | रोटेटिंग डेटासेंटर | मीडियम ई-कॉमर्स, कंटेंट साइट्स | | फ़िंगरप्रिंटिंग | रेजिडेंशियल | Sephora, Farfetch, बड़े ब्रांड | | एडवांस्ड WAF | रेजिडेंशियल + TLS फ़िंगरप्रिंट | Akamai, Cloudflare Enterprise | मुख्य बात यह है: **प्रॉक्सी की लागत प्रोटेक्शन लेवल के साथ बढ़ती है।** ऐसी साइट्स के लिए रेजिडेंशियल प्रॉक्सी पर पैसा बर्बाद न करें जो सिर्फ़ IP रेप्युटेशन चेक करती हैं। मेरा [Shopify scraper](/hi/tools/shopify-scraper/) डेटासेंटर प्रॉक्सी के साथ बढ़िया काम करता है क्योंकि Shopify का डिफ़ॉल्ट प्रोटेक्शन बहुत हल्का है। ## सेशन मैनेजमेंट ही सब कुछ है 60% और 99% सफलता दर के बीच का फ़र्क़ आमतौर पर सेशन मैनेजमेंट ही होता है: - **सिर्फ़ IP नहीं, सेशन भी रोटेट करें** — same cookies के साथ नया IP संदिग्ध लगता है - **सेशन वॉर्म अप करें** — प्रोडक्ट पेज खोलने से पहले होमपेज विज़िट करें - **रेट लिमिट का सम्मान करें** — 5 समवर्ती रिक्वेस्ट, 50 ब्लॉक हो जाने वाले रिक्वेस्ट से बेहतर हैं - **एक्सपोनेंशियल बैकऑफ़** — 1s, 2s, 4s, 8s रीट्राई, तुरंत रीट्राई नहीं मेरा [Sephora EU scraper](/hi/tools/sephora-eu-scraper/) ऑटोमैटिक रिफ़्रेश और एक्सपोनेंशियल बैकऑफ़ के साथ गेस्ट टोकन मैनेज करता है। यह ऐसे परसिस्टेंट सेशन बनाए रखता है जो असली ब्राउज़िंग पैटर्न जैसे दिखते हैं। ## अपने आउटपुट को नॉर्मलाइज़ करें रॉ स्क्रैप्ड डेटा गड़बड़ होता है। सब कुछ नॉर्मलाइज़ करें: ### प्राइस इंटीजर के रूप में स्टोर करें (cents, dollars नहीं)। `$29.99`, `2999` बन जाता है। इससे floating-point प्रिसिज़न एरर से बचा जाता है जो डाउनस्ट्रीम फाइनेंशियल डेटा को खराब कर सकते हैं। मेरा हर ई-कॉमर्स स्क्रैपर यही कन्वेंशन इस्तेमाल करता है। ### URL हमेशा एब्सोल्यूट URL स्टोर करें, कभी रिलेटिव पाथ नहीं। इन्हें एक्सट्रैक्शन के समय ही रिज़ॉल्व करें। ### तारीखें ISO 8601 (`2026-04-01T00:00:00Z`), हमेशा timezone के साथ। कभी locale-formatted तारीखें स्टोर न करें। ### टेक्स्ट एक्स्ट्रा whitespace हटाएं, Unicode नॉर्मलाइज़ करें, और एक HTML हैंडलिंग पॉलिसी तय करें (tags हटाना बनाम फ़ॉर्मेटिंग बनाए रखना)। ## एरर हैंडलिंग: फेलियर की उम्मीद रखें प्रोडक्शन स्क्रैपर लगातार फेल होते हैं — सवाल यह है कि कितनी ग्रेसफुली। मेरा तरीका: ``` Request fails (network error, timeout, 4xx/5xx) → Retry with exponential backoff (up to 5 attempts) → Rotate session/proxy on retry → Log failure with full context if all retries exhausted → Continue processing remaining URLs (don't crash the batch) ``` हर URL पैटर्न के लिए सफलता दर ट्रैक करें। अगर `/category/*` पेज अचानक 90% सफलता से नीचे गिर जाएं, तो साइट में शायद कुछ बदला है — आप इसे यूज़र्स के रिपोर्ट करने से पहले ही पकड़ लेंगे। ## मॉनिटर करें और अलर्ट करें बिना मॉनिटरिंग वाला स्क्रैपर एक ऐसा स्क्रैपर है जो चुपचाप फेल होने का इंतज़ार कर रहा है। इन्हें ट्रैक करें: - **सफलता दर** हर रन और हर URL पैटर्न के लिए - **आउटपुट काउंट** — अचानक गिरावट का मतलब है कुछ टूटा है - **डेटा क्वालिटी** — null फ़ील्ड, अनएक्सपेक्टेड वैल्यू, schema violations - **कॉस्ट** — प्रॉक्सी इस्तेमाल, कंप्यूट टाइम, स्टोरेज मेरे सभी Apify एक्टर ये मेट्रिक्स एक्सपोज़ करते हैं। जब सफलता दर गिरती है, मुझे घंटों के भीतर सूचना मिल जाती है — अक्सर किसी यूज़र के नोटिस करने से भी पहले। ## सिंपल शुरू करें, कॉम्प्लेक्सिटी बाद में जोड़ें मैं जो भी स्क्रैपर बनाता हूं, वह सबसे सिंपल चीज़ से शुरू होता है जो काम करे: 1. पहले **HTTP + Cheerio** (सबसे तेज़, सबसे सस्ता) 2. ब्लॉक होने पर ही **फ़िंगरप्रिंटिंग जोड़ें** 3. JavaScript ज़रूरी होने पर ही **ब्राउज़र रेंडरिंग जोड़ें** 4. रेट-लिमिटेड होने पर ही **प्रॉक्सी रोटेशन जोड़ें** मेरा [Ulta scraper](/hi/tools/ulta-scraper/) प्योर Cheerio है — किसी ब्राउज़र की ज़रूरत नहीं। मेरा [Universal Web Printer](/hi/tools/web-printer/) Playwright इस्तेमाल करता है क्योंकि इसे JavaScript रेंडर करना ही होता है। हर काम के लिए सही टूल। --- ये कोई थ्योरेटिकल सिद्धांत नहीं हैं — ये लाखों रिक्वेस्ट प्रोसेस करने वाले प्रोडक्शन स्क्रैपर चलाने के अनुभव से निकले हैं। अगर आपको इन्हीं प्रैक्टिसेज़ के साथ बना एक कस्टम स्क्रैपर चाहिए, तो [बात करते हैं](/hi/contact/)। --- # एंटी-बॉट प्रोटेक्शन को समझना: 2026 में क्या काम करता है - **URL:** https://proooxy.com/hi/blog/bypassing-anti-bot-protection-guide/ - **टाइप:** blog - **विवरण:** आधुनिक एंटी-बॉट सिस्टम — Cloudflare, Akamai, Datadome — और प्रोडक्शन स्क्रैपिंग में इस्तेमाल होने वाली वैध बाईपास तकनीकों पर एक तकनीकी डीप-डाइव। - **कीवर्ड्स:** cloudflare bypass कैसे करें, akamai waf bypass tutorial, datadome bypass techniques hindi, bot detection कैसे काम करता है, एंटी-बॉट प्रोटेक्शन बाईपास गाइड, web scraping protection 2026, tls fingerprinting bypass hindi, residential proxy for scraping hindi - **प्रकाशित:** 2026-03-15 - **संशोधित:** 2026-03-15 एंटी-बॉट प्रोटेक्शन एक आर्म्स रेस है। रोज़ ऐसे प्रोडक्शन स्क्रैपर बनाने वाले व्यक्ति के तौर पर जो इन सिस्टम को बाईपास करते हैं, यहां एक प्रैक्टिशनर का नज़रिया है — ये प्रोटेक्शन असल में क्या चेक करते हैं और वैध बाईपास तकनीकें कैसी दिखती हैं। ## डिटेक्शन लेयर्स आधुनिक एंटी-बॉट सिस्टम लेयर्स में काम करते हैं। भरोसेमंद बाईपास की कुंजी इन लेयर्स को समझना है: ### लेयर 1: IP रेप्युटेशन सबसे सिंपल चेक। एंटी-बॉट सर्विसेज़ जाने-पहचाने डेटासेंटर IP रेंज, VPN एग्ज़िट, और पहले फ़्लैग किए गए IP की डेटाबेस मेंटेन करती हैं। **वे क्या चेक करते हैं:** - क्या यह IP AWS, GCP, Azure, या किसी जाने-पहचाने होस्टिंग प्रोवाइडर से है? - क्या यह IP पहले कभी बॉट एक्टिविटी के लिए फ़्लैग हुआ है? - हाल ही में इस IP से कितने रिक्वेस्ट आए हैं? **काउंटर-अप्रोच:** Apify Proxy या Bright Data जैसी सर्विसेज़ के रेजिडेंशियल प्रॉक्सी ऐसे IP एड्रेस देते हैं जो असली ISP के होते हैं, जिससे IP लेवल पर इन्हें सामान्य यूज़र्स से अलग पहचानना मुश्किल हो जाता है। ### लेयर 2: TLS फ़िंगरप्रिंटिंग यहीं से यह दिलचस्प हो जाता है। हर HTTP क्लाइंट का एक यूनीक TLS हैंडशेक सिग्नेचर होता है, जो इन पर आधारित होता है: - सपोर्टेड cipher suites और उनका ऑर्डर - TLS एक्सटेंशन और उनका ऑर्डर - सपोर्टेड TLS वर्ज़न - ALPN प्रोटोकॉल एक स्टैंडर्ड `axios` या `requests` लाइब्रेरी का TLS फ़िंगरप्रिंट खुलकर "bot" होने का संकेत देता है, क्योंकि यह किसी असली ब्राउज़र से मेल नहीं खाता। Akamai और Cloudflare जैसी सर्विसेज़ हर ब्राउज़र वर्ज़न के लिए फ़िंगरप्रिंट डेटाबेस मेंटेन करती हैं। **काउंटर-अप्रोच:** `got-scraping` (जिसे मेरा [Shopify scraper](/hi/tools/shopify-scraper/) इस्तेमाल करता है) जैसी लाइब्रेरी और स्पेशलाइज़्ड TLS क्लाइंट ब्राउज़र-ग्रेड TLS फ़िंगरप्रिंट की नकल कर सकते हैं। मेरा [Sephora EU scraper](/hi/tools/sephora-eu-scraper/) Akamai WAF को बाईपास करने के लिए ब्राउज़र-ग्रेड TLS फ़िंगरप्रिंटिंग इस्तेमाल करता है। ### लेयर 3: HTTP/2 फ़िंगरप्रिंटिंग TLS से आगे, HTTP/2 सेटिंग्स क्लाइंट टाइप उजागर कर देती हैं: - SETTINGS फ़्रेम पैरामीटर (header table size, max concurrent streams) - WINDOW_UPDATE फ़्रेम वैल्यू - Priority ट्री स्ट्रक्चर - Header compression (HPACK) पैटर्न हर ब्राउज़र की अपनी खास HTTP/2 सेटिंग्स होती हैं। इस लेवल पर Chrome, Firefox, और Safari — सब अलग दिखते हैं। ### लेयर 4: JavaScript चैलेंज Cloudflare का "checking your browser" पेज और इसी तरह के चैलेंज ऐसा JavaScript चलाते हैं जो: - ब्राउज़र API चेक करता है (canvas, WebGL, AudioContext) - एक्ज़िक्यूशन टाइमिंग मापता है - DOM प्रॉपर्टीज़ वैलिडेट करता है - चैलेंज रिस्पॉन्स सर्वर को वापस भेजता है **काउंटर-अप्रोच:** हेडलेस ब्राउज़र (Playwright, Puppeteer) इन चैलेंज को नेटिवली एक्ज़िक्यूट कर देते हैं। असली बात यह सुनिश्चित करना है कि आपका हेडलेस ब्राउज़र ऑटोमेशन सिग्नल लीक न करे (इस पर आगे और बात होगी)। ### लेयर 5: बिहेवियरल एनालिसिस सबसे एडवांस लेयर। ये सिस्टम इनका विश्लेषण करते हैं: - माउस मूवमेंट पैटर्न (बहुत ज़्यादा लीनियर = bot) - स्क्रॉल बिहेवियर (सीधे नीचे तक इंस्टेंट स्क्रॉल = bot) - एक्शन के बीच का समय (बहुत ज़्यादा कंसिस्टेंट = bot) - नेविगेशन पैटर्न (बिना ब्राउज़ किए सीधे प्रोडक्ट पेज पर जाना = संदिग्ध) - रिक्वेस्ट कैडेंस (पूरी तरह यूनिफ़ॉर्म इंटरवल = bot) ## प्रोटेक्शन प्रोफ़ाइल: जानें आप किससे भिड़ रहे हैं ### Cloudflare **कहां मिलता है:** छोटी से मीडियम साइट्स, ब्लॉग, API Cloudflare कई प्रोटेक्शन लेवल ऑफ़र करता है: - **Basic** — IP रेप्युटेशन + रेट लिमिटिंग। रेट का ध्यान रखने वाले डेटासेंटर प्रॉक्सी आमतौर पर काम कर जाते हैं। - **Managed Challenge** — JavaScript चैलेंज + turnstile। ब्राउज़र या चैलेंज सॉल्वर चाहिए। - **Enterprise/Bot Management** — पूरा बिहेवियरल एनालिसिस + फ़िंगरप्रिंटिंग। रेजिडेंशियल प्रॉक्सी + सही फ़िंगरप्रिंटिंग चाहिए। ### Akamai Bot Manager **कहां मिलता है:** एंटरप्राइज़ ई-कॉमर्स (Sephora EU, बड़े रिटेलर) Akamai को बाईपास करना सबसे मुश्किल में से एक है, क्योंकि इसमें है: - आक्रामक TLS फ़िंगरप्रिंटिंग - क्लाइंट-साइड JavaScript के ज़रिए सेंसर डेटा कलेक्शन - सेशन-लेवल बिहेवियरल एनालिसिस - Cookie इंटीग्रिटी वेरिफ़िकेशन Akamai के लिए मेरा तरीका: ब्राउज़र-ग्रेड TLS फ़िंगरप्रिंटिंग + गेस्ट टोकन मैनेजमेंट + ऐसी रिक्वेस्ट पेसिंग जो इंसानी ब्राउज़िंग जैसी लगे। ### Datadome **कहां मिलता है:** ई-कॉमर्स, टिकटिंग Datadome इन पर फ़ोकस करता है: - JavaScript के ज़रिए डिवाइस फ़िंगरप्रिंटिंग - संदिग्ध ट्रैफ़िक के लिए CAPTCHA चैलेंज - रियल-टाइम बिहेवियरल स्कोरिंग ### PerimeterX (अब HUMAN) **कहां मिलता है:** रिटेल, फाइनेंशियल सर्विसेज़ आक्रामक JavaScript चैलेंज और बिहेवियरल एनालिसिस के लिए जाना जाता है। ## वैध बाईपास आर्किटेक्चर भरोसेमंद, लगातार चलने वाली डेटा एक्सट्रैक्शन चाहने वाले प्रोडक्शन सिस्टम के लिए, यह वह आर्किटेक्चर पैटर्न है जो मैं इस्तेमाल करता हूं: ### 1. API-फ़र्स्ट अप्रोच किसी भी प्रोटेक्शन को बाईपास करने की कोशिश करने से पहले, चेक करें कि क्या कोई ऐसा API पाथ है जो WAF को पूरी तरह अवॉइड करता हो। कई प्रोटेक्शन सिर्फ़ ब्राउज़र-फ़ेसिंग एंडपॉइंट पर लागू होते हैं, API रूट पर नहीं। मेरा [Sephora scraper](/hi/tools/sephora-scraper/) हर वेब URL को एक API कॉल में बदल देता है। API एंडपॉइंट पर वेबसाइट से हल्का प्रोटेक्शन होता है क्योंकि ये मोबाइल ऐप्स के लिए डिज़ाइन किए गए हैं। ### 2. सेशन वॉर्मिंग सीधे डेटा पेज पर मत जाइए। एक असली जैसा ब्राउज़िंग सेशन बनाएं: ``` Visit homepage → Browse categories → View product listing → Access product detail ``` हर स्टेप सेशन की विश्वसनीयता बढ़ाता है। एंटी-बॉट सिस्टम को एक ऐसा पैटर्न दिखता है जो असली यूज़र बिहेवियर से मेल खाता है। ### 3. फ़िंगरप्रिंट कंसिस्टेंसी यह बहुत ज़रूरी है: आपका फ़िंगरप्रिंट **अंदरूनी तौर पर कंसिस्टेंट** होना चाहिए। अगर आपका TLS "Chrome 120" कहता है लेकिन User-Agent "Chrome 118" कहता है, तो यह एक डिटेक्शन सिग्नल है। इन्हें अलाइन करें: - TLS फ़िंगरप्रिंट - HTTP/2 सेटिंग्स - User-Agent header - Accept-Language और अन्य headers - JavaScript ब्राउज़र प्रॉपर्टीज़ (अगर headless इस्तेमाल कर रहे हैं) ### 4. रिक्वेस्ट पेसिंग असली इंसान ठीक 1-सेकंड के इंटरवल पर रिक्वेस्ट नहीं भेजते। असली जैसा वैरिएंस लाएं: - रिक्वेस्ट के बीच बेस डिले (2-5 सेकंड) - रैंडम jitter (+/- 30%) - नेविगेशन इवेंट्स के बाद लंबे पॉज़ - कभी-कभी "idle" पीरियड ### 5. ग्रेसफुल डिग्रेडेशन जब आपको कोई चैलेंज या ब्लॉक मिले: 1. तुरंत रीट्राई न करें — इससे bot होने की पुष्टि हो जाती है 2. एक्सपोनेंशियली बैक ऑफ़ करें 3. एक फ्रेश सेशन पर रोटेट करें (नया IP + नई cookies) 4. अलग प्रॉक्सी रीजन आज़माएं 5. अगर समस्या बनी रहे, तो ब्राउज़र-बेस्ड अप्रोच पर स्विच करें ## अब क्या काम नहीं करता - **सिर्फ़ User-Agent बदलना** — डिटेक्शन सिस्टम दर्जनों सिग्नल चेक करते हैं, सिर्फ़ एक header नहीं - **सिर्फ़ रैंडम डिले** — सही फ़िंगरप्रिंटिंग के बिना, टाइमिंग से कोई फ़र्क़ नहीं पड़ता - **डिफ़ॉल्ट सेटिंग्स वाला Headless Chrome** — ऑटोमेशन सिग्नल हर जगह लीक होते हैं (`navigator.webdriver`, गायब प्लगइन्स, Chrome DevTools Protocol आर्टिफ़ैक्ट्स) - **Cookie रीप्ले** — आधुनिक सिस्टम cookies को TLS फ़िंगरप्रिंट और IP रेंज से जोड़ देते हैं ## एथिकल पहलू एंटी-बॉट बाईपास एक टूल है। किसी भी टूल की तरह, इसे ज़िम्मेदारी से या गैर-ज़िम्मेदारी से इस्तेमाल किया जा सकता है। **वैध यूज़ केस:** - उपभोक्ता के फ़ायदे के लिए प्राइस कंपैरिज़न - सार्वजनिक डेटा के साथ मार्केट रिसर्च - एक्सेसिबिलिटी (डेटा को संरचित फ़ॉर्मेट में उपलब्ध कराना) - एकेडमिक रिसर्च - क्वालिटी एश्योरेंस और मॉनिटरिंग **हमेशा इनका सम्मान करें:** - robots.txt निर्देश - रेट लिमिट (भले ही आप इन्हें पार कर सकें, मत कीजिए) - पर्सनल डेटा रेगुलेशन (GDPR, CCPA) - Terms of service (अपने क्षेत्राधिकार का कानूनी परिदृश्य समझें) मेरे सभी [टूल्स](/hi/tools/) वैध डेटा एक्सट्रैक्शन के लिए डिज़ाइन किए गए हैं, जिनमें बिल्ट-इन रेट लिमिटिंग और प्रॉक्सी बेस्ट प्रैक्टिस शामिल हैं। --- एंटी-बॉट सिस्टम को समझना आपको एक बेहतर स्क्रैपिंग इंजीनियर बनाता है। अगर आपको ऐसे प्रोडक्शन-ग्रेड स्क्रैपर चाहिए जो इन चैलेंज को भरोसे के साथ हैंडल करें, तो मेरे [टूल्स](/hi/tools/) देखें या कस्टम काम के लिए [संपर्क करें](/hi/contact/)। --- # परिचय - **URL:** https://proooxy.com/hi/about/ - **टाइप:** page - **विवरण:** Richard Feng — वेब स्क्रैपिंग इंजीनियर, 12+ साल के अनुभव के साथ। मैं प्रोटेक्टेड वेबसाइटों को AI एजेंट, रिट्रीवल पाइपलाइन और LLM के लिए साफ, RAG-तैयार संरचित डेटा में बदलता हूं। - **कीवर्ड्स:** web scraping engineer hire india, फ्रीलांस डेटा एक्सट्रैक्शन एक्सपर्ट, custom scraper developer for hire, API reverse engineering consultant, RAG data pipeline consultant india, एंटी-बॉट बाईपास एक्सपर्ट हायर करें, freelance web scraping developer, डेटा एक्सट्रैक्शन सर्विस प्रोवाइडर - **प्रकाशित:** 0001-01-01 - **संशोधित:** 0001-01-01 ## मैं कौन हूं मैं Richard Feng हूं, एक फ्रीलांस वेब-ऑटोमेशन इंजीनियर, जिसे कोडिंग का 12+ साल का अनुभव है। मैं **वेब स्क्रैपिंग, डेटा एक्सट्रैक्शन, और API रिवर्स इंजीनियरिंग** में विशेषज्ञ हूं — जटिल, प्रोटेक्टेड वेबसाइटों को ऐसे साफ, संरचित डेटा में बदलता हूं जिसे AI सिस्टम असल में इस्तेमाल कर सकें। मेरी टूलकिट **Node.js (TypeScript), Python, Go, और Java** तक फैली है, साथ ही **Crawlee, Playwright, और Cheerio** में गहरी विशेषज्ञता है। मैंने ऐसे प्रोडक्शन सिस्टम बनाए हैं जो लाखों रिक्वेस्ट **>99% सफलता** के साथ हैंडल करते हैं। ## मैं क्या करता हूं मैं **16 प्रोडक्शन-ग्रेड Apify एक्टर** बनाता और मेंटेन करता हूं, जो **3,100+ यूज़र्स** को लगातार **>99% रन सफलता दर** पर सर्व करते हैं। हर एक्टर साफ, **RAG-तैयार JSON** देता है — schema-सुसंगत, डीड्यूप्लिकेटेड, और वेक्टर स्टोर, रिट्रीवल पाइपलाइन, या ट्रेनिंग सेट में सीधे इस्तेमाल के लिए तैयार। ज़्यादातर सार्वजनिक-डेटा एक्टर के लिए किसी API key की ज़रूरत नहीं होती। मेरा काम चार क्षेत्रों में फैला है: ### ई-कॉमर्स और रिटेल डेटा प्रमुख ब्यूटी और फैशन प्लेटफ़ॉर्म के लिए स्क्रैपर, जिनमें शामिल हैं [Sephora](/hi/tools/sephora-scraper/) (21 ग्लोबल स्टोरफ्रंट), [Ulta Beauty](/hi/tools/ulta-scraper/), [Farfetch](/hi/tools/farfetch-scraper/), [Lululemon](/hi/tools/lululemon-scraper/), [Boohoo](/hi/tools/boohoo-scraper/), [Macy's](/hi/tools/macys-scraper/), और एक यूनिवर्सल [Shopify scraper](/hi/tools/shopify-scraper/) जो किसी भी Shopify-पावर्ड स्टोर के साथ काम करता है। ### सार्वजनिक, वित्तीय और कानूनी डेटा आधिकारिक U.S. डेटासेट साफ, RAG-तैयार JSON के रूप में — [SEC EDGAR फाइलिंग व XBRL फाइनेंशियल्स](/hi/tools/sec-edgar-scraper/), [USAspending.gov के संघीय अवार्ड्स](/hi/tools/usaspending-scraper/), [CourtListener अदालती फैसले](/hi/tools/courtlistener-scraper/), और [ClinicalTrials.gov स्टडीज़](/hi/tools/clinical-trials-scraper/)। ### सोशल और मीडिया इंटेलिजेंस AT Protocol के ज़रिए [Bluesky](/hi/tools/bluesky-scraper/) पोस्ट, प्रोफ़ाइल, और इंटरैक्शन, साथ ही एक [YouTube subtitle & transcript scraper](/hi/tools/youtube-transcript-scraper/) जो 100+ भाषाओं में JSON, SRT, VTT, या LLM-तैयार टेक्स्ट देता है। ### डेवलपर यूटिलिटीज़ स्क्रैपिंग से आगे के टूल्स — [SEO व संरचित-डेटा ऑडिटिंग](/hi/tools/schema-markup-scraper/), [web-to-PDF/image रेंडरिंग](/hi/tools/web-printer/), और [हाई-परफॉर्मेंस लोड टेस्टिंग](/hi/tools/load-tester/)। ## विशेषज्ञताएं - **प्राइवेट API रिवर्स इंजीनियरिंग** — अनडॉक्यूमेंटेड मोबाइल/वेब एंडपॉइंट्स को भरोसेमंद डेटा सोर्स में बदलना - **एंटी-बॉट बाईपास** — Cloudflare, DataDome, Akamai WAF, और कस्टम प्रोटेक्शन - **RAG-तैयार आउटपुट** — रिट्रीवल और ग्राउंडिंग के लिए बना normalized, schema-सुसंगत JSON - **मल्टी-रीजन स्क्रैपिंग** — लोकेल, करेंसी, और कंप्लायंस का पूरा ध्यान - **हाई-रिलायबिलिटी सिस्टम** — ऐसे एक्सट्रैक्टर जो स्केल पर >99% सफलता बनाए रखते हैं ## टेक स्टैक | कैटेगरी | टेक्नोलॉजीज़ | |----------|-------------| | भाषाएं | TypeScript, Python, Go, Java | | स्क्रैपिंग | Crawlee, Playwright, Cheerio, Parsel, got-scraping | | एंटी-बॉट | Fingerprint generators, TLS fingerprinting, session rotation | | इंफ्रास्ट्रक्चर | Apify Platform, Docker, GitHub Actions | | टेस्टिंग | Vegeta, custom load-testing frameworks | ## मेरे साथ काम करें मैं कस्टम स्क्रैपिंग सॉल्यूशन, RAG डेटा-पाइपलाइन इंजीनियरिंग, और लगातार चलने वाली डेटा एक्सट्रैक्शन सर्विसेज़ ऑफ़र करता हूं। अगर आपके AI को असली वेब साफ डेटा के रूप में चाहिए — [बात करते हैं](/hi/contact/)। --- # संपर्क - **URL:** https://proooxy.com/hi/contact/ - **टाइप:** page - **विवरण:** कस्टम स्क्रैपर या RAG डेटा पाइपलाइन बनवाएं — रिवर्स-इंजीनियर की गई प्राइवेट API, एंटी-बॉट बाईपास, और आपके AI स्टैक तक पहुंचाया गया साफ, संरचित JSON। - **कीवर्ड्स:** web scraping developer hire india, कस्टम स्क्रैपर बनवाएं, web scraping service india, RAG data pipeline सर्विस, data extraction service contact, वेब स्क्रैपिंग कंसल्टेंट से संपर्क करें, freelance scraper developer contact, प्राइवेट API रिवर्स इंजीनियरिंग सर्विस - **प्रकाशित:** 0001-01-01 - **संशोधित:** 0001-01-01 ## कैटलॉग में मौजूद नहीं ऐसा डेटा पाएं मैं कस्टम वेब स्क्रैपर और RAG डेटा पाइपलाइन बनाता हूं — AI टीमों, डेटा प्लेटफ़ॉर्म, और उन सभी के लिए जिन्हें ओपन वेब साफ, संरचित JSON के रूप में चाहिए। एक बार का पुल हो या लगातार अपडेट होने वाली फ़ीड, मैं मदद कर सकता हूं। ### मैं क्या बनाता हूं - **कस्टम स्क्रैपर** — आपकी टारगेट साइट्स के लिए खासतौर पर बने, एंटी-बॉट बाईपास शुरू से शामिल - **RAG डेटा पाइपलाइन** — एक्सट्रैक्ट, नॉर्मलाइज़, चंक करके रिट्रीवल-तैयार JSON सीधे आपके वेक्टर स्टोर या वेयरहाउस तक पहुंचाना - **प्राइवेट API रिवर्स इंजीनियरिंग** — अनडॉक्यूमेंटेड मोबाइल/वेब एंडपॉइंट्स को स्थिर, संरचित सोर्स में बदलना - **स्क्रैपर मेंटेनेंस** — टारगेट साइट बदलने पर भी मौजूदा एक्सट्रैक्टर चालू रखना - **टेक्निकल कंसल्टिंग** — आपके स्क्रैपिंग और डेटा-इनजेशन स्टैक का आर्किटेक्चर रिव्यू ### यह कैसे काम करता है 1. **डेटा के बारे में बताएं** — सोर्स, आपको चाहिए वाले फ़ील्ड, और डिलीवरी फ़ॉर्मेट 2. **मुफ़्त फ़िज़िबिलिटी चेक** — मैं बिना किसी शुल्क के टारगेट की जटिलता और एंटी-बॉट स्थिति का आकलन करता हूं 3. **प्रपोज़ल और टाइमलाइन** — स्पष्ट स्कोप, फिक्स्ड प्राइसिंग, डिलीवरी डेट 4. **बिल्ड और डिलीवर** — डॉक्यूमेंटेशन और साफ आउटपुट के साथ प्रोडक्शन-ग्रेड एक्सट्रैक्टर ### बिल्ड शुरू करें
### या सीधे मुझसे संपर्क करें - **ईमेल**: [p8p9cmk96@mozmail.com](mailto:p8p9cmk96@mozmail.com) - **GitHub**: [@autofacts](https://github.com/autofacts) - **Apify**: [apify.com/autofacts](https://apify.com/autofacts) ---