परिचय
Richard Feng — वेब स्क्रैपिंग इंजीनियर। मैं प्रोटेक्टेड वेबसाइटों को AI एजेंट, रिट्रीवल पाइपलाइन और LLM के लिए साफ, RAG-तैयार संरचित डेटा में बदलता हूं।
मैं कौन हूं
मैं Richard Feng हूं, एक फ्रीलांस वेब-ऑटोमेशन इंजीनियर। मैं वेब स्क्रैपिंग, डेटा एक्सट्रैक्शन, और API रिवर्स इंजीनियरिंग में विशेषज्ञ हूं — जटिल, प्रोटेक्टेड वेबसाइटों को ऐसे साफ, संरचित डेटा में बदलता हूं जिसे AI सिस्टम असल में इस्तेमाल कर सकें।
मेरी टूलकिट Node.js (TypeScript), Python, Go, और Java तक फैली है, साथ ही Crawlee, Playwright, और Cheerio में गहरी विशेषज्ञता है।
मैं क्या करता हूं
मैं इस कैटलॉग के प्रोडक्शन-ग्रेड Apify एक्टर बनाता और मेंटेन करता हूं। हर एक्टर साफ, RAG-तैयार JSON देता है — schema-सुसंगत, डीड्यूप्लिकेटेड, और वेक्टर स्टोर, रिट्रीवल पाइपलाइन, या ट्रेनिंग सेट में सीधे इस्तेमाल के लिए तैयार। ज़्यादातर सार्वजनिक-डेटा एक्टर के लिए किसी API key की ज़रूरत नहीं होती। मेरा काम पाँच क्षेत्रों में फैला है:
ई-कॉमर्स और रिटेल डेटा
प्रमुख ब्यूटी, फैशन, और रिटेल प्लेटफ़ॉर्म के लिए स्क्रैपर, जिनमें शामिल हैं Sephora (अमेरिका, कनाडा, EU, मिडिल ईस्ट, UK, भारत, और एशिया-पैसिफ़िक में स्टोरफ्रंट), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, और Talabat Mart, साथ ही किसी भी Shopify या WooCommerce स्टोर के लिए यूनिवर्सल स्क्रैपर।
सार्वजनिक, वित्तीय और कानूनी डेटा
आधिकारिक U.S. डेटासेट साफ, RAG-तैयार JSON के रूप में — SEC EDGAR फाइलिंग व XBRL फाइनेंशियल्स, USAspending.gov के संघीय अवार्ड्स, CourtListener अदालती फैसले, और ClinicalTrials.gov स्टडीज़।
बिज़नेस, जॉब और लीड डेटा
Indeed नौकरियाँ और नियोक्ता डेटा, Shopify स्टोर लीड, किसी प्रतिस्पर्धी का Google पर चलने वाला हर विज्ञापन, और वर्चुअल मेलबॉक्स (CMRA) लोकेशन।
सोशल और मीडिया इंटेलिजेंस
AT Protocol के ज़रिए Bluesky पोस्ट, प्रोफ़ाइल, और इंटरैक्शन, साथ ही एक YouTube subtitle & transcript scraper जो 100+ भाषाओं में JSON, SRT, VTT, या LLM-तैयार टेक्स्ट देता है, और एक TikTok transcript scraper।
डेवलपर यूटिलिटीज़
स्क्रैपिंग से आगे के टूल्स — SEO व संरचित-डेटा ऑडिटिंग और web-to-PDF/image रेंडरिंग।
विशेषज्ञताएं
- प्राइवेट API रिवर्स इंजीनियरिंग — अनडॉक्यूमेंटेड मोबाइल/वेब एंडपॉइंट्स को भरोसेमंद डेटा सोर्स में बदलना
- एंटी-बॉट बाईपास — Cloudflare, Akamai WAF, और कस्टम प्रोटेक्शन
- RAG-तैयार आउटपुट — रिट्रीवल और ग्राउंडिंग के लिए बना normalized, schema-सुसंगत JSON
- मल्टी-रीजन स्क्रैपिंग — लोकेल, करेंसी, और कंप्लायंस का पूरा ध्यान
- हाई-रिलायबिलिटी सिस्टम — ऐसे एक्सट्रैक्टर जो स्केल पर बिना निगरानी के लगातार काम करते रहते हैं
टेक स्टैक
| कैटेगरी | टेक्नोलॉजीज़ |
|---|---|
| भाषाएं | TypeScript, Python, Go, Java |
| स्क्रैपिंग | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| एंटी-बॉट | Fingerprint generators, TLS fingerprinting, session rotation |
| इंफ्रास्ट्रक्चर | Apify Platform, Docker, GitHub Actions |
| टेस्टिंग | Vegeta, custom load-testing frameworks |
मेरे साथ काम करें
मैं कस्टम स्क्रैपिंग सॉल्यूशन, RAG डेटा-पाइपलाइन इंजीनियरिंग, और लगातार चलने वाली डेटा एक्सट्रैक्शन सर्विसेज़ ऑफ़र करता हूं। अगर आपके AI को असली वेब साफ डेटा के रूप में चाहिए — बात करते हैं।