プロフィール
Richard Feng — Webスクレイピングエンジニア。保護されたWebサイトを、AIエージェント・検索パイプライン・LLM向けのクリーンでRAG対応の構造化データに変えます。
私について
Richard Fengと申します。フリーランスWeb自動化エンジニアです。専門はWebスクレイピング、データ抽出、APIリバースエンジニアリング——複雑に保護されたWebサイトを、AIシステムが実際に活用できるクリーンな構造化データへと変えることです。
得意とする技術スタックはNode.js(TypeScript)、Python、Go、Javaに及び、Crawlee、Playwright、Cheerioに深い専門性を持っています。
手がけていること
このカタログに掲載しているプロダクション品質のApifyアクターを開発・保守しています。すべてのアクターがクリーンなRAG対応JSONを出力します——スキーマが一貫し、重複排除済みで、ベクトルストア、検索パイプライン、学習データセットにそのまま投入できます。公開データを扱うアクターの大半はAPIキー不要です。私の業務は次の5分野にまたがります。
EC・小売データ
Sephora(米国、カナダ、EU、中東、イギリス、インド、アジア太平洋の各ストア)、Ulta Beauty、Farfetch、Lululemon、Boohoo、Macy’s、Talabat Martなど主要ビューティー・ファッション・リテールプラットフォーム向けのスクレイパーに加え、任意のShopifyやWooCommerceストアで動作する汎用スクレイパーを提供しています。
公共・金融・法律データ
米国政府の公式データセットをクリーンでRAG対応のJSONとして提供——SEC EDGAR開示書類・XBRL財務データ、USAspending.gov連邦調達・助成データ、CourtListener判例、ClinicalTrials.gov臨床試験データ。
企業・求人・リードデータ
Indeedの求人・企業データ、Shopifyストアリード、競合他社が出稿するすべての Google 広告、バーチャル私書箱(CMRA)拠点。
ソーシャル・メディアインテリジェンス
AT Protocol経由でBlueskyの投稿・プロフィール・エンゲージメントを取得するほか、100以上の言語でJSON、SRT、VTT、あるいはLLM向けテキストを出力するYouTube字幕・文字起こしスクレイパー、そしてTikTok文字起こしスクレイパーを提供しています。
開発者向けユーティリティ
スクレイピングにとどまらないツール群——SEO・構造化データ監査とWebからPDF/画像へのレンダリング。
得意分野
- プライベートAPIのリバースエンジニアリング — 未文書化のモバイル/Webエンドポイントを信頼できるデータソースに変換
- アンチボット回避 — Cloudflare、Akamai WAF、および独自の防御機構に対応
- RAG対応の出力 — 検索とグラウンディングのために設計された、正規化されスキーマが一貫したJSON
- マルチリージョン対応スクレイピング — ロケール、通貨、コンプライアンスまで対応
- 高信頼性システム — 大規模かつ無人運用でも稼働し続けるよう設計された抽出基盤
技術スタック
| カテゴリ | 技術 |
|---|---|
| 言語 | TypeScript, Python, Go, Java |
| スクレイピング | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| アンチボット | フィンガープリント生成、TLSフィンガープリンティング、セッションローテーション |
| インフラ | Apify Platform, Docker, GitHub Actions |
| テスト | Vegeta、独自の負荷テストフレームワーク |
お仕事のご相談
カスタムスクレイピングソリューション、RAGデータパイプライン構築、継続的なデータ抽出サービスを提供しています。AIに実際のWebをクリーンなデータとして取り込みたい方は——お気軽にご相談ください。