プロフィール
Richard Feng — 12年以上の経験を持つWebスクレイピングエンジニア。保護されたWebサイトを、AIエージェント・検索パイプライン・LLM向けのクリーンでRAG対応の構造化データに変えます。
私について
Richard Fengと申します。コーディング歴12年以上のフリーランスWeb自動化エンジニアです。専門はWebスクレイピング、データ抽出、APIリバースエンジニアリング——複雑に保護されたWebサイトを、AIシステムが実際に活用できるクリーンな構造化データへと変えることです。
得意とする技術スタックはNode.js(TypeScript)、Python、Go、Javaに及び、Crawlee、Playwright、Cheerioに深い専門性を持っています。数百万件規模のリクエストを処理する本番システムを、成功率99%超で構築してきました。
手がけていること
3,100人を超えるユーザーに、常時成功率99%超で稼働する16のプロダクション品質Apifyアクターを提供・保守しています。すべてのアクターがクリーンなRAG対応JSONを出力します——スキーマが一貫し、重複排除済みで、ベクトルストア、検索パイプライン、学習データセットにそのまま投入できます。公開データを扱うアクターの大半はAPIキー不要です。私の業務は次の4分野にまたがります。
EC・小売データ
Sephora(世界21店舗)、Ulta Beauty、Farfetch、Lululemon、Boohoo、Macy’sなど主要ビューティー・ファッションプラットフォーム向けのスクレイパーに加え、Shopify対応の任意のストアで動作する汎用Shopifyスクレイパーを提供しています。
公共・金融・法律データ
米国政府の公式データセットをクリーンでRAG対応のJSONとして提供——SEC EDGAR開示書類・XBRL財務データ、USAspending.gov連邦調達・助成データ、CourtListener判例、ClinicalTrials.gov臨床試験データ。
ソーシャル・メディアインテリジェンス
AT Protocol経由でBlueskyの投稿・プロフィール・エンゲージメントを取得するほか、100以上の言語でJSON、SRT、VTT、あるいはLLM向けテキストを出力するYouTube字幕・文字起こしスクレイパーを提供しています。
開発者向けユーティリティ
スクレイピングにとどまらないツール群——SEO・構造化データ監査、WebからPDF/画像へのレンダリング、高性能負荷テスト。
得意分野
- プライベートAPIのリバースエンジニアリング — 未文書化のモバイル/Webエンドポイントを信頼できるデータソースに変換
- アンチボット回避 — Cloudflare、DataDome、Akamai WAF、および独自の防御機構に対応
- RAG対応の出力 — 検索とグラウンディングのために設計された、正規化されスキーマが一貫したJSON
- マルチリージョン対応スクレイピング — ロケール、通貨、コンプライアンスまで対応
- 高信頼性システム — 大規模運用でも成功率99%超を維持する抽出基盤
技術スタック
| カテゴリ | 技術 |
|---|---|
| 言語 | TypeScript, Python, Go, Java |
| スクレイピング | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| アンチボット | フィンガープリント生成、TLSフィンガープリンティング、セッションローテーション |
| インフラ | Apify Platform, Docker, GitHub Actions |
| テスト | Vegeta、独自の負荷テストフレームワーク |
お仕事のご相談
カスタムスクレイピングソリューション、RAGデータパイプライン構築、継続的なデータ抽出サービスを提供しています。AIに実際のWebをクリーンなデータとして取り込みたい方は——お気軽にご相談ください。