~/about

プロフィール

Richard Feng — 12年以上の経験を持つWebスクレイピングエンジニア。保護されたWebサイトを、AIエージェント・検索パイプライン・LLM向けのクリーンでRAG対応の構造化データに変えます。

私について

Richard Fengと申します。コーディング歴12年以上のフリーランスWeb自動化エンジニアです。専門はWebスクレイピング、データ抽出、APIリバースエンジニアリング——複雑に保護されたWebサイトを、AIシステムが実際に活用できるクリーンな構造化データへと変えることです。

得意とする技術スタックはNode.js(TypeScript)、Python、Go、Javaに及び、Crawlee、Playwright、Cheerioに深い専門性を持っています。数百万件規模のリクエストを処理する本番システムを、成功率99%超で構築してきました。

手がけていること

3,100人を超えるユーザーに、常時成功率99%超で稼働する16のプロダクション品質Apifyアクターを提供・保守しています。すべてのアクターがクリーンなRAG対応JSONを出力します——スキーマが一貫し、重複排除済みで、ベクトルストア、検索パイプライン、学習データセットにそのまま投入できます。公開データを扱うアクターの大半はAPIキー不要です。私の業務は次の4分野にまたがります。

EC・小売データ

Sephora(世界21店舗)、Ulta BeautyFarfetchLululemonBoohooMacy’sなど主要ビューティー・ファッションプラットフォーム向けのスクレイパーに加え、Shopify対応の任意のストアで動作する汎用Shopifyスクレイパーを提供しています。

公共・金融・法律データ

米国政府の公式データセットをクリーンでRAG対応のJSONとして提供——SEC EDGAR開示書類・XBRL財務データUSAspending.gov連邦調達・助成データCourtListener判例ClinicalTrials.gov臨床試験データ

ソーシャル・メディアインテリジェンス

AT Protocol経由でBlueskyの投稿・プロフィール・エンゲージメントを取得するほか、100以上の言語でJSON、SRT、VTT、あるいはLLM向けテキストを出力するYouTube字幕・文字起こしスクレイパーを提供しています。

開発者向けユーティリティ

スクレイピングにとどまらないツール群——SEO・構造化データ監査WebからPDF/画像へのレンダリング高性能負荷テスト

得意分野

  • プライベートAPIのリバースエンジニアリング — 未文書化のモバイル/Webエンドポイントを信頼できるデータソースに変換
  • アンチボット回避 — Cloudflare、DataDome、Akamai WAF、および独自の防御機構に対応
  • RAG対応の出力 — 検索とグラウンディングのために設計された、正規化されスキーマが一貫したJSON
  • マルチリージョン対応スクレイピング — ロケール、通貨、コンプライアンスまで対応
  • 高信頼性システム — 大規模運用でも成功率99%超を維持する抽出基盤

技術スタック

カテゴリ技術
言語TypeScript, Python, Go, Java
スクレイピングCrawlee, Playwright, Cheerio, Parsel, got-scraping
アンチボットフィンガープリント生成、TLSフィンガープリンティング、セッションローテーション
インフラApify Platform, Docker, GitHub Actions
テストVegeta、独自の負荷テストフレームワーク

お仕事のご相談

カスタムスクレイピングソリューション、RAGデータパイプライン構築、継続的なデータ抽出サービスを提供しています。AIに実際のWebをクリーンなデータとして取り込みたい方は——お気軽にご相談ください