# Proooxy — AIエージェントとLLMのためのRAG対応Webデータ — 全文コンテンツ (llms-full.txt) > AIエージェント・検索パイプライン・LLMのための、構造化されたRAG対応Webデータ。Richard FengはEC、SEC/EDGAR開示書類、連邦支出、判例、臨床試験、ソーシャル・動画データを対象に、プロダクション品質のApifyアクターを開発。アンチボット回避、スキーマ一貫のクリーンなJSON、公開データはAPIキー不要。 このファイルは、https://proooxy.com/ja/上のすべての公開ページを1つの文書に連結したもので、LLMやAIエージェントが直接取り込むことを想定しています。各ページの前には構造化されたフロントマター(URL、種別、カテゴリ、技術、対応地域、日付)のファクトブロックがあり、続けてMarkdown本文全体が記載されています。稼働中のサイトから自動生成されます。 --- ## サイトメタデータ - **サイト:** Proooxy — AIエージェントとLLMのためのRAG対応Webデータ - **URL:** https://proooxy.com/ja/ - **説明:** AIエージェント・検索パイプライン・LLMのための、構造化されたRAG対応Webデータ。Richard FengはEC、SEC/EDGAR開示書類、連邦支出、判例、臨床試験、ソーシャル・動画データを対象に、プロダクション品質のApifyアクターを開発。アンチボット回避、スキーマ一貫のクリーンなJSON、公開データはAPIキー不要。 - **著者:** Richard Feng - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **ツール:** 17件のプロダクションアクター - **投稿数:** 2 - **最終生成日時:** 2026-08-04 --- ## ツールカタログ索引 - [Macy's Scraper — 商品・価格・SKU・ニュースを取得](https://proooxy.com/ja/tools/macys-scraper/) — Macy'sの商品・価格・SKU/UPC・ニュース——Akamai対応、ブラウザ不要。 - [Bluesky Scraper — 投稿・プロフィール・フィード・エンゲージメント](https://proooxy.com/ja/tools/bluesky-scraper/) — Blueskyの投稿・プロフィール・フィード・エンゲージメントをスクレイピング。 - [ClinicalTrials.gov Scraper — 試験・適格基準・結果データを取得](https://proooxy.com/ja/tools/clinical-trials-scraper/) — ClinicalTrials.govの試験・適格基準・結果を検索。 - [CourtListener Scraper — 判決文・ドケット・全文データを取得](https://proooxy.com/ja/tools/courtlistener-scraper/) — リーガルAI向けの米国判例、ドケット、判決文全文。 - [SEC EDGAR Scraper — 開示書類・全文・XBRL財務データを取得](https://proooxy.com/ja/tools/sec-edgar-scraper/) — SEC開示書類、10-K/10-Qテキスト、XBRL財務データ——RAG対応。 - [USAspending.gov Scraper — 連邦調達案件・受給者・集計データを取得](https://proooxy.com/ja/tools/usaspending-scraper/) — USAspending.govの連邦調達案件・受給者・支出集計データ。 - [YouTube Subtitle & Transcript Scraper — JSON・SRT・VTT・LLM対応](https://proooxy.com/ja/tools/youtube-transcript-scraper/) — YouTubeの文字起こしをJSON、SRT、VTT、またはLLM対応テキストで取得。 - [Sephora Scraper(グローバル)](https://proooxy.com/ja/tools/sephora-scraper/) — あらゆるSephora店舗をスクレイピング——21市場を1つのアクターで。 - [Boohoo Scraper — 7地域の商品データを取得](https://proooxy.com/ja/tools/boohoo-scraper/) — 7つの地域別ストアからBoohooの商品データをスクレイピング。 - [Farfetch Scraper — ラグジュアリーファッション商品データを取得](https://proooxy.com/ja/tools/farfetch-scraper/) — 多通貨対応でFarfetchのラグジュアリーファッション商品をスクレイピング。 - [Global API Load Tester — 10K+ RPSのストレステスト](https://proooxy.com/ja/tools/load-tester/) — 地理分散負荷テストで10K+ RPSをシミュレート。 - [Lululemon Scraper — 商品・バリアント・価格データを取得](https://proooxy.com/ja/tools/lululemon-scraper/) — Lululemonからバリアントとメディア付きの商品データを抽出。 - [Schema Markup Scraper — 構造化データ抽出とSEO監査](https://proooxy.com/ja/tools/schema-markup-scraper/) — あらゆるWebサイトの構造化データを抽出し、SEOを監査。 - [Sephora EU Scraper — 欧州9市場の商品データを取得](https://proooxy.com/ja/tools/sephora-eu-scraper/) — 欧州9市場のSephoraから商品データを抽出。 - [Shopify Scraper — あらゆるストアの商品データを取得](https://proooxy.com/ja/tools/shopify-scraper/) — あらゆるShopifyストアから商品データを抽出。 - [Ulta Beauty Scraper — 商品・価格・SKUデータを取得](https://proooxy.com/ja/tools/ulta-scraper/) — Ulta Beautyから完全な商品データをスクレイピング。 - [Universal Web Printer — URL・HTMLをPDF/画像に変換](https://proooxy.com/ja/tools/web-printer/) — URLやHTMLをPDF、PNG、JPEG、WebPに変換。 --- # Macy's Scraper — 商品・価格・SKU・ニュースを取得 - **URL:** https://proooxy.com/ja/tools/macys-scraper/ - **種別:** tools - **説明:** Macy'sの商品データ——価格、バリアント、SKU/UPCバーコード、画像、評価・レビュー——に加え、Macy's Inc.のニュースを、検索・カテゴリ・トレンド・商品URLから抽出します。ブラウザ不要でAkamaiにも対応。 - **概要:** Macy'sの商品・価格・SKU/UPC・ニュース——Akamai対応、ブラウザ不要。 - **カテゴリ:** ecommerce - **技術スタック:** TypeScript, Crawlee, Cheerio - **マーケット/対応地域:** アメリカ - **Apify掲載ページ:** https://apify.com/autofacts/macy-s-scraper - **キーワード:** Macy's スクレイピング, Macy's 商品データ, Macy's 価格モニタリング, 百貨店 スクレイパー, Macy's SKU UPC データ, Macy's レビュー スクレイパー, 小売 商品データ - **公開日:** 2026-07-15 - **更新日:** 2026-07-15 **主な機能:** - 1つのアクターで4つの取得対象 — 商品検索、カテゴリ、トレンド、Macy's Inc.ニュース - Macy's自身のモバイル・Web JSON APIを利用し、ブラウザなしでAkamai Bot Managerを突破 - 購入可能な全バリアントについて、SKUごとのUPCバーコードとカラー・サイズ・在庫状況・価格を取得 - 価格はセント単位の整数に加えローカライズされたフォーマット済み文字列でも提供 — 浮動小数点の丸め誤差なし - 詳細なレビューインテリジェンス — 星評価のヒストグラム、推奨件数、フィット感・サイズ感の副次評価 - バリアントごとに行を分けず、全カラー・サイズを1つの商品レコードにグループ化 - 出力にはクリーンな正規URLのみ — 内部APIエンドポイントやクライアントキーは一切含まれません - search、category、trending、商品詳細の結果すべてで統一された正規化スキーマ **活用例:** - SKUレベルでの百貨店価格・プロモーションモニタリング - 競合分析 — Macy's対Nordstrom、Ulta、ブランドDTC価格 - バリアント単位のUPCバーコードによる小売業者横断のカタログマッチング - Macy'sで販売されているブランドのレビュー・評価インテリジェンス - 小売ニュースモニタリング — Macy's Inc.のプレスリリースと決算発表 **入力パラメータ:** - `scrapeType` (string, 必須) — 取得対象:search、category、trending、news、allのいずれか(デフォルト:search)。 - `query` (string, 任意) — 商品検索用のキーワード。例:women shoes。 - `startUrls` (array, 任意) — MacyのURL(商品/カテゴリページ)またはMacy's Inc.ニュースのURL。 - `categoryIds` (array, 任意) — Macyのカテゴリ ID(例:5449)。判明している場合はカテゴリURLの使用を推奨。 - `trendingUrls` (array, 任意) — トレンド、ベストセラー、または特集リスティングのURL。 - `newsUrls` (array, 任意) — Macy's Inc.のニュース一覧または記事のURL。 - `includeProductDetails` (boolean, 任意) — リスト項目にバリアント・SKU・ギャラリーなどの詳細な商品情報を付加(デフォルト:true)。 - `maxPages` (number, 任意) — リスト/ニュースソースごとの最大ページネーション深度。 - `maxResults` (number, 任意) — 出力レコード数の上限。0=上限なし。 - `proxy` (object, 必須) — Apify Proxyまたはカスタムプロキシ URL。レジデンシャル・国はUSを推奨。 **よくある質問:** **Q: ブラウザなしでどうやってAkamaiを突破しているのですか?** そもそもJSチャレンジと戦っていません。リスティングはMacy'sのモバイルアプリAPIから、商品詳細はWebサイトのJSON APIから取得しており、どちらも匿名の読み取りリクエストに応答する別インフラ上で動作しています。ログイン、Cookie、APIキーは一切不要です。 **Q: 価格はドル単位ですか、それともセント単位ですか?** 浮動小数点の丸め誤差を避けるためセント単位の整数です(5999=$59.99)。あわせてローカライズされたフォーマット済み文字列($59.99)も提供します。 **Q: バリアントとUPCはどのように扱われますか?** すべてのカラー・サイズは、variants[]配列を持つ単一の商品レコードにグループ化されます。各バリアントは、Macy'sのSKU関連データから復元された独自のUPCバーコード・カラー・サイズ・在庫状況・価格を保持しています——スウォッチウィジェットからスクレイピングしたものではありません。 **Q: 商品とニュースを1回の実行でまとめてスクレイピングできますか?** はい。scrapeTypeをallに設定し、query、startUrls、categoryIds、trendingUrls、newsUrlsを任意に組み合わせて指定してください。 ## Output Example ```json { "type": "product", "source": { "id": "12345678", "canonicalUrl": "https://www.macys.com/shop/product/calvin-klein-womens-sheath-dress?ID=12345678", "retailer": "macys", "currency": "USD" }, "title": "Women's Sleeveless Sheath Dress", "brand": "Calvin Klein", "categories": ["Women", "Dresses", "Work Dresses"], "price": { "sale": 5999, "list": 9800, "currentFormatted": "$59.99", "stockStatus": "InStock" }, "stats": { "rating": 4.6, "reviewCount": 9, "ratingPercentage": 92 }, "options": [ { "type": "Color", "values": [{ "id": "1", "name": "Black" }] }, { "type": "Size", "values": [{ "id": "10", "name": "M" }, { "id": "12", "name": "L" }] } ], "variants": [ { "id": "987654", "sku": "192837465012", "options": ["Black", "M"], "price": { "stockStatus": "InStock" }, "extraInfo": { "upc": "192837465012" } } ], "medias": [{ "type": "Image", "url": "https://slimages.macysassets.com/is/image/MCY/products/.../main.jpg" }] } ``` ## Pricing イベント課金制——実際に保存されたアイテムに対してのみ課金されます。 | イベント | 価格 | 内容 | |---|---|---| | 商品のスクレイピング | $0.006 | バリアント、SKU/UPC、価格、画像、評価を含む詳細な商品1件 | | 記事のスクレイピング | $0.002 | タイトル、著者、日付、本文、画像を含むMacy's Inc.ニュース記事1件 | 上位のApifyプランではボリュームディスカウントが自動適用されます(商品1件あたり最低$0.0045まで)。1,000商品のクロールは定価で約$6.00です。 ## Tips - **レジデンシャルのUSプロキシを使いましょう。** 商品詳細エンドポイントは断続的にレート制限がかかります。レジデンシャルのセッションローテーションならスムーズに通過しますが、データセンターIPは403エラーが増えます。 - **同時実行数は控えめに保ちましょう。** `maxConcurrency`は2〜3が最適値です——それ以上に上げてもスループットは向上せず、レート制限に引っかかる頻度が増えるだけです。 - **裸のIDよりカテゴリURLを優先しましょう。** URLにはAPIが期待するカテゴリパスが含まれています。裸のIDでは、より広範囲な結果や空の結果になることがあります。 - **バリアントや商品説明が不要な場合は`includeProductDetails`をオフにしましょう。** 名前、ブランド、リスト価格、画像、評価だけの高速なリスティングレベル取得になります。 --- # Bluesky Scraper — 投稿・プロフィール・フィード・エンゲージメント - **URL:** https://proooxy.com/ja/tools/bluesky-scraper/ - **種別:** tools - **説明:** AT Protocol経由でBlueskyの投稿・プロフィール・フォロワー・フィード・スレッド・いいねしたユーザー・リポストしたユーザーを抽出——さらにアプリパスワードによる認証で検索とハッシュタグの結果にも対応。クリーンで正規化されたJSON。 - **概要:** Blueskyの投稿・プロフィール・フィード・エンゲージメントをスクレイピング。 - **カテゴリ:** social - **技術スタック:** TypeScript, AT Protocol - **マーケット/対応地域:** グローバル - **Apify掲載ページ:** https://apify.com/autofacts/bluesky-scraper - **キーワード:** Bluesky スクレイピング, Bluesky API 取得, AT Protocol データ取得, Bluesky 投稿 取得, Bluesky プロフィール データ, Bluesky ハッシュタグ 検索, SNS データ 抽出 - **公開日:** 2026-07-01 - **更新日:** 2026-07-01 **主な機能:** - 11のモード — search、profile、posts、followers、following、feed、thread、likers、reposters、actorLikes、hashtag - 認証不要の公開APIで、プロフィール・投稿・フォロワー・フォロー中・フィード・スレッド・いいねしたユーザー・リポストしたユーザーを取得 - 認証が必要なアプリパスワードモード — search、hashtag、自分のアカウントのいいね - 投稿エンゲージメントのエクスポート — 投稿ごとのいいねしたユーザー・リポストしたユーザーの全リスト - スレッドのフラット化 — 設定可能な深さまで返信ツリーを辿る - 全リストエンドポイントで、指定した件数上限まで自動カーソルページネーション - 全モードで統一された、投稿とプロフィールの正規化JSON構造 - 堅牢なHTTP処理 — リクエストスロットリング、指数バックオフ、429/5xxでのリトライ **活用例:** - 認証付き検索によるブランド・キーワードモニタリング - ネットワーク全体でのハッシュタグ・トレンド追跡 - オーディエンスのエクスポート — クリエイターやブランドのフォロワー・フォロー中リスト - エンゲージメント分析 — 特定の投稿に誰がいいね・リポストしたかを正確に把握 - クリーンで正規化されたJSONによる、BI・分析・RAGパイプライン向けデータセット構築 - 投稿配下の会話・スレッドのアーカイブ **入力パラメータ:** - `mode` (string, 任意) — 取得対象:posts、profile、followers、following、feed、thread、likers、reposters、actorLikes、search、hashtagのいずれか(デフォルト:posts)。 - `handles` (array, 任意) — profile/posts/followers/following/actorLikesモード用のBlueskyハンドル。例:bsky.app。 - `query` (string, 任意) — 検索テキスト(searchモード)またはハッシュタグ(hashtagモード — 自動的に#が付加されます)。 - `postUri` (string, 任意) — 投稿のAT URI — thread、likers、repostersモードで使用。 - `feedUri` (string, 任意) — カスタムフィードのAT URI — feedモードで使用。 - `identifier` (string, 任意) — 認証モード(search、hashtag、actorLikes)用のBlueskyログインハンドルまたはメールアドレス。 - `appPassword` (string, 任意) — 認証モード用のBlueskyアプリパスワード(メインアカウントのパスワードではありません)。 - `maxItems` (number, 任意) — 保存する投稿/プロフィールの最大数。1件ごとに1課金イベント(デフォルト:100)。 **よくある質問:** **Q: Blueskyの認証情報は必要ですか?** search、hashtag、actorLikesモードのみ必要です——Blueskyの設定でアプリパスワードを生成し、appPasswordとして渡してください。profile、posts、followers、following、feed、thread、likers、repostersモードは、公開のAT Protocol APIにより認証情報なしで動作します。 **Q: 任意のアカウントのいいねをエクスポートできますか?** いいえ。BlueskyのAPIは、認証済みアカウント自身のactorLikesしか公開していません。そのため、handleとログイン用identifierは同一アカウントを指している必要があります。 **Q: 投稿やフィードのURIはどうやって調べますか?** AT URIはat://did:plc:.../app.bsky.feed.post/...のような形式です——BlueskyのAPI出力や開発者向けツールからコピーしてください。フィードURIはapp.bsky.feed.generatorコレクションを使用します。 **Q: アプリパスワードを使うのは安全ですか?** はい——Blueskyのアプリパスワード(設定 → App Passwordsで作成)を使用し、メインパスワードは絶対に使わないでください。スコープが限定されており、取り消し可能で、シークレット入力として渡されます。 ## Output Example ```json { "itemType": "post", "mode": "posts", "uri": "at://did:plc:.../app.bsky.feed.post/...", "author": { "did": "did:plc:...", "handle": "bsky.app", "displayName": "Bluesky", "followersCount": 1234567 }, "text": "Example post text", "createdAt": "2026-06-11T00:00:00Z", "replyCount": 10, "repostCount": 20, "likeCount": 100, "langs": ["en"], "url": "https://bsky.app/profile/bsky.app/post/..." } ``` ## Pricing イベント課金制:保存された**アイテム(投稿またはプロフィール)1件につき$0.001**。1,000件のエクスポートで約$1.00、`maxItems`が件数とコストの両方に上限を設けます。 ## Tips - **まずは公開モードから始めましょう。** プロフィール、投稿、フォロワー、エンゲージメント(likers/reposters)にはログインが不要です——アプリパスワード認証はsearchとhashtagの実行時のためにとっておきましょう。 - **投稿だけでなくエンゲージメントもエクスポートしましょう。** likersとrepostersモードは、誰がその投稿を拡散したかを正確に明らかにします——多くのBlueskyスクレイパーが見落としているシグナルです。 - **大規模アカウントのフォロワー/フォロー中を取得する際は`maxItems`で上限を設定**し、実行を高速かつコストを予測可能に保ちましょう。 --- # ClinicalTrials.gov Scraper — 試験・適格基準・結果データを取得 - **URL:** https://proooxy.com/ja/tools/clinical-trials-scraper/ - **種別:** tools - **説明:** 公式ClinicalTrials.gov v2 APIを、疾患・介入・スポンサー・所在地・ステータス・NCT IDで検索。適格基準、結果メタデータ、増分更新を含む正規化された試験レコードをエクスポートします——APIキー不要。 - **概要:** ClinicalTrials.govの試験・適格基準・結果を検索。 - **カテゴリ:** public-data - **技術スタック:** TypeScript, REST API - **マーケット/対応地域:** グローバル - **Apify掲載ページ:** https://apify.com/autofacts/clinical-trials-scraper - **キーワード:** ClinicalTrials.gov API, 臨床試験 データ, 臨床試験 データセット, 募集中 臨床試験 データ, 臨床試験 適格基準 データ, 製薬 パイプライン モニタリング, 臨床試験 RAG 活用 - **公開日:** 2026-07-01 - **更新日:** 2026-07-01 **主な機能:** - 公式ClinicalTrials.gov v2 API — APIキー不要 - 複数フィールドでの検索 — 疾患、介入、スポンサー、所在地、フリーテキストクエリ - 募集状況(9種類の値、OR結合)とフェーズ(Early Phase 1 → Phase 4)でフィルタ - 1件または複数の特定試験をNCT IDで直接検索 - updatedSinceによる増分モニタリング — 指定日以降に変更された試験のみを返す - summaryまたはfull出力 — fullではprotocol、derived、resultsの生セクションが追加 - タイトル・概要・適格基準・アウトカムからRAG対応の段落チャンクを生成 - 結果シグナル — hasResultsに加え、参加者フロー・評価項目・有害事象のフラグ - MeSH用語の抽出、およびスポンサー・共同実施者・所在地データの正規化 **活用例:** - スポンサーまたは疾患別の製薬・バイオテックパイプラインモニタリング - CROおよび実施施設のフィージビリティ調査 — 所在地・フェーズ・疾患別の募集中試験 - 新規登録・更新された試験に関する競合インテリジェンス - 現在募集中の試験を対象とした患者リクルートメント調査 - システマティックレビュー — 適格基準、アウトカム、結果メタデータを大規模に収集 - チャンク化された試験テキストから構築する医療AI・RAGナレッジベース **入力パラメータ:** - `condition` (string, 任意) — 検索対象の疾患・状態。例:diabetes。 - `status` (array, 任意) — 募集状況フィルタ(OR結合)。例:RECRUITING、COMPLETED。 - `phase` (array, 任意) — 試験フェーズ — Not Applicable、Early Phase 1、Phase 1〜4。 - `nctIds` (array, 任意) — ClinicalTrials.govのNCT IDで特定の試験を取得。 - `updatedSince` (string, 任意) — YYYY-MM-DD形式 — LastUpdatePostDateがこの日付以降の試験を返す。 - `outputFields` (string, 任意) — summary(デフォルト、正規化済み)またはfull(protocol/derived/resultsの生セクションを追加)。 - `chunking` (string, 任意) — RAGテキストのチャンク分割:paragraph(デフォルト)またはnone。 - `maxItems` (number, 任意) — 保存する試験の最大数。1件ごとに1課金イベント(デフォルト:10)。 **よくある質問:** **Q: APIキーは必要ですか?** いいえ。ClinicalTrials.govのv2 APIは完全に公開されています——このアクターは説明用のUser-Agentを送信するのみで、認証は行いません。 **Q: 正規化されたフィールドだけでなく、試験の生データも取得できますか?** はい。outputFieldsを「full」に設定すると、正規化されたsummaryフィールドに加えて、生のprotocolSection、derivedSection、resultsSectionが含まれます。 **Q: 最近変更された試験をモニタリングするには?** updatedSinceにYYYY-MM-DD形式の日付を設定してください。このアクターはClinicalTrials.govのLastUpdatePostDateでフィルタし、その日以降に更新された試験のみを返します——日次のパイプラインモニタリングに最適です。 **Q: 対象範囲はグローバルですか、それとも米国限定ですか?** グローバルです。ClinicalTrials.govは世界中の試験を登録しており、各試験のlocations配列には、提供されている場合は国・州・市・施設が含まれます。 ## Output Example ```json { "itemType": "study", "nctId": "NCT01884792", "title": "Example Diabetes Study", "officialTitle": "A Study of Example Diabetes Study", "status": "COMPLETED", "phase": ["PHASE2"], "studyType": "INTERVENTIONAL", "conditions": ["Diabetes Mellitus"], "sponsors": { "lead": "Example Sponsor Inc.", "collaborators": [] }, "locations": [ { "facility": "Example Medical Center", "city": "Boston", "state": "MA", "country": "United States", "status": "COMPLETED" } ], "hasResults": true, "resultsSummary": { "hasParticipantFlow": true, "hasOutcomeMeasures": true, "hasAdverseEvents": true }, "lastUpdate": "2026-06-01", "url": "https://clinicaltrials.gov/study/NCT01884792" } ``` ## Pricing イベント課金制:出力モードがsummaryかfullかにかかわらず、保存された**試験1件につき$0.002**。1,000件のエクスポートで約$2.00、`maxItems`が件数とコストの両方に上限を設けます。 ## Tips - **変更モニタリングには`updatedSince`を使いましょう。** 前日の日付で毎日実行をスケジュールすれば、新規登録・修正された試験だけを取得できます——競合のパイプラインを追跡する最も安価な方法です。 - **`condition`+`status: [RECRUITING]`+`phase`を組み合わせる**ことで、レジストリ全体を取得せずに絞り込んだフィージビリティリストを構築できます。 - **`outputFields: full`を設定する**のは、生セクションが必要な場合のみにしましょう——正規化されたsummaryには、すでに適格基準、スポンサー、所在地、結果フラグが含まれています。 --- # CourtListener Scraper — 判決文・ドケット・全文データを取得 - **URL:** https://proooxy.com/ja/tools/courtlistener-scraper/ - **種別:** tools - **説明:** CourtListenerに対して米国の判決文、RECAPドケット、口頭弁論、裁判官、引用情報を検索——判決文の全文とRAG対応チャンク付き。裁判所、日付、キーワードでフィルタ可能です。 - **概要:** リーガルAI向けの米国判例、ドケット、判決文全文。 - **カテゴリ:** public-data - **技術スタック:** TypeScript, Cheerio - **マーケット/対応地域:** アメリカ - **Apify掲載ページ:** https://apify.com/autofacts/courtlistener-scraper - **キーワード:** CourtListener API, 判例データ API, 判決文 スクレイパー, RECAP ドケット データ, 法律調査 データ, 米国判例 データセット, 判例 RAG 活用 - **公開日:** 2026-07-01 - **更新日:** 2026-07-01 **主な機能:** - 1つのアクターで6種類の検索タイプ — opinions(判決文)、dockets(RECAP)、RECAP文書、oral arguments(口頭弁論)、judges(裁判官)、citation(引用)検索 - 判決文の全文 — 300文字のスニペットではなく、検索ヒットからデータベースを辿って完全な判決文を取得 - RAG対応のチャンク分割 — 約2000文字の段落チャンクごとに順序インデックスを付与 - 引用の解決 — 最大250件の引用文字列(例:576 U.S. 644)を該当する判例に解決 - ブール演算による全文検索に加え、裁判所ID・提出日範囲・ソート順によるフィルタ - レート制限を考慮したペーシングと、CourtListenerの各レスポンス形式に対応した精緻な429バックオフ - 設定した件数上限までのカーソルページネーションストリーミング - 自分のトークンを持ち込むか、内蔵のローテーショントークンプールを利用可能 **活用例:** - 法律調査 — 裁判所・日付範囲・キーワードで判例全文を取得 - 訴訟インテリジェンス — 主題や日付ごとに裁判所のドケット活動を追跡 - リーガルAI・RAG — チャンク化されたエンベディング対応の判例コーパスを構築 - 引用分析 — 準備書面中の引用を、関連する判例レコードと被引用数に解決 - 実証的法学研究 — 裁判官、口頭弁論メタデータ、判決トレンド - 法律ジャーナリズム — 特定の裁判所で新たに提出された判決文やドケットをモニタリング **入力パラメータ:** - `searchType` (string, 任意) — 取得対象:opinions、dockets、recap_docs、oral_arguments、judges、citationのいずれか(デフォルト:opinions)。 - `query` (string, 任意) — ブール演算子を使った全文検索クエリ — courtフィルタまたはcitation検索を使わない場合は必須。 - `citations` (array, 任意) — 解決対象の引用文字列(最大250件) — citationモードでは必須。 - `court` (string, 任意) — CourtListenerの裁判所ID。例:scotus、ca9、nyed。 - `dateFrom` (string, 任意) — この日付以降に提出されたもの(YYYY-MM-DD)。 - `includeFullText` (boolean, 任意) — 判決文の全文とRAGチャンクを取得(opinions用、デフォルト:false)。 - `apiToken` (string, 任意) — 自分のCourtListener APIトークン。省略した場合は内蔵のローテーションプールにフォールバックします。 - `maxItems` (number, 任意) — 保存するアイテムの最大数。1件ごとに1課金イベント(デフォルト:5)。 **よくある質問:** **Q: CourtListenerのAPIトークンは必要ですか?** CourtListener側で必須です。apiTokenで自分の無料トークンを渡すか、アクター内蔵のローテーションフォールバックプールを利用してください。自分のトークンを使えば、有料/会員ティアでスループットを引き上げられます。 **Q: 全文はすべての検索タイプで取得できますか?** いいえ。全文とチャンク分割(includeFullText)はopinionsのみに適用され、実行を高速に保つためデフォルトでは無効です。dockets、RECAP文書、oral arguments、judges、citationの結果はメタデータのみを返します。 **Q: 対象となる裁判所はどこですか?** CourtListenerがインデックスしているものすべてです——米国連邦裁判所(SCOTUS、控訴裁判所、RECAP経由の地方裁判所)に加え、多数の州裁判所を、scotus、ca9、nyedのようなCourtListener独自の裁判所IDでカバーしています。 **Q: どのくらいの速度で実行できますか?** スループットはトークンのレート制限に左右されます(CourtListenerの無料ティアは毎分数リクエスト程度)。429への自動バックオフを備えており、会員トークンを使えば上限が引き上げられます。 ## Output Example ```json { "itemType": "legal", "searchType": "opinions", "id": "10380001", "title": "Climate United Fund v. Citibank, N.A.", "court": "Court of Appeals for the D.C. Circuit", "date": "2025-04-16", "url": "https://www.courtlistener.com/opinion/10380001/...", "citations": [], "citeCount": 0, "docketNumber": "23-5138", "fullText": "...", "chunks": [{ "text": "...", "order": 0 }], "meta": { "courtId": "cadc", "clusterId": 10380001 } } ``` ## Pricing イベント課金制——保存されたアイテムに対してのみ課金されます。 | イベント | 価格 | 内容 | |---|---|---| | 全文付き判決文 | $0.005 | 全文+RAGチャンク付きで保存された判決文1件 | | メタデータアイテム | $0.002 | ドケット、口頭弁論、裁判官、引用など、メタデータのみのレコード1件 | 1,000件の全文判決文コーパスで約$5.00。`maxItems`が件数とコストの両方に上限を設けます。 ## Tips - **`includeFullText`は、実際にエンベディングする判決文だけでオンにしましょう。** 判決文ごとに追加リクエストのコストがかかるため、デフォルトでは無効です——まず裁判所と日付で絞り込みましょう。 - **準備書面の情報を充実させるには`citation`モードを使いましょう。** 引用文字列を貼り付ければ、1回の実行で関連する判例レコードと被引用数が得られます。 - **大規模なジョブには自分のCourtListenerトークンを持ち込みましょう**——無料ティアの低いレート制限が、スループットの主なボトルネックです。 --- # SEC EDGAR Scraper — 開示書類・全文・XBRL財務データを取得 - **URL:** https://proooxy.com/ja/tools/sec-edgar-scraper/ - **種別:** tools - **説明:** SEC EDGARの開示書類メタデータ、10-K/10-Qの全文セクション、EDGAR全文検索結果、XBRL財務ファクトを、クリーンでRAG対応のJSONとして抽出します。APIキー不要。 - **概要:** SEC開示書類、10-K/10-Qテキスト、XBRL財務データ——RAG対応。 - **カテゴリ:** public-data - **技術スタック:** TypeScript, Cheerio - **マーケット/対応地域:** アメリカ - **Apify掲載ページ:** https://apify.com/autofacts/sec-edgar-scraper - **キーワード:** SEC EDGAR API, SEC EDGAR スクレイパー, 10-K 開示書類 データ, 10-Q スクレイパー, XBRL 財務データ, EDGAR 全文検索, SEC開示書類 RAG活用, 企業財務データ API - **公開日:** 2026-07-01 - **更新日:** 2026-07-01 **主な機能:** - 1つのアクターで4つのモード — 開示書類メタデータ、文書全文、EDGAR全文検索、XBRL財務ファクト - RAG対応のチャンク分割 — section、paragraph(約2000文字)、noneから選択。各チャンクには元のItemと順序を付与 - 10-K/10-Qの「Item N」セクションを自動解析(Item 1A — Risk Factors、Item 7 — MD&Aなど) - タクソノミ、タグ、ラベル、単位、値、会計年度/期間、フォーム、アクセッション番号を含むXBRLファクト - ファクトの重複排除により、XBRLの修正再表示を期間ごとに1行へ集約し、最初の開示を保持 - ティッカー、CIK、または企業名でSEC公式ティッカーファイルと照合して企業を特定(あいまい一致フォールバック付き) - フレーズ検索、フォームタイプ、日付範囲フィルタに対応したEDGAR全文検索(2001年〜現在) - SEC準拠のレート制限とUser-Agent — APIキーもログインも不要 **活用例:** - セクション単位でチャンク化され、エンベディング対応の10-K/10-Qテキストを必要とする金融RAG・LLMパイプライン - 投資調査 — 売上高、純利益、希薄化後EPSの時系列をクリーンなXBRL行として取得 - コンプライアンス・株式保有モニタリング — 企業横断でのForm 4、SC 13D/13G、リスク要因の記述 - 独自クローラーを構築せずに構造化されたEDGARデータが必要なフィンテックプロダクト - 全文検索を用いた市場・業界調査 — どの企業がいつからそのフレーズを開示しているか - クリーンなXBRL財務ファクト行を取り込むBI・スプレッドシートワークフロー **入力パラメータ:** - `mode` (string, 必須) — 抽出モード:filings、fulltext、search、factsのいずれか(デフォルト:filings)。 - `ticker` (string, 任意) — 株式ティッカー。例:AAPL。ticker/cik/companyNameのいずれか1つが実行時に必須です。 - `cik` (string, 任意) — SECのCentral Index Key。例:320193 — tickerやcompanyNameより優先されます。 - `companyName` (string, 任意) — SEC登録企業名。公式ティッカーファイルに対して完全一致またはあいまい一致で照合されます。 - `query` (string, 任意) — EDGAR全文検索の検索式。例:"supply chain disruption" — searchモードでは必須。 - `formTypes` (array, 任意) — 含めるフォームタイプ。例:10-K、10-Q、8-K、S-1、DEF 14A、Form 4。空欄=全フォーム。 - `chunking` (string, 任意) — 全文取得時のRAG戦略:section、paragraph(約2000文字)、noneのいずれか(デフォルト:section)。 - `maxItems` (number, 任意) — 保存するアイテムの最大数。保存1件ごとに1課金イベント(デフォルト:100)。 **よくある質問:** **Q: SECのAPIキーは必要ですか?** いいえ。SEC EDGARは無料の公開データです。このアクターは準拠したUser-Agentで自己を識別し、SECのレート制限内で自動的にスロットリングを行います——キーもログインも不要です。 **Q: データはどこまで遡れますか?** EDGAR全文検索(EFTS)は2001年5月4日以降の開示書類をカバーし、クエリごとに最大10,000件のヒットに制限されています。開示書類メタデータは1994年まで遡り、XBRL財務ファクトは各企業がXBRLで報告したすべてのデータをカバーします。 **Q: 出力はLLMやRAGにそのまま使えますか?** はい。fulltextモードでは、このアクターが10-K/10-Qを「Item N」セクションに解析し、エンベディング対応のチャンク(sectionまたは約2000文字のparagraph)を生成します。各チャンクには元のItemと順序インデックスが付与されます。 **Q: fulltextモードで一部の開示書類がスキップされるのはなぜですか?** 主文書がHTMLでもTXTでもない開示書類(例:XBRLのみのForm 4 XML)はセクション解析ができないため、スキップされます——その場合は課金もされません。 ## Output Example ```json { "itemType": "filing-fulltext", "title": "Apple Inc. — 10-K 2025-10-31", "company": "Apple Inc.", "ticker": "AAPL", "cik": "0000320193", "formType": "10-K", "filedAt": "2025-10-31", "accessionNo": "0000320193-25-000123", "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...", "sections": [ { "name": "Item 1A — Risk Factors", "charCount": 38241 }, { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 } ], "chunks": [ { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 } ], "textLength": 220151 } ``` ## Pricing イベント課金制——実際に保存されたアイテムに対してのみ課金されます。 | イベント | 価格 | 内容 | |---|---|---| | 開示書類メタデータ/検索ヒット | $0.001 | 開示書類メタデータレコード1件、または全文検索結果1件 | | 全文開示書類 | $0.005 | 抽出・セクション解析・RAGチャンク化された開示書類1件 | | XBRLファクト | $0.0002 | XBRL財務ファクト行1件 | 1,000件の開示書類メタデータ取得で約$1.00、1,000件のXBRLファクトで約$0.20。`maxItems`が件数とコストの両方に上限を設けます。 ## Tips - **財務データはまず`facts`モードから。** 数値だけが必要な場合、XBRL行(売上高、純利益、EPS)の取得は、開示書類全文を解析するよりもはるかに安価でクリーンです。 - **RAGには`chunking: section`を使いましょう。** 各Item(Risk Factors、MD&Aなど)をひとまとまりに保つため、検索結果が一貫した引用可能な文章になります。 - **全文検索は2001年以降が対象です。** それより古い開示情報は、CIKで企業を特定し、開示書類メタデータを直接取得してください。 --- # USAspending.gov Scraper — 連邦調達案件・受給者・集計データを取得 - **URL:** https://proooxy.com/ja/tools/usaspending-scraper/ - **種別:** tools - **説明:** 公式USAspending.gov API v2に対して、連邦政府の契約・助成金・融資を検索します。省庁、受給者、NAICS/PSC、日付でフィルタし、受給者プロフィール、カテゴリ別集計、州/郡/選挙区別の地理集計を取得できます。APIキー不要。 - **概要:** USAspending.govの連邦調達案件・受給者・支出集計データ。 - **カテゴリ:** public-data - **技術スタック:** TypeScript, REST API - **マーケット/対応地域:** アメリカ - **Apify掲載ページ:** https://apify.com/autofacts/usaspending-scraper - **キーワード:** USAspending API, 連邦契約 データ, 政府支出 データ, 連邦助成金 データ, GovCon 市場調査, 連邦調達案件 データ, NAICS PSC 契約データ - **公開日:** 2026-07-01 - **更新日:** 2026-07-01 **主な機能:** - 公式USAspending.gov API v2 — APIキー不要 - キーワード、会計年度/日付範囲、省庁、受給者、NAICS、PSC、金額、案件タイプを横断した案件検索 - 6つのモード — 案件検索、案件詳細、サブアワード、受給者プロフィール、カテゴリ別集計、地理集計 - 18種類のカテゴリ集計ディメンション(受給者、NAICS、PSC、省庁、郡、選挙区、CFDA、TASなど) - 州・郡・連邦議会選挙区・国別の地理集計、人口・一人当たりの数値フィールド付き - 複数年にまたがる大規模な結果セットの自動日付分割(月次/四半期) - 案件タイプコードを有効なAPIリクエストグループへ自動バッチ化 - 生成された案件IDによる正確な案件詳細・サブアワード検索 **活用例:** - GovCon(政府契約ビジネス)の事業開発 — NAICS、PSC、省庁別に案件機会と既存の受注事業者を発見 - 競合の受注実績や省庁との関係に関する競合インテリジェンス - 特定の受給者や地域への連邦支出を追跡する調査報道 - カテゴリ・案件タイプ・期間別の支出トレンドに関する政策・学術研究 - 受給者の連邦調達・支出履歴に関するデューデリジェンス - 州・郡・連邦議会選挙区別の連邦支出をマッピングするBIダッシュボード **入力パラメータ:** - `mode` (string, 任意) — ワークフロー:awards、awardDetail、subawards、recipient、byCategory、geographyのいずれか(デフォルト:awards)。 - `keywords` (array, 任意) — 案件検索用のUSAspendingフリーテキストキーワードフィルタ。 - `fiscalYear` (number, 任意) — 連邦会計年度(10月1日〜翌9月30日の期間に対応)。 - `awardTypes` (array, 任意) — USAspendingの案件タイプコード。異なるグループが混在する場合は、自動的に有効なリクエストへ分割されます。 - `agency` (string, 任意) — 発注省庁または資金提供省庁名の完全一致フィルタ。 - `naicsCodes` (array, 任意) — 案件が一致すべきNAICSコード。 - `awardId` (string, 任意) — 生成された案件ID — awardDetailおよびsubawardsモードでは実行時に必須。 - `maxItems` (number, 任意) — 保存するレコードの最大数。1行ごとに1課金イベント(デフォルト:100)。 **よくある質問:** **Q: APIキーは必要ですか?** いいえ。USAspending.gov API v2は公開されており、キーもログインも不要です。 **Q: 異なる案件タイプコードが混在すると、なぜ複数のリクエストに分割されるのですか?** USAspendingは、異なる案件タイプグループ(contracts、IDVs、grants、loans、other financial assistance、direct payments)のコードが混在した単一の検索を拒否します。このアクターはリクエストされたコードを自動的にグループ化し、各出力行に一致した案件タイプコードをタグ付けします。 **Q: どのような地理的な内訳が取得できますか?** 州、郡、連邦議会選挙区、国です——履行地または受給者所在地のいずれかを基準とし、人口と一人当たりの数値フィールドも含まれます。 **Q: 実行の料金はどう決まりますか?** イベント課金制で、保存された行1件につき$0.001。正常に返されたレコード1件につき1回課金されます。maxItemsが行数、ひいてはコストの上限を決めます。 ## Output Example ```json { "itemType": "award", "title": "HT940216C0001 — HUMANA GOVERNMENT BUSINESS INC", "date": "2016-02-01", "awardId": "HT940216C0001", "generatedId": "CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-", "recipient": { "name": "HUMANA GOVERNMENT BUSINESS INC", "uei": "...", "duns": "..." }, "awardingAgency": "Department of Defense", "fundingAgency": "Department of Defense", "amount": 51269205263.03, "awardType": "IDV_B_C", "naics": { "code": "...", "description": "..." }, "placeOfPerformance": { "stateCode": "...", "state": "..." }, "awardTypeCodes": ["IDV_B_C"], "url": "https://www.usaspending.gov/award/CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-" } ``` ## Pricing イベント課金制:保存された**レコード1件につき$0.001**。正常に返された行1件につき1回課金されます。約1,000件の実行で約$1.00、`maxItems`が件数とコストの両方に上限を設けます。 ## Tips - **GovConの見込み客開拓には、まずNAICSまたはPSCコードから始めましょう。** 自社が提供する製品/サービスに直結し、最も的確な関連案件のセットが得られます。 - **個別の案件詳細を取得する前に`byCategory`モードを使いましょう。** 市場ごとの上位受給者や省庁をランキング形式で把握できます。 - **geographyモードは、日付範囲/案件タイプの組み合わせごとに最初のページ(最大100行)を返します。** 州/郡/選挙区の集計を得るには、`maxItems`を上げるよりもフィルタを絞り込みましょう。 --- # YouTube Subtitle & Transcript Scraper — JSON・SRT・VTT・LLM対応 - **URL:** https://proooxy.com/ja/tools/youtube-transcript-scraper/ - **種別:** tools - **説明:** 動画、Shorts、再生リスト、チャンネルからYouTubeの字幕・文字起こしを、JSON、SRT、VTT、プレーンテキスト、またはクリーンなLLM対応テキストとして抽出します。100以上の言語、豊富なメタデータに対応、APIキー不要——抽出に失敗した場合は課金されません。 - **概要:** YouTubeの文字起こしをJSON、SRT、VTT、またはLLM対応テキストで取得。 - **カテゴリ:** social - **技術スタック:** TypeScript, InnerTube - **マーケット/対応地域:** グローバル - **Apify掲載ページ:** https://apify.com/autofacts/youtube-subtitle-transcript-scraper - **キーワード:** YouTube 文字起こし スクレイパー, YouTube 字幕 API, YouTube 字幕 ダウンロード, YouTube 字幕 テキスト化, YouTube 文字起こし 一括取得, YouTube 文字起こし srt vtt, YouTube 文字起こし LLM活用 - **公開日:** 2026-07-01 - **更新日:** 2026-07-01 **主な機能:** - 1つの入力で動画、Shorts、youtu.beリンク、再生リスト、チャンネルに対応 — 1回の実行で混在指定可能 - 5種類の出力フォーマット — JSON(タイムスタンプ付き)、SRT、VTT、プレーンテキスト、LLM対応([Music]、[Applause]、話者ラベルを除去) - 優先順位付きの言語リストによる100以上の言語対応と、切り替え可能な自動字幕フォールバック - 豊富なメタデータ — タイトル、チャンネル、説明文、公開日、再生回数、サムネイル、長さ、対応言語 - maxVideos上限と1〜10の同時実行数で再生リスト・チャンネル全体を一括処理 - レジデンシャルプロキシ対応とオプションのCookie指定で、ボットチェックによるブロックを軽減 - 多層的な抽出処理 — InnerTubeクライアント間で最大9段階のフォールバックを備え、最終手段としてyt-dlpのPOトークンを使用 - サーキットブレーカーとアイテム単位のエラーハンドリングにより、大規模バッチも処理を継続 **活用例:** - 音声動画からRAGやファインチューニング用データセットを構築するAI/MLチーム(LLM対応テキスト出力) - 文字起こしをブログ記事、番組概要、SNSキャプションへ再利用するコンテンツチーム - インデックス登録やキーワード調査のために検索可能な動画テキストを抽出するSEOマーケター - 標準的なSRT/VTT字幕ファイルを必要とする編集者・パブリッシャー - チャンネルや再生リスト全体から文字起こしを一括収集する研究者 - YouTube APIキーなしで構造化されたタイムスタンプ付き字幕を必要とする開発者 **入力パラメータ:** - `urls` (array, 任意) — YouTubeのURLまたは裸のID — 動画、Shorts、youtu.beリンク、再生リスト、チャンネル。実行時に必須。 - `outputFormat` (string, 任意) — 文字起こしのフォーマット:json、srt、vtt、text、llmのいずれか(デフォルト:json)。 - `languages` (array, 任意) — 優先順に指定する字幕言語(ISO 639-1コード、デフォルト:en)。 - `includeAutoGenerated` (boolean, 任意) — 手動字幕がない場合に自動生成字幕へフォールバック(デフォルト:true)。 - `maxVideos` (number, 任意) — 1回の実行で処理する動画数の上限(再生リスト/チャンネル向け、デフォルト:0=無制限)。 - `maxConcurrency` (number, 任意) — 並列処理する動画数、1〜10(デフォルト:3)。 - `proxyConfiguration` (object, 任意) — プロキシ設定。デフォルトはUSに固定されたApify Residential。 - `youtubeCookies` (string, 任意) — ボットチェックによるブロックを軽減するオプションのYouTube Cookie(CookieヘッダーまたはCookies.txt)。 **よくある質問:** **Q: YouTube APIキーやログインは必要ですか?** いいえ。このアクターは字幕を直接抽出します——YouTube Data APIキーもログインも不要です。一部の動画で「ボットではないことを確認するためログインしてください」というブロックを軽減するために、オプションでCookieを指定できます。 **Q: 対応している言語と字幕タイプは?** 100以上の言語に対応しています。優先順位付きのISO 639-1コードのリストを指定してください(デフォルト:en)。このアクターは手動作成された字幕を優先し、includeAutoGeneratedを無効にしない限り自動生成字幕にフォールバックします。 **Q: 抽出に失敗した動画にも課金されますか?** いいえ。課金は「文字起こし抽出成功」という単一のイベント単位で行われ、文字起こしが正常に保存された場合にのみ発生します。失敗した動画は出力にerrorフィールド付きで表示されますが、課金対象にはなりません。 **Q: RAG向けのクリーンなLLM対応テキストを取得できますか?** はい。outputFormatを「llm」に設定すると、[Music]/[Applause]の注記や話者ラベルが除去され、エンベディングやファインチューニングに最適なクリーンな文章が生成されます。 ## Output Example ```json { "videoId": "dQw4w9WgXcQ", "url": "https://www.youtube.com/watch?v=dQw4w9WgXcQ", "title": "Rick Astley - Never Gonna Give You Up (Official Video)", "channelName": "Rick Astley", "channelId": "UCuAXFkgsw1L7xaCfnd5JJOw", "publishDate": "2009-10-25", "viewCount": 1761003712, "availableLanguages": ["en", "de-DE", "ja", "pt-BR", "es-419"], "language": "en", "isAutoGenerated": false, "duration": 213, "wordCount": 487, "segmentCount": 61, "text": "We're no strangers to love, you know the rules and so do I...", "segments": [{ "text": "We're no strangers to love", "start": 18.64, "end": 21.88 }], "error": null } ``` ## Pricing イベント課金制:**正常に抽出された文字起こし**1件につき1回課金されます——失敗した動画には一切課金されません。チャンネルや再生リストをまるごと渡しても、実際に取得できた字幕分だけの支払いで済みます。 ## Tips - **RAGやファインチューニングには`outputFormat: llm`を使いましょう。** 非音声の注記が除去され、エンベディングにはクリーンな文章が渡ります。 - **レジデンシャルプロキシは有効にしておきましょう。** YouTubeはデータセンターIPを積極的にブロックします。このアクターがデフォルトでUSレジデンシャルを使うのはそのためです。 - **大規模なジョブでは`maxConcurrency`を1〜3から始め**、徐々に上げていきましょう——大きなチャンネルのスクレイピングで同時実行数を上げすぎると、レート制限のリスクが高まります。 --- # Sephora Scraper(グローバル) - **URL:** https://proooxy.com/ja/tools/sephora-scraper/ - **種別:** tools - **説明:** 米国、カナダ、9つのEU市場、10のアジア太平洋市場——合計21店舗のSephoraから、バリアント・価格・画像・成分・レビューを含む完全な商品データを、単一の正規化スキーマで抽出するApifyアクターです。 - **概要:** あらゆるSephora店舗をスクレイピング——21市場を1つのアクターで。 - **カテゴリ:** ecommerce - **技術スタック:** Python, Crawlee, curl_cffi - **マーケット/対応地域:** アメリカ, カナダ, フランス, イタリア, ドイツ, スペイン, ポーランド, チェコ, ギリシャ, ルーマニア, ポルトガル, ニュージーランド, オーストラリア, シンガポール, マレーシア, タイ, インドネシア, フィリピン, 香港, 台湾, ブルネイ - **アンチボット対策:** レジデンシャルプロキシとcurl_cffiのTLSフィンガープリンティングによるAkamai回避 - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/sephora - **キーワード:** Sephora スクレイピング, Sephora 商品データ, Sephora API, Sephora 商品 取得, Sephora 価格トラッカー, 美容 商品データ, コスメ データ抽出, Sephora グローバル スクレイパー - **公開日:** 2026-04-18 - **更新日:** 2026-04-18 **主な機能:** - 1つのアクターで21店舗に対応 — 米国、カナダ、9つのEU市場、10のAPAC市場を単一のSKUでカバー - 市場の自動検出 — sephora.*のURLを貼り付けるだけで、ディスパッチャーが適切なモジュールへルーティング - 複数市場を混在させた実行 — US+EU+SEAのURLを1つのstartUrlsリストにまとめ、`market`タグ付きの単一データセットへストリーミング - ロケールに応じた正確な価格 — NZD、EUR、USD、AUDおよびその他17通貨を、Sephora自身のローカライゼーション層から返却 - 正規化されたスキーマ — すべての市場が同じ`source / brand / title / options / variants / medias / stats`構造で出力 - 市場ごとのセッション分離 — 認証状態がリージョン間で混線することはありません - グローバルサーキットブレーカー — 50回連続で失敗すると実行を中断し、ダウンしたターゲットへの無駄な計算リソース消費を回避 **活用例:** - 米国・EU・APACの美容市場を横断する地域間価格インテリジェンス - 市場横断での商品在庫・品揃えモニタリング - 新たなSephora地域に進出するブランド向けの競合分析 - 地域別処方における成分比較 - レビュー・評価のトラッキング — SEAのウィッシュリストシグナルや米国のAIセンチメント要約を含む - 市場ごとのロイヤルティ/会員価格監査 **入力パラメータ:** - `startUrls` (array, 必須) — 任意のsephora.*店舗の商品またはカテゴリURL。市場はホスト名から自動検出されます。 - `market` (string, 任意) — 市場を上書き指定するオプション項目(us、eu-fr、eu-it、eu-de、eu-es、eu-pl、eu-cz、eu-gr、eu-ro、eu-pt、sea-nz、sea-au、sea-sg、sea-my、sea-th、sea-id、sea-ph、sea-hk、sea-tw、sea-bn)。 - `locale` (string, 任意) — オプションのBCP 47ロケール(例:fr-FR、en-NZ) — 市場のデフォルト設定を上書きします。 - `categoryIds` (array, 任意) — EU限定。C479のようなSFCCカテゴリID — カテゴリURLを貼り付ける代わりに使用できます。 - `proxy` (object, 任意) — Apifyプロキシ設定。レジデンシャルを強く推奨。apifyProxyCountryを対象市場に固定してください。 - `maxConcurrency` (number, 任意) — 同時実行リクエスト数。デフォルト5。US:2〜5。EU:3。SEA:8〜16。 - `maxRequestsPerCrawl` (number, 任意) — 全市場共通のグローバルな上限値。0=無制限。 **よくある質問:** **Q: このスクレイパーが対応しているSephora店舗はどこですか?** 21店舗:米国(sephora.com)、カナダ(sephora.ca)、9つのEU市場(フランス、イタリア、ドイツ、スペイン、ポーランド、チェコ、ギリシャ、ルーマニア、ポルトガル)、10のAPAC市場(ニュージーランド、オーストラリア、シンガポール、マレーシア、タイ、インドネシア、フィリピン、香港、台湾、ブルネイ)です。市場はホスト名から自動検出されるため、複数市場を混在させる場合も入力の変更は不要です。 **Q: 1回の実行で複数の市場をスクレイピングできますか?** はい。sephora.com、sephora.fr、sephora.nzのURLを1つのstartUrlsリストに混在させてください。ディスパッチャーが市場ごとにグループ化し、各モジュールを市場に適した認証で並列実行し、すべてのデータセットアイテムに`market`フィールドを付与します。 **Q: アンチボット対策にはどう対応していますか?** 全市場でレジデンシャルプロキシを使用し、EUとSEAのトラフィックにはcurl_cffiによるブラウザ品質のTLSフィンガープリンティングを用いてAkamaiを回避します。米国のトラフィックは、403/429でローテーションするセッションプールを備えたCrawleeのHttpCrawlerを使用します。 **Q: 既存のv1.x US実行設定はそのまま使えますか?** はい。2.0より前の入力——startUrls、maxConcurrency、proxy、maxRequestsPerCrawl——は同一の挙動をします。出力の変更点は、すべてのアイテムに新たな`market`キーが追加される点のみで、これは後方互換性のある追加的な変更です。 **Q: SEAデータで一部のフィールドがnullになるのはなぜですか?** Sephora SEAのAPIは`lovesCount`カウンターを公開していないため、APACのアイテムでは`stats.lovesCount = null`になります。代わりに、各バリアントにはboolean型の`wishlisted`フィールドがあります。逆に、`sentiments`(AIによるレビュー要約)と`source.crawlUrl`は米国限定です。 **Q: 市場ごとに個別のAPIトークンやアカウントが必要ですか?** いいえ。既存のApify APIトークンをそのまま使用できます。市場ごとのゲストトークンはアクター内部で処理されます——EU/SEAでは認証情報は不要で、米国は標準のApifyレジデンシャルプロキシで動作します。 ## Supported markets | 地域 | マーケットID | 国 | 通貨 | ホスト名 | |---|---|---|---|---| | 南北アメリカ | `us` | United States | USD | sephora.com | | 南北アメリカ | `us` | Canada | CAD | sephora.ca | | EU | `eu-fr` | France | EUR | sephora.fr | | EU | `eu-it` | Italy | EUR | sephora.it | | EU | `eu-de` | Germany | EUR | sephora.de | | EU | `eu-es` | Spain | EUR | sephora.es | | EU | `eu-pl` | Poland | PLN | sephora.pl | | EU | `eu-cz` | Czech Republic | CZK | sephora.cz | | EU | `eu-gr` | Greece | EUR | sephora.gr | | EU | `eu-ro` | Romania | RON | sephora.ro | | EU | `eu-pt` | Portugal | EUR | sephora.pt | | APAC | `sea-nz` | New Zealand | NZD | sephora.nz | | APAC | `sea-au` | Australia | AUD | sephora.com.au | | APAC | `sea-sg` | Singapore | SGD | sephora.sg | | APAC | `sea-my` | Malaysia | MYR | sephora.com.my | | APAC | `sea-th` | Thailand | THB | sephora.co.th | | APAC | `sea-id` | Indonesia | IDR | sephora.co.id | | APAC | `sea-ph` | Philippines | PHP | sephora.ph | | APAC | `sea-hk` | Hong Kong | HKD | sephora.hk | | APAC | `sea-tw` | Taiwan | TWD | sephora.tw | | APAC | `sea-bn` | Brunei | BND | sephora.bn | ## Output Example ```json { "market": "sea-nz", "source": { "id": 58792, "canonicalUrl": "https://www.sephora.nz/products/rare-beauty-true-to-myself-natural-matte-longwear-foundation", "retailer": "SEPHORA", "currency": "NZD" }, "brand": "Rare Beauty", "title": "True To Myself Natural Matte Longwear Foundation", "description": "

A self-priming and self-setting foundation...

", "ingredients": "Aqua/Water, Cyclopentasiloxane, Glycerin...", "currentSku": "770225", "categories": ["makeup/face/foundation"], "options": [ { "name": "shade", "id": "66488", "values": [{"value": "1 Fair Neutral", "orderable": true}] } ], "variants": [ { "id": "276343", "sku": "770225", "price": { "current": 77.0, "original": 77.0, "stockStatus": "IN_STOCK" }, "options": [{"name": "shade", "value": "1 Fair Neutral"}], "highlights": ["NEW", "Only at Sephora"], "wishlisted": null } ], "medias": [{ "url": "https://www.sephora.nz/.../foundation-shade.jpg", "type": "image" }], "stats": { "reviewCount": 971, "rating": 4.8, "lovesCount": null } } ``` ## Tips - **プロキシの国を対象市場に固定しましょう。** 国が一致しないレジデンシャル出口は、SephoraのAkamai層による403エラーの最大の原因です。`apifyProxyCountry`を店舗のISOコード(`US`、`FR`、`NZ`など)に設定してください。 - **まずはスモークテストを。** 新しい市場での本番実行前に`maxRequestsPerCrawl=10`を設定して試しましょう。 - **同時実行数はリージョンごとに調整しましょう。** US:2〜5。EU:3。SEA:8〜16。混在実行では、各市場が独自のセマフォを持ちます。 --- # Boohoo Scraper — 7地域の商品データを取得 - **URL:** https://proooxy.com/ja/tools/boohoo-scraper/ - **種別:** tools - **説明:** 自動ページネーション、ファセットフィルタ、多通貨対応で、7地域のBoohoo ECサイトから商品データを抽出します。 - **概要:** 7つの地域別ストアからBoohooの商品データをスクレイピング。 - **カテゴリ:** ecommerce - **技術スタック:** TypeScript, Cheerio, Fingerprint Generator - **マーケット/対応地域:** オランダ, スウェーデン, イギリス, アイルランド, フランス, オーストラリア, アメリカ - **アンチボット対策:** アンチボット回避のためのフィンガープリント生成 - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/boohoo-scraper - **キーワード:** Boohoo スクレイピング, Boohoo 商品データ, Boohoo 価格 モニタリング, ファストファッション スクレイパー, ファッション カタログ データ, 多地域 ファッション データ - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - 7地域のストアに対応 — オランダ(EUR)、スウェーデン(SEK)、イギリス(GBP)、アイルランド(EUR)、フランス(EUR)、オーストラリア(AUD)、アメリカ(USD) - 自動ページネーション付きのカテゴリ・検索スクレイピング - ファセットフィルタ対応 — サイズ、カラー、価格帯、スタイル - バリアントや在庫状況を含む詳細な商品情報 - アンチボット回避のためのブラウザフィンガープリント生成 - 地域別ストアに応じた多通貨での価格表示 **活用例:** - ファストファッションの競合価格分析 - 同一商品の多地域価格比較 - 手頃な価格帯のファッショントレンドモニタリング - 地域横断での在庫トラッキング - 欧州およびグローバル市場を対象としたファッション市場調査 **入力パラメータ:** - `startUrls` (array, 必須) — BoohooのURL(商品ページまたはカテゴリページ) - `maxRequestsPerCrawl` (number, 任意) — リクエスト数の上限(デフォルト:5) - `maxConcurrency` (number, 任意) — 並列リクエスト数(デフォルト:5) - `proxy` (object, 任意) — プロキシ設定 **よくある質問:** **Q: 対応している地域別Boohooストアはどれですか?** オランダ(EUR)、スウェーデン(SEK)、イギリス(GBP)、アイルランド(EUR)、フランス(EUR)、オーストラリア(AUD)、アメリカ(USD)です。 **Q: サイズやカラーで商品をフィルタできますか?** はい、このスクレイパーはファセットフィルタに対応しています。フィルタ適用済みのカテゴリURLを渡せば、そのフィルタ条件がそのまま反映されます。 **Q: ページネーションはどのように処理されますか?** ページネーションは自動で処理されます。カテゴリまたは検索URLを渡せば、すべてのページネーションリンクを辿ってすべての商品を抽出します。 ## Output Example ```json { "source": "https://www.boohoo.com/...", "brand": "boohoo", "title": "Oversized Hoodie", "description": "Stay cozy in this oversized hoodie...", "categories": ["Women", "Hoodies & Sweatshirts"], "price": { "current": 1500, "original": 3000, "currency": "GBP" }, "variants": [ { "sku": "BH-OH-BLK-S", "size": "S", "color": "Black", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Farfetch Scraper — ラグジュアリーファッション商品データを取得 - **URL:** https://proooxy.com/ja/tools/farfetch-scraper/ - **種別:** tools - **説明:** Farfetchからラグジュアリーファッションの商品データを抽出——多通貨価格、サイズ/フィットバリエーション、商品レコメンデーションを含みます。 - **概要:** 多通貨対応でFarfetchのラグジュアリーファッション商品をスクレイピング。 - **カテゴリ:** ecommerce - **技術スタック:** TypeScript, Cheerio, Crawlee - **マーケット/対応地域:** グローバル - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/farfetch - **キーワード:** Farfetch スクレイピング, Farfetch 商品データ, ラグジュアリーファッション データ, デザイナーズファッション スクレイパー, Farfetch 価格モニタリング, 高級品 小売データ - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - カテゴリページと商品詳細ページのスクレイピング - 多通貨価格 — プロキシの所在地に基づき自動検出 - サイズ/フィットバリエーションのオプション抽出 - 商品ごとに最大90件のレコメンデーション商品 - 完全なメディアギャラリーと詳細な商品説明 - ブランド、カテゴリ、追加情報の抽出 **活用例:** - ラグジュアリーファッション市場インテリジェンス - デザイナーズブランドのプラットフォーム横断価格比較 - ファッショントレンド分析と商品発見 - マルチブランド小売業者向けの競合価格分析 - 商品レコメンデーションエンジン向けの学習データ **入力パラメータ:** - `startUrls` (array, 必須) — FarfetchのURL(商品ページまたはカテゴリページ) - `proxy` (object, 任意) — プロキシ設定 — 所在地が通貨に影響します - `maxRequestsPerCrawl` (number, 任意) — リクエスト数の上限(デフォルト:100) - `maxConcurrency` (number, 任意) — 並列リクエスト数(デフォルト:5) - `withSizeFit` (boolean, 任意) — サイズ/フィットデータを含める(デフォルト:false) - `withRecommends` (boolean, 任意) — レコメンデーションを含める(デフォルト:false) **よくある質問:** **Q: 多通貨価格はどのように機能しますか?** Farfetchは所在地に基づいて価格を表示します。このスクレイパーはプロキシの所在地を使って返される通貨を決定します。USDにはUSプロキシ、GBPにはUKプロキシを使用してください。 **Q: レコメンデーション商品は何件まで抽出できますか?** withRecommendsを有効にすると、商品ごとに最大90件のレコメンデーション商品を抽出できます。商品グラフやレコメンデーションデータセットの構築に役立ちます。 ## Output Example ```json { "source": "https://www.farfetch.com/shopping/...", "brand": "Gucci", "title": "GG Marmont Matelasse Shoulder Bag", "description": "Crafted from matelasse leather...", "details": ["Made in Italy", "100% Calf Leather"], "categories": ["Women", "Bags", "Shoulder Bags"], "options": [ { "name": "Size", "values": ["One Size"] } ], "variants": [ { "sku": "FF-GU-001", "price": 229000, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Global API Load Tester — 10K+ RPSのストレステスト - **URL:** https://proooxy.com/ja/tools/load-tester/ - **種別:** tools - **説明:** 秒間10,000リクエスト超をシミュレートする高性能負荷テストツール。地理分散トラフィック、重み付きターゲット、インタラクティブなHTMLレポートに対応。 - **概要:** 地理分散負荷テストで10K+ RPSをシミュレート。 - **カテゴリ:** utility - **技術スタック:** Go, Vegeta - **マーケット/対応地域:** グローバル - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/global-api-load-tester - **キーワード:** API 負荷テスト ツール, HTTP 負荷テスト, ストレステスト ツール, パフォーマンステスト ツール, 負荷テスト 10k rps, 地理分散 負荷テスト, Vegeta 負荷テスト - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - 圧倒的な性能 — 秒間10,000リクエスト超 - 米国・欧州・アジアからの地理分散テスト - 重み付けされた複数ターゲットへの負荷生成(例:読み取り90%/書き込み10%) - 現実的なトラフィックを再現するレジデンシャルプロキシ対応 - Coordinated Omissionを防ぐ一定レートのペーシング - Vegeta PlotsによるインタラクティブなHTMLレポート - 詳細なレイテンシ・スループット・エラーメトリクス **活用例:** - リリース前のAPIパフォーマンスベンチマーク - キャパシティプランニングとインフラのサイジング - 限界点とボトルネックの特定 - CDNとロードバランサー設定のテスト - 地理分散レイテンシテスト - パフォーマンスが重要なエンドポイントのリグレッションテスト **入力パラメータ:** - `targets` (array, 必須) — URL、メソッド、ボディ、ヘッダー、重みを含むターゲットエンドポイント - `rate` (number, 任意) — 秒間リクエスト数(デフォルト:50) - `duration` (number, 任意) — テスト実行時間(秒)(デフォルト:60) - `geoDistribution` (array, 任意) — 国コードとトラフィック重みを指定したリージョン - `useStickySessions` (boolean, 任意) — セッションアフィニティを維持する(デフォルト:true) - `maxCostLimit` (number, 任意) — テスト実行のコスト上限 **よくある質問:** **Q: 地理分散テストはどのように機能しますか?** 国コードとトラフィックの重みを指定します。このツールは該当リージョンのApifyプロキシサーバーにリクエストを分散させ、現実的なグローバルトラフィックパターンをシミュレートします。 **Q: Coordinated Omissionとは何ですか?** 負荷テストにおける典型的な落とし穴で、対象システムが過負荷になるとツール自体の速度が落ち、実際より良い結果に見えてしまう現象です。Vegetaは一定レートのペーシングによってこれを回避します。 **Q: 認証が必要なエンドポイントもテストできますか?** はい、ターゲット設定に認証ヘッダーを含めてください。各ターゲットは独自のヘッダー、メソッド、ボディを持てます。 ## Output Example このロードテスターは、インタラクティブなHTMLレポートと構造化されたメトリクスを生成します。 ```json { "summary": { "totalRequests": 50000, "duration": "60s", "rps": 833.33, "successRate": 99.8, "latency": { "mean": "12.4ms", "p50": "10.1ms", "p95": "28.7ms", "p99": "89.2ms", "max": "342.1ms" }, "statusCodes": { "200": 49900, "503": 100 } } } ``` --- # Lululemon Scraper — 商品・バリアント・価格データを取得 - **URL:** https://proooxy.com/ja/tools/lululemon-scraper/ - **種別:** tools - **説明:** Lululemonをクロールし、バリアントデータ、カラーオプション、メディアギャラリー、価格情報を含む商品詳細を抽出します。 - **概要:** Lululemonからバリアントとメディア付きの商品データを抽出。 - **カテゴリ:** ecommerce - **技術スタック:** TypeScript, Crawlee - **マーケット/対応地域:** アメリカ - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/lululemon-scraper - **キーワード:** Lululemon スクレイピング, Lululemon 商品データ, Lululemon 価格トラッカー, アクティブウェア 商品データ, アスレジャー 価格データ, Lululemon 在庫スクレイパー - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - カテゴリページと商品ページのクロール - カラー・サイズオプション付きのバリアント抽出 - カラー別画像を含む完全なメディアギャラリー - 構造化された出力による価格トラッキング - カテゴリ階層の抽出 - Crawleeフレームワークによる軽量・高速動作 **活用例:** - アクティブウェア市場調査と競合分析 - リセラーや比較プラットフォーム向けの価格モニタリング - フィットネスEC向けの商品カタログ集約 - カラー・サイズの在庫状況トラッキング - アクティブウェアファッションのトレンド分析 **入力パラメータ:** - `startUrls` (array, 必須) — LululemonのURL(商品ページまたはカテゴリページ) - `proxy` (object, 任意) — プロキシ設定 - `maxConcurrency` (number, 任意) — 並列リクエスト数の上限 **よくある質問:** **Q: 異なるカラーバリアントにも対応していますか?** はい、各カラーバリアントはそれぞれ独自の画像、SKU、在庫状況とともに抽出されます。メディアギャラリーもカラーごとに分かれています。 **Q: Lululemonのカテゴリ全体をスクレイピングできますか?** はい、カテゴリURLを渡せば、そのカテゴリ内のすべての商品をクロールします。 ## Output Example ```json { "source": "https://shop.lululemon.com/p/...", "brand": "lululemon", "title": "Align High-Rise Pant 25\"", "description": "Buttery-soft, weightless Nulu fabric...", "categories": ["Women", "Pants", "Yoga Pants"], "options": [ { "name": "Color", "values": ["Black", "True Navy", "Dark Olive"] }, { "name": "Size", "values": ["2", "4", "6", "8", "10", "12"] } ], "variants": [ { "sku": "LL-AHR-BLK-6", "name": "Black / 6", "price": 9800, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://...", "color": "Black" } ], "stats": { "rating": 4.7, "reviewCount": 15234 } } ``` --- # Schema Markup Scraper — 構造化データ抽出とSEO監査 - **URL:** https://proooxy.com/ja/tools/schema-markup-scraper/ - **種別:** tools - **説明:** あらゆるURLからJSON-LD、Microdata、RDFa、Open Graph、Twitter Cardsを抽出し、総合的なSEO監査スコアリングを行います。 - **概要:** あらゆるWebサイトの構造化データを抽出し、SEOを監査。 - **カテゴリ:** utility - **技術スタック:** TypeScript, Crawlee - **マーケット/対応地域:** グローバル - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/metadata-scraper - **キーワード:** 構造化データ チェッカー, 構造化データ 抽出ツール, JSON-LD 抽出, SEO監査 ツール, Open Graph チェッカー, Microdata スクレイパー, リッチリザルト テスト - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - 構造化データ抽出 — JSON-LD、Microdata、RDFa - ソーシャルメタタグ — Open Graph、Twitter Cards、Dublin Core - 0〜100点のスコアリングによるSEO分析 - 正規URLとhreflangの検証 - EEATシグナルのための著者情報抽出 - 80種類以上のサブタイプに対応したLocalBusiness検出 - 画像alt属性の監査 - パンくずリストのスキーマ検証 - ジオタグとNAP(店舗名・住所・電話番号)の抽出 **活用例:** - 大規模なテクニカルSEO監査 - Webサイトの構造化データ検証 - 競合SEO分析 — 競合サイト間のスキーママークアップ比較 - コンテンツサイト向けEEATシグナル評価 - 企業向けローカルSEO監査 - 公開前のSEOチェックリスト検証 **入力パラメータ:** - `startUrls` (array, 必須) — 分析対象のURL - `proxy` (object, 任意) — プロキシ設定 - `maxRequestsPerCrawl` (number, 任意) — 監査するURLの総数上限 - `maxConcurrency` (number, 任意) — 並列リクエスト数 - `extractMetaTags` (boolean, 任意) — メタタグを抽出(デフォルト:true) - `extractSeoAnalysis` (boolean, 任意) — SEO分析を実行(デフォルト:true) - `computeSeoScore` (boolean, 任意) — 0〜100点のSEOスコアを算出(デフォルト:true) - `extractGeoData` (boolean, 任意) — ジオタグとNAPデータを抽出 **よくある質問:** **Q: 対応している構造化データ形式は?** JSON-LD、Microdata、RDFaです。加えて、Open Graph、Twitter Cards、Dublin Coreのメタデータも抽出します。 **Q: SEOスコアはどのように算出されますか?** 0〜100点のスコアは、titleタグ、メタディスクリプション、見出し階層、画像alt属性、正規URL、モバイルビューポート、構造化データの有無などを評価して算出されます。 **Q: 複数ページを一度に監査できますか?** はい、startUrlsに複数のURLを指定してください。並列処理により高速な一括監査が可能です。 ## Output Example ```json { "url": "https://example.com/product/...", "title": "Example Product Page", "linkedData": [ { "@type": "Product", "name": "..." } ], "openGraph": { "og:title": "Example Product", "og:type": "product" }, "twitterCard": { "card": "summary_large_image" }, "seoAudit": { "score": 78, "issues": [ "Missing alt text on 3 images", "No hreflang tags detected" ] }, "headings": { "h1": ["Example Product"], "h2": ["Description", "Reviews"] } } ``` --- # Sephora EU Scraper — 欧州9市場の商品データを取得 - **URL:** https://proooxy.com/ja/tools/sephora-eu-scraper/ - **種別:** tools - **説明:** マルチバリアント抽出、Akamai WAF回避、スマートトークン管理により、欧州9つのEU市場のSephoraから完全な商品データをスクレイピングします。 - **概要:** 欧州9市場のSephoraから商品データを抽出。 - **カテゴリ:** ecommerce - **技術スタック:** TypeScript, Crawlee, Akamai Bypass - **マーケット/対応地域:** フランス, イタリア, ドイツ, スペイン, ポーランド, チェコ, ギリシャ, ルーマニア, ポルトガル - **アンチボット対策:** Akamai WAF — ブラウザ品質のTLSフィンガープリンティング - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/sephora-eu-scraper - **キーワード:** Sephora ヨーロッパ スクレイピング, Sephora EU 商品データ, ヨーロッパ 美容データ, Sephora フランス スクレイパー, Sephora ドイツ スクレイパー, ヨーロッパ コスメ データ, Akamai WAF 回避 - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - EU9市場に対応 — フランス、イタリア、ドイツ、スペイン、ポーランド、チェコ、ギリシャ、ルーマニア、ポルトガル - 個別の価格・在庫状況を含むマルチバリアント抽出 - 商品ごとの高解像度画像ギャラリー - カテゴリIDによる一括抽出向けカテゴリブラウジング - Akamai WAFを回避するブラウザ品質のTLSフィンガープリンティング - 自動リフレッシュと指数バックオフによるゲストトークン管理 **活用例:** - 汎欧州の美容市場価格比較 - 市場横断での商品在庫モニタリング - 美容ブランドのEU市場展開リサーチ - 欧州市場全体での競合インテリジェンス - 地域別価格戦略分析 **入力パラメータ:** - `startUrls` (array, 任意) — スクレイピング対象のSephora EU商品URL - `categoryIds` (array, 任意) — 一括商品抽出用のカテゴリID - `locale` (string, 任意) — 対象市場のロケール(例:fr-FR、it-IT) - `maxProducts` (number, 任意) — 抽出する商品数の上限 - `maxConcurrency` (number, 任意) — 並列リクエスト数の上限 - `proxyConfiguration` (object, 任意) — プロキシ設定 — レジデンシャルを推奨 **よくある質問:** **Q: 対応している欧州のSephora市場はどこですか?** フランス(fr-FR)、イタリア(it-IT)、ドイツ(de-DE)、スペイン(es-ES)、ポーランド(pl-PL)、チェコ(cs-CZ)、ギリシャ(el-GR)、ルーマニア(ro-RO)、ポルトガル(pt-PT)です。 **Q: このスクレイパーはどのようにAkamai WAFを回避しますか?** ブラウザ品質のTLSフィンガープリンティングを使い、実際のブラウザ接続を模倣することで、リクエストを本物のユーザートラフィックと区別できないようにしています。 **Q: カテゴリ全体をスクレイピングできますか?** はい、カテゴリIDを指定すれば、そのカテゴリ内のすべての商品を抽出できます。一括抽出を行う最も効率的な方法です。 ## Output Example ```json { "source": "https://www.sephora.fr/p/...", "brand": "Rare Beauty", "title": "Soft Pinch Liquid Blush", "description": "Un blush liquide longue tenue...", "shortDescription": "Blush liquide", "categories": ["Maquillage", "Teint", "Blush"], "options": [ { "name": "Shade", "values": ["Joy", "Hope", "Grace"] } ], "variants": [ { "sku": "EU-RB-001", "name": "Joy", "price": 2800, "currency": "EUR", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ], "stats": { "rating": 4.7, "reviewCount": 3421 } } ``` --- # Shopify Scraper — あらゆるストアの商品データを取得 - **URL:** https://proooxy.com/ja/tools/shopify-scraper/ - **種別:** tools - **説明:** Shopifyを利用するあらゆるストアから、コレクション・検索・商品レコメンデーションを含む高精度な商品データを抽出するプロフェッショナル品質のツールです。 - **概要:** あらゆるShopifyストアから商品データを抽出。 - **カテゴリ:** ecommerce - **技術スタック:** TypeScript, got-scraping - **マーケット/対応地域:** グローバル - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/shopify-scraper-ppe - **キーワード:** Shopify スクレイピング, Shopify 商品 スクレイパー, Shopify ストア データ取得, Shopify 商品データ, Shopify API 代替, EC データ抽出, Shopify 商品 エクスポート, Shopify コレクション スクレイパー - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - 汎用性 — Shopifyを利用するあらゆるストアで動作 - ストア全体のカタログ抽出と検索に対応 - 商品レコメンデーション(商品ごとに最大20件) - コレクションおよび個別商品のスクレイピング - タグとカテゴリの抽出 - 精度確保のための通貨正規化(価格を100倍) **活用例:** - あらゆるニッチのShopifyストアを対象とした市場調査 - DTCブランド向けの競合分析 - 比較プラットフォーム向けの商品カタログ集約 - 独立系ECストア全体のトレンドモニタリング - 商品レコメンデーションデータセットの構築 - リセラー向けの価格モニタリング **入力パラメータ:** - `startUrls` (array, 必須) — ShopifyストアのURL — 商品ページ、コレクション、またはストアのトップページ - `proxy` (object, 任意) — 最良の結果を得るにはレジデンシャルプロキシを推奨 - `maxRequestsPerCrawl` (number, 任意) — リクエスト数の上限(デフォルト:100) - `maxRecommendationsPerProduct` (number, 任意) — 取得するレコメンデーション商品数(デフォルト:0、最大:20) - `query` (string, 任意) — ストア内で商品を検索するための検索クエリ **よくある質問:** **Q: どのShopifyストアでも使えますか?** はい、Shopifyを利用しているストアであればどこでも動作します。全ストアで共通のShopify標準の商品データ構造を活用しています。 **Q: 特定の商品を検索できますか?** はい、queryパラメータを使えば特定のストア内を検索できます。カタログ全体をスクレイピングせずに特定の商品タイプを探すのに便利です。 **Q: 商品レコメンデーションはどのように抽出されますか?** maxRecommendationsPerProductを設定すると、関連商品を取得できます。商品ごとに最大20件のレコメンデーションが取得可能で、商品グラフの構築に役立ちます。 ## Output Example ```json { "source": "https://store.example.com/products/...", "brand": "Example Brand", "title": "Premium Organic Cotton T-Shirt", "description": "Made from 100% organic cotton...", "categories": ["Tops", "T-Shirts"], "tags": ["organic", "sustainable", "cotton"], "options": [ { "name": "Size", "values": ["S", "M", "L", "XL"] }, { "name": "Color", "values": ["White", "Black", "Navy"] } ], "variants": [ { "sku": "SHOP-OCT-WHT-M", "name": "White / M", "price": 4500, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Ulta Beauty Scraper — 商品・価格・SKUデータを取得 - **URL:** https://proooxy.com/ja/tools/ulta-scraper/ - **種別:** tools - **説明:** Ulta Beautyから、カテゴリページ・ブランドページ・セールセクションを含む商品詳細、価格、画像、SKU情報を抽出します。 - **概要:** Ulta Beautyから完全な商品データをスクレイピング。 - **カテゴリ:** ecommerce - **技術スタック:** TypeScript, Cheerio, Crawlee - **マーケット/対応地域:** アメリカ - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/ulta-scraper - **キーワード:** Ulta スクレイピング, Ulta Beauty スクレイパー, Ulta 商品データ, Ulta 価格トラッカー, Ulta SKU スクレイパー, Ulta セール モニタリング, 美容 小売データ - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - カテゴリ・商品詳細・ブランド・セールページに対応 - 価格・商品説明・画像を含む詳細な商品情報 - バリアントをグループ化したSKUレベルのデータ抽出 - URLからのページタイプ自動検出 - 軽量なCheerioベースの高速パース処理 - 関連するSKUを同一商品としてグループ化 **活用例:** - 美容業界の競合分析 — Ulta対Sephoraの価格比較 - 比較ショッピングプラットフォーム向けの商品カタログ構築 - セール・プロモーションモニタリング - ブランド発見と市場プレゼンストラッキング - SKUレベルの在庫モニタリング **入力パラメータ:** - `startUrls` (array, 必須) — UltaのURL(商品・カテゴリ・ブランド・セールページ) - `proxy` (object, 任意) — プロキシ設定 - `maxConcurrency` (number, 任意) — 並列リクエスト数の上限 - `maxRequestsPerCrawl` (number, 任意) — 実行あたりの総リクエスト数の上限 **よくある質問:** **Q: Ultaのどのページタイプをスクレイピングできますか?** このスクレイパーは商品詳細ページ、カテゴリ一覧ページ、ブランドページ、セール/プロモーションページに対応しています。ページタイプはURLから自動検出されます。 **Q: 商品バリアントはどのように扱われますか?** バリアント(異なるシェードやサイズ)は、同じ親商品の下にグループ化されます。各バリアントは独自のSKU、価格、在庫状況を持ちます。 ## Output Example ```json { "source": "https://www.ulta.com/p/...", "brand": "NYX Professional Makeup", "title": "Butter Gloss", "description": "A buttery soft and silky lip gloss...", "categories": ["Makeup", "Lips", "Lip Gloss"], "variants": [ { "sku": "ULTA-NYX-BG-001", "name": "Angel Food Cake", "price": 900, "currency": "USD", "inStock": true } ], "stats": { "rating": 4.5, "reviewCount": 8932 } } ``` --- # Universal Web Printer — URL・HTMLをPDF/画像に変換 - **URL:** https://proooxy.com/ja/tools/web-printer/ - **種別:** tools - **説明:** スマートスクロールスティッチ、要素抽出、PDF暗号化、透かし機能を備え、あらゆるURLやHTMLをPDF、PNG、JPEG、WebPに変換します。 - **概要:** URLやHTMLをPDF、PNG、JPEG、WebPに変換。 - **カテゴリ:** utility - **技術スタック:** TypeScript, Playwright, PDF-lib, Sharp - **マーケット/対応地域:** グローバル - **公表されている成功率:** >99% - **Apify掲載ページ:** https://apify.com/autofacts/universal-web-printer - **キーワード:** HTML PDF変換 API, URL PDF変換ツール, Webサイト スクリーンショット API, Webページ PDF化, URL 画像変換, Webページ PNG化, PDF生成 API - **公開日:** 2026-04-04 - **更新日:** 2026-04-04 **主な機能:** - マルチフォーマット出力 — PDF、PNG、JPEG、WebP - 複数の表示モード — ビューポート、フルページ、CSSセレクタ、リーダビリティ - 正確なフルページキャプチャのためのスマートスクロールスティッチ - CSSセレクタによる要素レベルの抽出 - ページ操作 — 要素の削除、ボタンのクリック、CSSの注入、固定ヘッダーの非表示 - PDF暗号化(RC4 128ビット)と透かし - 複数ページ文書のPDF結合 - カスタムビューポートとスケールファクターの設定 **活用例:** - Webダッシュボードからの自動レポート生成 - Webサイトのアーカイブとドキュメント化 - ビジュアルリグレッションテスト用スナップショット - カタログ向けのEC商品ページスクリーンショット - 法令順守 — Webコンテンツを証拠として保存 - WebアプリケーションからのPDF生成 **入力パラメータ:** - `startUrls` (array, 任意) — レンダリング対象のURL - `htmlContent` (string, 任意) — レンダリングする生のHTML - `outputFormat` (string, 任意) — pdf、png、jpeg、webpのいずれか(デフォルト:pdf) - `viewMode` (string, 任意) — viewport、fullPage、selector、readabilityのいずれか - `targetSelector` (string, 任意) — 要素レベルキャプチャ用のCSSセレクタ - `viewportWidth` (number, 任意) — ブラウザのビューポート幅(デフォルト:1280) - `viewportHeight` (number, 任意) — ブラウザのビューポート高さ(デフォルト:720) - `removeSelectors` (array, 任意) — キャプチャ前に削除する要素のCSSセレクタ - `pdfPassword` (string, 任意) — RC4 128ビット暗号化でPDFを暗号化 **よくある質問:** **Q: ページ内の特定の要素だけをキャプチャできますか?** はい、targetSelectorパラメータにCSSセレクタを指定すれば、特定の要素だけをキャプチャできます。例えば'#main-content'を指定すれば、メインコンテンツ領域のみをキャプチャできます。 **Q: スマートスクロールスティッチはどのように機能しますか?** フルページキャプチャの場合、このツールはページを段階的にスクロールしながら各ビューポート分のスライスをキャプチャし、それらを結合します。これにより、遅延読み込みされるコンテンツやアニメーションも確実にキャプチャされます。 **Q: キャプチャ前にCookieバナーや広告を削除できますか?** はい、removeSelectorsで削除したい要素のCSSセレクタを指定してください。hideFixedElementsを使えば、固定ヘッダーやフローティング要素を非表示にすることもできます。 ## Output Example このツールは選択したフォーマット(PDF、PNG、JPEG、WebP)でファイルを生成し、Apifyデータセットに保存します。各出力にはメタデータが含まれます。 ```json { "url": "https://example.com", "format": "pdf", "fileName": "example-com.pdf", "fileSize": 245832, "viewMode": "fullPage", "viewport": { "width": 1280, "height": 720 }, "encrypted": false } ``` --- # 2026年版 Webスクレイピングのベストプラクティス:実践者のガイド - **URL:** https://proooxy.com/ja/blog/web-scraping-best-practices-2026/ - **種別:** blog - **説明:** 12年以上の実運用経験から得られた、実戦で鍛えられたWebスクレイピング戦略——アーキテクチャパターン、エラーハンドリング、プロキシ管理、出力の正規化について解説します。 - **キーワード:** Webスクレイピング ベストプラクティス, 本番環境 スクレイピング, データ抽出 ガイド, スクレイパー アーキテクチャ設計 - **公開日:** 2026-04-01 - **更新日:** 2026-04-01 3,100人を超えるユーザーに成功率99%超でサービスを提供する、15のプロダクションスクレイパーを構築・保守してきた経験から、本当に重要なプラクティスをまとめました。 ## アーキテクチャ:スクリプトではなくパイプラインとして考える よくある最大の過ちは、スクレイピングを単一ステップの処理として扱ってしまうことです。プロダクションスクレイパーはデータパイプラインです。 1. **URL探索** — 何をスクレイピングするかを見つける(サイトマップ、カテゴリページ、検索、API) 2. **リクエスト実行** — 適切なリトライとローテーションでデータを取得する 3. **パース** — 生のレスポンスから構造化フィールドを抽出する 4. **正規化** — 出力をクリーンアップ・検証・標準化する 5. **保存** — データセット、データベース、または下流システムへ送信する 各ステップは独立してテスト・リトライ可能であるべきです。Sephoraが商品ページのレイアウトを変更しても、更新が必要なのはステップ3だけで、パイプラインの残りは安定したままです。 ## HTML解析よりも常にAPIを優先する CSSセレクタを1つでも書く前に、対象サイトに以下があるか確認しましょう。 - **公開API** — JSONを返す、ドキュメント化されたエンドポイント - **プライベートAPI** — ブラウザのDevToolsで確認できるXHR/fetch呼び出し - **GraphQLエンドポイント** — 近年増加傾向にあり、多くの場合introspectionが有効 - **埋め込みJSON** — HTML内の`__NEXT_DATA__`、`window.__INITIAL_STATE__`、またはJSON-LD APIレスポンスは構造化されておりバージョン管理もされているため、HTMLレイアウトよりもはるかに安定しています。私の[Sephoraスクレイパー](/ja/tools/sephora-scraper/)はすべてのWeb URLをAPI呼び出しに変換しており、フロントエンドの刷新で壊れたことは一度もありません。 ## プロキシ戦略:防御レベルに合わせる すべてのサイトにレジデンシャルプロキシが必要なわけではありません。私が使っている判断基準は以下の通りです。 | 防御レベル | プロキシタイプ | 対象サイト例 | |-----------------|------------|---------------| | なし/Basic | データセンター | 大半のShopifyストア、小規模サイト | | レート制限 | ローテーション型データセンター | 中規模EC、コンテンツサイト | | フィンガープリンティング | レジデンシャル | Sephora、Farfetch、大手ブランド | | 高度なWAF | レジデンシャル+TLSフィンガープリント | Akamai、Cloudflare Enterprise | 重要な洞察: **プロキシコストは防御レベルに比例します**。IPレピュテーションしかチェックしないサイトに、レジデンシャルプロキシで無駄なコストをかけないでください。私の[Shopifyスクレイパー](/ja/tools/shopify-scraper/)はデータセンタープロキシで問題なく動作します。Shopifyのデフォルトの防御は最小限だからです。 ## セッション管理がすべて 成功率60%と99%の違いは、たいていセッション管理にあります。 - **IPだけでなくセッションもローテーションする** — 同じCookieのまま新しいIPを使うと不審に見えます - **セッションをウォームアップする** — 商品ページにアクセスする前にホームページを訪問する - **レート制限を守る** — ブロックされる50並列より、通る5並列の方が優れています - **指数バックオフ** — 即座のリトライではなく、1秒・2秒・4秒・8秒間隔でリトライする 私の[Sephora EUスクレイパー](/ja/tools/sephora-eu-scraper/)は、自動リフレッシュと指数バックオフでゲストトークンを管理します。実際の閲覧パターンに見える永続的なセッションを維持します。 ## 出力を正規化する スクレイピングした生データは乱雑です。すべてを正規化しましょう。 ### 価格 ドルではなく整数(セント単位)で保存します。`$29.99`は`2999`になります。これにより、下流の金融データを破損させる浮動小数点の精度誤差を回避できます。私のすべてのECスクレイパーがこの規約を採用しています。 ### URL 相対パスではなく、常に絶対URLを保存してください。抽出時点で解決しておきます。 ### 日付 ISO 8601形式(`2026-04-01T00:00:00Z`)を使い、常にタイムゾーンを含めます。ロケール依存の日付フォーマットで保存してはいけません。 ### テキスト 余分な空白を除去し、Unicodeを正規化し、HTMLの扱い方針(タグを除去するか、書式を保持するか)を決めておきます。 ## エラーハンドリング:失敗は前提 プロダクションスクレイパーは常に失敗します——問題は、いかに優雅に失敗するかです。私のアプローチは以下の通りです。 ``` Request fails (network error, timeout, 4xx/5xx) → Retry with exponential backoff (up to 5 attempts) → Rotate session/proxy on retry → Log failure with full context if all retries exhausted → Continue processing remaining URLs (don't crash the batch) ``` URLパターンごとに成功率を追跡しましょう。`/category/*`ページの成功率が突然90%を下回ったら、サイト側で何かが変更された可能性が高いです——ユーザーから報告される前に気づけます。 ## 監視とアラート 監視のないスクレイパーは、静かに壊れるのを待っているだけです。以下を追跡しましょう。 - **成功率** — 実行ごと、URLパターンごと - **出力件数** — 急激な減少は、何かが壊れたサインです - **データ品質** — nullフィールド、想定外の値、スキーマ違反 - **コスト** — プロキシ使用量、計算時間、ストレージ 私のApifyアクターはすべて、これらのメトリクスを公開しています。成功率が落ち込むと数時間以内に通知が届きます——多くの場合、ユーザーが気づくより先にです。 ## シンプルに始め、複雑さは後から加える 私が構築するスクレイパーはすべて、動作する最もシンプルな形から始まります。 1. まず**HTTP+Cheerio**(最速・最安) 2. ブロックされた場合のみ**フィンガープリンティングを追加** 3. JavaScriptが必要な場合のみ**ブラウザレンダリングを追加** 4. レート制限にかかった場合のみ**プロキシローテーションを追加** 私の[Ultaスクレイパー](/ja/tools/ulta-scraper/)は純粋なCheerioのみで、ブラウザは不要です。私の[Universal Web Printer](/ja/tools/web-printer/)はJavaScriptのレンダリングが必須のためPlaywrightを使用しています。適材適所です。 --- これらは机上の理論ではなく、数百万件のリクエストを処理する実際のプロダクションスクレイパーの運用から導き出されたものです。こうしたプラクティスに基づくカスタムスクレイパーが必要な方は、[お気軽にご相談ください](/ja/contact/)。 --- # アンチボット対策を理解する:2026年に通用する手法 - **URL:** https://proooxy.com/ja/blog/bypassing-anti-bot-protection-guide/ - **種別:** blog - **説明:** Cloudflare、Akamai、Datadomeなど最新のアンチボットシステムを技術的に深掘りし、実運用のスクレイピングで使われている合法的な回避手法を解説します。 - **キーワード:** アンチボット 回避 方法, Cloudflare 回避, Akamai 回避, Datadome 回避, ボット検知 対策, スクレイピング ブロック 回避 - **公開日:** 2026-03-15 - **更新日:** 2026-03-15 アンチボット対策は終わりのない軍拡競争です。日々こうしたシステムを回避するプロダクションスクレイパーを構築している立場から、この分野の実践的な見取り図をお伝えします——実際に何がチェックされているのか、そして合法的な回避手法とはどのようなものかを解説します。 ## 検知の階層構造 最新のアンチボットシステムは複数の階層で動作します。これらの階層を理解することが、確実な回避の鍵となります。 ### レイヤー1:IPレピュテーション 最もシンプルなチェックです。アンチボットサービスは、既知のデータセンターIP範囲、VPN出口ノード、過去にフラグが立てられたIPのデータベースを保持しています。 **チェック対象:** - そのIPはAWS、GCP、Azure、または既知のホスティングプロバイダのものか - そのIPは過去にボット活動でフラグを立てられたことがあるか - そのIPから最近どれだけのリクエストが送信されているか **対抗策:** Apify ProxyやBright Dataのようなサービスが提供するレジデンシャルプロキシは、実在のISPに属するIPアドレスを使うため、IPレベルでは一般ユーザーと区別がつきません。 ### レイヤー2:TLSフィンガープリンティング ここからが本題です。あらゆるHTTPクライアントは、以下の要素に基づく固有のTLSハンドシェイク署名を持っています。 - 対応する暗号スイートとその順序 - TLS拡張とその順序 - 対応するTLSバージョン - ALPNプロトコル 標準的な`axios`や`requests`ライブラリのTLSフィンガープリントは、どのブラウザとも一致しないため一目で「ボット」だとわかってしまいます。AkamaiやCloudflareのようなサービスは、あらゆるブラウザバージョンのフィンガープリントデータベースを保持しています。 **対抗策:** `got-scraping`([Shopifyスクレイパー](/ja/tools/shopify-scraper/)で使用)のようなライブラリや専用のTLSクライアントは、ブラウザ品質のTLSフィンガープリントを再現できます。[Sephora EUスクレイパー](/ja/tools/sephora-eu-scraper/)では、ブラウザ品質のTLSフィンガープリンティングを用いてAkamai WAFを回避しています。 ### レイヤー3:HTTP/2フィンガープリンティング TLSに加えて、HTTP/2の設定もクライアントの種類を明らかにします。 - SETTINGSフレームのパラメータ(ヘッダーテーブルサイズ、最大同時ストリーム数) - WINDOW_UPDATEフレームの値 - 優先度ツリーの構造 - ヘッダー圧縮(HPACK)のパターン 各ブラウザには特徴的なHTTP/2設定があります。Chrome、Firefox、Safariはこのレベルで見るとそれぞれ異なります。 ### レイヤー4:JavaScriptチャレンジ Cloudflareの「ブラウザを確認しています」ページや類似のチャレンジは、以下を行うJavaScriptを実行します。 - ブラウザAPI(canvas、WebGL、AudioContext)の有無を確認 - 実行タイミングを計測 - DOMプロパティを検証 - チャレンジのレスポンスをサーバーへ送信 **対抗策:** ヘッドレスブラウザ(Playwright、Puppeteer)はこれらのチャレンジをネイティブに実行できます。重要なのは、ヘッドレスブラウザが自動化のシグナルを漏らさないようにすることです(詳細は後述)。 ### レイヤー5:行動分析 最も高度な階層です。これらのシステムは以下を分析します。 - マウスの動きのパターン(動きが直線的すぎる=ボット) - スクロール挙動(一瞬で最下部までスクロール=ボット) - 操作間の時間間隔(一定すぎる=ボット) - ナビゲーションパターン(閲覧せずに商品ページへ直行=不審) - リクエストの頻度(間隔が完全に均一=ボット) ## 防御プロファイル:相手を知る ### Cloudflare **よく見られる対象:** 中小規模サイト、ブログ、API Cloudflareには複数の防御レベルがあります。 - **Basic** — IPレピュテーション+レート制限。レート制限を守るデータセンタープロキシで大抵は突破できます。 - **Managed Challenge** — JavaScriptチャレンジ+turnstile。ブラウザまたはチャレンジソルバーが必要です。 - **Enterprise/Bot Management** — 完全な行動分析+フィンガープリンティング。レジデンシャルプロキシと適切なフィンガープリンティングが必要です。 ### Akamai Bot Manager **よく見られる対象:** エンタープライズEC(Sephora EU、大手小売業者) Akamaiは以下の理由から、回避が最も難しいものの一つです。 - 積極的なTLSフィンガープリンティング - クライアント側JavaScriptによるセンサーデータ収集 - セッション単位の行動分析 - Cookieの整合性検証 Akamaiに対する私のアプローチ: ブラウザ品質のTLSフィンガープリンティング+ゲストトークン管理+人間の閲覧を模したリクエストペーシングです。 ### Datadome **よく見られる対象:** EC、チケット販売 Datadomeが重視するのは以下の点です。 - JavaScriptによるデバイスフィンガープリンティング - 不審なトラフィックに対するCAPTCHAチャレンジ - リアルタイムの行動スコアリング ### PerimeterX(現HUMAN) **よく見られる対象:** 小売、金融サービス 積極的なJavaScriptチャレンジと行動分析で知られています。 ## 正当な回避アーキテクチャ 信頼性の高い継続的なデータ抽出が必要なプロダクションシステム向けに、私が実際に使っているアーキテクチャパターンを紹介します。 ### 1. APIファーストアプローチ 防御の回避を試みる前に、WAFを完全に迂回できるAPI経路がないか確認しましょう。多くの防御はブラウザ向けエンドポイントにのみ適用され、APIルートには適用されないことが多いのです。 私の[Sephoraスクレイパー](/ja/tools/sephora-scraper/)は、すべてのWeb URLをAPI呼び出しに変換します。APIエンドポイントはモバイルアプリ向けに設計されているため、Webサイトよりも防御が軽い傾向にあります。 ### 2. セッションウォームアップ データページにいきなりアクセスしないでください。現実的な閲覧セッションを積み上げましょう。 ``` Visit homepage → Browse categories → View product listing → Access product detail ``` 各ステップがセッションの信頼性を積み上げます。アンチボットシステムには、実際のユーザー行動と一致するパターンとして映ります。 ### 3. フィンガープリントの一貫性 これは非常に重要です。フィンガープリントは**内部的に一貫している**必要があります。TLSが「Chrome 120」を示しているのにUser-Agentが「Chrome 118」を示している場合、それは検知シグナルになります。 以下を揃えましょう。 - TLSフィンガープリント - HTTP/2設定 - User-Agentヘッダー - Accept-Languageなどのその他のヘッダー - JavaScriptのブラウザプロパティ(ヘッドレスを使用する場合) ### 4. リクエストペーシング 実際の人間は、正確に1秒間隔でリクエストを送信することはありません。現実的なばらつきを持たせましょう。 - リクエスト間の基本遅延(2〜5秒) - ランダムなジッター(±30%) - ナビゲーションイベント後のより長い休止 - 時折の「アイドル」時間 ### 5. グレースフルデグラデーション チャレンジやブロックに遭遇した場合: 1. 即座にリトライしない — ボット行動だと確定させてしまいます 2. 指数関数的にバックオフする 3. 新しいセッションにローテーションする(新しいIP+新しいCookie) 4. 別のプロキシリージョンを試す 5. それでも解決しない場合は、ブラウザベースの手法に切り替える ## もはや通用しない手法 - **User-Agentを変更するだけ** — 検知システムは1つのヘッダーだけでなく数十のシグナルをチェックします - **ランダムな遅延だけ** — 適切なフィンガープリンティングがなければ、タイミング調整だけでは効果がありません - **デフォルト設定のヘッドレスChrome** — 自動化のシグナルがあらゆる箇所から漏れます(`navigator.webdriver`、プラグインの欠如、Chrome DevTools Protocolの痕跡など) - **Cookieのリプレイ** — 最新のシステムはCookieをTLSフィンガープリントやIP範囲に紐づけています ## 倫理的な配慮 アンチボット回避は一つの手段(ツール)です。どんな手段も同じように、責任を持って使うことも、そうでない使い方をすることもできます。 **正当な利用例:** - 消費者の利益のための価格比較 - 公開データを用いた市場調査 - アクセシビリティ向上(データを構造化フォーマットで利用可能にする) - 学術研究 - 品質保証とモニタリング **常に尊重すべきこと:** - robots.txtの指示 - レート制限(超過が可能であっても、超過しないこと) - 個人データ規制(GDPR、CCPA) - 利用規約(自分の法域における法的状況を理解すること) 私の[ツール](/ja/tools/)はすべて、レート制限とプロキシのベストプラクティスを組み込んだ、正当なデータ抽出のために設計されています。 --- アンチボットシステムを理解することは、スクレイピングエンジニアとしての力量を高めてくれます。こうした課題を確実に処理できるプロダクション品質のスクレイパーが必要な方は、私の[ツール](/ja/tools/)をご覧いただくか、カスタム開発について[お問い合わせ](/ja/contact/)ください。 --- # お問い合わせ - **URL:** https://proooxy.com/ja/contact/ - **種別:** page - **説明:** カスタムスクレイパーやRAGデータパイプラインのご依頼はこちら——リバースエンジニアリングによるプライベートAPI連携、アンチボット回避、そしてクリーンで構造化されたJSONをAIスタックへお届けします。 - **キーワード:** Webスクレイピング 開発者 依頼, スクレイパー 開発 依頼, スクレイピング代行 サービス, RAG データパイプライン 構築, データ抽出 代行, スクレイピング コンサルタント - **公開日:** 0001-01-01 - **更新日:** 0001-01-01 ## カタログにないデータが必要な方へ AIチーム、データプラットフォーム、そしてオープンWebをクリーンな構造化JSONとして必要とするあらゆる方のために、オーダーメイドのWebスクレイパーとRAGデータパイプラインを構築します。一度限りの取得でも、継続更新されるフィードでも対応可能です。 ### 提供内容 - **カスタムスクレイパー** — 対象サイト専用に設計し、アンチボット回避を標準搭載 - **RAGデータパイプライン** — 抽出・正規化・チャンク分割を行い、検索対応のJSONをベクトルストアやデータウェアハウスへ配信 - **プライベートAPIのリバースエンジニアリング** — 未文書化のモバイル/Webエンドポイントを安定した構造化データソースに変換 - **スクレイパーの保守** — 対象サイトの変更に合わせて既存の抽出処理を維持 - **技術コンサルティング** — スクレイピング・データ取り込みスタックのアーキテクチャレビュー ### 進め方 1. **データ要件をお聞かせください** — 取得元、必要なフィールド、納品形式 2. **無料の実現可能性チェック** — 対象サイトの複雑さとアンチボット対策を無料で診断 3. **提案とスケジュール** — 明確な作業範囲、固定料金、納品日を提示 4. **構築と納品** — ドキュメント付きのプロダクション品質の抽出基盤とクリーンな出力を納品 ### 依頼を始める
### 直接連絡する - **メール**: [p8p9cmk96@mozmail.com](mailto:p8p9cmk96@mozmail.com) - **GitHub**: [@autofacts](https://github.com/autofacts) - **Apify**: [apify.com/autofacts](https://apify.com/autofacts) --- # プロフィール - **URL:** https://proooxy.com/ja/about/ - **種別:** page - **説明:** Richard Feng — 12年以上の経験を持つWebスクレイピングエンジニア。保護されたWebサイトを、AIエージェント・検索パイプライン・LLM向けのクリーンでRAG対応の構造化データに変えます。 - **キーワード:** Webスクレイピング エンジニア, データ抽出 コンサルタント, スクレイパー 開発 依頼, アンチボット 回避 専門家, RAG データパイプライン 構築, API リバースエンジニアリング 依頼 - **公開日:** 0001-01-01 - **更新日:** 0001-01-01 ## 私について Richard Fengと申します。コーディング歴12年以上のフリーランスWeb自動化エンジニアです。専門は**Webスクレイピング、データ抽出、APIリバースエンジニアリング**——複雑に保護されたWebサイトを、AIシステムが実際に活用できるクリーンな構造化データへと変えることです。 得意とする技術スタックは**Node.js(TypeScript)、Python、Go、Java**に及び、**Crawlee、Playwright、Cheerio**に深い専門性を持っています。数百万件規模のリクエストを処理する本番システムを、**成功率99%超**で構築してきました。 ## 手がけていること **3,100人**を超えるユーザーに、常時**成功率99%超**で稼働する**16のプロダクション品質Apifyアクター**を提供・保守しています。すべてのアクターがクリーンな**RAG対応JSON**を出力します——スキーマが一貫し、重複排除済みで、ベクトルストア、検索パイプライン、学習データセットにそのまま投入できます。公開データを扱うアクターの大半はAPIキー不要です。私の業務は次の4分野にまたがります。 ### EC・小売データ [Sephora](/ja/tools/sephora-scraper/)(世界21店舗)、[Ulta Beauty](/ja/tools/ulta-scraper/)、[Farfetch](/ja/tools/farfetch-scraper/)、[Lululemon](/ja/tools/lululemon-scraper/)、[Boohoo](/ja/tools/boohoo-scraper/)、[Macy's](/ja/tools/macys-scraper/)など主要ビューティー・ファッションプラットフォーム向けのスクレイパーに加え、Shopify対応の任意のストアで動作する汎用[Shopifyスクレイパー](/ja/tools/shopify-scraper/)を提供しています。 ### 公共・金融・法律データ 米国政府の公式データセットをクリーンでRAG対応のJSONとして提供——[SEC EDGAR開示書類・XBRL財務データ](/ja/tools/sec-edgar-scraper/)、[USAspending.gov連邦調達・助成データ](/ja/tools/usaspending-scraper/)、[CourtListener判例](/ja/tools/courtlistener-scraper/)、[ClinicalTrials.gov臨床試験データ](/ja/tools/clinical-trials-scraper/)。 ### ソーシャル・メディアインテリジェンス AT Protocol経由で[Bluesky](/ja/tools/bluesky-scraper/)の投稿・プロフィール・エンゲージメントを取得するほか、100以上の言語でJSON、SRT、VTT、あるいはLLM向けテキストを出力する[YouTube字幕・文字起こしスクレイパー](/ja/tools/youtube-transcript-scraper/)を提供しています。 ### 開発者向けユーティリティ スクレイピングにとどまらないツール群——[SEO・構造化データ監査](/ja/tools/schema-markup-scraper/)、[WebからPDF/画像へのレンダリング](/ja/tools/web-printer/)、[高性能負荷テスト](/ja/tools/load-tester/)。 ## 得意分野 - **プライベートAPIのリバースエンジニアリング** — 未文書化のモバイル/Webエンドポイントを信頼できるデータソースに変換 - **アンチボット回避** — Cloudflare、DataDome、Akamai WAF、および独自の防御機構に対応 - **RAG対応の出力** — 検索とグラウンディングのために設計された、正規化されスキーマが一貫したJSON - **マルチリージョン対応スクレイピング** — ロケール、通貨、コンプライアンスまで対応 - **高信頼性システム** — 大規模運用でも成功率99%超を維持する抽出基盤 ## 技術スタック | カテゴリ | 技術 | |----------|-------------| | 言語 | TypeScript, Python, Go, Java | | スクレイピング | Crawlee, Playwright, Cheerio, Parsel, got-scraping | | アンチボット | フィンガープリント生成、TLSフィンガープリンティング、セッションローテーション | | インフラ | Apify Platform, Docker, GitHub Actions | | テスト | Vegeta、独自の負荷テストフレームワーク | ## お仕事のご相談 カスタムスクレイピングソリューション、RAGデータパイプライン構築、継続的なデータ抽出サービスを提供しています。AIに実際のWebをクリーンなデータとして取り込みたい方は——[お気軽にご相談ください](/ja/contact/)。 ---