# Proooxy — 面向 AI Agent 与 LLM 的 RAG 就绪网页数据 — 完整内容 (llms-full.txt) > 面向 AI Agent、检索管道与大语言模型的结构化、RAG 就绪网页数据。Richard Feng 打造生产级 Apify Actor,覆盖电商、SEC/EDGAR 财报文件、联邦支出、法院判决、临床试验及社交与视频数据——绕过反爬虫防护,输出干净、schema 一致的 JSON,公开数据无需 API 密钥。 本文件将 https://proooxy.com/zh/ 上的所有公开页面合并为单一文档,供 LLM 与 AI Agent 直接读取。每个页面前都有一段由结构化 front matter 组成的信息块(URL、类型、分类、技术、地区、日期),随后是完整的 Markdown 正文。内容由线上站点自动生成。 --- ## 站点元数据 - **网站:** Proooxy — 面向 AI Agent 与 LLM 的 RAG 就绪网页数据 - **URL:** https://proooxy.com/zh/ - **描述:** 面向 AI Agent、检索管道与大语言模型的结构化、RAG 就绪网页数据。Richard Feng 打造生产级 Apify Actor,覆盖电商、SEC/EDGAR 财报文件、联邦支出、法院判决、临床试验及社交与视频数据——绕过反爬虫防护,输出干净、schema 一致的 JSON,公开数据无需 API 密钥。 - **作者:** Richard Feng - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **工具:** 17 款生产级 Actor - **文章数:** 2 - **最后生成时间:** 2026-08-04 --- ## 工具目录索引 - [Macy's Scraper——商品、价格、SKU 与新闻](https://proooxy.com/zh/tools/macys-scraper/) — Macy's 商品、价格、SKU/UPC 与新闻——绕过 Akamai,无需浏览器。 - [Bluesky Scraper——帖子、主页资料、动态与互动数据](https://proooxy.com/zh/tools/bluesky-scraper/) — 抓取 Bluesky 的帖子、主页资料、动态与互动数据。 - [ClinicalTrials.gov Scraper——临床研究、入组标准与结果数据](https://proooxy.com/zh/tools/clinical-trials-scraper/) — 检索 ClinicalTrials.gov 的临床研究、入组标准与结果数据。 - [CourtListener Scraper——判决书、案卷与全文数据](https://proooxy.com/zh/tools/courtlistener-scraper/) — 面向法律 AI 的美国判例法、案卷与判决全文数据。 - [SEC EDGAR Scraper——财报文件、全文与 XBRL 财务数据](https://proooxy.com/zh/tools/sec-edgar-scraper/) — SEC 财报文件、10-K/10-Q 全文与 XBRL 财务数据——RAG 就绪。 - [USAspending.gov Scraper——联邦支出项目、接收方与汇总数据](https://proooxy.com/zh/tools/usaspending-scraper/) — 来自 USAspending.gov 的联邦支出项目、接收方与支出汇总数据。 - [YouTube Subtitle & Transcript Scraper——JSON、SRT、VTT、LLM 多格式输出](https://proooxy.com/zh/tools/youtube-transcript-scraper/) — YouTube 文字稿,输出 JSON、SRT、VTT 或适合 LLM 使用的文本。 - [Sephora Scraper(全球版)](https://proooxy.com/zh/tools/sephora-scraper/) — 抓取任意 Sephora 站点——21 个市场,一个 Actor 搞定。 - [Boohoo Scraper——覆盖 7 个地区的商品数据](https://proooxy.com/zh/tools/boohoo-scraper/) — 抓取 Boohoo 在 7 个地区站点的商品数据。 - [Farfetch Scraper——奢侈时尚商品数据](https://proooxy.com/zh/tools/farfetch-scraper/) — 抓取 Farfetch 的奢侈时尚商品,支持多币种。 - [Global API Load Tester——10K+ RPS 压力测试](https://proooxy.com/zh/tools/load-tester/) — 地理分布式负载测试,可模拟 10K+ RPS。 - [Lululemon Scraper——商品、变体与价格](https://proooxy.com/zh/tools/lululemon-scraper/) — 提取 Lululemon 的商品数据,含变体与媒体资源。 - [Schema Markup Scraper——结构化数据抓取与 SEO 审计工具](https://proooxy.com/zh/tools/schema-markup-scraper/) — 为任意网站提取结构化数据并进行 SEO 审计。 - [Sephora EU Scraper——覆盖 9 个欧洲市场](https://proooxy.com/zh/tools/sephora-eu-scraper/) — 提取 Sephora 在 9 个欧洲市场的商品数据。 - [Shopify Scraper——任意商店的商品数据](https://proooxy.com/zh/tools/shopify-scraper/) — 提取任意 Shopify 商店的商品数据。 - [Ulta Beauty Scraper——商品、价格与 SKU](https://proooxy.com/zh/tools/ulta-scraper/) — 抓取 Ulta Beauty 的完整商品数据。 - [Universal Web Printer——URL 与 HTML 转 PDF、图片](https://proooxy.com/zh/tools/web-printer/) — 将 URL 与 HTML 转换为 PDF、PNG、JPEG 或 WebP。 --- # Macy's Scraper——商品、价格、SKU 与新闻 - **URL:** https://proooxy.com/zh/tools/macys-scraper/ - **类型:** tools - **描述:** 提取 Macy's 的商品数据——价格、变体、SKU/UPC 条码、图片、评分与评论——以及 Macy's Inc. 新闻,覆盖搜索、分类、热门与商品 URL。无需浏览器,可绕过 Akamai。 - **摘要:** Macy's 商品、价格、SKU/UPC 与新闻——绕过 Akamai,无需浏览器。 - **分类:** ecommerce - **技术栈:** TypeScript, Crawlee, Cheerio - **市场/地区:** 美国 - **Apify 页面:** https://apify.com/autofacts/macy-s-scraper - **关键词:** macys 爬虫, macy's 商品数据, macys 价格监控, 百货商店爬虫, macys sku upc 数据, macys 评论爬虫, 零售商品数据 - **发布时间:** 2026-07-15 - **更新时间:** 2026-07-15 **核心特性:** - 一个 Actor 覆盖四大场景——商品搜索、分类、热门商品与 Macy's Inc. 新闻 - 无需浏览器即可绕过 Akamai Bot Manager,直接调用 Macy's 自有的移动端与网站 JSON API - 每个可购买变体的 SKU 均附带 UPC 条码、颜色、尺码、库存状态与价格 - 价格以整数美分存储,并附带本地化格式化字符串——杜绝浮点数舍入误差 - 完整的评论情报——星级分布直方图、推荐数,以及版型/尺码等二级评分 - 所有色号与尺码归并到同一条商品记录下,而非一个变体一行 - 只输出干净的规范网址——内部 API 端点与客户端密钥绝不会泄露到输出结果中 - search、category、trending 与商品详情结果统一采用同一套规范化 schema **应用场景:** - SKU 级别的百货商店价格与促销监控 - 竞品分析——Macy's 对比 Nordstrom、Ulta 或品牌自营 DTC 定价 - 通过每个变体的 UPC 条码实现跨零售商的商品目录匹配 - 针对 Macy's 在售品牌的评论与评分情报 - 零售新闻监控——Macy's Inc. 的新闻稿与财报公告 **输入参数:** - `scrapeType` (string, 必填) — 要抓取的场景:search、category、trending、news 或 all(默认:search)。 - `query` (string, 可选) — 商品搜索关键词,例如 women shoes。 - `startUrls` (array, 可选) — Macy's 商品页/分类页 URL,或 Macy's Inc. 新闻页 URL。 - `categoryIds` (array, 可选) — Macy's 分类 ID(例如 5449)。已知分类页 URL 时优先使用 URL。 - `trendingUrls` (array, 可选) — 热门、畅销或精选榜单页 URL。 - `newsUrls` (array, 可选) — Macy's Inc. 新闻列表页或文章页 URL。 - `includeProductDetails` (boolean, 可选) — 为列表条目补全完整商品详情——变体、SKU、图库(默认:true)。 - `maxPages` (number, 可选) — 每个列表/新闻来源的最大分页深度。 - `maxResults` (number, 可选) — 输出记录数上限。0 表示不限。 - `proxy` (object, 必填) — Apify Proxy 或自定义代理 URL。推荐使用美国住宅代理。 **常见问题:** **Q: 在不使用浏览器的情况下,它是如何绕过 Akamai 的?** 它根本不需要正面应对 JS 挑战。列表数据来自 Macy's 移动 App 的 API,商品详情来自网站自身的 JSON API——两者都运行在能够响应匿名读取请求的独立基础设施上。无需登录、无需 cookie、无需 API 密钥。 **Q: 价格单位是美元还是美分?** 以整数美分存储(5999 = $59.99),以避免浮点数舍入误差,同时附带本地化格式化字符串($59.99)。 **Q: 变体与 UPC 是如何处理的?** 所有颜色与尺码都归并在同一条商品记录的 variants[] 数组下。每个变体都携带各自的 UPC 条码、颜色、尺码、库存状态与价格——这些数据来自 Macy's 的 SKU 关系数据,而非从色卡组件上抓取。 **Q: 可以在一次运行中同时抓取商品与新闻吗?** 可以。将 scrapeType 设为 all,并按需组合提供 query、startUrls、categoryIds、trendingUrls 与 newsUrls。 ## 输出示例 ```json { "type": "product", "source": { "id": "12345678", "canonicalUrl": "https://www.macys.com/shop/product/calvin-klein-womens-sheath-dress?ID=12345678", "retailer": "macys", "currency": "USD" }, "title": "Women's Sleeveless Sheath Dress", "brand": "Calvin Klein", "categories": ["Women", "Dresses", "Work Dresses"], "price": { "sale": 5999, "list": 9800, "currentFormatted": "$59.99", "stockStatus": "InStock" }, "stats": { "rating": 4.6, "reviewCount": 9, "ratingPercentage": 92 }, "options": [ { "type": "Color", "values": [{ "id": "1", "name": "Black" }] }, { "type": "Size", "values": [{ "id": "10", "name": "M" }, { "id": "12", "name": "L" }] } ], "variants": [ { "id": "987654", "sku": "192837465012", "options": ["Black", "M"], "price": { "stockStatus": "InStock" }, "extraInfo": { "upc": "192837465012" } } ], "medias": [{ "type": "Image", "url": "https://slimages.macysassets.com/is/image/MCY/products/.../main.jpg" }] } ``` ## 价格 按事件计费——只对实际保存的条目计费: | 事件 | 价格 | 说明 | |---|---|---| | 抓取一件商品 | $0.006 | 一件完整商品详情——变体、SKU/UPC、价格、图片、评分 | | 抓取一篇文章 | $0.002 | 一篇 Macy's Inc. 新闻文章——标题、作者、日期、正文、图片 | 更高级别的 Apify 套餐会自动享受批量折扣(低至每件商品 $0.0045)。按标价计算,抓取 1,000 件商品约为 $6.00。 ## 使用建议 - **使用美国住宅代理。** 商品详情端点会间歇性触发速率限制;住宅代理的会话轮换能顺利通过,而数据中心 IP 会遇到更多 403 错误。 - **保持适度并发。** `maxConcurrency` 设为 2–3 是最佳区间——更高的值只会增加触发速率限制的概率,而不会提升吞吐量。 - **优先使用分类页 URL,而非裸 ID。** URL 中携带了 API 所需的分类路径;单独的 ID 可能会解析出范围过大或为空的结果集。 - **不需要变体或描述信息时,可关闭 `includeProductDetails`**,实现快速的列表级抓取(名称、品牌、列表价格、图片、评分)。 --- # Bluesky Scraper——帖子、主页资料、动态与互动数据 - **URL:** https://proooxy.com/zh/tools/bluesky-scraper/ - **类型:** tools - **描述:** 通过 AT Protocol 提取 Bluesky 的帖子、主页资料、关注者、动态、话题串、点赞者与转发者数据——并支持通过 App Password 进行已登录搜索与话题标签查询。输出干净、规范化的 JSON。 - **摘要:** 抓取 Bluesky 的帖子、主页资料、动态与互动数据。 - **分类:** social - **技术栈:** TypeScript, AT Protocol - **市场/地区:** 全球 - **Apify 页面:** https://apify.com/autofacts/bluesky-scraper - **关键词:** bluesky 爬虫, bluesky api 数据, at protocol 数据采集, bluesky 帖子抓取, bluesky 主页数据, bluesky 话题标签抓取, 社交媒体数据采集 - **发布时间:** 2026-07-01 - **更新时间:** 2026-07-01 **核心特性:** - 十一种模式——search、profile、posts、followers、following、feed、thread、likers、reposters、actorLikes 与 hashtag - 面向 profiles、posts、followers、following、feeds、threads、likers、reposters 的公开 API,无需凭证 - 需要 App Password 认证的模式——search、hashtag,以及你自己账户的点赞记录 - 帖子互动数据导出——每条帖子完整的点赞者与转发者列表 - 话题串展平——按可配置深度遍历回复树 - 所有列表端点均自动进行游标分页,直到达到你设置的条目上限 - 所有模式下帖子与主页资料均采用统一规范化的 JSON 结构 - 健壮的 HTTP 请求机制——请求节流、指数退避,并在 429/5xx 时自动重试 **应用场景:** - 通过已登录搜索进行品牌与关键词监控 - 追踪全站范围内的话题标签与热点趋势 - 受众数据导出——创作者或品牌的粉丝与关注列表 - 互动分析——精确追踪谁点赞或转发了某条帖子 - 基于干净、规范化的 JSON 构建面向 BI、分析或 RAG 管道的数据集 - 归档某条帖子下的对话与话题串 **输入参数:** - `mode` (string, 可选) — 要抓取的内容:posts、profile、followers、following、feed、thread、likers、reposters、actorLikes、search 或 hashtag(默认:posts)。 - `handles` (array, 可选) — 用于 profile/posts/followers/following/actorLikes 模式的 Bluesky 账号 handle,例如 bsky.app。 - `query` (string, 可选) — 搜索文本(search 模式)或话题标签(hashtag 模式——会自动添加 # 前缀)。 - `postUri` (string, 可选) — 帖子的 AT URI——用于 thread、likers 和 reposters 模式。 - `feedUri` (string, 可选) — 自定义动态的 AT URI——用于 feed 模式。 - `identifier` (string, 可选) — 用于已登录模式(search、hashtag、actorLikes)的 Bluesky 登录 handle/邮箱。 - `appPassword` (string, 可选) — 用于已登录模式的 Bluesky App Password(不是你的主账户密码)。 - `maxItems` (number, 可选) — 最多保存的 posts/profiles 数量;每条计为一次计费事件(默认:100)。 **常见问题:** **Q: 我需要 Bluesky 凭证吗?** 只有 search、hashtag 和 actorLikes 模式才需要——在 Bluesky 设置中生成一个 App Password,作为 appPassword 传入即可。profile、posts、followers、following、feed、thread、likers 和 reposters 模式都可以通过公开的 AT Protocol API 在无凭证的情况下正常工作。 **Q: 我可以导出任意账户的点赞记录吗?** 不可以。Bluesky 的 API 只对已登录账户本身暴露 actorLikes 数据,因此 handle 与登录 identifier 必须指向同一个账户。 **Q: 如何获取帖子或动态的 URI?** AT URI 的形式类似 at://did:plc:.../app.bsky.feed.post/...——可以从 Bluesky 的 API 输出或开发者工具中复制获得。动态 URI 使用的是 app.bsky.feed.generator 集合。 **Q: 使用 App Password 安全吗?** 安全——请使用 Bluesky 的 App Password(在 Settings → App Passwords 中创建),切勿使用主密码。它是限定权限范围、可随时撤销的凭证,并以密文(secret)方式传入。 ## 输出示例 ```json { "itemType": "post", "mode": "posts", "uri": "at://did:plc:.../app.bsky.feed.post/...", "author": { "did": "did:plc:...", "handle": "bsky.app", "displayName": "Bluesky", "followersCount": 1234567 }, "text": "Example post text", "createdAt": "2026-06-11T00:00:00Z", "replyCount": 10, "repostCount": 20, "likeCount": 100, "langs": ["en"], "url": "https://bsky.app/profile/bsky.app/post/..." } ``` ## 价格 按事件计费:每条保存的记录(帖子或主页资料)**收费 $0.001**。导出 1,000 条约为 $1.00,`maxItems` 可同时限制导出量与费用上限。 ## 使用建议 - **优先使用公开模式。** profiles、posts、followers 以及互动数据(likers/reposters)都无需登录——把 App Password 认证留给 search 和 hashtag 模式使用。 - **不要只导出帖子,也导出互动数据。** likers 和 reposters 模式能精确呈现是谁扩散了一条帖子——这是大多数 Bluesky 爬虫都会忽略的信号。 - **为大账户的 follower/following 拉取设置 `maxItems` 上限**,以保证运行速度与成本可预测。 --- # ClinicalTrials.gov Scraper——临床研究、入组标准与结果数据 - **URL:** https://proooxy.com/zh/tools/clinical-trials-scraper/ - **类型:** tools - **描述:** 按病症、干预措施、申办方、地点、状态或 NCT ID 检索官方 ClinicalTrials.gov v2 API。导出包含入组标准、结果元数据的规范化研究记录,并支持增量更新——无需 API 密钥。 - **摘要:** 检索 ClinicalTrials.gov 的临床研究、入组标准与结果数据。 - **分类:** public-data - **技术栈:** TypeScript, REST API - **市场/地区:** 全球 - **Apify 页面:** https://apify.com/autofacts/clinical-trials-scraper - **关键词:** clinicaltrials.gov api, 临床试验数据, 临床研究数据集, 招募中临床试验数据, 临床试验入组标准数据, 制药管线监控, 临床试验 RAG 数据 - **发布时间:** 2026-07-01 - **更新时间:** 2026-07-01 **核心特性:** - 官方 ClinicalTrials.gov v2 API——无需 API 密钥 - 多字段检索——病症、干预措施、申办方、地点与自由文本查询 - 按招募状态(9 种取值,OR 组合)与研究阶段(Early Phase 1 → Phase 4)筛选 - 支持通过 NCT ID 直接查询一项或多项指定研究 - 通过 updatedSince 实现增量监控——只返回指定日期当天及之后发生变更的研究 - summary 或 full 两种输出模式——full 模式会附加原始的 protocol、derived 与 results 部分 - 对标题、摘要、入组标准与结果进行 RAG 就绪的段落分块 - 结果信号——hasResults,以及受试者流程、结局指标、不良事件相关标志位 - 推导得到的 MeSH 术语,以及规范化的申办方、合作方与地点数据 **应用场景:** - 按申办方或病症监控制药/生物科技管线 - CRO 与研究机构可行性调研——按地点、阶段与病症筛选招募中的试验 - 针对新发布或新更新研究的竞争情报 - 面向正在招募患者的试验开展受试者招募调研 - 系统性综述——大规模获取入组标准、结局指标与结果元数据 - 基于分块试验文本构建医疗 AI / RAG 知识库 **输入参数:** - `condition` (string, 可选) — 要检索的病症或疾病,例如 diabetes。 - `status` (array, 可选) — 招募状态筛选,OR 组合,例如 RECRUITING、COMPLETED。 - `phase` (array, 可选) — 研究阶段——Not Applicable、Early Phase 1、Phase 1–4。 - `nctIds` (array, 可选) — 按 ClinicalTrials.gov 的 NCT ID 获取指定研究。 - `updatedSince` (string, 可选) — YYYY-MM-DD——返回 LastUpdatePostDate 在该日期当天及之后的研究。 - `outputFields` (string, 可选) — summary(默认,规范化输出)或 full(附加原始 protocol/derived/results 部分)。 - `chunking` (string, 可选) — RAG 文本分块方式:paragraph(默认)或 none。 - `maxItems` (number, 可选) — 最多保存的研究数量;每条计为一次计费事件(默认:10)。 **常见问题:** **Q: 我需要 API 密钥吗?** 不需要。ClinicalTrials.gov 的 v2 API 完全公开——该 Actor 仅发送一个描述性的 User-Agent,无需任何身份验证。 **Q: 我能获取原始研究数据,而不仅仅是规范化字段吗?** 可以。将 outputFields 设为“full”,即可在规范化的 summary 字段之外,附带原始的 protocolSection、derivedSection 与 resultsSection。 **Q: 如何监控近期发生变更的研究?** 将 updatedSince 设为一个 YYYY-MM-DD 格式的日期。该 Actor 会基于 ClinicalTrials.gov 的 LastUpdatePostDate 进行筛选,只返回当天及之后更新的研究——非常适合按日监控管线。 **Q: 数据覆盖范围是全球性的,还是仅限美国?** 覆盖全球。ClinicalTrials.gov 登记的是全球范围内的试验,每项研究的 locations 数组在提供相关信息时会包含国家、州/省、城市与机构。 ## 输出示例 ```json { "itemType": "study", "nctId": "NCT01884792", "title": "Example Diabetes Study", "officialTitle": "A Study of Example Diabetes Study", "status": "COMPLETED", "phase": ["PHASE2"], "studyType": "INTERVENTIONAL", "conditions": ["Diabetes Mellitus"], "sponsors": { "lead": "Example Sponsor Inc.", "collaborators": [] }, "locations": [ { "facility": "Example Medical Center", "city": "Boston", "state": "MA", "country": "United States", "status": "COMPLETED" } ], "hasResults": true, "resultsSummary": { "hasParticipantFlow": true, "hasOutcomeMeasures": true, "hasAdverseEvents": true }, "lastUpdate": "2026-06-01", "url": "https://clinicaltrials.gov/study/NCT01884792" } ``` ## 价格 按事件计费:每保存一项研究**收费 $0.002**,无论是 summary 还是 full 输出模式。导出 1,000 项研究约为 $2.00,`maxItems` 可同时限制导出量与费用上限。 ## 使用建议 - **用 `updatedSince` 做变更监控。** 每天用昨天的日期定时运行,只捕获新发布或修改过的试验——这是追踪竞争对手管线最省钱的方式。 - **组合使用 `condition` + `status: [RECRUITING]` + `phase`**,无需拉取整个注册库即可构建有针对性的可行性名单。 - **只在需要原始数据部分时才设置 `outputFields: full`**——规范化的 summary 输出已经包含入组标准、申办方、地点与结果标志位。 --- # CourtListener Scraper——判决书、案卷与全文数据 - **URL:** https://proooxy.com/zh/tools/courtlistener-scraper/ - **类型:** tools - **描述:** 查询 CourtListener 的美国法院判决、RECAP 案卷、口头辩论、法官与判例引注——附带完整判决全文与 RAG 就绪分块。支持按法院、日期或关键词筛选。 - **摘要:** 面向法律 AI 的美国判例法、案卷与判决全文数据。 - **分类:** public-data - **技术栈:** TypeScript, Cheerio - **市场/地区:** 美国 - **Apify 页面:** https://apify.com/autofacts/courtlistener-scraper - **关键词:** courtlistener api, 判例法数据 api, 法院判决爬虫, recap 案卷数据, 法律检索数据, 美国判例法数据集, 判例法 rag 数据 - **发布时间:** 2026-07-01 - **更新时间:** 2026-07-01 **核心特性:** - 一个 Actor 内置六种检索类型——opinions(判决书)、dockets(RECAP 案卷)、RECAP documents(RECAP 文档)、oral arguments(口头辩论)、judges(法官)与 citation lookup(引注查询) - 完整判决全文——从搜索命中结果深入数据库获取完整判决书,而非 300 字符的片段摘要 - RAG 就绪分块——约 2000 字符的段落分块,每块附带顺序索引 - 引注解析——最多可将 250 条引注字符串(例如 576 U.S. 644)解析为对应的判例 - 支持布尔全文检索,以及法院 ID、立案日期区间与排序方式筛选 - 感知速率限制的请求节流,针对 CourtListener 各类响应格式精确处理 429 退避 - 游标分页流式获取,直到达到你设置的条目上限 - 支持自带令牌,或使用内置的轮换令牌池 **应用场景:** - 法律研究——按法院、日期区间或关键词拉取判例法全文 - 诉讼情报——按主题与日期追踪某法院的案卷动态 - 法律 AI / RAG——构建已分块、可直接生成向量嵌入的判例法语料库 - 引注分析——将法律文书中的引注解析为关联判例记录与被引次数 - 实证法学研究——法官信息、口头辩论元数据与判决趋势 - 法律新闻报道——监控特定法院新立案的判决或案卷 **输入参数:** - `searchType` (string, 可选) — 要获取的内容:opinions、dockets、recap_docs、oral_arguments、judges 或 citation(默认:opinions)。 - `query` (string, 可选) — 带布尔运算符的全文查询——除非使用法院筛选或引注查询,否则为必填。 - `citations` (array, 可选) — 待解析的引注字符串(最多 250 条)——citation 模式下为必填。 - `court` (string, 可选) — CourtListener 的法院 ID,例如 scotus、ca9、nyed。 - `dateFrom` (string, 可选) — 立案起始日期(YYYY-MM-DD)。 - `includeFullText` (boolean, 可选) — 获取判决书的完整全文与 RAG 分块(默认:false)。 - `apiToken` (string, 可选) — 你的 CourtListener API 令牌;若不填写,将回退使用内置轮换令牌池。 - `maxItems` (number, 可选) — 最多保存的条目数;每条计为一次计费事件(默认:5)。 **常见问题:** **Q: 我需要 CourtListener 的 API 令牌吗?** CourtListener 要求提供令牌。你可以通过 apiToken 提供自己的免费令牌,也可以依赖该 Actor 内置的轮换备用令牌池。自带令牌可以让你在付费/会员套餐下获得更高的吞吐量。 **Q: 所有检索类型都能获取判决全文吗?** 不能。全文与分块功能(includeFullText)仅适用于 opinions,且默认关闭以保证运行速度。dockets、RECAP 文档、oral arguments、judges 与 citation 结果只返回元数据。 **Q: 覆盖哪些法院?** 凡是 CourtListener 收录的法院均可覆盖——包括美国联邦法院(最高法院 SCOTUS、上诉法院,以及通过 RECAP 收录的地区法院),还有大量州法院,均以 CourtListener 自有的法院 ID(如 scotus、ca9、nyed)标识。 **Q: 运行速度能有多快?** 吞吐量受限于你令牌的速率限制(CourtListener 免费层级每分钟仅有几次请求),并会自动进行 429 退避;会员令牌可以提高这一上限。 ## 输出示例 ```json { "itemType": "legal", "searchType": "opinions", "id": "10380001", "title": "Climate United Fund v. Citibank, N.A.", "court": "Court of Appeals for the D.C. Circuit", "date": "2025-04-16", "url": "https://www.courtlistener.com/opinion/10380001/...", "citations": [], "citeCount": 0, "docketNumber": "23-5138", "fullText": "...", "chunks": [{ "text": "...", "order": 0 }], "meta": { "courtId": "cadc", "clusterId": 10380001 } } ``` ## 价格 按事件计费——只对实际保存的条目计费: | 事件 | 价格 | 说明 | |---|---|---| | 带全文的判决书 | $0.005 | 保存一份判决书,含完整全文 + RAG 分块 | | 元数据条目 | $0.002 | 一条案卷、口头辩论、法官、引注或纯元数据记录 | 1,000 份判决全文语料约为 $5.00;`maxItems` 可同时限制导出量与费用上限。 ## 使用建议 - **只为真正需要生成向量嵌入的判决书开启 `includeFullText`。** 它会为每份判决书带来额外请求开销,且默认关闭——建议先按法院和日期做精细筛选。 - **用 `citation` 模式为法律文书补全引注信息。** 粘贴引注字符串,一次运行即可获得关联的判例记录与被引次数。 - **大规模任务请使用你自己的 CourtListener 令牌**——免费层级过低的速率限制是主要的吞吐瓶颈。 --- # SEC EDGAR Scraper——财报文件、全文与 XBRL 财务数据 - **URL:** https://proooxy.com/zh/tools/sec-edgar-scraper/ - **类型:** tools - **描述:** 提取 SEC EDGAR 的财报文件元数据、10-K/10-Q 全文章节、EDGAR 全文检索结果,以及 XBRL 财务数据,输出干净、RAG 就绪的 JSON。无需 API 密钥。 - **摘要:** SEC 财报文件、10-K/10-Q 全文与 XBRL 财务数据——RAG 就绪。 - **分类:** public-data - **技术栈:** TypeScript, Cheerio - **市场/地区:** 美国 - **Apify 页面:** https://apify.com/autofacts/sec-edgar-scraper - **关键词:** sec edgar api, sec edgar 爬虫, 10-k 财报数据, 10-q 爬虫, xbrl 财务数据, edgar 全文检索, sec 财报 rag 数据, 公司财务数据 api - **发布时间:** 2026-07-01 - **更新时间:** 2026-07-01 **核心特性:** - 一个 Actor 内置四种模式——财报文件元数据、文档全文、EDGAR 全文检索与 XBRL 财务数据 - RAG 就绪分块——section(章节)、paragraph(约 2000 字符的段落)或 none;每个分块都标注了来源 Item 与顺序 - 自动解析 10-K/10-Q 的“Item N”章节结构(Item 1A 风险因素、Item 7 管理层讨论与分析等) - XBRL 数据点包含分类标准(taxonomy)、标签、名称、单位、数值、财年/报告期、表格类型与登记编号 - 数据点去重会将 XBRL 重述数据合并为每个报告期一行,保留最早披露版本 - 支持按股票代码、CIK 或公司名称对照 SEC 官方 ticker 文件进行公司匹配,并提供模糊匹配兜底 - 支持带引号短语、表格类型与日期区间筛选的 EDGAR 全文检索(覆盖 2001 年至今) - 符合 SEC 规范的速率限制与 User-Agent——无需 API 密钥,无需登录 **应用场景:** - 需要按章节分块、可直接生成向量嵌入的 10-K 与 10-Q 文本的金融 RAG / LLM 管道 - 投资研究——以干净的 XBRL 行记录形式拉取营收、净利润与稀释每股收益的时间序列 - 合规与股权监控——跨公司追踪 Form 4、SC 13D/13G 与风险因素表述 - 无需自建爬虫即可获取结构化 EDGAR 数据的金融科技产品 - 通过全文检索开展市场与行业研究——谁披露过某个表述,以及从何时开始 - 消费干净 XBRL 财务数据行的 BI 与电子表格工作流 **输入参数:** - `mode` (string, 必填) — 提取模式:filings、fulltext、search 或 facts(默认:filings)。 - `ticker` (string, 可选) — 股票代码,例如 AAPL。运行时 ticker/cik/companyName 三者需至少提供一个。 - `cik` (string, 可选) — SEC 中央索引码(CIK),例如 320193——优先级高于 ticker 与 companyName。 - `companyName` (string, 可选) — SEC 注册名称,会与官方 ticker 文件进行精确或模糊匹配。 - `query` (string, 可选) — EDGAR 全文检索表达式,例如 "supply chain disruption"——search 模式下为必填。 - `formTypes` (array, 可选) — 要包含的表格类型,例如 10-K、10-Q、8-K、S-1、DEF 14A、Form 4。留空表示包含所有类型。 - `chunking` (string, 可选) — 全文 RAG 分块策略:section、paragraph(约 2000 字符)或 none(默认:section)。 - `maxItems` (number, 可选) — 最多保存的条目数;每条保存的条目计为一次计费事件(默认:100)。 **常见问题:** **Q: 我需要 SEC 的 API 密钥吗?** 不需要。SEC EDGAR 是免费公开数据。该 Actor 会使用合规的 User-Agent 表明身份,并自动按 SEC 的速率限制自我节流——无需密钥,也无需登录。 **Q: 数据最早可以追溯到什么时候?** EDGAR 全文检索(EFTS)覆盖 2001-05-04 之后的财报文件,且每次查询最多返回 10,000 条命中结果。财报文件元数据可追溯至 1994 年,XBRL 财务数据则覆盖公司在 XBRL 中披露过的全部内容。 **Q: 输出结果是否适合直接用于 LLM 与 RAG?** 是的。在 fulltext 模式下,该 Actor 会将 10-K/10-Q 解析为“Item N”章节,并生成可直接用于向量嵌入的分块(按 section 或约 2000 字符的段落),每个分块都标注了来源 Item 与顺序索引。 **Q: 为什么 fulltext 模式下部分财报文件会被跳过?** 主文档格式不是 HTML 或 TXT 的财报文件(例如仅有 XBRL 的 Form 4 XML)无法进行章节解析,因此会被跳过——且不会产生费用。 ## 输出示例 ```json { "itemType": "filing-fulltext", "title": "Apple Inc. — 10-K 2025-10-31", "company": "Apple Inc.", "ticker": "AAPL", "cik": "0000320193", "formType": "10-K", "filedAt": "2025-10-31", "accessionNo": "0000320193-25-000123", "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...", "sections": [ { "name": "Item 1A — Risk Factors", "charCount": 38241 }, { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 } ], "chunks": [ { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 } ], "textLength": 220151 } ``` ## 价格 按事件计费——只对实际保存的条目计费: | 事件 | 价格 | 说明 | |---|---|---| | 财报文件元数据 / 检索命中 | $0.001 | 一条财报文件元数据记录,或一条全文检索结果 | | 全文财报文件 | $0.005 | 一份财报文件的提取、章节解析与 RAG 分块 | | XBRL 数据点 | $0.0002 | 一条 XBRL 财务数据行 | 拉取 1,000 条财报文件元数据约为 $1.00;1,000 条 XBRL 数据约为 $0.20。`maxItems` 可同时限制拉取量与费用上限。 ## 使用建议 - **需要财务数据时,优先使用 `facts` 模式。** 如果你只需要具体数字,拉取 XBRL 行数据(营收、净利润、EPS)比解析完整财报文件要便宜、干净得多。 - **RAG 场景请使用 `chunking: section`。** 它会保持每个 Item(风险因素、MD&A 等)的完整性,让检索结果返回连贯、可引用的段落。 - **全文检索仅覆盖 2001 年以后的数据。** 若需要更早的披露记录,请通过 CIK 定位公司,直接拉取财报文件元数据。 --- # USAspending.gov Scraper——联邦支出项目、接收方与汇总数据 - **URL:** https://proooxy.com/zh/tools/usaspending-scraper/ - **类型:** tools - **描述:** 查询官方 USAspending.gov API v2 的联邦合同、拨款与贷款数据。支持按机构、接收方、NAICS/PSC 或日期筛选,并可拉取接收方档案、分类汇总,以及州/县/选区的地理汇总数据。无需 API 密钥。 - **摘要:** 来自 USAspending.gov 的联邦支出项目、接收方与支出汇总数据。 - **分类:** public-data - **技术栈:** TypeScript, REST API - **市场/地区:** 美国 - **Apify 页面:** https://apify.com/autofacts/usaspending-scraper - **关键词:** usaspending api, 联邦合同数据, 政府支出数据, 联邦拨款数据, govcon 市场调研, 联邦支出项目数据, naics psc 合同数据 - **发布时间:** 2026-07-01 - **更新时间:** 2026-07-01 **核心特性:** - 官方 USAspending.gov API v2——无需 API 密钥 - 支持按关键词、财年/日期区间、机构、接收方、NAICS、PSC、金额与支出类型检索支出项目 - 六种模式——支出项目检索、支出项目详情、转授项目、接收方档案、分类汇总与地理分布 - 18 个分类汇总维度(接收方、NAICS、PSC、机构、县、选区、CFDA、TAS 等) - 按州、县、国会选区与国家汇总地理数据,并附带人口与人均字段 - 对跨年度的大型结果集自动按月/季度切片 - 自动将支出类型代码分批组合为合法的 API 请求分组 - 支持按生成的项目 ID 精确查询支出项目详情与转授项目 **应用场景:** - GovCon(政府采购)业务拓展——按 NAICS、PSC 或机构寻找商机与在位承包商 - 针对竞争对手中标历史与机构关系的竞争情报 - 追踪联邦支出流向特定接收方或地区的调查性新闻报道 - 按类别、支出类型或时间段研究支出趋势的政策与学术研究 - 对某接收方联邦支出与获授历史的尽职调查 - 按州、县或国会选区绘制联邦支出分布的 BI 仪表盘 **输入参数:** - `mode` (string, 可选) — 工作流:awards、awardDetail、subawards、recipient、byCategory 或 geography(默认:awards)。 - `keywords` (array, 可选) — 用于支出项目检索的 USAspending 自由文本关键词筛选。 - `fiscalYear` (number, 可选) — 联邦财年(对应 10 月 1 日至次年 9 月 30 日的日期区间)。 - `awardTypes` (array, 可选) — USAspending 的支出类型代码;混合的类型分组会被自动拆分为合法请求。 - `agency` (string, 可选) — 精确匹配的授予机构或出资机构名称筛选。 - `naicsCodes` (array, 可选) — 支出项目必须匹配的 NAICS 代码。 - `awardId` (string, 可选) — 生成的项目 ID——awardDetail 与 subawards 模式下运行时为必填。 - `maxItems` (number, 可选) — 最多保存的记录数;每行计为一次计费事件(默认:100)。 **常见问题:** **Q: 我需要 API 密钥吗?** 不需要。USAspending.gov API v2 是公开的,无需密钥或登录。 **Q: 为什么混合的支出类型代码会被拆分成多个请求?** USAspending 不接受在同一次检索中混用不同支出类型分组(合同、IDV、拨款、贷款、其他财政援助、直接支付)的代码。该 Actor 会自动对请求的代码分组,并为每一行输出结果标注匹配到的支出类型代码。 **Q: 支持哪些地理维度的拆分?** 州、县、国会选区与国家——可按履约地点或接收方所在地划分,并包含人口与人均字段。 **Q: 运行如何计费?** 按事件计费,每保存一行收费 $0.001,每条成功返回的记录只收费一次。maxItems 可限制记录行数,从而控制费用。 ## 输出示例 ```json { "itemType": "award", "title": "HT940216C0001 — HUMANA GOVERNMENT BUSINESS INC", "date": "2016-02-01", "awardId": "HT940216C0001", "generatedId": "CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-", "recipient": { "name": "HUMANA GOVERNMENT BUSINESS INC", "uei": "...", "duns": "..." }, "awardingAgency": "Department of Defense", "fundingAgency": "Department of Defense", "amount": 51269205263.03, "awardType": "IDV_B_C", "naics": { "code": "...", "description": "..." }, "placeOfPerformance": { "stateCode": "...", "state": "..." }, "awardTypeCodes": ["IDV_B_C"], "url": "https://www.usaspending.gov/award/CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-" } ``` ## 价格 按事件计费:每保存一条记录**收费 $0.001**,每条成功返回的记录只收费一次。约 1,000 条记录的运行费用约为 $1.00,`maxItems` 可同时限制数量与费用上限。 ## 使用建议 - **GovCon 商机挖掘优先使用 NAICS 或 PSC 代码**——它们直接对应你所销售的产品/服务,能返回最干净、最相关的支出项目集合。 - **在拉取单个支出项目详情之前,先用 `byCategory` 模式**为某个市场的头部接收方或机构排名。 - **geography 模式每个日期区间/支出类型组合只返回首页(最多 100 行)**——做州/县/选区汇总时,应收紧筛选条件,而不是一味调高 `maxItems`。 --- # YouTube Subtitle & Transcript Scraper——JSON、SRT、VTT、LLM 多格式输出 - **URL:** https://proooxy.com/zh/tools/youtube-transcript-scraper/ - **类型:** tools - **描述:** 从视频、Shorts、播放列表与频道中提取 YouTube 字幕与文字稿,输出为 JSON、SRT、VTT、纯文本,或适合 LLM 使用的干净文本。支持 100+ 种语言、丰富的元数据、无需 API 密钥——提取失败不收费。 - **摘要:** YouTube 文字稿,输出 JSON、SRT、VTT 或适合 LLM 使用的文本。 - **分类:** social - **技术栈:** TypeScript, InnerTube - **市场/地区:** 全球 - **Apify 页面:** https://apify.com/autofacts/youtube-subtitle-transcript-scraper - **关键词:** youtube 字幕提取, youtube transcript api, youtube 字幕下载, youtube 字幕转文字, 批量提取 youtube 字幕, youtube 字幕 srt vtt, youtube 文字稿 llm - **发布时间:** 2026-07-01 - **更新时间:** 2026-07-01 **核心特性:** - 单一输入即可处理视频、Shorts、youtu.be 短链接、播放列表与频道——可在同一次运行中混合使用 - 五种输出格式——JSON(带时间戳)、SRT、VTT、纯文本,以及 LLM 就绪格式(去除 [Music]、[Applause] 与说话人标签) - 支持 100+ 种语言,可设置优先级语言列表,并可切换是否回退到自动生成字幕 - 丰富的元数据——标题、频道、简介、发布日期、播放量、缩略图、时长与可用语言 - 批量处理整个播放列表与频道,支持 maxVideos 上限与 1–10 的并发数 - 支持住宅代理,并可选提供 cookie 以减少机器人检测拦截 - 多层提取机制——最多跨 InnerTube 客户端提供九级回退,并以 yt-dlp PO-token 作为最后手段 - 熔断机制与逐条错误处理,确保大批量任务持续运行 **应用场景:** - AI/ML 团队基于视频语音构建 RAG 或微调数据集(输出 LLM 就绪文本) - 内容团队将文字稿二次创作为博客文章、节目笔记与社交媒体文案 - SEO 营销人员提取可检索的视频文本,用于收录与关键词研究 - 需要标准 SRT/VTT 字幕文件的编辑与出版方 - 批量采集整个频道或播放列表文字稿的研究人员 - 无需 YouTube API 密钥即可获取结构化、带时间戳字幕的开发者 **输入参数:** - `urls` (array, 可选) — YouTube URL 或裸 ID——视频、Shorts、youtu.be 链接、播放列表或频道。运行时为必填。 - `outputFormat` (string, 可选) — 文字稿格式:json、srt、vtt、text 或 llm(默认:json)。 - `languages` (array, 可选) — 按优先级排序的字幕语言偏好,使用 ISO 639-1 代码(默认:en)。 - `includeAutoGenerated` (boolean, 可选) — 当没有人工字幕时,是否回退到自动生成字幕(默认:true)。 - `maxVideos` (number, 可选) — 每次运行处理的视频数量上限,例如用于播放列表/频道场景(默认:0 表示不限)。 - `maxConcurrency` (number, 可选) — 并行处理的视频数,1–10(默认:3)。 - `proxyConfiguration` (object, 可选) — 代理设置;默认使用固定为美国的 Apify 住宅代理。 - `youtubeCookies` (string, 可选) — 可选的 YouTube cookie(Cookie 请求头或 cookies.txt),用于减少机器人检测拦截。 **常见问题:** **Q: 我需要 YouTube API 密钥或登录吗?** 不需要。该 Actor 直接提取字幕——无需 YouTube Data API 密钥,也无需登录。你可以选择性提供 cookie 输入,以减少部分视频出现的“Sign in to confirm you're not a bot”拦截。 **Q: 支持哪些语言与字幕类型?** 支持 100 多种语言。提供一份按优先级排序的 ISO 639-1 代码列表(默认:en);该 Actor 会优先使用人工创建的字幕,并在未关闭 includeAutoGenerated 的情况下回退到自动生成字幕。 **Q: 提取失败的视频会收费吗?** 不会。计费方式为按事件计费,仅在文字稿成功保存后才会产生一次计费事件。提取失败的视频会在输出中显示 error 字段,且不会产生费用。 **Q: 可以获取适合 RAG 使用的干净 LLM 就绪文本吗?** 可以。将 outputFormat 设为 'llm',即可去除 [Music]/[Applause] 等标注与说话人标签,生成适合生成向量嵌入与微调的干净文本。 ## 输出示例 ```json { "videoId": "dQw4w9WgXcQ", "url": "https://www.youtube.com/watch?v=dQw4w9WgXcQ", "title": "Rick Astley - Never Gonna Give You Up (Official Video)", "channelName": "Rick Astley", "channelId": "UCuAXFkgsw1L7xaCfnd5JJOw", "publishDate": "2009-10-25", "viewCount": 1761003712, "availableLanguages": ["en", "de-DE", "ja", "pt-BR", "es-419"], "language": "en", "isAutoGenerated": false, "duration": 213, "wordCount": 487, "segmentCount": 61, "text": "We're no strangers to love, you know the rules and so do I...", "segments": [{ "text": "We're no strangers to love", "start": 18.64, "end": 21.88 }], "error": null } ``` ## 价格 按事件计费:每份**成功提取的文字稿**只收费一次——提取失败的视频永远不收费。你可以直接输入整个频道或播放列表,只为实际拿到的字幕付费。 ## 使用建议 - **RAG 与微调场景请使用 `outputFormat: llm`**——它会移除非语音标注,让你的向量嵌入只看到干净的文本。 - **请保持住宅代理开启。** YouTube 会激进地封锁数据中心 IP;该 Actor 默认使用美国住宅代理正是出于这个原因。 - **大批量任务请将 `maxConcurrency` 从 1–3 开始**,再逐步提高——并发过高会增加大型频道抓取时触发速率限制的风险。 --- # Sephora Scraper(全球版) - **URL:** https://proooxy.com/zh/tools/sephora-scraper/ - **类型:** tools - **描述:** 这是一款 Apify Actor,可提取 Sephora 完整的商品数据——变体、价格、图片、成分与评论——覆盖美国、加拿大、9 个欧盟市场与 10 个亚太市场,共 21 个站点,全部纳入同一套规范化 schema。 - **摘要:** 抓取任意 Sephora 站点——21 个市场,一个 Actor 搞定。 - **分类:** ecommerce - **技术栈:** Python, Crawlee, curl_cffi - **市场/地区:** 美国, 加拿大, 法国, 意大利, 德国, 西班牙, 波兰, 捷克, 希腊, 罗马尼亚, 葡萄牙, 新西兰, 澳大利亚, 新加坡, 马来西亚, 泰国, 印度尼西亚, 菲律宾, 中国香港, 中国台湾, 文莱 - **反爬虫策略:** 通过住宅代理 + curl_cffi TLS 指纹伪装绕过 Akamai - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/sephora - **关键词:** sephora 爬虫, sephora 商品数据, sephora api, 抓取 sephora 商品, sephora 价格追踪, 美妆商品数据, 化妆品数据采集, sephora 全球爬虫 - **发布时间:** 2026-04-18 - **更新时间:** 2026-04-18 **核心特性:** - 一个 Actor 覆盖 21 个站点——美国、加拿大、9 个欧盟市场与 10 个亚太市场,由同一个 SKU 统一提供服务 - 自动识别市场——粘贴任意 sephora.* URL,调度器会自动路由到对应模块 - 支持混合多市场运行——在同一个 startUrls 列表中混合 US + EU + SEA 的 URL,统一流式写入同一个数据集,并以 `market` 字段标记 - 语言区域正确的定价——由 Sephora 自身的本地化层返回 NZD、EUR、USD、AUD,以及另外 17 种币种 - 规范化 schema——所有市场都输出相同的 `source / brand / title / options / variants / medias / stats` 结构 - 按市场隔离会话——认证状态不会在地区之间相互污染 - 全局熔断机制——连续 50 次失败会中止运行,避免在目标下线时持续消耗算力 **应用场景:** - 覆盖美国、欧盟与亚太美妆市场的跨地区定价情报 - 跨市场商品可购性与选品结构监控 - 品牌进入 Sephora 新市场时的竞品分析 - 跨地区配方成分对比 - 评论与评分追踪——包括东南亚的心愿单信号与美国的 AI 情感摘要 - 按市场审计会员/忠诚度定价 **输入参数:** - `startUrls` (array, 必填) — 任意 sephora.* 站点的商品页或分类页 URL。市场会根据主机名自动识别。 - `market` (string, 可选) — 可选的市场覆盖设置(us、eu-fr、eu-it、eu-de、eu-es、eu-pl、eu-cz、eu-gr、eu-ro、eu-pt、sea-nz、sea-au、sea-sg、sea-my、sea-th、sea-id、sea-ph、sea-hk、sea-tw、sea-bn)。 - `locale` (string, 可选) — 可选的 BCP 47 语言区域代码(例如 fr-FR、en-NZ)——会覆盖市场默认值。 - `categoryIds` (array, 可选) — 仅限 EU。SFCC 分类 ID(例如 C479)——可替代直接粘贴分类页 URL。 - `proxy` (object, 可选) — Apify 代理配置。强烈建议使用住宅代理;请将 apifyProxyCountry 固定为目标市场。 - `maxConcurrency` (number, 可选) — 并发请求数。默认 5。US:2-5。EU:3。SEA:8-16。 - `maxRequestsPerCrawl` (number, 可选) — 跨所有市场的全局硬性上限。0 表示不限。 **常见问题:** **Q: 这个爬虫支持哪些 Sephora 站点?** 共 21 个站点:美国(sephora.com)、加拿大(sephora.ca)、9 个欧盟市场(FR、IT、DE、ES、PL、CZ、GR、RO、PT),以及 10 个亚太市场(NZ、AU、SG、MY、TH、ID、PH、HK、TW、BN)。市场会根据主机名自动识别——混合多个市场时无需修改输入。 **Q: 可以在一次运行中抓取多个市场吗?** 可以。在同一个 startUrls 列表中混合 sephora.com、sephora.fr 与 sephora.nz 的 URL 即可。调度器会按市场对它们分组,以各市场对应的认证方式并发运行各模块,并为数据集中的每条记录打上 `market` 字段标记。 **Q: 爬虫是如何处理反爬虫防护的?** 所有市场均使用住宅代理,EU 与 SEA 流量还会使用 curl_cffi 进行浏览器级 TLS 指纹伪装以绕过 Akamai。US 流量则使用 Crawlee 的 HttpCrawler,配合在 403/429 时自动轮换的会话池。 **Q: 我现有的 v1.x 版本美国运行配置还能继续用吗?** 可以。2.0 之前的输入字段——startUrls、maxConcurrency、proxy、maxRequestsPerCrawl——行为完全一致。唯一的输出变化是每条记录新增了一个 `market` 字段,这是一个非破坏性的增量变更。 **Q: 为什么 SEA 数据中部分字段为 null?** Sephora SEA 的 API 不提供 `lovesCount` 计数器,因此亚太商品的 `stats.lovesCount` 为 null;每个变体改为提供一个布尔型的 `wishlisted` 字段。相对地,`sentiments`(AI 评论摘要)与 `source.crawlUrl` 仅美国市场提供。 **Q: 每个市场是否都需要单独的 API 令牌或账户?** 不需要。你现有的 Apify API 令牌无需任何改动即可继续使用。该 Actor 会在内部处理各市场的访客令牌——EU/SEA 无需任何凭证,US 则使用标准的 Apify 住宅代理。 ## 支持的市场 | 地区 | 市场 ID | 国家/地区 | 币种 | 域名 | |---|---|---|---|---| | 美洲 | `us` | 美国 | USD | sephora.com | | 美洲 | `us` | 加拿大 | CAD | sephora.ca | | 欧盟 | `eu-fr` | 法国 | EUR | sephora.fr | | 欧盟 | `eu-it` | 意大利 | EUR | sephora.it | | 欧盟 | `eu-de` | 德国 | EUR | sephora.de | | 欧盟 | `eu-es` | 西班牙 | EUR | sephora.es | | 欧盟 | `eu-pl` | 波兰 | PLN | sephora.pl | | 欧盟 | `eu-cz` | 捷克 | CZK | sephora.cz | | 欧盟 | `eu-gr` | 希腊 | EUR | sephora.gr | | 欧盟 | `eu-ro` | 罗马尼亚 | RON | sephora.ro | | 欧盟 | `eu-pt` | 葡萄牙 | EUR | sephora.pt | | 亚太 | `sea-nz` | 新西兰 | NZD | sephora.nz | | 亚太 | `sea-au` | 澳大利亚 | AUD | sephora.com.au | | 亚太 | `sea-sg` | 新加坡 | SGD | sephora.sg | | 亚太 | `sea-my` | 马来西亚 | MYR | sephora.com.my | | 亚太 | `sea-th` | 泰国 | THB | sephora.co.th | | 亚太 | `sea-id` | 印度尼西亚 | IDR | sephora.co.id | | 亚太 | `sea-ph` | 菲律宾 | PHP | sephora.ph | | 亚太 | `sea-hk` | 中国香港 | HKD | sephora.hk | | 亚太 | `sea-tw` | 中国台湾 | TWD | sephora.tw | | 亚太 | `sea-bn` | 文莱 | BND | sephora.bn | ## 输出示例 ```json { "market": "sea-nz", "source": { "id": 58792, "canonicalUrl": "https://www.sephora.nz/products/rare-beauty-true-to-myself-natural-matte-longwear-foundation", "retailer": "SEPHORA", "currency": "NZD" }, "brand": "Rare Beauty", "title": "True To Myself Natural Matte Longwear Foundation", "description": "

A self-priming and self-setting foundation...

", "ingredients": "Aqua/Water, Cyclopentasiloxane, Glycerin...", "currentSku": "770225", "categories": ["makeup/face/foundation"], "options": [ { "name": "shade", "id": "66488", "values": [{"value": "1 Fair Neutral", "orderable": true}] } ], "variants": [ { "id": "276343", "sku": "770225", "price": { "current": 77.0, "original": 77.0, "stockStatus": "IN_STOCK" }, "options": [{"name": "shade", "value": "1 Fair Neutral"}], "highlights": ["NEW", "Only at Sephora"], "wishlisted": null } ], "medias": [{ "url": "https://www.sephora.nz/.../foundation-shade.jpg", "type": "image" }], "stats": { "reviewCount": 971, "rating": 4.8, "lovesCount": null } } ``` ## 使用建议 - **将代理国家固定为目标市场。** 住宅出口节点与目标市场国家不匹配,是触发 Sephora Akamai 层 403 错误的头号原因。请将 `apifyProxyCountry` 设置为对应站点的 ISO 代码(`US`、`FR`、`NZ` 等)。 - **先做冒烟测试。** 在新市场首次正式运行前,先将 `maxRequestsPerCrawl` 设为 10。 - **按地区调整并发数。** US:2-5。EU:3。SEA:8-16。混合运行时,每个市场都拥有各自独立的信号量。 --- # Boohoo Scraper——覆盖 7 个地区的商品数据 - **URL:** https://proooxy.com/zh/tools/boohoo-scraper/ - **类型:** tools - **描述:** 提取 Boohoo 电商网站在 7 个地区的商品数据,支持自动分页、分面筛选与多币种。 - **摘要:** 抓取 Boohoo 在 7 个地区站点的商品数据。 - **分类:** ecommerce - **技术栈:** TypeScript, Cheerio, Fingerprint Generator - **市场/地区:** 荷兰, 瑞典, 英国, 爱尔兰, 法国, 澳大利亚, 美国 - **反爬虫策略:** 生成浏览器指纹以绕过反爬虫防护 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/boohoo-scraper - **关键词:** boohoo 爬虫, boohoo 商品数据, boohoo 价格监控, 快时尚爬虫, 时尚品类数据, 多地区时尚数据 - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 支持 7 个地区站点——荷兰(EUR)、瑞典(SEK)、英国(GBP)、爱尔兰(EUR)、法国(EUR)、澳大利亚(AUD)、美国(USD) - 分类与搜索页抓取,自动分页 - 支持分面筛选——尺码、颜色、价格区间、风格 - 完整商品详情,包括变体与库存状态 - 生成浏览器指纹以绕过反爬虫防护 - 根据地区站点自动匹配对应币种价格 **应用场景:** - 快时尚竞品定价分析 - 同款商品的跨地区比价 - 平价时尚的趋势监控 - 跨地区库存追踪 - 覆盖欧洲及全球市场的时尚行业调研 **输入参数:** - `startUrls` (array, 必填) — Boohoo 商品页或分类页 URL - `maxRequestsPerCrawl` (number, 可选) — 请求数量上限(默认:5) - `maxConcurrency` (number, 可选) — 并行请求数(默认:5) - `proxy` (object, 可选) — 代理配置 **常见问题:** **Q: 支持哪些地区的 Boohoo 站点?** 荷兰(EUR)、瑞典(SEK)、英国(GBP)、爱尔兰(EUR)、法国(EUR)、澳大利亚(AUD)与美国(USD)。 **Q: 可以按尺码或颜色筛选商品吗?** 可以,爬虫支持分面筛选。你可以直接提供带筛选条件的分类页 URL,爬虫会遵循已应用的筛选条件。 **Q: 爬虫如何处理分页?** 分页是自动处理的。只需提供分类页或搜索页 URL,爬虫会跟随所有分页链接,提取每一件商品。 ## 输出示例 ```json { "source": "https://www.boohoo.com/...", "brand": "boohoo", "title": "Oversized Hoodie", "description": "Stay cozy in this oversized hoodie...", "categories": ["Women", "Hoodies & Sweatshirts"], "price": { "current": 1500, "original": 3000, "currency": "GBP" }, "variants": [ { "sku": "BH-OH-BLK-S", "size": "S", "color": "Black", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Farfetch Scraper——奢侈时尚商品数据 - **URL:** https://proooxy.com/zh/tools/farfetch-scraper/ - **类型:** tools - **描述:** 提取 Farfetch 的奢侈时尚商品数据,包括多币种定价、尺码/版型变体与商品推荐。 - **摘要:** 抓取 Farfetch 的奢侈时尚商品,支持多币种。 - **分类:** ecommerce - **技术栈:** TypeScript, Cheerio, Crawlee - **市场/地区:** 全球 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/farfetch - **关键词:** farfetch 爬虫, farfetch 商品数据, 奢侈时尚数据, 设计师品牌爬虫, farfetch 价格监控, 奢侈品零售数据 - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 分类页与商品详情页抓取 - 多币种定价——根据代理所在地区自动识别 - 可选的尺码/版型变体提取 - 每件商品最多提取 90 个推荐商品 - 完整的媒体图库与详细描述 - 提取品牌、分类与附加信息 **应用场景:** - 奢侈时尚市场情报 - 设计师品牌的跨平台比价 - 时尚趋势分析与选品发现 - 多品牌零售商的竞品定价分析 - 商品推荐引擎的训练数据 **输入参数:** - `startUrls` (array, 必填) — Farfetch 商品页或分类页 URL - `proxy` (object, 可选) — 代理配置——地区会影响返回的币种 - `maxRequestsPerCrawl` (number, 可选) — 请求数量上限(默认:100) - `maxConcurrency` (number, 可选) — 并行请求数(默认:5) - `withSizeFit` (boolean, 可选) — 是否包含尺码/版型数据(默认:false) - `withRecommends` (boolean, 可选) — 是否包含推荐商品(默认:false) **常见问题:** **Q: 多币种定价是如何实现的?** Farfetch 会根据访问者所在地区显示价格。爬虫通过代理所在地区来决定返回哪种币种——使用美国代理返回 USD,英国代理返回 GBP,以此类推。 **Q: 最多可以提取多少个推荐商品?** 启用 withRecommends 后,每件商品最多可提取 90 个推荐商品。这对构建商品关系图谱与推荐数据集非常有用。 ## 输出示例 ```json { "source": "https://www.farfetch.com/shopping/...", "brand": "Gucci", "title": "GG Marmont Matelasse Shoulder Bag", "description": "Crafted from matelasse leather...", "details": ["Made in Italy", "100% Calf Leather"], "categories": ["Women", "Bags", "Shoulder Bags"], "options": [ { "name": "Size", "values": ["One Size"] } ], "variants": [ { "sku": "FF-GU-001", "price": 229000, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Global API Load Tester——10K+ RPS 压力测试 - **URL:** https://proooxy.com/zh/tools/load-tester/ - **类型:** tools - **描述:** 高性能负载测试工具,可模拟 10,000+ 每秒请求数,支持地理分布式流量、加权测试目标与交互式 HTML 报告。 - **摘要:** 地理分布式负载测试,可模拟 10K+ RPS。 - **分类:** utility - **技术栈:** Go, Vegeta - **市场/地区:** 全球 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/global-api-load-tester - **关键词:** api 负载测试工具, http 负载测试, 压力测试工具, 性能测试工具, 10k rps 压测, 地理分布式负载测试, vegeta 负载测试 - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 极致性能——每秒 10,000+ 请求 - 支持从美国、欧洲与亚洲发起地理分布式测试 - 多目标加权攻击(例如 90% 读 / 10% 写) - 支持住宅代理,模拟更真实的流量 - 恒定速率节流,避免 Coordinated Omission(协调遗漏)问题 - 通过 Vegeta Plots 生成交互式 HTML 报告 - 详细的延迟、吞吐量与错误指标 **应用场景:** - 上线前的 API 性能基准测试 - 容量规划与基础设施规模评估 - 定位系统的极限点与性能瓶颈 - 测试 CDN 与负载均衡器配置 - 地理分布式延迟测试 - 对性能关键端点做回归测试 **输入参数:** - `targets` (array, 必填) — 目标端点列表,包含 URL、method、body、headers 与权重 - `rate` (number, 可选) — 每秒请求数(默认:50) - `duration` (number, 可选) — 测试时长,单位秒(默认:60) - `geoDistribution` (array, 可选) — 地区列表,包含国家代码与流量权重 - `useStickySessions` (boolean, 可选) — 是否保持会话粘性(默认:true) - `maxCostLimit` (number, 可选) — 本次测试运行的费用上限 **常见问题:** **Q: 地理分布式测试是如何工作的?** 你只需指定国家代码与流量权重,工具会将请求分发到这些地区的 Apify 代理服务器上,模拟真实的全球流量模式。 **Q: 什么是 Coordinated Omission(协调遗漏)?** 这是负载测试中常见的一个陷阱:当目标系统过载时,测试工具本身也会随之变慢,导致结果看起来比实际情况更好。Vegeta 通过恒定速率节流来避免这一问题。 **Q: 可以测试需要身份验证的端点吗?** 可以,在目标配置中加入 authorization 请求头即可。每个目标都可以拥有各自独立的 headers、method 与 body。 ## 输出示例 该负载测试工具会生成交互式 HTML 报告与结构化指标数据: ```json { "summary": { "totalRequests": 50000, "duration": "60s", "rps": 833.33, "successRate": 99.8, "latency": { "mean": "12.4ms", "p50": "10.1ms", "p95": "28.7ms", "p99": "89.2ms", "max": "342.1ms" }, "statusCodes": { "200": 49900, "503": 100 } } } ``` --- # Lululemon Scraper——商品、变体与价格 - **URL:** https://proooxy.com/zh/tools/lululemon-scraper/ - **类型:** tools - **描述:** 抓取并提取 Lululemon 的商品详情,包括变体数据、颜色选项、媒体图库与定价信息。 - **摘要:** 提取 Lululemon 的商品数据,含变体与媒体资源。 - **分类:** ecommerce - **技术栈:** TypeScript, Crawlee - **市场/地区:** 美国 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/lululemon-scraper - **关键词:** lululemon 爬虫, lululemon 商品数据, lululemon 价格追踪, 运动服饰商品数据, 运动休闲定价数据, lululemon 库存爬虫 - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 分类页与商品页抓取 - 提取包含颜色与尺码选项的商品变体 - 完整媒体图库,按颜色区分图片 - 价格追踪,输出结构化数据 - 提取分类层级结构 - 基于 Crawlee 框架,轻量快速 **应用场景:** - 运动服饰市场调研与竞品分析 - 面向转售商与比价平台的价格监控 - 健身类电商的商品目录聚合 - 颜色与尺码库存追踪 - 运动休闲时尚趋势分析 **输入参数:** - `startUrls` (array, 必填) — Lululemon 商品页或分类页 URL - `proxy` (object, 可选) — 代理配置 - `maxConcurrency` (number, 可选) — 并行请求数上限 **常见问题:** **Q: 爬虫能处理不同的颜色变体吗?** 可以,每个颜色变体都会附带各自独立的图片、SKU 与库存状态,媒体图库也按颜色区分。 **Q: 可以抓取整个 Lululemon 分类吗?** 可以,提供一个分类页 URL,爬虫会抓取该分类下的所有商品。 ## 输出示例 ```json { "source": "https://shop.lululemon.com/p/...", "brand": "lululemon", "title": "Align High-Rise Pant 25\"", "description": "Buttery-soft, weightless Nulu fabric...", "categories": ["Women", "Pants", "Yoga Pants"], "options": [ { "name": "Color", "values": ["Black", "True Navy", "Dark Olive"] }, { "name": "Size", "values": ["2", "4", "6", "8", "10", "12"] } ], "variants": [ { "sku": "LL-AHR-BLK-6", "name": "Black / 6", "price": 9800, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://...", "color": "Black" } ], "stats": { "rating": 4.7, "reviewCount": 15234 } } ``` --- # Schema Markup Scraper——结构化数据抓取与 SEO 审计工具 - **URL:** https://proooxy.com/zh/tools/schema-markup-scraper/ - **类型:** tools - **描述:** 从任意 URL 提取 JSON-LD、Microdata、RDFa、Open Graph 与 Twitter Cards,并提供完整的 SEO 审计评分系统。 - **摘要:** 为任意网站提取结构化数据并进行 SEO 审计。 - **分类:** utility - **技术栈:** TypeScript, Crawlee - **市场/地区:** 全球 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/metadata-scraper - **关键词:** schema markup 检测工具, 结构化数据提取, json-ld 提取工具, seo 审计工具, open graph 检测, microdata 爬虫, 富媒体结果测试 - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 结构化数据提取——JSON-LD、Microdata 与 RDFa - 社交元标签——Open Graph、Twitter Cards、Dublin Core - SEO 分析,采用 0-100 分制评分 - 规范网址与 hreflang 校验 - 提取作者信息,用于 EEAT 信号评估 - LocalBusiness 检测,覆盖 80+ 种子类型 - 图片 alt 文本审计 - 面包屑 schema 校验 - 提取地理标签与 NAP 信息 **应用场景:** - 大规模技术性 SEO 审计 - 网站结构化数据校验 - 竞品 SEO 分析——对比各竞争对手的 schema 标记 - 面向内容网站的 EEAT 信号评估 - 面向本地商家的本地 SEO 审计 - 上线前的 SEO 检查清单校验 **输入参数:** - `startUrls` (array, 必填) — 待分析的 URL - `proxy` (object, 可选) — 代理配置 - `maxRequestsPerCrawl` (number, 可选) — 限制待审计的 URL 总数 - `maxConcurrency` (number, 可选) — 并行请求数 - `extractMetaTags` (boolean, 可选) — 是否提取 meta 标签(默认:true) - `extractSeoAnalysis` (boolean, 可选) — 是否运行 SEO 分析(默认:true) - `computeSeoScore` (boolean, 可选) — 是否计算 0-100 的 SEO 评分(默认:true) - `extractGeoData` (boolean, 可选) — 是否提取地理标签与 NAP 数据 **常见问题:** **Q: 支持哪些结构化数据格式?** JSON-LD、Microdata 与 RDFa。此外,爬虫还会提取 Open Graph、Twitter Cards 与 Dublin Core 元数据。 **Q: SEO 评分是如何计算的?** 这个 0-100 的评分会综合评估标题标签、meta 描述、标题层级结构、图片 alt 文本、规范网址、移动端 viewport、结构化数据是否存在等多项因素。 **Q: 可以一次审计多个页面吗?** 可以,在 startUrls 中提供多个 URL 即可。爬虫会并行处理,实现快速批量审计。 ## 输出示例 ```json { "url": "https://example.com/product/...", "title": "Example Product Page", "linkedData": [ { "@type": "Product", "name": "..." } ], "openGraph": { "og:title": "Example Product", "og:type": "product" }, "twitterCard": { "card": "summary_large_image" }, "seoAudit": { "score": 78, "issues": [ "Missing alt text on 3 images", "No hreflang tags detected" ] }, "headings": { "h1": ["Example Product"], "h2": ["Description", "Reviews"] } } ``` --- # Sephora EU Scraper——覆盖 9 个欧洲市场 - **URL:** https://proooxy.com/zh/tools/sephora-eu-scraper/ - **类型:** tools - **描述:** 抓取 Sephora 欧洲站点在 9 个欧盟市场的完整商品数据,支持多变体提取、Akamai WAF 绕过与智能令牌管理。 - **摘要:** 提取 Sephora 在 9 个欧洲市场的商品数据。 - **分类:** ecommerce - **技术栈:** TypeScript, Crawlee, Akamai Bypass - **市场/地区:** 法国, 意大利, 德国, 西班牙, 波兰, 捷克, 希腊, 罗马尼亚, 葡萄牙 - **反爬虫策略:** Akamai WAF——浏览器级 TLS 指纹伪装 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/sephora-eu-scraper - **关键词:** sephora 欧洲爬虫, sephora eu 商品数据, 欧洲美妆数据, sephora 法国爬虫, sephora 德国爬虫, 欧洲美妆数据采集, akamai waf 绕过 - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 支持 9 个欧盟市场——FR、IT、DE、ES、PL、CZ、GR、RO、PT - 多变体提取,各自独立的价格与库存状态 - 每件商品的高分辨率图库 - 通过分类 ID 浏览分类,实现批量提取 - 浏览器级 TLS 指纹伪装,绕过 Akamai WAF - 访客令牌管理,支持自动刷新与指数退避 **应用场景:** - 泛欧洲美妆市场比价 - 跨市场商品可购性监控 - 美妆品牌拓展欧盟市场的调研 - 覆盖欧洲各市场的竞争情报 - 区域定价策略分析 **输入参数:** - `startUrls` (array, 可选) — 待抓取的 Sephora EU 商品 URL - `categoryIds` (array, 可选) — 用于批量商品提取的分类 ID - `locale` (string, 可选) — 目标市场语言区域(例如 fr-FR、it-IT) - `maxProducts` (number, 可选) — 最多提取的商品数量 - `maxConcurrency` (number, 可选) — 并行请求数上限 - `proxyConfiguration` (object, 可选) — 代理设置——推荐使用住宅代理 **常见问题:** **Q: 支持哪些欧洲 Sephora 市场?** 法国(fr-FR)、意大利(it-IT)、德国(de-DE)、西班牙(es-ES)、波兰(pl-PL)、捷克(cs-CZ)、希腊(el-GR)、罗马尼亚(ro-RO)与葡萄牙(pt-PT)。 **Q: 爬虫是如何绕过 Akamai WAF 的?** 它使用浏览器级 TLS 指纹伪装来模拟真实的浏览器连接,使请求与真实用户流量难以区分。 **Q: 可以抓取整个分类吗?** 可以,提供分类 ID 即可提取该分类下的所有商品,这是批量提取效率最高的方式。 ## 输出示例 ```json { "source": "https://www.sephora.fr/p/...", "brand": "Rare Beauty", "title": "Soft Pinch Liquid Blush", "description": "Un blush liquide longue tenue...", "shortDescription": "Blush liquide", "categories": ["Maquillage", "Teint", "Blush"], "options": [ { "name": "Shade", "values": ["Joy", "Hope", "Grace"] } ], "variants": [ { "sku": "EU-RB-001", "name": "Joy", "price": 2800, "currency": "EUR", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ], "stats": { "rating": 4.7, "reviewCount": 3421 } } ``` --- # Shopify Scraper——任意商店的商品数据 - **URL:** https://proooxy.com/zh/tools/shopify-scraper/ - **类型:** tools - **描述:** 专业级工具,可从任意 Shopify 商店提取高保真商品数据,包括系列(collections)、搜索与商品推荐。 - **摘要:** 提取任意 Shopify 商店的商品数据。 - **分类:** ecommerce - **技术栈:** TypeScript, got-scraping - **市场/地区:** 全球 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/shopify-scraper-ppe - **关键词:** shopify 爬虫, shopify 商品爬虫, 抓取 shopify 商店, shopify 商品数据, shopify api 替代方案, 电商数据采集, 导出 shopify 商品, shopify collection 爬虫 - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 通用性强——适用于任意基于 Shopify 搭建的商店 - 支持全店目录提取与搜索 - 商品推荐(每件商品最多 20 个) - 支持系列(collection)与单品抓取 - 提取标签与分类 - 货币规范化(价格 ×100)以保证精度 **应用场景:** - 覆盖任意细分领域 Shopify 商店的市场调研 - DTC 品牌的竞品分析 - 为比价平台聚合商品目录 - 独立电商网站的趋势监控 - 构建商品推荐数据集 - 面向转售商的价格监控 **输入参数:** - `startUrls` (array, 必填) — Shopify 商店 URL——商品页、系列页或商店首页 - `proxy` (object, 可选) — 推荐使用住宅代理以获得最佳效果 - `maxRequestsPerCrawl` (number, 可选) — 请求数量上限(默认:100) - `maxRecommendationsPerProduct` (number, 可选) — 要获取的推荐商品数(默认:0,最大:20) - `query` (string, 可选) — 用于在商店内查找商品的搜索关键词 **常见问题:** **Q: 这个工具适用于任意 Shopify 商店吗?** 是的,该爬虫适用于任意基于 Shopify 搭建的商店。它利用了 Shopify 标准的商品数据结构,这一结构在所有商店中都是一致的。 **Q: 可以搜索特定商品吗?** 可以,使用 query 参数即可在指定商店内搜索。这在你只想查找特定类型商品、而不想抓取整个目录时非常有用。 **Q: 商品推荐是如何提取的?** 设置 maxRecommendationsPerProduct 即可获取相关商品。每件商品最多可提供 20 个推荐,适合用于构建商品关系图谱。 ## 输出示例 ```json { "source": "https://store.example.com/products/...", "brand": "Example Brand", "title": "Premium Organic Cotton T-Shirt", "description": "Made from 100% organic cotton...", "categories": ["Tops", "T-Shirts"], "tags": ["organic", "sustainable", "cotton"], "options": [ { "name": "Size", "values": ["S", "M", "L", "XL"] }, { "name": "Color", "values": ["White", "Black", "Navy"] } ], "variants": [ { "sku": "SHOP-OCT-WHT-M", "name": "White / M", "price": 4500, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Ulta Beauty Scraper——商品、价格与 SKU - **URL:** https://proooxy.com/zh/tools/ulta-scraper/ - **类型:** tools - **描述:** 提取 Ulta Beauty 的商品详情、定价、图片与 SKU 信息,覆盖分类页、品牌页与促销专区。 - **摘要:** 抓取 Ulta Beauty 的完整商品数据。 - **分类:** ecommerce - **技术栈:** TypeScript, Cheerio, Crawlee - **市场/地区:** 美国 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/ulta-scraper - **关键词:** ulta 爬虫, ulta beauty 爬虫, ulta 商品数据, ulta 价格追踪, ulta sku 爬虫, ulta 促销监控, 美妆零售数据 - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 支持分类页、商品详情页、品牌页与促销页 - 完整商品详情,含价格、描述与图片 - SKU 级别数据提取,并按变体分组 - 根据 URL 自动识别页面类型 - 基于 Cheerio 的轻量解析,速度更快 - 将相关 SKU 归并到同一商品下 **应用场景:** - 美妆行业竞品分析——Ulta 与 Sephora 定价对比 - 为比价购物平台构建商品目录 - 促销活动监控 - 品牌发现与市场覆盖追踪 - SKU 级别的库存监控 **输入参数:** - `startUrls` (array, 必填) — Ulta 商品页、分类页、品牌页或促销页 URL - `proxy` (object, 可选) — 代理配置 - `maxConcurrency` (number, 可选) — 最大并行请求数 - `maxRequestsPerCrawl` (number, 可选) — 限制每次运行的请求总数 **常见问题:** **Q: 可以抓取哪些类型的 Ulta 页面?** 该爬虫支持商品详情页、分类列表页、品牌页与促销页,并会根据 URL 自动识别页面类型。 **Q: 商品变体是如何处理的?** 变体(不同色号、尺码)会归并在同一个父商品下,每个变体都包含各自的 SKU、价格与库存状态。 ## 输出示例 ```json { "source": "https://www.ulta.com/p/...", "brand": "NYX Professional Makeup", "title": "Butter Gloss", "description": "A buttery soft and silky lip gloss...", "categories": ["Makeup", "Lips", "Lip Gloss"], "variants": [ { "sku": "ULTA-NYX-BG-001", "name": "Angel Food Cake", "price": 900, "currency": "USD", "inStock": true } ], "stats": { "rating": 4.5, "reviewCount": 8932 } } ``` --- # Universal Web Printer——URL 与 HTML 转 PDF、图片 - **URL:** https://proooxy.com/zh/tools/web-printer/ - **类型:** tools - **描述:** 将任意 URL 或 HTML 转换为 PDF、PNG、JPEG 或 WebP,支持智能滚动拼接、元素提取、PDF 加密与水印。 - **摘要:** 将 URL 与 HTML 转换为 PDF、PNG、JPEG 或 WebP。 - **分类:** utility - **技术栈:** TypeScript, Playwright, PDF-lib, Sharp - **市场/地区:** 全球 - **官方成功率:** >99% - **Apify 页面:** https://apify.com/autofacts/universal-web-printer - **关键词:** html 转 pdf api, url 转 pdf 工具, 网站截图 api, 网页转 pdf, url 转图片, 网页转 png, pdf 生成 api - **发布时间:** 2026-04-04 - **更新时间:** 2026-04-04 **核心特性:** - 多格式输出——PDF、PNG、JPEG、WebP - 多种视图模式——viewport(视口)、full-page(整页)、CSS 选择器、readability(阅读模式) - 智能滚动拼接,实现精确的整页截图 - 通过 CSS 选择器实现元素级提取 - 页面操控——移除元素、点击按钮、注入 CSS、隐藏固定头部 - PDF 加密(RC4 128 位)与水印 - 支持多页文档的 PDF 合并 - 自定义视口与缩放比例配置 **应用场景:** - 从网页仪表盘自动生成报告 - 网站存档与留档 - 视觉回归测试快照 - 为商品目录截取电商商品页截图 - 法律合规——将网页内容截取存证 - 从 Web 应用生成 PDF **输入参数:** - `startUrls` (array, 可选) — 待渲染的 URL - `htmlContent` (string, 可选) — 待渲染的原始 HTML - `outputFormat` (string, 可选) — pdf、png、jpeg 或 webp(默认:pdf) - `viewMode` (string, 可选) — viewport、fullPage、selector 或 readability - `targetSelector` (string, 可选) — 用于元素级截图的 CSS 选择器 - `viewportWidth` (number, 可选) — 浏览器视口宽度(默认:1280) - `viewportHeight` (number, 可选) — 浏览器视口高度(默认:720) - `removeSelectors` (array, 可选) — 截图前要移除元素的 CSS 选择器 - `pdfPassword` (string, 可选) — 使用 RC4 128 位加密对 PDF 进行加密 **常见问题:** **Q: 可以只截取页面上的特定元素吗?** 可以,使用 targetSelector 参数配合 CSS 选择器,即可只截取特定元素。例如,使用 '#main-content' 就能只截取主要内容区域。 **Q: 智能滚动拼接是如何工作的?** 在整页截图时,工具会分段滚动页面,逐个截取每个视口切片,再将它们拼接起来。这能确保懒加载内容与动画都被正确捕获。 **Q: 可以在截图前移除 cookie 提示条或广告吗?** 可以,使用 removeSelectors 指定要移除元素的 CSS 选择器。你也可以使用 hideFixedElements 来隐藏吸顶头部与悬浮元素。 ## 输出示例 该工具会按你选择的格式(PDF、PNG、JPEG 或 WebP)生成文件,并存储到 Apify 数据集中。每个输出都包含以下元数据: ```json { "url": "https://example.com", "format": "pdf", "fileName": "example-com.pdf", "fileSize": 245832, "viewMode": "fullPage", "viewport": { "width": 1280, "height": 720 }, "encrypted": false } ``` --- # 2026 年网页抓取最佳实践:一线工程师指南 - **URL:** https://proooxy.com/zh/blog/web-scraping-best-practices-2026/ - **类型:** blog - **描述:** 源自 12+ 年生产环境实战的爬虫策略——架构模式、错误处理、代理管理与输出规范化。 - **关键词:** 网页抓取最佳实践, 生产级爬虫架构, 数据采集指南, 爬虫架构设计 - **发布时间:** 2026-04-01 - **更新时间:** 2026-04-01 在构建并维护 15 款生产级爬虫、服务超过 3,100 位用户、成功率保持 >99% 之后,以下是真正重要的实践经验。 ## 架构:把爬虫当管道来设计,而不是脚本 我见过最大的错误,就是把爬虫当成单步骤流程。生产级爬虫其实是数据管道: 1. **URL 发现**——找到要抓取的目标(sitemap、分类页、搜索、API) 2. **请求执行**——通过恰当的重试与轮换机制获取数据 3. **解析**——从原始响应中提取结构化字段 4. **规范化**——清洗、校验并统一输出格式 5. **存储**——写入数据集、数据库或下游系统 每一步都应该可以独立测试、独立重试。当 Sephora 修改商品详情页布局时,只需要更新第 3 步——管道的其余部分保持不变。 ## 永远优先选择 API,而非 HTML 解析 在写下第一个 CSS 选择器之前,先检查目标网站是否具备: - **公开 API**——有文档记录、返回 JSON 的端点 - **私有 API**——在浏览器 DevTools 中可见的 XHR/fetch 调用 - **GraphQL 端点**——越来越常见,往往开启了 introspection(内省) - **内嵌 JSON**——HTML 中的 `__NEXT_DATA__`、`window.__INITIAL_STATE__` 或 JSON-LD API 响应结构化、带版本号,比 HTML 布局稳定得多。我的 [Sephora 爬虫](/zh/tools/sephora-scraper/)会把每一个网页 URL 都转换成 API 调用——从未因为前端改版而失效过。 ## 代理策略:与防护级别相匹配 不是每个网站都需要住宅代理。以下是我的决策框架: | 防护级别 | 代理类型 | 示例网站 | |-----------------|------------|---------------| | 无 / 基础 | 数据中心代理 | 大多数 Shopify 商店、小型网站 | | 速率限制 | 轮换数据中心代理 | 中型电商、内容类网站 | | 指纹识别 | 住宅代理 | Sephora、Farfetch 等知名品牌 | | 高级 WAF | 住宅代理 + TLS 指纹伪装 | Akamai、Cloudflare 企业版 | 核心洞察:**代理成本随防护级别同步上升**。不要在只检查 IP 信誉的网站上浪费钱购买住宅代理。我的 [Shopify 爬虫](/zh/tools/shopify-scraper/)用数据中心代理就能正常工作,因为 Shopify 的默认防护非常薄弱。 ## 会话管理决定一切 60% 和 99% 成功率之间的差距,往往就在于会话管理: - **轮换的是会话,而不只是 IP**——用新 IP 搭配旧 cookie 反而显得可疑 - **预热会话**——在访问商品页之前先访问首页 - **遵守速率限制**——5 个并发请求跑通,胜过 50 个并发被封 - **指数退避**——按 1 秒、2 秒、4 秒、8 秒的间隔重试,而不是立即重试 我的 [Sephora EU 爬虫](/zh/tools/sephora-eu-scraper/)通过自动刷新与指数退避来管理访客令牌,维持着与真实浏览模式相符的持久会话。 ## 规范化你的输出 抓取到的原始数据往往很杂乱,需要对一切进行规范化: ### 价格 以整数形式存储(单位为美分,而非美元)。`$29.99` 会存为 `2999`。这样可以避免浮点精度误差污染下游财务数据。我的每一个电商爬虫都遵循这一约定。 ### URL 始终存储绝对 URL,禁止使用相对路径,在提取阶段就完成解析。 ### 日期 使用 ISO 8601 格式(`2026-04-01T00:00:00Z`),并始终携带时区信息,禁止存储按地区习惯格式化的日期。 ### 文本 去除多余空白,规范化 Unicode 编码,并明确 HTML 处理策略(去除标签还是保留格式)。 ## 错误处理:预设失败会发生 生产级爬虫会持续遭遇失败——问题在于失败得是否体面。我的做法: ``` Request fails (network error, timeout, 4xx/5xx) → Retry with exponential backoff (up to 5 attempts) → Rotate session/proxy on retry → Log failure with full context if all retries exhausted → Continue processing remaining URLs (don't crash the batch) ``` 按 URL 模式追踪成功率。如果 `/category/*` 页面的成功率突然跌破 90%,多半是网站改了什么——这样你能在用户反馈之前就先发现问题。 ## 监控与告警 没有监控的爬虫,迟早会在无人察觉的情况下悄悄失效。需要追踪: - **成功率**——按每次运行和每种 URL 模式统计 - **输出数量**——骤降往往意味着出了问题 - **数据质量**——空字段、异常值、schema 违规 - **成本**——代理用量、计算时间、存储空间 我的所有 Apify Actor 都会暴露这些指标。一旦成功率下滑,我会在几小时内收到通知——往往早于任何用户察觉。 ## 从简单开始,按需增加复杂度 我构建的每一个爬虫,都从能跑通的最简方案开始: 1. **先用 HTTP + Cheerio**(最快、最省钱) 2. **只有被封锁时才加入指纹伪装** 3. **只有必须渲染 JavaScript 时才加入浏览器渲染** 4. **只有遇到速率限制时才加入代理轮换** 我的 [Ulta 爬虫](/zh/tools/ulta-scraper/)纯用 Cheerio 实现——完全不需要浏览器。我的 [Universal Web Printer](/zh/tools/web-printer/) 则使用 Playwright,因为它必须渲染 JavaScript。为任务选择合适的工具。 --- 这些都不是纸上谈兵的理论——而是从处理数百万级请求的生产级爬虫中提炼出来的实战经验。如果你需要一个按这些实践标准打造的定制爬虫,[联系我](/zh/contact/)。 --- # 读懂反爬虫防护:2026 年哪些方法依然有效 - **URL:** https://proooxy.com/zh/blog/bypassing-anti-bot-protection-guide/ - **类型:** blog - **描述:** 深入解析现代反爬虫系统——Cloudflare、Akamai、Datadome——以及生产级爬虫中实际使用的合规绕过技术。 - **关键词:** 反爬虫绕过, cloudflare 反爬绕过, akamai waf 绕过, datadome 绕过方法, 网站反爬机制, 爬虫防封 IP - **发布时间:** 2026-03-15 - **更新时间:** 2026-03-15 反爬虫防护是一场军备竞赛。作为每天都要构建生产级爬虫来绕过这些系统的人,这里是我的一线实战视角——这些防护系统究竟在检查什么,合规的绕过技术又是什么样子。 ## 检测的层次 现代反爬虫系统以分层方式运作。理解这些层次,是实现可靠绕过的关键: ### 第一层:IP 信誉 最简单的一层检查。反爬虫服务会维护已知数据中心 IP 段、VPN 出口节点,以及历史被标记 IP 的数据库。 **它们会检查什么:** - 这个 IP 是否来自 AWS、GCP、Azure 或其他知名主机服务商? - 这个 IP 此前是否曾因机器人活动被标记? - 这个 IP 最近发出过多少请求? **应对方法:** Apify Proxy、Bright Data 等服务提供的住宅代理,其 IP 地址归属真实 ISP,在 IP 层面与普通用户毫无区别。 ### 第二层:TLS 指纹识别 这一层开始变得有意思。每个 HTTP 客户端都拥有独一无二的 TLS 握手特征,取决于: - 支持的密码套件及其顺序 - TLS 扩展及其顺序 - 支持的 TLS 版本 - ALPN 协议 标准的 `axios` 或 `requests` 库会带有一眼就能看出“是机器人”的 TLS 指纹,因为它和任何真实浏览器都对不上。Akamai、Cloudflare 这类服务为每一个浏览器版本都维护着指纹数据库。 **应对方法:** `got-scraping`(我的 [Shopify 爬虫](/zh/tools/shopify-scraper/)所使用的库)以及其他专门的 TLS 客户端,都可以模拟浏览器级 TLS 指纹。我的 [Sephora EU 爬虫](/zh/tools/sephora-eu-scraper/)就使用浏览器级 TLS 指纹伪装来绕过 Akamai WAF。 ### 第三层:HTTP/2 指纹识别 除 TLS 之外,HTTP/2 的设置同样会暴露客户端类型: - SETTINGS 帧参数(header table size、max concurrent streams) - WINDOW_UPDATE 帧的取值 - 优先级树结构 - 头部压缩(HPACK)模式 每款浏览器都有其特有的 HTTP/2 设置。Chrome、Firefox 和 Safari 在这一层面各不相同。 ### 第四层:JavaScript 挑战 Cloudflare 的“正在检查您的浏览器”页面及同类挑战会执行如下 JavaScript: - 检测浏览器 API(canvas、WebGL、AudioContext) - 测量执行耗时 - 校验 DOM 属性 - 将挑战响应发送回服务器 **应对方法:** 无头浏览器(Playwright、Puppeteer)可以原生执行这些挑战。关键在于确保你的无头浏览器不会泄露自动化信号(详见下文)。 ### 第五层:行为分析 这是最精密的一层。这些系统会分析: - 鼠标移动轨迹(过于线性 = 机器人) - 滚动行为(瞬间滚到底部 = 机器人) - 操作间隔时间(过于规律 = 机器人) - 浏览路径(跳过浏览直接进入商品详情页 = 可疑) - 请求节奏(间隔完全均匀 = 机器人) ## 防护画像:认清你面对的是什么 ### Cloudflare **常见于:** 中小型网站、博客、API Cloudflare 提供多档防护级别: - **Basic(基础版)**——IP 信誉 + 速率限制。搭配合理速率的数据中心代理通常就能应对。 - **Managed Challenge(托管挑战)**——JavaScript 挑战 + turnstile 验证。需要浏览器或挑战破解服务。 - **Enterprise/Bot Management(企业版/机器人管理)**——完整的行为分析 + 指纹识别。需要住宅代理 + 恰当的指纹伪装。 ### Akamai Bot Manager **常见于:** 企业级电商(Sephora EU、各大零售商) Akamai 是最难绕过的防护之一,原因在于: - 激进的 TLS 指纹识别 - 通过客户端 JavaScript 采集传感器数据 - 会话级行为分析 - Cookie 完整性校验 我应对 Akamai 的方法:浏览器级 TLS 指纹伪装 + 访客令牌管理 + 模拟真人浏览节奏的请求节流。 ### Datadome **常见于:** 电商、票务平台 Datadome 主要关注: - 通过 JavaScript 进行设备指纹识别 - 对可疑流量发起 CAPTCHA 验证码挑战 - 实时行为评分 ### PerimeterX(现更名为 HUMAN) **常见于:** 零售、金融服务 以激进的 JavaScript 挑战和行为分析著称。 ## 合规绕过架构 对于需要可靠、持续数据提取的生产系统,以下是我采用的架构模式: ### 1. API 优先 在尝试绕过任何防护之前,先确认是否存在完全绕开 WAF 的 API 路径。许多防护只作用于面向浏览器的端点,而不覆盖 API 路由。 我的 [Sephora 爬虫](/zh/tools/sephora-scraper/)会把每一个网页 URL 都转换为一次 API 调用。这些 API 端点的防护比网站本身更宽松,因为它们本来是为移动 App 设计的。 ### 2. 会话预热 不要直接跳到数据页面,而是构建一个真实的浏览会话: ``` Visit homepage → Browse categories → View product listing → Access product detail ``` 每一步都在为会话积累可信度。反爬虫系统看到的,是与真实用户行为相符的模式。 ### 3. 指纹一致性 这一点至关重要:你的指纹必须**内部保持一致**。如果你的 TLS 显示“Chrome 120”,但 User-Agent 却显示“Chrome 118”,这就是一个检测信号。 需要对齐的项目: - TLS 指纹 - HTTP/2 设置 - User-Agent 请求头 - Accept-Language 及其他请求头 - JavaScript 浏览器属性(如果使用无头浏览器) ### 4. 请求节流 真人不会以精确的 1 秒间隔发出请求。需要引入贴近真实的波动: - 请求间的基础延迟(2-5 秒) - 随机抖动(±30%) - 导航事件后加入更长的停顿 - 偶尔穿插“空闲”时段 ### 5. 优雅降级 遇到挑战或封锁时: 1. 不要立即重试——这会坐实机器人行为 2. 按指数退避 3. 切换到全新会话(新 IP + 新 cookie) 4. 尝试更换代理地区 5. 若问题持续,改用基于浏览器的方案 ## 已经不再奏效的方法 - **只改 User-Agent**——检测系统会核查数十种信号,不只是一个请求头 - **只靠随机延迟**——没有恰当的指纹伪装,光调整时间毫无用处 - **使用默认设置的无头 Chrome**——自动化信号无处不在地泄露(`navigator.webdriver`、缺失的插件、Chrome DevTools Protocol 痕迹) - **重放 Cookie**——现代系统会把 cookie 与 TLS 指纹、IP 段绑定在一起 ## 伦理考量 反爬虫绕过是一种工具。和任何工具一样,它既可以被负责任地使用,也可能被滥用。 **合规使用场景:** - 为消费者利益服务的比价 - 基于公开数据的市场调研 - 无障碍访问(将数据转化为结构化格式) - 学术研究 - 质量保证与监控 **务必遵守:** - robots.txt 规则 - 速率限制(即使能突破也不要突破) - 个人数据法规(GDPR、CCPA) - 服务条款(了解你所在司法辖区的法律环境) 我的所有[工具](/zh/tools/)在设计上都面向合规数据提取,内置速率限制与代理最佳实践。 --- 理解反爬虫系统,能让你成为更出色的爬虫工程师。如果你需要能可靠应对这些挑战的生产级爬虫,欢迎查看我的[工具](/zh/tools/),或[联系我](/zh/contact/)洽谈定制开发。 --- # 关于 - **URL:** https://proooxy.com/zh/about/ - **类型:** page - **描述:** Richard Feng——拥有 12+ 年经验的爬虫工程师。我将受保护的网站转化为面向 AI Agent、检索管道与 LLM 的干净、RAG 就绪结构化数据。 - **关键词:** 爬虫工程师, 数据采集顾问, 定制爬虫开发, 反爬虫绕过专家, RAG 数据管道咨询, API 逆向工程 - **发布时间:** 0001-01-01 - **更新时间:** 0001-01-01 ## 我是谁 我是 Richard Feng,一名自由职业的网页自动化工程师,拥有 12+ 年编程经验。我专注于**爬虫、数据采集与 API 逆向工程**——将复杂、受保护的网站转化为 AI 系统真正可用的干净结构化数据。 我的技术栈涵盖 **Node.js(TypeScript)、Python、Go 和 Java**,并深入掌握 **Crawlee、Playwright 与 Cheerio**。我构建的生产系统能够以 **>99% 的成功率**处理数百万级请求。 ## 我做什么 我构建并维护 **16 款生产级 Apify Actor**,服务超过 **3,100 位用户**,运行成功率稳定保持在 **>99%**。每个 Actor 都输出干净的 **RAG 就绪 JSON**——schema 一致、去重完毕,可直接放入向量数据库、检索管道或训练集。大多数公开数据类 Actor 无需 API 密钥。我的工作涵盖四大领域: ### 电商与零售数据 面向主流美妆与时尚平台的爬虫,包括 [Sephora](/zh/tools/sephora-scraper/)(21 个全球站点)、[Ulta Beauty](/zh/tools/ulta-scraper/)、[Farfetch](/zh/tools/farfetch-scraper/)、[Lululemon](/zh/tools/lululemon-scraper/)、[Boohoo](/zh/tools/boohoo-scraper/)、[Macy's](/zh/tools/macys-scraper/),以及适用于任意 Shopify 商店的通用 [Shopify 爬虫](/zh/tools/shopify-scraper/)。 ### 公开、金融与法律数据 官方美国数据集,转化为干净、RAG 就绪的 JSON——[SEC EDGAR 财报文件与 XBRL 财务数据](/zh/tools/sec-edgar-scraper/)、[USAspending.gov 联邦支出项目](/zh/tools/usaspending-scraper/)、[CourtListener 法院判决](/zh/tools/courtlistener-scraper/),以及 [ClinicalTrials.gov 临床研究](/zh/tools/clinical-trials-scraper/)。 ### 社交与媒体情报 通过 AT Protocol 获取 [Bluesky](/zh/tools/bluesky-scraper/) 的帖子、主页资料与互动数据,以及一款 [YouTube 字幕与文字稿爬虫](/zh/tools/youtube-transcript-scraper/),可输出 JSON、SRT、VTT 或适合 LLM 使用的文本,支持 100+ 种语言。 ### 开发者工具 爬虫之外的工具——[SEO 与结构化数据审计](/zh/tools/schema-markup-scraper/)、[网页转 PDF/图片渲染](/zh/tools/web-printer/),以及[高性能负载测试](/zh/tools/load-tester/)。 ## 专长 - **私有 API 逆向工程**——将未公开的移动端/网页端接口转化为可靠的数据源 - **反爬虫绕过**——Cloudflare、DataDome、Akamai WAF 及各类定制防护 - **RAG 就绪输出**——为检索与事实支撑而设计的规范化、schema 一致 JSON - **多地区爬取**——妥善处理语言区域、货币与合规问题 - **高可靠性系统**——在大规模场景下仍保持 >99% 成功率的提取工具 ## 技术栈 | 类别 | 技术 | |----------|-------------| | 编程语言 | TypeScript, Python, Go, Java | | 爬虫 | Crawlee, Playwright, Cheerio, Parsel, got-scraping | | 反爬虫 | Fingerprint generators, TLS fingerprinting, session rotation | | 基础设施 | Apify Platform, Docker, GitHub Actions | | 测试 | Vegeta, custom load-testing frameworks | ## 与我合作 我提供定制爬虫方案、RAG 数据管道工程,以及持续性数据采集服务。如果你的 AI 需要将真实网页转化为干净数据——[联系我](/zh/contact/)。 --- # 联系 - **URL:** https://proooxy.com/zh/contact/ - **类型:** page - **描述:** 委托定制爬虫或 RAG 数据管道开发——逆向工程私有 API、反爬虫绕过,将干净的结构化 JSON 交付到你的 AI 技术栈。 - **关键词:** 雇佣爬虫开发者, 定制爬虫开发, 爬虫服务外包, RAG 数据管道, 数据采集服务, 爬虫技术咨询 - **发布时间:** 0001-01-01 - **更新时间:** 0001-01-01 ## 获取目录中没有的数据 我为 AI 团队、数据平台,以及任何需要将开放网络转化为干净结构化 JSON 的人,构建定制爬虫与 RAG 数据管道。无论是一次性拉取,还是持续更新的数据流,我都可以提供帮助。 ### 我能构建什么 - **定制爬虫**——为你的目标网站量身打造,内置反爬虫绕过能力 - **RAG 数据管道**——提取、规范化、分块,并将可检索的 JSON 交付到你的向量数据库或数据仓库 - **私有 API 逆向工程**——将未公开的移动端/网页端接口转化为稳定的结构化数据源 - **爬虫维护**——在目标网站变动时,保持现有提取工具持续可用 - **技术咨询**——为你的爬虫与数据接入技术栈提供架构评审 ### 合作流程 1. **描述数据需求**——数据来源、所需字段与交付格式 2. **免费可行性评估**——我会免费评估目标网站的复杂度与反爬虫防护情况 3. **方案与排期**——明确的范围、固定报价与交付日期 4. **构建与交付**——生产级提取工具,附带文档与干净的输出数据 ### 发起定制开发
### 或直接联系我 - **邮箱**:[p8p9cmk96@mozmail.com](mailto:p8p9cmk96@mozmail.com) - **GitHub**:[@autofacts](https://github.com/autofacts) - **Apify**:[apify.com/autofacts](https://apify.com/autofacts) ---