# Proooxy — 面向 AI Agent 与 LLM 的 RAG 就绪网页数据 > 面向 AI Agent、检索管道与大语言模型的结构化、RAG 就绪网页数据。Richard Feng 打造生产级 Apify Actor,覆盖电商、SEC/EDGAR 财报文件、联邦支出、法院判决、临床试验及社交与视频数据——绕过反爬虫防护,输出干净、schema 一致的 JSON,公开数据无需 API 密钥。 Richard Feng 是一名独立爬虫工程师,专注于将开放网络转化为面向 AI Agent、检索管道与 LLM 的干净、RAG 就绪结构化数据。他打造生产级 Apify Actor,覆盖四大领域:电商与零售、公开与金融数据(SEC EDGAR 财报文件与 XBRL、USAspending.gov 联邦支出项目、CourtListener 法院判决、ClinicalTrials.gov 临床研究)、社交与媒体(Bluesky、YouTube 字幕/文字稿),以及开发者/SEO 工具。每个 Actor 都输出 schema 一致的 JSON,专为事实支撑与检索而设计——大多数公开数据类 Actor 无需 API 密钥——并具备反爬虫绕过能力(Cloudflare、DataDome、Akamai)、按需支持住宅代理、按事件计费,生产环境运行成功率 >99%。 **最适合:** 为 AI Agent 与 RAG 系统提供实时网页数据支撑、构建 LLM 训练/评估数据集、开展市场与竞争情报分析,以及搭建另类数据管道。 ## 基本信息 - **网站:** https://proooxy.com/zh/ - **作者:** Richard Feng (p8p9cmk96@mozmail.com) - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **工具数量:** 17 - **技术栈:** Python(Crawlee、curl_cffi、Parsel)与 TypeScript(Apify SDK、Crawlee、Cheerio) - **托管方式:** Apify 云端——按事件计费,提供免费额度 ## 工具 ### [Macy's Scraper——商品、价格、SKU 与新闻](https://proooxy.com/zh/tools/macys-scraper/) 提取 Macy's 的商品数据——价格、变体、SKU/UPC 条码、图片、评分与评论——以及 Macy's Inc. 新闻,覆盖搜索、分类、热门与商品 URL。无需浏览器,可绕过 Akamai。 - 市场: 美国 - 技术栈: TypeScript, Crawlee, Cheerio - Apify: https://apify.com/autofacts/macy-s-scraper ### [Bluesky Scraper——帖子、主页资料、动态与互动数据](https://proooxy.com/zh/tools/bluesky-scraper/) 通过 AT Protocol 提取 Bluesky 的帖子、主页资料、关注者、动态、话题串、点赞者与转发者数据——并支持通过 App Password 进行已登录搜索与话题标签查询。输出干净、规范化的 JSON。 - 市场: 全球 - 技术栈: TypeScript, AT Protocol - Apify: https://apify.com/autofacts/bluesky-scraper ### [ClinicalTrials.gov Scraper——临床研究、入组标准与结果数据](https://proooxy.com/zh/tools/clinical-trials-scraper/) 按病症、干预措施、申办方、地点、状态或 NCT ID 检索官方 ClinicalTrials.gov v2 API。导出包含入组标准、结果元数据的规范化研究记录,并支持增量更新——无需 API 密钥。 - 市场: 全球 - 技术栈: TypeScript, REST API - Apify: https://apify.com/autofacts/clinical-trials-scraper ### [CourtListener Scraper——判决书、案卷与全文数据](https://proooxy.com/zh/tools/courtlistener-scraper/) 查询 CourtListener 的美国法院判决、RECAP 案卷、口头辩论、法官与判例引注——附带完整判决全文与 RAG 就绪分块。支持按法院、日期或关键词筛选。 - 市场: 美国 - 技术栈: TypeScript, Cheerio - Apify: https://apify.com/autofacts/courtlistener-scraper ### [SEC EDGAR Scraper——财报文件、全文与 XBRL 财务数据](https://proooxy.com/zh/tools/sec-edgar-scraper/) 提取 SEC EDGAR 的财报文件元数据、10-K/10-Q 全文章节、EDGAR 全文检索结果,以及 XBRL 财务数据,输出干净、RAG 就绪的 JSON。无需 API 密钥。 - 市场: 美国 - 技术栈: TypeScript, Cheerio - Apify: https://apify.com/autofacts/sec-edgar-scraper ### [USAspending.gov Scraper——联邦支出项目、接收方与汇总数据](https://proooxy.com/zh/tools/usaspending-scraper/) 查询官方 USAspending.gov API v2 的联邦合同、拨款与贷款数据。支持按机构、接收方、NAICS/PSC 或日期筛选,并可拉取接收方档案、分类汇总,以及州/县/选区的地理汇总数据。无需 API 密钥。 - 市场: 美国 - 技术栈: TypeScript, REST API - Apify: https://apify.com/autofacts/usaspending-scraper ### [YouTube Subtitle & Transcript Scraper——JSON、SRT、VTT、LLM 多格式输出](https://proooxy.com/zh/tools/youtube-transcript-scraper/) 从视频、Shorts、播放列表与频道中提取 YouTube 字幕与文字稿,输出为 JSON、SRT、VTT、纯文本,或适合 LLM 使用的干净文本。支持 100+ 种语言、丰富的元数据、无需 API 密钥——提取失败不收费。 - 市场: 全球 - 技术栈: TypeScript, InnerTube - Apify: https://apify.com/autofacts/youtube-subtitle-transcript-scraper ### [Sephora Scraper(全球版)](https://proooxy.com/zh/tools/sephora-scraper/) 这是一款 Apify Actor,可提取 Sephora 完整的商品数据——变体、价格、图片、成分与评论——覆盖美国、加拿大、9 个欧盟市场与 10 个亚太市场,共 21 个站点,全部纳入同一套规范化 schema。 - 市场: 美国, 加拿大, 法国, 意大利, 德国, 西班牙, 波兰, 捷克, 希腊, 罗马尼亚, 葡萄牙, 新西兰, 澳大利亚, 新加坡, 马来西亚, 泰国, 印度尼西亚, 菲律宾, 中国香港, 中国台湾, 文莱 - 技术栈: Python, Crawlee, curl_cffi - Apify: https://apify.com/autofacts/sephora ### [Boohoo Scraper——覆盖 7 个地区的商品数据](https://proooxy.com/zh/tools/boohoo-scraper/) 提取 Boohoo 电商网站在 7 个地区的商品数据,支持自动分页、分面筛选与多币种。 - 市场: 荷兰, 瑞典, 英国, 爱尔兰, 法国, 澳大利亚, 美国 - 技术栈: TypeScript, Cheerio, Fingerprint Generator - Apify: https://apify.com/autofacts/boohoo-scraper ### [Farfetch Scraper——奢侈时尚商品数据](https://proooxy.com/zh/tools/farfetch-scraper/) 提取 Farfetch 的奢侈时尚商品数据,包括多币种定价、尺码/版型变体与商品推荐。 - 市场: 全球 - 技术栈: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/farfetch ### [Global API Load Tester——10K+ RPS 压力测试](https://proooxy.com/zh/tools/load-tester/) 高性能负载测试工具,可模拟 10,000+ 每秒请求数,支持地理分布式流量、加权测试目标与交互式 HTML 报告。 - 市场: 全球 - 技术栈: Go, Vegeta - Apify: https://apify.com/autofacts/global-api-load-tester ### [Lululemon Scraper——商品、变体与价格](https://proooxy.com/zh/tools/lululemon-scraper/) 抓取并提取 Lululemon 的商品详情,包括变体数据、颜色选项、媒体图库与定价信息。 - 市场: 美国 - 技术栈: TypeScript, Crawlee - Apify: https://apify.com/autofacts/lululemon-scraper ### [Schema Markup Scraper——结构化数据抓取与 SEO 审计工具](https://proooxy.com/zh/tools/schema-markup-scraper/) 从任意 URL 提取 JSON-LD、Microdata、RDFa、Open Graph 与 Twitter Cards,并提供完整的 SEO 审计评分系统。 - 市场: 全球 - 技术栈: TypeScript, Crawlee - Apify: https://apify.com/autofacts/metadata-scraper ### [Sephora EU Scraper——覆盖 9 个欧洲市场](https://proooxy.com/zh/tools/sephora-eu-scraper/) 抓取 Sephora 欧洲站点在 9 个欧盟市场的完整商品数据,支持多变体提取、Akamai WAF 绕过与智能令牌管理。 - 市场: 法国, 意大利, 德国, 西班牙, 波兰, 捷克, 希腊, 罗马尼亚, 葡萄牙 - 技术栈: TypeScript, Crawlee, Akamai Bypass - Apify: https://apify.com/autofacts/sephora-eu-scraper ### [Shopify Scraper——任意商店的商品数据](https://proooxy.com/zh/tools/shopify-scraper/) 专业级工具,可从任意 Shopify 商店提取高保真商品数据,包括系列(collections)、搜索与商品推荐。 - 市场: 全球 - 技术栈: TypeScript, got-scraping - Apify: https://apify.com/autofacts/shopify-scraper-ppe ### [Ulta Beauty Scraper——商品、价格与 SKU](https://proooxy.com/zh/tools/ulta-scraper/) 提取 Ulta Beauty 的商品详情、定价、图片与 SKU 信息,覆盖分类页、品牌页与促销专区。 - 市场: 美国 - 技术栈: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/ulta-scraper ### [Universal Web Printer——URL 与 HTML 转 PDF、图片](https://proooxy.com/zh/tools/web-printer/) 将任意 URL 或 HTML 转换为 PDF、PNG、JPEG 或 WebP,支持智能滚动拼接、元素提取、PDF 加密与水印。 - 市场: 全球 - 技术栈: TypeScript, Playwright, PDF-lib, Sharp - Apify: https://apify.com/autofacts/universal-web-printer ## 博客 - [2026 年网页抓取最佳实践:一线工程师指南](https://proooxy.com/zh/blog/web-scraping-best-practices-2026/) — 源自 12+ 年生产环境实战的爬虫策略——架构模式、错误处理、代理管理与输出规范化。 - [读懂反爬虫防护:2026 年哪些方法依然有效](https://proooxy.com/zh/blog/bypassing-anti-bot-protection-guide/) — 深入解析现代反爬虫系统——Cloudflare、Akamai、Datadome——以及生产级爬虫中实际使用的合规绕过技术。 ## 站点地图 - [关于 Richard Feng](https://proooxy.com/zh/about/) — 背景、专业领域与服务 - [联系方式](https://proooxy.com/zh/contact/) — 用于定制爬虫 / DaaS 合作咨询 - [Apify Store](https://apify.com/autofacts) — 免费试用任意工具 - [GitHub](https://github.com/autofacts) — 部分项目的源码 - [纯文本形式的完整内容](https://proooxy.com/zh/llms-full.txt) — 整合全站页面内容,适配 AI 上下文窗口