# Proooxy — Dados web prontos para RAG para agentes de IA e LLMs > Dados web estruturados e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs. Richard Feng cria atores Apify de nível de produção para e-commerce, arquivos SEC/EDGAR, gastos federais, decisões judiciais, ensaios clínicos e dados sociais e de vídeo — bypass de anti-bot, JSON limpo com esquema consistente e sem chaves de API para dados públicos. Richard Feng é um engenheiro de web scraping independente que transforma a web aberta em dados estruturados, limpos e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs. Ele desenvolve atores Apify de nível de produção em quatro áreas: e-commerce e varejo; dados públicos e financeiros (arquivos SEC EDGAR e XBRL, concessões federais do USAspending.gov, decisões judiciais do CourtListener, estudos do ClinicalTrials.gov); redes sociais e mídia (Bluesky, legendas/transcrições do YouTube); e utilitários para desenvolvedores/SEO. Cada ator gera JSON com esquema consistente, construído para grounding e recuperação — a maioria dos atores de dados públicos não exige chave de API — com bypass de anti-bot (Cloudflare, DataDome, Akamai), suporte a proxy residencial quando necessário, cobrança por evento e taxas de sucesso de execução acima de 99% em produção. **Ideal para:** fundamentar (grounding) agentes de IA e sistemas de RAG com dados web atualizados, construir datasets de treinamento/avaliação para LLMs, inteligência de mercado e competitiva, e pipelines de dados alternativos. ## Dados rápidos - **Site:** https://proooxy.com/pt/ - **Autor:** Richard Feng (p8p9cmk96@mozmail.com) - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **Número de ferramentas:** 17 - **Stack:** Python (Crawlee, curl_cffi, Parsel) e TypeScript (Apify SDK, Crawlee, Cheerio) - **Hospedagem:** Nuvem Apify — cobrança por evento, com plano gratuito disponível ## Ferramentas ### [Macy's Scraper — Produtos, Preços, SKUs e Notícias](https://proooxy.com/pt/tools/macys-scraper/) Extraia dados de produtos da Macy's — preços, variantes, códigos de barras SKU/UPC, imagens, avaliações e reviews — além de notícias da Macy's Inc., a partir de URLs de busca, categoria, trending e produto. Sem navegador, à prova de Akamai. - Mercados: Estados Unidos - Stack: TypeScript, Crawlee, Cheerio - Apify: https://apify.com/autofacts/macy-s-scraper ### [Bluesky Scraper — Posts, Perfis, Feeds e Interações](https://proooxy.com/pt/tools/bluesky-scraper/) Extraia posts, perfis, seguidores, feeds, threads e listas de curtidas e republicações do Bluesky via AT Protocol — além de busca autenticada e resultados de hashtags com uma app password. JSON limpo e normalizado. - Mercados: Global - Stack: TypeScript, AT Protocol - Apify: https://apify.com/autofacts/bluesky-scraper ### [ClinicalTrials.gov Scraper — Estudos, Elegibilidade e Resultados](https://proooxy.com/pt/tools/clinical-trials-scraper/) Pesquise na API v2 oficial do ClinicalTrials.gov por condição, intervenção, patrocinador, localização, status ou ID NCT. Exporte registros de estudos normalizados com elegibilidade, metadados de resultados e atualizações incrementais — sem chave de API. - Mercados: Global - Stack: TypeScript, REST API - Apify: https://apify.com/autofacts/clinical-trials-scraper ### [CourtListener Scraper — Decisões, Processos e Texto Completo](https://proooxy.com/pt/tools/courtlistener-scraper/) Consulte o CourtListener em busca de decisões judiciais dos EUA, processos RECAP, sustentações orais, juízes e citações — com texto completo das decisões e chunks prontos para RAG. Filtre por tribunal, data ou palavra-chave. - Mercados: Estados Unidos - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/courtlistener-scraper ### [SEC EDGAR Scraper — Arquivos, Texto Completo e Dados Financeiros XBRL](https://proooxy.com/pt/tools/sec-edgar-scraper/) Extraia metadados de arquivos do SEC EDGAR, seções em texto completo de 10-K/10-Q, resultados de busca em texto completo do EDGAR e fatos financeiros XBRL como JSON limpo e pronto para RAG. Sem necessidade de chave de API. - Mercados: Estados Unidos - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/sec-edgar-scraper ### [USAspending.gov Scraper — Concessões Federais, Beneficiários e Agregados](https://proooxy.com/pt/tools/usaspending-scraper/) Consulte a API v2 oficial do USAspending.gov para contratos, subvenções e empréstimos federais. Filtre por agência, beneficiário, NAICS/PSC ou data, e obtenha perfis de beneficiários, totais por categoria e agregados geográficos por estado/condado/distrito. Sem chave de API. - Mercados: Estados Unidos - Stack: TypeScript, REST API - Apify: https://apify.com/autofacts/usaspending-scraper ### [YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/pt/tools/youtube-transcript-scraper/) Extraia legendas e transcrições do YouTube de vídeos, Shorts, playlists e canais como JSON, SRT, VTT, texto simples ou texto limpo pronto para LLM. Mais de 100 idiomas, metadados ricos, sem chave de API — e extrações que falham são gratuitas. - Mercados: Global - Stack: TypeScript, InnerTube - Apify: https://apify.com/autofacts/youtube-subtitle-transcript-scraper ### [Sephora Scraper (Global)](https://proooxy.com/pt/tools/sephora-scraper/) Ator Apify que extrai dados completos de produtos da Sephora — variantes, preços, imagens, ingredientes e reviews — de 21 lojas nos EUA, Canadá, 9 mercados da UE e 10 mercados da Ásia-Pacífico, em um único esquema normalizado. - Mercados: Estados Unidos, Canadá, França, Itália, Alemanha, Espanha, Polônia, República Tcheca, Grécia, Romênia, Portugal, Nova Zelândia, Austrália, Singapura, Malásia, Tailândia, Indonésia, Filipinas, Hong Kong, Taiwan, Brunei - Stack: Python, Crawlee, curl_cffi - Apify: https://apify.com/autofacts/sephora ### [Boohoo Scraper — Dados de Produtos em 7 Regiões](https://proooxy.com/pt/tools/boohoo-scraper/) Extraia dados de produtos dos sites de e-commerce da Boohoo em 7 regiões, com paginação automática, filtragem por facetas e suporte a múltiplas moedas. - Mercados: Países Baixos, Suécia, Reino Unido, Irlanda, França, Austrália, Estados Unidos - Stack: TypeScript, Cheerio, Fingerprint Generator - Apify: https://apify.com/autofacts/boohoo-scraper ### [Farfetch Scraper — Dados de Produtos de Moda de Luxo](https://proooxy.com/pt/tools/farfetch-scraper/) Extraia dados de produtos de moda de luxo da Farfetch, incluindo precificação multi-moeda, variações de tamanho/caimento e recomendações de produtos. - Mercados: Global - Stack: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/farfetch ### [Global API Load Tester — Teste de Carga de 10K+ RPS](https://proooxy.com/pt/tools/load-tester/) Ferramenta de teste de carga de alta performance que simula mais de 10,000 requisições por segundo, com tráfego geodistribuído, alvos ponderados e relatórios HTML interativos. - Mercados: Global - Stack: Go, Vegeta - Apify: https://apify.com/autofacts/global-api-load-tester ### [Lululemon Scraper — Produtos, Variantes e Preços](https://proooxy.com/pt/tools/lululemon-scraper/) Rastreie e extraia detalhes de produtos da Lululemon, incluindo dados de variantes, opções de cor, galerias de mídia e informações de preço. - Mercados: Estados Unidos - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/lululemon-scraper ### [Schema Markup Scraper e Auditor de SEO](https://proooxy.com/pt/tools/schema-markup-scraper/) Extraia JSON-LD, Microdata, RDFa, Open Graph e Twitter Cards de qualquer URL, com um sistema abrangente de pontuação de auditoria de SEO. - Mercados: Global - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/metadata-scraper ### [Sephora EU Scraper — 9 Mercados Europeus](https://proooxy.com/pt/tools/sephora-eu-scraper/) Extraia dados completos de produtos da Sephora Europa em 9 mercados da UE, com extração multi-variante, bypass de Akamai WAF e gerenciamento inteligente de tokens. - Mercados: França, Itália, Alemanha, Espanha, Polônia, República Tcheca, Grécia, Romênia, Portugal - Stack: TypeScript, Crawlee, Akamai Bypass - Apify: https://apify.com/autofacts/sephora-eu-scraper ### [Shopify Scraper — Dados de Produtos de Qualquer Loja](https://proooxy.com/pt/tools/shopify-scraper/) Ferramenta de nível profissional para extrair dados de produtos de alta fidelidade de qualquer loja baseada em Shopify, incluindo coleções, busca e recomendações de produtos. - Mercados: Global - Stack: TypeScript, got-scraping - Apify: https://apify.com/autofacts/shopify-scraper-ppe ### [Ulta Beauty Scraper — Produtos, Preços e SKUs](https://proooxy.com/pt/tools/ulta-scraper/) Extraia detalhes de produtos, preços, imagens e informações de SKU da Ulta Beauty, incluindo páginas de categoria, páginas de marca e seções de promoção. - Mercados: Estados Unidos - Stack: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/ulta-scraper ### [Universal Web Printer — URL e HTML para PDF, Imagem](https://proooxy.com/pt/tools/web-printer/) Converta qualquer URL ou HTML em PDF, PNG, JPEG ou WebP, com scroll-stitch inteligente, extração de elementos, criptografia de PDF e marca d'água. - Mercados: Global - Stack: TypeScript, Playwright, PDF-lib, Sharp - Apify: https://apify.com/autofacts/universal-web-printer ## Blog - [Boas Práticas de Web Scraping em 2026: Um Guia Prático](https://proooxy.com/pt/blog/web-scraping-best-practices-2026/) — Estratégias de web scraping testadas em batalha, com mais de 12 anos de experiência em produção — padrões de arquitetura, tratamento de erros, gerenciamento de proxies e normalização de saída. - [Entendendo a Proteção Anti-Bot: O Que Funciona em 2026](https://proooxy.com/pt/blog/bypassing-anti-bot-protection-guide/) — Um mergulho técnico nos sistemas anti-bot modernos — Cloudflare, Akamai, Datadome — e nas técnicas legítimas de bypass usadas em scraping de produção. ## Mapa do site - [Sobre Richard Feng](https://proooxy.com/pt/about/) — trajetória, especialidades, serviços - [Contato](https://proooxy.com/pt/contact/) — para projetos de scraper personalizado / DaaS - [Apify Store](https://apify.com/autofacts) — teste qualquer ferramenta gratuitamente - [GitHub](https://github.com/autofacts) — código-fonte de projetos selecionados - [Conteúdo completo em texto puro](https://proooxy.com/pt/llms-full.txt) — todas as páginas concatenadas para janelas de contexto de IA